HERMES + VEO 3

Hermes Agent에서 Veo 3를 사용하세요.

Veo 3는 Google DeepMind의 영상 생성 모델로, 네이티브 오디오(동기화된 대화, 주변 소리, 음악)와 함께 최대 8초의 1080p 클립을 생성합니다. Hermes Agent는 채팅에서 설정한 것과 동일한 API key를 재사용하여 RunAPI 커스텀 프로바이더 엔드포인트를 통해 호출합니다.

하나의 API key · 텍스트-비디오 엔드포인트 · 네이티브 오디오 출력
Generate a cinematic video clip with native audio using Google Veo 3 through RunAPI.

Requirements:
- Read the API key from RUNAPI_API_KEY. Do not hardcode the key.
- Use the custom:runapi provider with base_url https://runapi.ai/v1.
- Send a POST request to https://runapi.ai/api/v1/veo_3_1/text_to_video
- Set model to "veo-3.1".
- Write a descriptive prompt including scene, camera movement, and audio cues.
- Set duration_seconds to 4, 6, or 8.
- Set aspect_ratio to "16:9", "9:16", or "auto".
- The task is async. Poll the returned task_id until status is "completed".
- When done, read the video URL from the response output.
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "veo-3.1",
    "prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns, light rain.",
    "duration_seconds": 8,
    "aspect_ratio": "16:9"
  }'
{
  "task_id": "tsk_abc123",
  "status": "pending",
  "model": "veo-3.1"
}
curl 명령어를 복사하여 테스트하세요 veo-3
작동 방식

Hermes Agent에서 Veo 3를 세 단계로 사용하기

1

RunAPI 설정

Hermes Agent가 실행되는 환경에 RUNAPI_API_KEY를 설정하세요. 채팅용 custom:runapi 프로바이더로 RunAPI를 이미 추가했다면, 동일한 key와 base_url이 영상 생성을 처리합니다 — 별도의 Google Cloud 자격증명이 필요 없습니다.

export RUNAPI_API_KEY=runapi_xxx
2

Veo 3 text_to_video 호출

model을 veo-3.1로 설정하여 text_to_video 엔드포인트에 POST 요청을 보내세요. 장면 설명과 오디오 큐(대화, 주변 소리)가 포함된 프롬프트를 포함하세요. duration_seconds를 4, 6, 또는 8로 설정하고 aspect_ratio를 16:9 또는 9:16으로 설정하세요. Hermes Agent는 custom:runapi 프로바이더를 통해 라우팅합니다.

POST /api/v1/veo_3_1/text_to_video
3

결과 가져오기

엔드포인트는 즉시 task_id를 반환합니다. 상태가 completed로 변경될 때까지 작업 상태 엔드포인트를 폴링한 후 출력 영상 URL을 가져오세요. 영상에는 프롬프트에서 생성된 동기화된 오디오가 포함됩니다.

GET /api/v1/veo_3_1/text_to_video/tsk_abc123
파라미터

Veo 3 text_to_video 파라미터

파라미터 유형 설명
model string 필수. veo-3.1 (표준 품질) 또는 veo-3.1-fast (저렴한 비용, 빠른 생성).
prompt string 필수. 시각적 액션, 카메라 움직임, 대화 또는 주변 소리를 위한 오디오 큐가 포함된 장면 설명.
duration_seconds integer 선택 사항. 영상 길이(초). 허용 값: 4, 6, 8. 기본값은 8.
aspect_ratio string 선택 사항. 출력 화면 비율. 허용 값: 16:9, 9:16, auto.
input_mode string 선택 사항. 생성 모드. text (기본값), first_and_last_frames (키프레임 가이드), 또는 reference (스타일 레퍼런스).
first_frame_image_url string 선택 사항. 첫 번째 프레임 이미지의 URL. input_mode가 first_and_last_frames일 때 사용합니다.
last_frame_image_url string 선택 사항. 마지막 프레임 이미지의 URL. input_mode가 first_and_last_frames일 때 사용합니다.
reference_image_urls array 선택 사항. 스타일 레퍼런스 이미지의 URL. input_mode가 reference일 때 사용합니다.
callback_url string 선택 사항. 작업 완료 시 POST를 수신하는 웹훅 URL.

Hermes Agent의 Veo 3이란?

Google DeepMind의 Veo 3은 생생한 동영상을 만들어냅니다——영화급 영상과 동기화된 대사·주변 효과음·음악을 단일 생성으로 출력합니다. Hermes Agent의 custom:runapi provider를 통해 별도의 TTS나 오디오 편집 단계 없이 최장 8초의 1080p 네이티브 오디오 동영상을 얻을 수 있습니다.

Veo 3 활용 사례

애니메이션 및 스타일화된 시퀀스

매칭된 오디오 큐가 포함된 애니메이션 스타일 또는 스타일화된 동영상 클립을 생성합니다. 프롬프트에 비주얼 스타일과 사운드 방향을 기술하면 Veo 3이 둘 다 동시에 렌더링합니다.

음악 및 노래 콘텐츠

짧은 뮤직비디오 클립이나 노래 듀엣 장면을 제작합니다. 동기화된 시청각 출력을 위해 프롬프트에 가사나 음악 방향을 포함합니다.

사운드가 포함된 소셜 미디어 콘텐츠

주변 오디오·내레이션·대사가 내장된 완성된 동영상 클립을 생성합니다. 오디오 편집이 필요 없으며——출력물에 동영상과 음성 트랙 모두 포함되어 바로 게시할 수 있습니다.

FAQ

Veo 3 + Hermes Agent 자주 묻는 질문

Hermes Agent 일반 설정

아직 설정하지 않으셨나요? Hermes Agent용 RunAPI 설정 가이드로 시작하세요.

Hermes Agent 설정 가이드 →

Veo 3 모델 카탈로그

Veo 3 변형, 가격, API 문서를 확인하세요.

RunAPI의 Veo 3 →

지금 Hermes Agent에서 Veo 3를 사용해보세요.

무료 RunAPI key를 발급받고, custom:runapi 프로바이더를 설정하여 Google Veo 3로 네이티브 오디오가 포함된 시네마틱 영상을 생성하세요.