OpenClaw에서 Veo 3를 사용하세요.
Veo 3는 Google DeepMind의 영상 생성 모델로, 네이티브 오디오(동기화된 대화, 주변 소리, 음악)와 함께 최대 8초의 1080p 클립을 생성합니다. OpenClaw 에이전트는 채팅에 사용하는 것과 동일한 RunAPI key와 엔드포인트로 호출하며, 추가 스킬 설치가 필요 없습니다.
Generate a cinematic video clip with native audio using Google Veo 3 through RunAPI.
Requirements:
- Read the API key from RUNAPI_API_KEY. Do not hardcode the key.
- Send a POST request to https://runapi.ai/api/v1/veo_3_1/text_to_video
- Set model to "veo-3.1".
- Write a descriptive prompt including scene, camera movement, and audio cues.
- Set duration_seconds to 4, 6, or 8.
- Set aspect_ratio to "16:9", "9:16", or "auto".
- The task is async. Poll the returned task_id until status is "completed".
- When done, read the video URL from the response output.
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "veo-3.1",
"prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns, light rain.",
"duration_seconds": 8,
"aspect_ratio": "16:9"
}'
{
"task_id": "tsk_abc123",
"status": "pending",
"model": "veo-3.1"
}
OpenClaw에서 Veo 3를 세 단계로 사용하기
RunAPI 설정
RUNAPI_API_KEY 환경 변수를 설정하세요. OpenClaw에서 채팅용 RunAPI 프로바이더를 이미 설정했다면, 동일한 key가 영상 생성에도 사용됩니다 — 추가 설정이나 프로바이더 계정이 필요 없습니다.
export RUNAPI_API_KEY=runapi_xxx
Veo 3 text_to_video 호출
model을 veo-3.1로 설정하여 text_to_video 엔드포인트에 POST 요청을 보내세요. 장면 설명과 오디오 큐(대화, 주변 소리)가 포함된 프롬프트를 포함하세요. duration_seconds를 4, 6, 또는 8로 설정하고 aspect_ratio를 16:9 또는 9:16으로 설정하세요.
POST /api/v1/veo_3_1/text_to_video
결과 가져오기
엔드포인트는 즉시 task_id를 반환합니다. 상태가 completed로 변경될 때까지 작업 상태 엔드포인트를 폴링한 후 출력 영상 URL을 가져오세요. 영상에는 프롬프트에서 생성된 동기화된 오디오가 포함됩니다.
GET /api/v1/veo_3_1/text_to_video/tsk_abc123
Veo 3 text_to_video 파라미터
| 파라미터 | 유형 | 설명 |
|---|---|---|
model |
string |
필수. veo-3.1 (표준 품질) 또는 veo-3.1-fast (저렴한 비용, 빠른 생성). |
prompt |
string |
필수. 시각적 액션, 카메라 움직임, 대화 또는 주변 소리를 위한 오디오 큐가 포함된 장면 설명. |
duration_seconds |
integer |
선택 사항. 영상 길이(초). 허용 값: 4, 6, 8. 기본값은 8. |
aspect_ratio |
string |
선택 사항. 출력 화면 비율. 허용 값: 16:9, 9:16, auto. |
input_mode |
string |
선택 사항. 생성 모드. text (기본값), first_and_last_frames (키프레임 가이드), 또는 reference (스타일 레퍼런스). |
first_frame_image_url |
string |
선택 사항. 첫 번째 프레임 이미지의 URL. input_mode가 first_and_last_frames일 때 사용합니다. |
last_frame_image_url |
string |
선택 사항. 마지막 프레임 이미지의 URL. input_mode가 first_and_last_frames일 때 사용합니다. |
reference_image_urls |
array |
선택 사항. 스타일 레퍼런스 이미지의 URL. input_mode가 reference일 때 사용합니다. |
callback_url |
string |
선택 사항. 작업 완료 시 POST를 수신하는 웹훅 URL. |
OpenClaw의 Veo 3이란?
Veo 3은 Google DeepMind의 동영상 생성 모델로 정확한 주변 오디오를 갖춘 사실적인 영화급 영상을 제작합니다. 동기화된 대사·효과음·음악과 함께 최장 8초의 1080p 동영상을 생성하며, 별도의 오디오 파이프라인이 필요 없습니다. OpenClaw agent는 RunAPI 엔드포인트를 통해 채팅과 동일한 API 키로 호출합니다.
Veo 3 활용 사례
거리 인터뷰 및 대화 장면
캐릭터가 대사를 말하는 짧은 동영상 장면을 생성합니다. 프롬프트에 대화 내용을 기술하면 Veo 3이 입 움직임과 도시 환경 소음을 함께 생성합니다.
분위기 있는 풍경 콘텐츠
여행 Vlog 장면·빗속의 도시 환경·안개 낀 자연 풍경을 제작하며, Veo 3의 환경 오디오 생성이 후반 작업 없이 깊이를 더합니다.
내레이션이 포함된 제품 데모 동영상
내레이터가 기능을 설명하는 제품 쇼케이스 클립을 생성합니다. 프롬프트에 내레이션 텍스트를 포함하면 Veo 3이 시각적 데모와 음성 오디오를 한 번에 렌더링합니다.
Veo 3 + OpenClaw 자주 묻는 질문
네. OpenClaw 에이전트는 RunAPI Veo 3 text_to_video 엔드포인트를 직접 호출합니다. model을 veo-3.1로 설정하고 채팅에 사용하는 것과 동일한 RUNAPI_API_KEY로 요청을 보내세요. 추가 스킬, 플러그인 또는 Google Cloud 계정이 필요 없습니다.
Veo 3는 텍스트 프롬프트에서 네이티브로 동기화된 오디오를 생성합니다. 프롬프트에 대화를 따옴표로 포함하고 주변 소리나 음악을 설명하면 — 별도의 오디오 파이프라인 없이 매칭되는 오디오가 생성됩니다.
두 모델 모두 최대 1080p의 네이티브 오디오가 포함된 영상을 생성합니다. veo-3.1은 전체 품질 파이프라인을 사용하며 생성당 비용이 더 높습니다. veo-3.1-fast는 일부 시각적 품질을 낮추는 대신 비용이 저렴하고 처리가 더 빠릅니다 — 초안 작업과 반복 작업에 적합합니다.
네. RunAPI는 Veo 3용 extend_video와 upscale_video 엔드포인트를 제공합니다. 클립을 확장하려면 원본 생성의 source_task_id를 전달하거나, 1080p 또는 4K 해상도로 업스케일하세요. 두 작업 모두 비동기로 처리되며 별도로 청구됩니다.
Veo 3는 최대 1080p 기본 해상도로 4초, 6초, 또는 8초 클립을 생성합니다. upscale_video 엔드포인트를 사용하여 완료된 영상을 4K로 업스케일할 수 있습니다. 화면 비율 옵션은 16:9, 9:16, auto입니다.
지금 OpenClaw에서 Veo 3를 사용해보세요.
무료 RunAPI key를 발급받고, OpenClaw에 프롬프트를 붙여넣어 Google Veo 3로 네이티브 오디오가 포함된 시네마틱 영상을 생성하세요.