Usa Veo 3 en OpenClaw.
Veo 3 es el modelo de generación de video de Google DeepMind que produce clips a 1080p de hasta 8 segundos con audio nativo — diálogo sincronizado, sonido ambiental y música generados junto con el video. Los agentes de OpenClaw lo llaman a través de la misma clave y endpoint de RunAPI usados para chat, sin necesidad de instalar skills adicionales.
Genera un clip de video cinemático con audio nativo usando Google Veo 3 a través de RunAPI.
Requisitos:
- Lee la clave API de RUNAPI_API_KEY. No escribas la clave directamente en el código.
- Envía una solicitud POST a https://runapi.ai/api/v1/veo_3_1/text_to_video
- Establece model en "veo-3.1".
- Escribe un prompt descriptivo incluyendo escena, movimiento de cámara y pistas de audio.
- Establece duration_seconds en 4, 6 u 8.
- Establece aspect_ratio en "16:9", "9:16" o "auto".
- La tarea es asíncrona. Consulta el task_id devuelto hasta que el estado sea "completed".
- Cuando termine, lee la URL del video de la salida de la respuesta.
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "veo-3.1",
"prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns, light rain.",
"duration_seconds": 8,
"aspect_ratio": "16:9"
}'
{
"task_id": "tsk_abc123",
"status": "pending",
"model": "veo-3.1"
}
Usa Veo 3 en OpenClaw en tres pasos
Configura RunAPI
Establece la variable de entorno RUNAPI_API_KEY. Si ya configuraste RunAPI como proveedor de OpenClaw para chat, la misma clave funciona para generación de video — no se necesita configuración adicional ni cuentas de proveedor.
export RUNAPI_API_KEY=runapi_xxx
Llama a Veo 3 text_to_video
Envía un POST al endpoint text_to_video con model establecido en veo-3.1. Incluye un prompt con descripciones de escena y pistas de audio (diálogo, sonidos ambientales). Establece duration_seconds en 4, 6 u 8 y aspect_ratio en 16:9 o 9:16.
POST /api/v1/veo_3_1/text_to_video
Consulta el resultado
El endpoint devuelve un task_id inmediatamente. Consulta el endpoint de estado de la tarea hasta que el estado cambie a completado, luego recupera la URL del video de salida. El video incluye audio sincronizado generado a partir de tu prompt.
GET /api/v1/veo_3_1/text_to_video/tsk_abc123
Parámetros de Veo 3 text_to_video
| Parâmetro | Tipo | Descrição |
|---|---|---|
model |
string |
Obligatorio. veo-3.1 (calidad estándar) o veo-3.1-fast (menor coste, generación más rápida). |
prompt |
string |
Obligatorio. Descripción de la escena incluyendo acción visual, movimiento de cámara y pistas de audio para diálogo o sonido ambiental. |
duration_seconds |
integer |
Opcional. Duración del video en segundos. Valores aceptados: 4, 6, 8. Por defecto 8. |
aspect_ratio |
string |
Opcional. Relación de aspecto de salida. Valores aceptados: 16:9, 9:16, auto. |
input_mode |
string |
Opcional. Modo de generación. text (por defecto), first_and_last_frames (guiado por fotogramas clave), o reference (referencia de estilo). |
first_frame_image_url |
string |
Opcional. URL de la imagen del primer fotograma. Se usa cuando input_mode es first_and_last_frames. |
last_frame_image_url |
string |
Opcional. URL de la imagen del último fotograma. Se usa cuando input_mode es first_and_last_frames. |
reference_image_urls |
array |
Opcional. URLs de imágenes de referencia de estilo. Se usa cuando input_mode es reference. |
callback_url |
string |
Opcional. URL de webhook que recibe un POST cuando la tarea se completa. |
O que é Veo 3 no OpenClaw?
Veo 3 é o modelo de vídeo do Google DeepMind que produz visuais cinematográficos realistas com áudio ambiente integrado. Gera clipes 1080p de até 8 segundos com diálogo sincronizado, efeitos sonoros e música — sem pipeline de áudio separado necessário. Agentes OpenClaw o chamam via endpoint RunAPI usando a mesma chave de API configurada para chat.
Casos de uso do Veo 3
Entrevistas de rua e cenas de diálogo
Gere cenas de vídeo curtas com personagens falando diálogo, incluindo sincronização labial e som ambiente.
Conteúdo atmosférico e paisagístico
Crie cenas de vlog de viagem, ambientes urbanos chuvosos e paisagens naturais com sons que realmente combinam.
Vídeos de demonstração de produto com narração
Gere clipes de showcase de produto onde um narrador descreve funcionalidades, tudo em uma única etapa de geração.
Preguntas sobre Veo 3 + OpenClaw
Sí. Los agentes de OpenClaw llaman al endpoint text_to_video de Veo 3 en RunAPI directamente. Establece model en veo-3.1 y envía la solicitud con la misma RUNAPI_API_KEY que usas para chat. No se necesitan skills adicionales, plugins ni cuentas de Google Cloud.
Veo 3 produce audio sincronizado de forma nativa a partir del prompt de texto. Incluye diálogos entre comillas y describe sonidos ambientales o música en el prompt — el modelo genera audio correspondiente sin necesidad de un pipeline de audio separado.
Ambos producen video con audio nativo a hasta 1080p. veo-3.1 usa el pipeline de calidad completa y cuesta más por generación. veo-3.1-fast sacrifica algo de fidelidad visual a cambio de menor coste y mayor rapidez — adecuado para borradores e iteraciones.
Sí. RunAPI expone endpoints extend_video y upscale_video para Veo 3. Pasa el source_task_id de la generación original para extender el clip, o escala a resolución 1080p o 4K. Ambos son asíncronos y se facturan por separado.
Veo 3 genera clips de 4, 6 u 8 segundos a una resolución base de hasta 1080p. Puedes escalar los videos completados a 4K usando el endpoint upscale_video. Las opciones de relación de aspecto son 16:9, 9:16 y auto.
Configuración general de OpenClaw
¿Aún no lo has configurado? Empieza con la guía de configuración de RunAPI para OpenClaw.
Guía de configuración de OpenClaw →Catálogo de modelos Veo 3
Ver las variantes de Veo 3, precios y documentación de la API.
Veo 3 en RunAPI →Prueba Veo 3 en OpenClaw hoy.
Obtén una clave RunAPI gratuita, pega el prompt en OpenClaw y genera video cinemático con audio nativo usando Google Veo 3.