Usa Veo 3 en OpenClaw.
Veo 3 es el modelo de generación de video de Google DeepMind que produce clips a 1080p de hasta 8 segundos con audio nativo — diálogo sincronizado, sonido ambiental y música generados junto con el video. Los agentes de OpenClaw lo llaman a través de la misma clave y endpoint de RunAPI usados para chat, sin necesidad de instalar skills adicionales.
Genera un clip de video cinemático con audio nativo usando Google Veo 3 a través de RunAPI.
Requisitos:
- Lee la clave API de RUNAPI_API_KEY. No escribas la clave directamente en el código.
- Envía una solicitud POST a https://runapi.ai/api/v1/veo_3_1/text_to_video
- Establece model en "veo-3.1".
- Escribe un prompt descriptivo incluyendo escena, movimiento de cámara y pistas de audio.
- Establece duration_seconds en 4, 6 u 8.
- Establece aspect_ratio en "16:9", "9:16" o "auto".
- La tarea es asíncrona. Consulta el task_id devuelto hasta que el estado sea "completed".
- Cuando termine, lee la URL del video de la salida de la respuesta.
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "veo-3.1",
"prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns, light rain.",
"duration_seconds": 8,
"aspect_ratio": "16:9"
}'
{
"task_id": "tsk_abc123",
"status": "pending",
"model": "veo-3.1"
}
Usa Veo 3 en OpenClaw en tres pasos
Configura RunAPI
Establece la variable de entorno RUNAPI_API_KEY. Si ya configuraste RunAPI como proveedor de OpenClaw para chat, la misma clave funciona para generación de video — no se necesita configuración adicional ni cuentas de proveedor.
export RUNAPI_API_KEY=runapi_xxx
Llama a Veo 3 text_to_video
Envía un POST al endpoint text_to_video con model establecido en veo-3.1. Incluye un prompt con descripciones de escena y pistas de audio (diálogo, sonidos ambientales). Establece duration_seconds en 4, 6 u 8 y aspect_ratio en 16:9 o 9:16.
POST /api/v1/veo_3_1/text_to_video
Consulta el resultado
El endpoint devuelve un task_id inmediatamente. Consulta el endpoint de estado de la tarea hasta que el estado cambie a completado, luego recupera la URL del video de salida. El video incluye audio sincronizado generado a partir de tu prompt.
GET /api/v1/veo_3_1/text_to_video/tsk_abc123
Parámetros de Veo 3 text_to_video
| Parámetro | Tipo | Descripción |
|---|---|---|
model |
string |
Obligatorio. veo-3.1 (calidad estándar) o veo-3.1-fast (menor coste, generación más rápida). |
prompt |
string |
Obligatorio. Descripción de la escena incluyendo acción visual, movimiento de cámara y pistas de audio para diálogo o sonido ambiental. |
duration_seconds |
integer |
Opcional. Duración del video en segundos. Valores aceptados: 4, 6, 8. Por defecto 8. |
aspect_ratio |
string |
Opcional. Relación de aspecto de salida. Valores aceptados: 16:9, 9:16, auto. |
input_mode |
string |
Opcional. Modo de generación. text (por defecto), first_and_last_frames (guiado por fotogramas clave), o reference (referencia de estilo). |
first_frame_image_url |
string |
Opcional. URL de la imagen del primer fotograma. Se usa cuando input_mode es first_and_last_frames. |
last_frame_image_url |
string |
Opcional. URL de la imagen del último fotograma. Se usa cuando input_mode es first_and_last_frames. |
reference_image_urls |
array |
Opcional. URLs de imágenes de referencia de estilo. Se usa cuando input_mode es reference. |
callback_url |
string |
Opcional. URL de webhook que recibe un POST cuando la tarea se completa. |
¿Qué es Veo 3 en OpenClaw?
Veo 3 es el modelo de video de Google DeepMind que produce visuales cinematográficos realistas con audio ambiental preciso integrado. Genera clips de 1080p de hasta 8 segundos con diálogo sincronizado, efectos de sonido y música -- no se necesita pipeline de audio separado. Los agentes de OpenClaw lo llaman a través del endpoint de RunAPI usando la misma clave API configurada para el chat.
Casos de uso de Veo 3
Entrevistas callejeras y escenas de conversación
Generar escenas de video cortas con personajes hablando diálogo. Describe la conversación en tu prompt y Veo 3 produce movimientos de labios sincronizados y ruido ambiental urbano juntos.
Contenido atmosférico y de paisajes
Crear escenas de vlog de viaje, entornos urbanos bajo la lluvia o tomas de naturaleza neblinosa donde la generación de sonido ambiental de Veo 3 añade profundidad sin trabajo de audio en postproducción.
Videos de demostración de productos con voz en off
Generar clips de presentación de productos donde un narrador describe características. Incluir el texto de voz en off en tu prompt y Veo 3 renderiza tanto la demostración visual como el audio hablado en un solo paso.
Preguntas sobre Veo 3 + OpenClaw
Sí. Los agentes de OpenClaw llaman al endpoint text_to_video de Veo 3 en RunAPI directamente. Establece model en veo-3.1 y envía la solicitud con la misma RUNAPI_API_KEY que usas para chat. No se necesitan skills adicionales, plugins ni cuentas de Google Cloud.
Veo 3 produce audio sincronizado de forma nativa a partir del prompt de texto. Incluye diálogos entre comillas y describe sonidos ambientales o música en el prompt — el modelo genera audio correspondiente sin necesidad de un pipeline de audio separado.
Ambos producen video con audio nativo a hasta 1080p. veo-3.1 usa el pipeline de calidad completa y cuesta más por generación. veo-3.1-fast sacrifica algo de fidelidad visual a cambio de menor coste y mayor rapidez — adecuado para borradores e iteraciones.
Sí. RunAPI expone endpoints extend_video y upscale_video para Veo 3. Pasa el source_task_id de la generación original para extender el clip, o escala a resolución 1080p o 4K. Ambos son asíncronos y se facturan por separado.
Veo 3 genera clips de 4, 6 u 8 segundos a una resolución base de hasta 1080p. Puedes escalar los videos completados a 4K usando el endpoint upscale_video. Las opciones de relación de aspecto son 16:9, 9:16 y auto.
Configuración general de OpenClaw
¿Aún no lo has configurado? Empieza con la guía de configuración de RunAPI para OpenClaw.
Guía de configuración de OpenClaw →Catálogo de modelos Veo 3
Ver las variantes de Veo 3, precios y documentación de la API.
Veo 3 en RunAPI →Prueba Veo 3 en OpenClaw hoy.
Obtén una clave RunAPI gratuita, pega el prompt en OpenClaw y genera video cinemático con audio nativo usando Google Veo 3.