OPENCLAW + VEO 3

Usa Veo 3 en OpenClaw.

Veo 3 es el modelo de generación de video de Google DeepMind que produce clips a 1080p de hasta 8 segundos con audio nativo — diálogo sincronizado, sonido ambiental y música generados junto con el video. Los agentes de OpenClaw lo llaman a través de la misma clave y endpoint de RunAPI usados para chat, sin necesidad de instalar skills adicionales.

una clave API · endpoint de texto a video · salida con audio nativo
Genera un clip de video cinemático con audio nativo usando Google Veo 3 a través de RunAPI.


      Requisitos:

      - Lee la clave API de RUNAPI_API_KEY. No escribas la clave directamente en el código.

      - Envía una solicitud POST a https://runapi.ai/api/v1/veo_3_1/text_to_video

      - Establece model en "veo-3.1".

      - Escribe un prompt descriptivo incluyendo escena, movimiento de cámara y pistas de audio.

      - Establece duration_seconds en 4, 6 u 8.

      - Establece aspect_ratio en "16:9", "9:16" o "auto".

      - La tarea es asíncrona. Consulta el task_id devuelto hasta que el estado sea "completed".

      - Cuando termine, lee la URL del video de la salida de la respuesta.

      
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "veo-3.1",
    "prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns, light rain.",
    "duration_seconds": 8,
    "aspect_ratio": "16:9"
  }'
{
  "task_id": "tsk_abc123",
  "status": "pending",
  "model": "veo-3.1"
}
Copia el comando curl para probarlo veo-3
CÓMO FUNCIONA

Usa Veo 3 en OpenClaw en tres pasos

1

Configura RunAPI

Establece la variable de entorno RUNAPI_API_KEY. Si ya configuraste RunAPI como proveedor de OpenClaw para chat, la misma clave funciona para generación de video — no se necesita configuración adicional ni cuentas de proveedor.

export RUNAPI_API_KEY=runapi_xxx
2

Llama a Veo 3 text_to_video

Envía un POST al endpoint text_to_video con model establecido en veo-3.1. Incluye un prompt con descripciones de escena y pistas de audio (diálogo, sonidos ambientales). Establece duration_seconds en 4, 6 u 8 y aspect_ratio en 16:9 o 9:16.

POST /api/v1/veo_3_1/text_to_video
3

Consulta el resultado

El endpoint devuelve un task_id inmediatamente. Consulta el endpoint de estado de la tarea hasta que el estado cambie a completado, luego recupera la URL del video de salida. El video incluye audio sincronizado generado a partir de tu prompt.

GET /api/v1/veo_3_1/text_to_video/tsk_abc123
PARÁMETROS

Parámetros de Veo 3 text_to_video

Parámetro Tipo Descripción
model string Obligatorio. veo-3.1 (calidad estándar) o veo-3.1-fast (menor coste, generación más rápida).
prompt string Obligatorio. Descripción de la escena incluyendo acción visual, movimiento de cámara y pistas de audio para diálogo o sonido ambiental.
duration_seconds integer Opcional. Duración del video en segundos. Valores aceptados: 4, 6, 8. Por defecto 8.
aspect_ratio string Opcional. Relación de aspecto de salida. Valores aceptados: 16:9, 9:16, auto.
input_mode string Opcional. Modo de generación. text (por defecto), first_and_last_frames (guiado por fotogramas clave), o reference (referencia de estilo).
first_frame_image_url string Opcional. URL de la imagen del primer fotograma. Se usa cuando input_mode es first_and_last_frames.
last_frame_image_url string Opcional. URL de la imagen del último fotograma. Se usa cuando input_mode es first_and_last_frames.
reference_image_urls array Opcional. URLs de imágenes de referencia de estilo. Se usa cuando input_mode es reference.
callback_url string Opcional. URL de webhook que recibe un POST cuando la tarea se completa.

¿Qué es Veo 3 en OpenClaw?

Veo 3 es el modelo de video de Google DeepMind que produce visuales cinematográficos realistas con audio ambiental preciso integrado. Genera clips de 1080p de hasta 8 segundos con diálogo sincronizado, efectos de sonido y música -- no se necesita pipeline de audio separado. Los agentes de OpenClaw lo llaman a través del endpoint de RunAPI usando la misma clave API configurada para el chat.

Casos de uso de Veo 3

Entrevistas callejeras y escenas de conversación

Generar escenas de video cortas con personajes hablando diálogo. Describe la conversación en tu prompt y Veo 3 produce movimientos de labios sincronizados y ruido ambiental urbano juntos.

Contenido atmosférico y de paisajes

Crear escenas de vlog de viaje, entornos urbanos bajo la lluvia o tomas de naturaleza neblinosa donde la generación de sonido ambiental de Veo 3 añade profundidad sin trabajo de audio en postproducción.

Videos de demostración de productos con voz en off

Generar clips de presentación de productos donde un narrador describe características. Incluir el texto de voz en off en tu prompt y Veo 3 renderiza tanto la demostración visual como el audio hablado en un solo paso.

FAQ

Preguntas sobre Veo 3 + OpenClaw

Configuración general de OpenClaw

¿Aún no lo has configurado? Empieza con la guía de configuración de RunAPI para OpenClaw.

Guía de configuración de OpenClaw →

Catálogo de modelos Veo 3

Ver las variantes de Veo 3, precios y documentación de la API.

Veo 3 en RunAPI →

Prueba Veo 3 en OpenClaw hoy.

Obtén una clave RunAPI gratuita, pega el prompt en OpenClaw y genera video cinemático con audio nativo usando Google Veo 3.