OPENCLAW + VEO 3

Usa Veo 3 in OpenClaw.

Veo 3 è il modello di generazione video di Google DeepMind che produce clip 1080p fino a 8 secondi con audio nativo — dialoghi sincronizzati, suoni ambientali e musica generati insieme al video. Gli agenti OpenClaw lo chiamano tramite la stessa API key e lo stesso endpoint RunAPI usati per la chat, senza skill aggiuntivi da installare.

una API key · endpoint text to video · output audio nativo
Genera un clip video cinematografico con audio nativo usando Google Veo 3 tramite RunAPI.

Requisiti:
- Leggi la API key da RUNAPI_API_KEY. Non inserire la key nel codice.
- Invia una richiesta POST a https://runapi.ai/api/v1/veo_3_1/text_to_video
- Imposta model su "veo-3.1".
- Scrivi un prompt descrittivo che includa scena, movimento della telecamera e indicazioni audio.
- Imposta duration_seconds su 4, 6 o 8.
- Imposta aspect_ratio su "16:9", "9:16" o "auto".
- Il task è asincrono. Esegui il polling del task_id restituito finché lo stato non è "completed".
- Al termine, leggi l'URL video dall'output della risposta.
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "veo-3.1",
    "prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns,\ light rain.",
    "duration_seconds": 8,
    "aspect_ratio": "16:9"
  }'
{
  "task_id": "tsk_abc123",
  "status": "pending",
  "model": "veo-3.1"
}
Copia il comando curl per testare veo-3
COME FUNZIONA

Usa Veo 3 in OpenClaw in tre passaggi

1

Configura RunAPI

Imposta la variabile d'ambiente RUNAPI_API_KEY. Se hai già configurato RunAPI come provider OpenClaw per la chat, la stessa key funziona per la generazione video — nessuna configurazione o account provider aggiuntivo.

export RUNAPI_API_KEY=runapi_xxx
2

Chiama Veo 3 text_to_video

Invia una richiesta POST all'endpoint text_to_video con model impostato su veo-3.1. Includi un prompt con descrizioni della scena e indicazioni audio (dialoghi, suoni ambientali). Imposta duration_seconds su 4, 6 o 8 e aspect_ratio su 16:9 o 9:16.

POST /api/v1/veo_3_1/text_to_video
3

Ottieni il risultato

L'endpoint restituisce subito un task_id. Esegui il polling dell'endpoint di stato del task finché lo stato non cambia in completed, poi recupera l'URL del video di output. Il video include l'audio sincronizzato generato dal tuo prompt.

GET /api/v1/veo_3_1/text_to_video/tsk_abc123
PARAMETRI

Parametri Veo 3 text_to_video

Parametro Tipo Descrizione
model string Obbligatorio. veo-3.1 (qualità standard) o veo-3.1-fast (costo inferiore, generazione più rapida).
prompt string Obbligatorio. Descrizione della scena con azione visiva, movimento della telecamera e indicazioni audio per dialoghi o suoni ambientali.
duration_seconds integer Facoltativo. Durata del video in secondi. Valori accettati: 4, 6, 8. Predefinito: 8.
aspect_ratio string Facoltativo. Rapporto d'aspetto dell'output. Valori accettati: 16:9, 9:16, auto.
input_mode string Facoltativo. Modalità di generazione. text (predefinito), first_and_last_frames (guidato da keyframe) o reference (riferimento di stile).
first_frame_image_url string Facoltativo. URL dell'immagine del primo fotogramma. Usato quando input_mode è first_and_last_frames.
last_frame_image_url string Facoltativo. URL dell'immagine dell'ultimo fotogramma. Usato quando input_mode è first_and_last_frames.
reference_image_urls array Facoltativo. URL di immagini di riferimento per lo stile. Usato quando input_mode è reference.
callback_url string Facoltativo. URL webhook che riceve una POST quando il task è completato.

Cos'è Veo 3 su OpenClaw?

Veo 3 è il modello video di Google DeepMind che produce visual cinematografici realistici con audio ambientale preciso integrato. Genera clip 1080p fino a 8 secondi con dialogo sincronizzato, effetti sonori e musica -- nessuna pipeline audio separata necessaria. Gli agenti OpenClaw lo chiamano tramite l'endpoint RunAPI usando la stessa API key configurata per la chat.

Casi d'uso di Veo 3

Interviste di strada e scene di dialogo

Generare brevi scene video con personaggi che parlano dialogo. Descrivi la conversazione nel prompt e Veo 3 produce movimenti delle labbra sincronizzati e rumore ambientale urbano insieme.

Contenuto atmosferico e paesaggistico

Creare scene di vlog di viaggio, ambienti urbani sotto la pioggia o riprese di natura nebbiosa dove la generazione di suono ambientale di Veo 3 aggiunge profondità senza lavoro audio in post-produzione.

Video dimostrativi di prodotti con voce fuori campo

Generare clip di presentazione dei prodotti dove un narratore descrive le caratteristiche. Includere il testo della voce fuori campo nel prompt e Veo 3 renderizza sia la demo visiva che l'audio parlato in un unico passaggio.

FAQ

Domande su Veo 3 + OpenClaw

Configurazione generale di OpenClaw

Non ancora configurato? Inizia con la guida di configurazione RunAPI per OpenClaw.

Guida di configurazione di OpenClaw →

Catalogo modelli Veo 3

Vedi le varianti Veo 3, i prezzi e la documentazione API.

Veo 3 su RunAPI →

Prova Veo 3 in OpenClaw oggi.

Ottieni una API key RunAPI gratuita, incolla il prompt in OpenClaw e genera video cinematografici con audio nativo usando Google Veo 3.