Usa Veo 3 in OpenClaw.
Veo 3 è il modello di generazione video di Google DeepMind che produce clip 1080p fino a 8 secondi con audio nativo — dialoghi sincronizzati, suoni ambientali e musica generati insieme al video. Gli agenti OpenClaw lo chiamano tramite la stessa API key e lo stesso endpoint RunAPI usati per la chat, senza skill aggiuntivi da installare.
Genera un clip video cinematografico con audio nativo usando Google Veo 3 tramite RunAPI.
Requisiti:
- Leggi la API key da RUNAPI_API_KEY. Non inserire la key nel codice.
- Invia una richiesta POST a https://runapi.ai/api/v1/veo_3_1/text_to_video
- Imposta model su "veo-3.1".
- Scrivi un prompt descrittivo che includa scena, movimento della telecamera e indicazioni audio.
- Imposta duration_seconds su 4, 6 o 8.
- Imposta aspect_ratio su "16:9", "9:16" o "auto".
- Il task è asincrono. Esegui il polling del task_id restituito finché lo stato non è "completed".
- Al termine, leggi l'URL video dall'output della risposta.
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "veo-3.1",
"prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns,\ light rain.",
"duration_seconds": 8,
"aspect_ratio": "16:9"
}'
{
"task_id": "tsk_abc123",
"status": "pending",
"model": "veo-3.1"
}
Usa Veo 3 in OpenClaw in tre passaggi
Configura RunAPI
Imposta la variabile d'ambiente RUNAPI_API_KEY. Se hai già configurato RunAPI come provider OpenClaw per la chat, la stessa key funziona per la generazione video — nessuna configurazione o account provider aggiuntivo.
export RUNAPI_API_KEY=runapi_xxx
Chiama Veo 3 text_to_video
Invia una richiesta POST all'endpoint text_to_video con model impostato su veo-3.1. Includi un prompt con descrizioni della scena e indicazioni audio (dialoghi, suoni ambientali). Imposta duration_seconds su 4, 6 o 8 e aspect_ratio su 16:9 o 9:16.
POST /api/v1/veo_3_1/text_to_video
Ottieni il risultato
L'endpoint restituisce subito un task_id. Esegui il polling dell'endpoint di stato del task finché lo stato non cambia in completed, poi recupera l'URL del video di output. Il video include l'audio sincronizzato generato dal tuo prompt.
GET /api/v1/veo_3_1/text_to_video/tsk_abc123
Parametri Veo 3 text_to_video
| Parametro | Tipo | Descrizione |
|---|---|---|
model |
string |
Obbligatorio. veo-3.1 (qualità standard) o veo-3.1-fast (costo inferiore, generazione più rapida). |
prompt |
string |
Obbligatorio. Descrizione della scena con azione visiva, movimento della telecamera e indicazioni audio per dialoghi o suoni ambientali. |
duration_seconds |
integer |
Facoltativo. Durata del video in secondi. Valori accettati: 4, 6, 8. Predefinito: 8. |
aspect_ratio |
string |
Facoltativo. Rapporto d'aspetto dell'output. Valori accettati: 16:9, 9:16, auto. |
input_mode |
string |
Facoltativo. Modalità di generazione. text (predefinito), first_and_last_frames (guidato da keyframe) o reference (riferimento di stile). |
first_frame_image_url |
string |
Facoltativo. URL dell'immagine del primo fotogramma. Usato quando input_mode è first_and_last_frames. |
last_frame_image_url |
string |
Facoltativo. URL dell'immagine dell'ultimo fotogramma. Usato quando input_mode è first_and_last_frames. |
reference_image_urls |
array |
Facoltativo. URL di immagini di riferimento per lo stile. Usato quando input_mode è reference. |
callback_url |
string |
Facoltativo. URL webhook che riceve una POST quando il task è completato. |
Cos'è Veo 3 su OpenClaw?
Veo 3 è il modello video di Google DeepMind che produce visual cinematografici realistici con audio ambientale preciso integrato. Genera clip 1080p fino a 8 secondi con dialogo sincronizzato, effetti sonori e musica -- nessuna pipeline audio separata necessaria. Gli agenti OpenClaw lo chiamano tramite l'endpoint RunAPI usando la stessa API key configurata per la chat.
Casi d'uso di Veo 3
Interviste di strada e scene di dialogo
Generare brevi scene video con personaggi che parlano dialogo. Descrivi la conversazione nel prompt e Veo 3 produce movimenti delle labbra sincronizzati e rumore ambientale urbano insieme.
Contenuto atmosferico e paesaggistico
Creare scene di vlog di viaggio, ambienti urbani sotto la pioggia o riprese di natura nebbiosa dove la generazione di suono ambientale di Veo 3 aggiunge profondità senza lavoro audio in post-produzione.
Video dimostrativi di prodotti con voce fuori campo
Generare clip di presentazione dei prodotti dove un narratore descrive le caratteristiche. Includere il testo della voce fuori campo nel prompt e Veo 3 renderizza sia la demo visiva che l'audio parlato in un unico passaggio.
Domande su Veo 3 + OpenClaw
Sì. Gli agenti OpenClaw chiamano direttamente l'endpoint RunAPI Veo 3 text_to_video. Imposta model su veo-3.1 e invia la richiesta con la stessa RUNAPI_API_KEY che usi per la chat. Non sono necessari skill aggiuntivi, plugin o account Google Cloud.
Veo 3 produce audio sincronizzato nativamente dal prompt testuale. Includi i dialoghi tra virgolette e descrivi suoni ambientali o musica nel prompt — il modello genera l'audio corrispondente senza una pipeline audio separata.
Entrambi producono video con audio nativo fino a 1080p. veo-3.1 usa la pipeline di qualità completa e costa di più per generazione. veo-3.1-fast sacrifica una parte della fedeltà visiva per un costo inferiore e una generazione più rapida — adatto per bozze e iterazioni.
Sì. RunAPI espone gli endpoint extend_video e upscale_video per Veo 3. Passa il source_task_id dalla generazione originale per estendere il clip, oppure effettua l'upscale a risoluzione 1080p o 4K. Entrambi sono asincroni e fatturati separatamente.
Veo 3 genera clip da 4, 6 o 8 secondi fino a 1080p di risoluzione base. Puoi aumentare la risoluzione dei video completati a 4K usando l'endpoint upscale_video. Le opzioni di rapporto d'aspetto sono 16:9, 9:16 e auto.
Configurazione generale di OpenClaw
Non ancora configurato? Inizia con la guida di configurazione RunAPI per OpenClaw.
Guida di configurazione di OpenClaw →Prova Veo 3 in OpenClaw oggi.
Ottieni una API key RunAPI gratuita, incolla il prompt in OpenClaw e genera video cinematografici con audio nativo usando Google Veo 3.