Veo 3 in OpenClaw verwenden.
Veo 3 ist Googles DeepMind-Videogenerierungsmodell, das 1080p-Clips von bis zu 8 Sekunden mit nativem Audio produziert — synchronisierter Dialog, Umgebungssound und Musik werden gemeinsam mit dem Video generiert. OpenClaw-Agenten rufen es über denselben RunAPI-Key und -Endpunkt wie für Chat auf, ohne zusätzliche Skills zu installieren.
Einen Kino-Videoclip mit nativem Audio über Google Veo 3 via RunAPI generieren.
Requirements:
- Read the API key from RUNAPI_API_KEY. Do not hardcode the key.
- Send a POST request to https://runapi.ai/api/v1/veo_3_1/text_to_video
- Set model to "veo-3.1".
- Write a descriptive prompt including scene, camera movement, and audio cues.
- Set duration_seconds to 4, 6, or 8.
- Set aspect_ratio to "16:9", "9:16", or "auto".
- The task is async. Poll the returned task_id until status is "completed".
- When done, read the video URL from the response output.
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "veo-3.1",
"prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns, light rain.",
"duration_seconds": 8,
"aspect_ratio": "16:9"
}'
{
"task_id": "tsk_abc123",
"status": "pending",
"model": "veo-3.1"
}
Veo 3 in OpenClaw in drei Schritten verwenden
RunAPI konfigurieren
Die RUNAPI_API_KEY-Umgebungsvariable setzen. Wenn RunAPI bereits als OpenClaw-Provider für Chat konfiguriert ist, funktioniert derselbe Key für die Videogenerierung — keine zusätzliche Einrichtung oder Provider-Konten.
export RUNAPI_API_KEY=runapi_xxx
Veo 3 text_to_video aufrufen
Einen POST-Request an den text_to_video-Endpunkt mit model veo-3.1 senden. Einen Prompt mit Szenenbeschreibungen und Audio-Hinweisen (Dialog, Umgebungsgeräusche) einschließen. duration_seconds auf 4, 6 oder 8 und aspect_ratio auf 16:9 oder 9:16 setzen.
POST /api/v1/veo_3_1/text_to_video
Ergebnis abrufen
Der Endpunkt gibt sofort eine task_id zurück. Den Task-Status-Endpunkt abfragen, bis der Status auf completed wechselt, dann die Video-URL aus der Antwort abrufen. Das Video enthält synchronisierten Audio, der aus dem Prompt generiert wurde.
GET /api/v1/veo_3_1/text_to_video/tsk_abc123
Veo 3 text_to_video-Parameter
| Parameter | Typ | Beschreibung |
|---|---|---|
model |
string |
Erforderlich. veo-3.1 (Standardqualität) oder veo-3.1-fast (niedrigere Kosten, schnellere Generierung). |
prompt |
string |
Erforderlich. Szenenbeschreibung mit visueller Aktion, Kamerabewegung und Audio-Hinweisen für Dialog oder Umgebungsgeräusche. |
duration_seconds |
integer |
Optional. Videolänge in Sekunden. Akzeptierte Werte: 4, 6, 8. Standard ist 8. |
aspect_ratio |
string |
Optional. Ausgabe-Seitenverhältnis. Akzeptierte Werte: 16:9, 9:16, auto. |
input_mode |
string |
Optional. Generierungsmodus. text (Standard), first_and_last_frames (Keyframe-gesteuert) oder reference (Stil-Referenz). |
first_frame_image_url |
string |
Optional. URL des ersten Frame-Bildes. Wird verwendet, wenn input_mode first_and_last_frames ist. |
last_frame_image_url |
string |
Optional. URL des letzten Frame-Bildes. Wird verwendet, wenn input_mode first_and_last_frames ist. |
reference_image_urls |
array |
Optional. URLs von Stil-Referenzbildern. Wird verwendet, wenn input_mode reference ist. |
callback_url |
string |
Optional. Webhook-URL, die einen POST erhält, wenn der Task abgeschlossen ist. |
Was ist Veo 3 auf OpenClaw?
Veo 3 ist Google DeepMinds Videomodell, das lebensechte, kinematische Visuals mit eingebautem präzisem Ambient-Audio produziert. Es generiert 1080p-Clips bis zu 8 Sekunden mit synchronisiertem Dialog, Soundeffekten und Musik – keine separate Audio-Pipeline erforderlich. OpenClaw-Agenten rufen es über den RunAPI-Endpunkt mit demselben API-Key auf, der für Chat konfiguriert ist.
Veo 3 Anwendungsfälle
Straßeninterviews und Dialogszenen
Kurze Videosequenzen mit sprechenden Charakteren generieren. Den Dialog im Prompt beschreiben und Veo 3 produziert synchronisierte Lippenbewegungen und Ambient-Stadtgeräusche zusammen.
Atmosphärischer und Landschafts-Content
Reisevlog-Szenen, regengetränkte Stadtumgebungen oder neblige Naturaufnahmen erstellen, bei denen Veo 3s Ambient-Sound-Generierung ohne nachträgliche Audio-Arbeit Tiefe hinzufügt.
Produkt-Demo-Videos mit Voiceover
Produktpräsentationsclips generieren, bei denen ein Sprecher Funktionen beschreibt. Den Voiceover-Text im Prompt einschließen und Veo 3 rendert sowohl das visuelle Demo als auch den gesprochenen Audio in einem Durchgang.
Veo 3 + OpenClaw — Fragen
Ja. OpenClaw-Agenten rufen den RunAPI Veo 3 text_to_video-Endpunkt direkt auf. model auf veo-3.1 setzen und den Request mit demselben RUNAPI_API_KEY wie für Chat senden. Keine zusätzlichen Skills, Plugins oder Google-Cloud-Konten erforderlich.
Veo 3 generiert synchronisierten Audio nativ aus dem Textprompt. Dialog in Anführungszeichen einschließen und Umgebungsgeräusche oder Musik im Prompt beschreiben — das Modell generiert passenden Audio ohne separate Audio-Pipeline.
Beide produzieren Videos mit nativem Audio mit bis zu 1080p. veo-3.1 verwendet die vollständige Qualitäts-Pipeline und kostet mehr pro Generierung. veo-3.1-fast tauscht etwas visuelle Qualität gegen niedrigere Kosten und schnellere Fertigstellung — geeignet für Entwürfe und Iterationen.
Ja. RunAPI stellt extend_video- und upscale_video-Endpunkte für Veo 3 bereit. Die source_task_id aus der ursprünglichen Generierung übergeben, um den Clip zu verlängern, oder auf 1080p oder 4K hochzuskalieren. Beide sind asynchron und werden separat abgerechnet.
Veo 3 generiert Clips von 4, 6 oder 8 Sekunden mit bis zu 1080p Basisauflösung. Fertige Videos können mit dem upscale_video-Endpunkt auf 4K hochskaliert werden. Seitenverhältnisoptionen sind 16:9, 9:16 und auto.
OpenClaw Grundeinrichtung
Noch nicht eingerichtet? Mit der RunAPI-Einrichtungsanleitung für OpenClaw starten.
OpenClaw Einrichtungsanleitung →Veo 3 in OpenClaw noch heute ausprobieren.
Einen kostenlosen RunAPI-Key holen, den Prompt in OpenClaw einfügen und Kino-Videos mit nativem Audio über Google Veo 3 generieren.