OPENCLAW + VEO 3

Veo 3 in OpenClaw verwenden.

Veo 3 ist Googles DeepMind-Videogenerierungsmodell, das 1080p-Clips von bis zu 8 Sekunden mit nativem Audio produziert — synchronisierter Dialog, Umgebungssound und Musik werden gemeinsam mit dem Video generiert. OpenClaw-Agenten rufen es über denselben RunAPI-Key und -Endpunkt wie für Chat auf, ohne zusätzliche Skills zu installieren.

ein API-Key · Text-to-Video-Endpunkt · nativer Audio-Output
Einen Kino-Videoclip mit nativem Audio über Google Veo 3 via RunAPI generieren.


      Requirements:

      - Read the API key from RUNAPI_API_KEY. Do not hardcode the key.

      - Send a POST request to https://runapi.ai/api/v1/veo_3_1/text_to_video

      - Set model to "veo-3.1".

      - Write a descriptive prompt including scene, camera movement, and audio cues.

      - Set duration_seconds to 4, 6, or 8.

      - Set aspect_ratio to "16:9", "9:16", or "auto".

      - The task is async. Poll the returned task_id until status is "completed".

      - When done, read the video URL from the response output.

      
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
  -H "Authorization: Bearer $RUNAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "veo-3.1",
    "prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns, light rain.",
    "duration_seconds": 8,
    "aspect_ratio": "16:9"
  }'
{
  "task_id": "tsk_abc123",
  "status": "pending",
  "model": "veo-3.1"
}
Den curl-Befehl kopieren und testen veo-3
SO FUNKTIONIERT ES

Veo 3 in OpenClaw in drei Schritten verwenden

1

RunAPI konfigurieren

Die RUNAPI_API_KEY-Umgebungsvariable setzen. Wenn RunAPI bereits als OpenClaw-Provider für Chat konfiguriert ist, funktioniert derselbe Key für die Videogenerierung — keine zusätzliche Einrichtung oder Provider-Konten.

export RUNAPI_API_KEY=runapi_xxx
2

Veo 3 text_to_video aufrufen

Einen POST-Request an den text_to_video-Endpunkt mit model veo-3.1 senden. Einen Prompt mit Szenenbeschreibungen und Audio-Hinweisen (Dialog, Umgebungsgeräusche) einschließen. duration_seconds auf 4, 6 oder 8 und aspect_ratio auf 16:9 oder 9:16 setzen.

POST /api/v1/veo_3_1/text_to_video
3

Ergebnis abrufen

Der Endpunkt gibt sofort eine task_id zurück. Den Task-Status-Endpunkt abfragen, bis der Status auf completed wechselt, dann die Video-URL aus der Antwort abrufen. Das Video enthält synchronisierten Audio, der aus dem Prompt generiert wurde.

GET /api/v1/veo_3_1/text_to_video/tsk_abc123
PARAMETER

Veo 3 text_to_video-Parameter

Parameter Typ Beschreibung
model string Erforderlich. veo-3.1 (Standardqualität) oder veo-3.1-fast (niedrigere Kosten, schnellere Generierung).
prompt string Erforderlich. Szenenbeschreibung mit visueller Aktion, Kamerabewegung und Audio-Hinweisen für Dialog oder Umgebungsgeräusche.
duration_seconds integer Optional. Videolänge in Sekunden. Akzeptierte Werte: 4, 6, 8. Standard ist 8.
aspect_ratio string Optional. Ausgabe-Seitenverhältnis. Akzeptierte Werte: 16:9, 9:16, auto.
input_mode string Optional. Generierungsmodus. text (Standard), first_and_last_frames (Keyframe-gesteuert) oder reference (Stil-Referenz).
first_frame_image_url string Optional. URL des ersten Frame-Bildes. Wird verwendet, wenn input_mode first_and_last_frames ist.
last_frame_image_url string Optional. URL des letzten Frame-Bildes. Wird verwendet, wenn input_mode first_and_last_frames ist.
reference_image_urls array Optional. URLs von Stil-Referenzbildern. Wird verwendet, wenn input_mode reference ist.
callback_url string Optional. Webhook-URL, die einen POST erhält, wenn der Task abgeschlossen ist.

Was ist Veo 3 auf OpenClaw?

Veo 3 ist Google DeepMinds Videomodell, das lebensechte, kinematische Visuals mit eingebautem präzisem Ambient-Audio produziert. Es generiert 1080p-Clips bis zu 8 Sekunden mit synchronisiertem Dialog, Soundeffekten und Musik – keine separate Audio-Pipeline erforderlich. OpenClaw-Agenten rufen es über den RunAPI-Endpunkt mit demselben API-Key auf, der für Chat konfiguriert ist.

Veo 3 Anwendungsfälle

Straßeninterviews und Dialogszenen

Kurze Videosequenzen mit sprechenden Charakteren generieren. Den Dialog im Prompt beschreiben und Veo 3 produziert synchronisierte Lippenbewegungen und Ambient-Stadtgeräusche zusammen.

Atmosphärischer und Landschafts-Content

Reisevlog-Szenen, regengetränkte Stadtumgebungen oder neblige Naturaufnahmen erstellen, bei denen Veo 3s Ambient-Sound-Generierung ohne nachträgliche Audio-Arbeit Tiefe hinzufügt.

Produkt-Demo-Videos mit Voiceover

Produktpräsentationsclips generieren, bei denen ein Sprecher Funktionen beschreibt. Den Voiceover-Text im Prompt einschließen und Veo 3 rendert sowohl das visuelle Demo als auch den gesprochenen Audio in einem Durchgang.

FAQ

Veo 3 + OpenClaw — Fragen

OpenClaw Grundeinrichtung

Noch nicht eingerichtet? Mit der RunAPI-Einrichtungsanleitung für OpenClaw starten.

OpenClaw Einrichtungsanleitung →

Veo 3 Modellkatalog

Veo 3-Varianten, Preise und API-Dokumentation ansehen.

Veo 3 on RunAPI →

Veo 3 in OpenClaw noch heute ausprobieren.

Einen kostenlosen RunAPI-Key holen, den Prompt in OpenClaw einfügen und Kino-Videos mit nativem Audio über Google Veo 3 generieren.