Używaj Veo 3 w OpenClaw.
Veo 3 to model generowania wideo Google DeepMind, który produkuje klipy 1080p do 8 sekund z natywnym audio — zsynchronizowane dialogi, dźwięki otoczenia i muzyka generowane wraz z wideo. Agenci OpenClaw wywołują go przez ten sam klucz RunAPI i endpoint używany do czatu, bez dodatkowych wtyczek do instalacji.
Wygeneruj kinematograficzny klip wideo z natywnym audio przy użyciu Google Veo 3 przez RunAPI.
Wymagania:
- Odczytaj klucz API ze zmiennej RUNAPI_API_KEY. Nie wpisuj klucza na stałe.
- Wyślij żądanie POST na https://runapi.ai/api/v1/veo_3_1/text_to_video
- Ustaw model na "veo-3.1".
- Napisz opisowy prompt zawierający scenę, ruch kamery i wskazówki audio.
- Ustaw duration_seconds na 4, 6 lub 8.
- Ustaw aspect_ratio na "16:9", "9:16" lub "auto".
- Zadanie jest asynchroniczne. Odpytuj zwrócone task_id aż status będzie "completed".
- Po zakończeniu odczytaj URL wideo z odpowiedzi.
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "veo-3.1",
"prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns, light rain.",
"duration_seconds": 8,
"aspect_ratio": "16:9"
}'
{
"task_id": "tsk_abc123",
"status": "pending",
"model": "veo-3.1"
}
Używaj Veo 3 w OpenClaw w trzech krokach
Skonfiguruj RunAPI
Ustaw zmienną środowiskową RUNAPI_API_KEY. Jeśli skonfigurowałeś już RunAPI jako provider OpenClaw do czatu, ten sam klucz działa do generowania wideo — nie są potrzebne dodatkowe konfiguracje ani konta dostawcy.
export RUNAPI_API_KEY=runapi_xxx
Wywołaj Veo 3 text_to_video
Wyślij POST na endpoint text_to_video z modelem ustawionym na veo-3.1. Dołącz prompt z opisami scen i wskazówkami audio (dialogi, dźwięki otoczenia). Ustaw duration_seconds na 4, 6 lub 8 i aspect_ratio na 16:9 lub 9:16.
POST /api/v1/veo_3_1/text_to_video
Pobierz wynik
Endpoint natychmiast zwraca task_id. Odpytuj endpoint statusu zadania, aż status zmieni się na completed, a następnie pobierz URL wyjściowego wideo. Wideo zawiera zsynchronizowane audio wygenerowane z promptu.
GET /api/v1/veo_3_1/text_to_video/tsk_abc123
Parametry Veo 3 text_to_video
| Parametr | Typ | Opis |
|---|---|---|
model |
string |
Wymagane. veo-3.1 (standardowa jakość) lub veo-3.1-fast (niższy koszt, szybsze generowanie). |
prompt |
string |
Wymagane. Opis sceny zawierający akcję wizualną, ruch kamery i wskazówki audio dotyczące dialogów lub dźwięków otoczenia. |
duration_seconds |
integer |
Opcjonalne. Długość wideo w sekundach. Akceptowane wartości: 4, 6, 8. Domyślnie 8. |
aspect_ratio |
string |
Opcjonalne. Proporcje wyjściowe. Akceptowane wartości: 16:9, 9:16, auto. |
input_mode |
string |
Opcjonalne. Tryb generowania. text (domyślnie), first_and_last_frames (prowadzony klatkami kluczowymi) lub reference (referencja stylu). |
first_frame_image_url |
string |
Opcjonalne. URL obrazu pierwszej klatki. Używane gdy input_mode to first_and_last_frames. |
last_frame_image_url |
string |
Opcjonalne. URL obrazu ostatniej klatki. Używane gdy input_mode to first_and_last_frames. |
reference_image_urls |
array |
Opcjonalne. URL-e obrazów referencyjnych stylu. Używane gdy input_mode to reference. |
callback_url |
string |
Opcjonalne. URL webhooka, który otrzymuje POST po zakończeniu zadania. |
Czym jest Veo 3 w OpenClaw?
Veo 3 to model wideo Google DeepMind, który produkuje realistyczne, kinematograficzne wizualizacje z wbudowanym dźwiękiem otoczenia. Generuje klipy 1080p do 8 sekund z zsynchronizowanymi dialogami, efektami dźwiękowymi i muzyką — bez osobnego pipeline audio. Agenty OpenClaw wywołują go przez endpoint RunAPI z tym samym kluczem API co do czatu.
Zastosowania Veo 3
Wywiady uliczne i sceny dialogowe
Generuj krótkie sceny wideo z postaciami mówiącymi dialogi, ze zsynchronizowaną synchronizacją ust i dźwiękiem otoczenia.
Treści atmosferyczne i krajobrazowe
Twórz sceny vloga podróżniczego, deszczowe środowiska miejskie i krajobrazy naturalne z pasującymi dźwiękami.
Filmy demonstracyjne z komentarzem
Generuj klipy prezentujące produkty, gdzie narrator opisuje funkcje — wszystko w jednym kroku generowania.
Pytania o Veo 3 + OpenClaw
Tak. Agenci OpenClaw wywołują endpoint RunAPI Veo 3 text_to_video bezpośrednio. Ustaw model na veo-3.1 i wyślij żądanie z tym samym RUNAPI_API_KEY, którego używasz do czatu. Nie są wymagane dodatkowe wtyczki, rozszerzenia ani konta Google Cloud.
Veo 3 natywnie generuje zsynchronizowane audio z promptu tekstowego. Umieść dialogi w cudzysłowie i opisz dźwięki otoczenia lub muzykę w prompcie — model generuje pasujące audio bez osobnego potoku audio.
Oba produkują wideo z natywnym audio w rozdzielczości do 1080p. veo-3.1 używa pełnego potoku jakościowego i kosztuje więcej za generowanie. veo-3.1-fast poświęca trochę wierności wizualnej na rzecz niższego kosztu i szybszego czasu realizacji — odpowiedni do szkiców i iteracji.
Tak. RunAPI udostępnia endpointy extend_video i upscale_video dla Veo 3. Przekaż source_task_id z oryginalnego generowania, aby przedłużyć klip, lub skaluj do rozdzielczości 1080p lub 4K. Oba są asynchroniczne i rozliczane osobno.
Veo 3 generuje klipy trwające 4, 6 lub 8 sekund w rozdzielczości bazowej do 1080p. Możesz przeskalować ukończone wideo do 4K za pomocą endpointu upscale_video. Dostępne opcje proporcji to 16:9, 9:16 i auto.
Ogólna konfiguracja OpenClaw
Nie skonfigurowano jeszcze? Zacznij od przewodnika konfiguracji RunAPI dla OpenClaw.
Przewodnik konfiguracji OpenClaw →Wypróbuj Veo 3 w OpenClaw już dziś.
Zdobądź darmowy klucz RunAPI, wklej prompt do OpenClaw i generuj kinematograficzne wideo z natywnym audio przy użyciu Google Veo 3.