استخدم Veo 3 في OpenClaw.
Veo 3 هو نموذج توليد الفيديو من Google DeepMind، يُنتج مقاطع بدقة 1080p مدتها حتى 8 ثوانٍ مع صوت مدمج — حوار متزامن وأصوات محيطة وموسيقى تُولَّد جنبًا إلى جنب مع الفيديو. تستدعيه وكلاء OpenClaw عبر مفتاح RunAPI ونقطة النهاية ذاتهما المستخدَمين في المحادثة، دون الحاجة إلى تثبيت مهارات إضافية.
Generate a cinematic video clip with native audio using Google Veo 3 through RunAPI.
Requirements:
- Read the API key from RUNAPI_API_KEY. Do not hardcode the key.
- Send a POST request to https://runapi.ai/api/v1/veo_3_1/text_to_video
- Set model to "veo-3.1".
- Write a descriptive prompt including scene, camera movement, and audio cues.
- Set duration_seconds to 4, 6, or 8.
- Set aspect_ratio to "16:9", "9:16", or "auto".
- The task is async. Poll the returned task_id until status is "completed".
- When done, read the video URL from the response output.
curl -X POST https://runapi.ai/api/v1/veo_3_1/text_to_video \
-H "Authorization: Bearer $RUNAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "veo-3.1",
"prompt": "A woman walks through a bustling Tokyo street at night, neon signs reflecting on wet pavement. She speaks into her phone: I just arrived. Ambient city noise, distant car horns, light rain.",
"duration_seconds": 8,
"aspect_ratio": "16:9"
}'
{
"task_id": "tsk_abc123",
"status": "pending",
"model": "veo-3.1"
}
استخدام Veo 3 في OpenClaw في ثلاث خطوات
تهيئة RunAPI
عيّن متغير البيئة RUNAPI_API_KEY. إذا كنت قد هيّأت RunAPI بالفعل كمزود لـ OpenClaw للمحادثة، فإن المفتاح ذاته يعمل لتوليد الفيديو — دون إعداد إضافي أو حسابات مزود أخرى.
export RUNAPI_API_KEY=runapi_xxx
استدعاء Veo 3 text_to_video
أرسل طلب POST إلى نقطة نهاية text_to_video مع ضبط model على veo-3.1. أضف مطالبة تتضمن وصف المشهد وإشارات صوتية (حوار، أصوات محيطة). اضبط duration_seconds على 4 أو 6 أو 8، وaspect_ratio على 16:9 أو 9:16.
POST /api/v1/veo_3_1/text_to_video
استطلاع النتيجة
تُعيد نقطة النهاية task_id فورًا. استطلع نقطة نهاية حالة المهمة حتى تتغير الحالة إلى completed، ثم استرجع رابط الفيديو الناتج. يتضمن الفيديو صوتًا متزامنًا مُولَّدًا من مطالبتك.
GET /api/v1/veo_3_1/text_to_video/tsk_abc123
معاملات Veo 3 text_to_video API
| المعامل | النوع | الوصف |
|---|---|---|
model |
string |
مطلوب. veo-3.1 (الجودة القياسية) أو veo-3.1-fast (تكلفة أقل، توليد أسرع). |
prompt |
string |
مطلوب. وصف المشهد يشمل الحركة البصرية وحركة الكاميرا وإشارات صوتية للحوار أو الأصوات المحيطة. |
duration_seconds |
integer |
اختياري. مدة الفيديو بالثواني. القيم المقبولة: 4، 6، 8. الافتراضي 8. |
aspect_ratio |
string |
اختياري. نسبة عرض الإخراج. القيم المقبولة: 16:9، 9:16، auto. |
input_mode |
string |
اختياري. وضع التوليد. text (الافتراضي)، أو first_and_last_frames (موجَّه بالإطارات المفتاحية)، أو reference (مرجع أسلوب). |
first_frame_image_url |
string |
اختياري. رابط صورة الإطار الأول. يُستخدم عندما يكون input_mode هو first_and_last_frames. |
last_frame_image_url |
string |
اختياري. رابط صورة الإطار الأخير. يُستخدم عندما يكون input_mode هو first_and_last_frames. |
reference_image_urls |
array |
اختياري. روابط صور مرجعية للأسلوب. يُستخدم عندما يكون input_mode هو reference. |
callback_url |
string |
اختياري. رابط webhook يستقبل طلب POST عند اكتمال المهمة. |
ما هو Veo 3 في OpenClaw؟
Veo 3 نموذج الفيديو من Google DeepMind الذي ينتج مرئيات سينمائية حية مع صوت محيط مدمج. يُنشئ مقاطع 1080p تصل إلى 8 ثوانٍ مع حوار متزامن ومؤثرات صوتية وموسيقى — دون الحاجة لخط أنابيب صوتي منفصل. تستدعيه وكلاء OpenClaw عبر نقطة نهاية RunAPI بنفس مفتاح API المهيّأ للمحادثة.
حالات استخدام Veo 3
مقابلات الشارع ومشاهد الحوار
أنتج مشاهد فيديو قصيرة بشخصيات تتحدث بحوار مع مزامنة الشفاه والصوت المحيط.
محتوى طبيعي ومناظر طبيعية
أنشئ مشاهد vlog السفر والبيئات الحضرية الممطرة والمناظر الطبيعية مع الأصوات المتوافقة.
مقاطع عرض توضيحي للمنتجات مع تعليق صوتي
أنتج مقاطع عرض المنتجات حيث يصف المعلق الميزات، كل ذلك في خطوة توليد واحدة.
أسئلة Veo 3 + OpenClaw
نعم. تستدعي وكلاء OpenClaw نقطة نهاية RunAPI Veo 3 text_to_video مباشرة. اضبط model على veo-3.1 وأرسل الطلب بنفس RUNAPI_API_KEY المستخدم في المحادثة. لا حاجة لمهارات إضافية أو إضافات أو حسابات Google Cloud.
يُنتج Veo 3 صوتًا متزامنًا بشكل أصيل من المطالبة النصية. أضف الحوار بين علامتَي اقتباس وصِف الأصوات المحيطة أو الموسيقى في المطالبة — يُولِّد النموذج الصوت المطابق دون خط أنابيب صوتي منفصل.
كلاهما يُنتج فيديو مع صوت مدمج بدقة تصل إلى 1080p. يستخدم veo-3.1 خط أنابيب الجودة الكاملة ويكلف أكثر لكل توليد. يتنازل veo-3.1-fast عن بعض الدقة البصرية مقابل تكلفة أقل وتسليم أسرع — مناسب للمسودات والتكرار.
نعم. تعرض RunAPI نقطتَي نهاية extend_video وupscale_video لـ Veo 3. مرِّر source_task_id من التوليد الأصلي لتمديد المقطع، أو قم بالتكبير إلى دقة 1080p أو 4K. كلاهما غير متزامن ويُحتسب لهما رسوم منفصلة.
يُولِّد Veo 3 مقاطع مدتها 4 أو 6 أو 8 ثوانٍ بدقة أساسية تصل إلى 1080p. يمكنك تكبير الفيديوهات المكتملة إلى 4K باستخدام نقطة نهاية upscale_video. خيارات نسبة العرض هي 16:9 و9:16 وauto.
جرّب Veo 3 في OpenClaw اليوم.
احصل على مفتاح RunAPI مجاني، والصق المطالبة في OpenClaw، وأنشئ فيديو سينمائيًا مع صوت مدمج باستخدام Google Veo 3.