Wan 3.0 من صورة مرجعية إلى فيديو
ارفع الوجه والسترة والمنتج والصوت — يأخذها Wan 3.0 أربعتها ويبقي كل واحدة منها كما هي حتى ثلاثين ثانية، داخل مشهد لم يوجد قط. حتى عشر صور وخمسة مقاطع وخمسة مسارات صوتية في عملية إنشاء واحدة.
ثلاث عمليات منشورة من Wan 3.0، ثم بقية الأفكار على الموقع · «جرّب هذا» يحمّل البرومبت
16:9 · 720P · 5 ثيستشهد بالصورة 1 ويثبّتها
ما الذي يبقيه التحويل من صورة مرجعية إلى فيديو
كما هو
ترفع أنت المواد، ويبني Wan 3.0 مشهدًا يلتزم بها.
التحويل من صورة مرجعية إلى فيديو مع Wan 3.0 يأخذ حتى عشرين أصلًا مرجعيًا — عشر صور وخمسة مقاطع فيديو وخمسة مسارات صوتية — ويعامل كل واحد منها قيدًا لا نقطة انطلاق. فتبقى تلك الوجوه والملابس والأدوات والأصوات والعلاقات المكانية متسقة طوال لقطة واحدة تصل إلى ثلاثين ثانية، والصوت يُولَّد في المرور نفسه.
- Images · clips · audio
- 10 + 5 + 5
- أصلًا في طلب واحد
- 20
- أي ثانية صحيحة
- 2–30 s
- 30 إطارًا في الثانية، والصوت مشمول
- 480P / 720P / 1080P
Images · clips · audio
أصلًا في طلب واحد
أي ثانية صحيحة
30 إطارًا في الثانية، والصوت مشمول
- ليس برنامج مونتاج — فهو يبني مشهدًا جديدًا لا يعدّل مشهدًا قديمًا
- ليس تبديل وجوه، ولا وسيلة لوضع شخص في فيديو دون موافقته
- بلا إطار أول إلى جانب المراجع — فالعائلتان تستبعد كل منهما الأخرى
لماذا لا يقبل Wan 3.0 مراجع وإطارًا أول معًا
لدى Wan 3.0 عائلتان من مدخلات الوسائط، والطلب الواحد لا يستخدم إلا واحدة منهما.
reference_imageعائلة المراجعهذه الصفحةreference_image·reference_video·reference_audio·file·link— مواد يستعير منها النموذج ليبني مشهدًا لم يوجد قط.
first_frameعائلة الإطاراتتحويل الصورة إلى فيديوfirst_frame·last_frame— افتتاحية محددة بالضبط، ونهاية محددة اختياريًا، على الناتج أن يمر بهما.
أرسل واحدًا من كل عائلة فيرفض Wan 3.0 الطلب من أساسه بدل أن يختار فائزًا — ولهذا تعطّل هذه الصفحة مدخلات الإطارات لحظة إضافتك مرجعًا. والرفض يقع عند Alibaba بعد دخولك الطابور، فالتقاطه هنا يكلفك ثانية بدل أن يكلفك مكانك في الطابور.
وأي عائلة تريد يتبع السؤال الذي تطرحه. «ابدأ من هذه الصورة بالضبط» إطار، وذلك هو تحويل الصورة إلى فيديو. و«أبقِ هذا الوجه لكن في مكان لم يكن فيه قط» مرجع، وذلك هو هذه الصفحة. وإن كان الموضوع ينحرف داخل مقطع واحد لا بين لقطات، فمجموعة المراجع ليست العلاج — اتساق الشخصيات هو العلاج.
كم مرجعًا
يقبل Wan 3.0
ثلاثة أنواع من المواد تدخل إلى Wan 3.0، ولكل نوع سقفه: عشر صور، وخمسة مقاطع فيديو، وخمسة مسارات صوتية.
⚠️ يحتسب Wan 3.0 ثواني المقطع المرجعي إلى جانب ثواني إخراجك، ولا يجوز أن يتجاوز مجموعهما ثلاثين. فست ثوانٍ من المرجع مع إخراج من عشرين ثانية تساوي ستًا وعشرين ثانية محتسبة وطلبًا صحيحًا؛ أما ست مع ثمانٍ وعشرين فلا. والصور والصوت والمستندات والروابط لا تضيف شيئًا.
- الصور المرجعية
- حتى 10 · حتى 20 ميغابايت لكل صورة · JPEG · JPG · PNG (بلا ألفا) · BMP · WEBPمن 240 إلى 8,000 بكسل لكل ضلع، ونسبة حتى 8:1
- رسمي
- المقطع المرجعي
- حتى 5 مقاطع · 1–15 ثانية لكل مقطع · 15 ثانية إجمالًا لكل المقاطع · mp4 · mov · حتى 100 ميغابايت لكل مقطع
- رسمي
- الصوت المرجعي
- حتى 5 مسارات · 1–15 ثانية لكل مسار · 15 ثانية إجمالًا · wav · mp3 · حتى 15 ميغابايت لكل مسار
- رسمي
- المجموع
- 20، وهي حاصل جمع الثلاثةتضع Alibaba حدًا لكل نوع. ولا يوجد سقف منفصل للمجموع — فهذا السطر حساب لا رقم منشور.
- رسمي
خمس خانات فيديو بخمس عشرة ثانية لكل منها تساوي خمسًا وسبعين ثانية، والسقف خمس عشرة — فعلى الفيديو لا يكون عدد الخانات هو القيد المُلزِم أبدًا، بل المجموع الجاري. والعدّاد فوق صندوق البرومبت يتتبع الاثنين، بالثواني وبالرصيد، قبل أن تضغط زر الإنشاء.
ما الذي يثبّته Wan 3.0 فعلًا
تسرد Alibaba أربعة محاور لاتساق Wan 3.0. ويستحق كل منها أن يُعرف على حدة، لأن ما ينحرف عادة هو واحد منها لا الأربعة معًا.
الموضوع
ما تشير إليه الكاميرا.
charactersالشخصيات
ملامح الوجه، وتسريحة الشعر ولونه، وبنية الجسم، والملابس، والإكسسوارات.
بدقة تكفي لبقاء أحزمة السترة عبر مشهد قتال.
propsالأدوات
المظهر من زوايا متعددة، وبنية القطع، والشعارات، وتفاصيل الخامة.
الزجاجة نفسها، لقطة بعد لقطة، والملصق سليم.
المشهد
كل ما يحيط بالموضوع.
spaceالمكان
توزيع الشخصيات ومنظور الكاميرا، مع إبقاء العلاقات المكانية صحيحة.
الجغرافيا تتوقف عن الانحراف بين اللقطات.
styleStyle
نبرة سينمائية تُقدَّم باتساق، بلا تسرب بين المظاهر في مشروع متعدد الأساليب.
تدرج لوني واحد عبر المجموعة كلها.
معرض Wan 3.0 الرسمي من Alibaba يمرر مرجعين مصورين عبر ثلاثين ثانية من الحركة السريعة ويمسك الفرو والملابس والأغماد والتوزيع طوال الوقت. ذلك هو السقف؛ أما نتيجتك فتعتمد في أغلبها على جودة المراجع.
وأغلب العمل الحقيقي ليس لقطة واحدة طويلة — بل ثلاثة أو أربعة مقاطع يجب أن تبدو من إنتاج واحد، والطريقة إلى ذلك أكثر مللًا مما تبدو: أبقِ كل شيء ثابتًا عدا البرومبت. الملفات نفسها بايتًا ببايت، والمهمة نفسها لكل أصل، وجملة الأسلوب نفسها في النهاية، والدقة والنسبة نفسهما. ولا تغيّر سوى الفعل والكاميرا. وإعادة رفع نسخة أُعيد تصديرها قليلًا من الصورة نفسها هي السبب المعتاد لانحراف التسلسل، لأن الملف لم يعد مطابقًا — فنموذج Wan 3.0 بلا ذاكرة بين الطلبات، والاتساق كله دالة لما تسلمه إليه.
أعطِ كل مرجع في Wan 3.0 مهمة واحدة
هذا هو الجزء الذي يحدد إن كانت النتيجة ستبدو صحيحة، وهو موضع خطأ أغلب المحاولات على Wan 3.0. فالنموذج لا يخمّن لماذا رفعت ملفًا — بل تخبره أنت، داخل البرومبت، بالرقم.
ثبّت وجهًا وملابسأقوى ما يفعله Wan 3.0. شخص واحد لكل صورة، من الأمام وبإضاءة جيدة، يتفوق على الفني في كل مرة — فصورة بأسلوب جواز السفر تتفوق على صورة شخصية بمزاج خاص.
الصورة 1 هي المرأة ذات المعطف الصوفي الرمادي؛ أبقِ وجهها وشعرها ومعطفها كما هي بالضبط.
ثبّت منتجًا أو أداةالمظهر من زوايا متعددة والشعارات والقطع والخامة تثبت جميعًا. وزاويتان للجسم نفسه تعملان أفضل من لقطة بطولية واحدة.
الصورة 2 والصورة 3 هما الزجاجة نفسها؛ أبقِ الملصق وقطعة الغطاء.
امنح حركة وإيقاعًاالمقطع المرجعي ليس موجودًا ليُنسخ — بل ليمنح إيقاعه: كم يثبت المشهد، وكيف يتحرك الانتقال.
الفيديو 1 يمنح إيقاع المشي وحده، لا الشخصية.
امنح صوتًا، أو حدد المكانالمرجع الصوتي يحدد طابع الصوت، ومقترنًا بوجه مرجعي تتبعه مزامنة الشفاه. أما لوحة الموقع فتثبّت التوزيع ومنظور الكاميرا حتى تتوقف الجغرافيا عن الانحراف.
الصوت 1 يمنح الطابع وحده. والصورة 4 تحدد الغرفة وارتفاع الكاميرا.
اكتب Image 1، لا image1
Image 1 · Video 1 · Audio 1Wan 3.0@image1Seedance
يتوقع Wan 3.0 الصيغة الإنجليزية بحرف كبير ومسافة. أما @image1 فهي صيغة Seedance، وعدة أدلة تكررها هنا حيث لا تُقرأ. والترقيم يجري منفصلًا داخل كل نوع وسائط ويتبع ترتيب الرفع — فأعد ترتيب ملفاتك تكن قد صنعت طلبًا مختلفًا.
عشرون أصلًا هو الرقم البارز؛ أما الرقم الذي ينبغي أن تستخدمه فأصغر بكثير. موضوع واحد لكل صورة، ومهمة واحدة لكل أصل — فما إن يحمل ملف واحد مهمتين متعارضتين، أو تحوي صورة واحدة شخصين، حتى يضطر النموذج إلى التخمين، والتخمين هو ما رفعت المراجع لتمنعه. وأغلب المشاهد الجيدة تُنجز بثلاثة أو أربعة. وتفضّل ألا تكتب بقية البرومبت؟ مولد برومبت يكتبه بترتيب Alibaba.
متى ينكسر اتساق Wan 3.0، وما العمل
وضع المراجع هو المسار الوحيد في Wan 3.0 الذي تُحتسب فيه مدخلاتك أيضًا، فالعملية التي تعود خاطئة تكلفك مرتين. وهذه هي الطرق الخمس التي تسوء بها، مرتبة بحسب احتمال أن تصادفها — واللوحة فوق زر الإنشاء تقرأ إعدادك بحثًا عما تستطيع رؤيته قادمًا.
الشخصية لا تشبه المرجع
في الغالب لأن الصورة تحوي أكثر من شخص، أو لأن تلك الصورة نفسها طُلب منها أيضًا تحديد الموقع أو الأسلوب.
موضوع واحد لكل صورة، ومهمة واحدة لكل أصل.
شخصيتان تتداخلان عند التلامس
المواضع المتداخلة مع الفعل المتزامن أصعب حالة. تحقق أولًا على لقطة فيها فصل واضح، ثم أضف التلامس.
شخصيتان متباعدتان جيدًا أمر يُعتمد عليه؛ أما حشد يتلامس فلا.
الحركة تتجاهل المقطع المرجعي
ذلك الأصل طُلب منه أيضًا تحديد شخصية، فهو يحمل مهمتين وعلى النموذج أن يختار إحداهما.
قسّمه إلى أصلين لكل منهما مهمة واحدة.
الفاتورة أكبر من المتوقع
ثواني المقطع المرجعي تُحتسب بسعر إخراجك، وتُحسب ضمن سقف الثلاثين ثانية نفسه. أما الصور والصوت والمستندات والروابط فبلا مقابل.
6 ثوانٍ مرجع + 20 ثانية إخراج = 26 ثانية محتسبة.
الطلب يُرفض قبل الإنشاء
أُرسل إطار أول إلى جانب المراجع. والعائلتان تستبعد كل منهما الأخرى، والرفض يطال الطلب كله لا مدخلًا واحدًا.
الترتيب: الصورة 1 · الصورة 2 · الفيديو 1 — بلا مدخلات إطارات.
ابدأ بسيطًا للتحقق من جودة المراجع، ثم أضف التعقيد. فمشهد يفشل بخمس شخصيات ينجح غالبًا باثنتين، ومقطعان نظيفان يُركَّبان معًا أفضل من واحد مشوّش.
كم يكلف مقطع من صورة مرجعية إلى فيديو مع Wan 3.0
السعر لكل ثانية هو نفسه في كل الأوضاع — والمراجع نفسها بلا رسم إضافي. والاستثناء الوحيد هو المقطع المرجعي: تُحتسب ثوانيه بالسعر نفسه الذي يُحتسب به إخراجك. أما الصور والصوت والمستندات والروابط فلا تضيف شيئًا. وكما في كل موضع آخر، العملية الفاشلة يُعاد رصيدها تلقائيًا، فكل ما تكلفك إياه عملية سيئة هو الانتظار.
كيف تُحتسب الفاتورة
- الاحتساب بحسب
- ثانية الإخراج
- الصور المرجعية · الصوت · الملف · الرابط
- free
- المقطع المرجعي
- يُحتسب بسعر إخراجك
- العملية الفاشلة
- refunded
- الصور المرجعية · الصوت · الملف · الرابط
- بلا رسم إضافي
المقطع المرجعي هو المتغير الثالث الذي تملكه هذه الصفحة ولا تملكه بقية الأدوات: فمقطع مرجعي من 15 ثانية على إخراج من 15 ثانية يساوي ثلاثين ثانية محتسبة لا خمس عشرة. جرّب عند 480P، ثم شغّل ما ستحتفظ به مرة واحدة. الأسعار كاملة
الأرصدة الشهرية نفسها في الحالتين
استخدام شبه شخص حقيقي
التحويل من صورة مرجعية إلى فيديو مع Wan 3.0 يمسك وجهًا عبر لقطة كاملة. تلك هي الميزة، وهي أيضًا ما يجعل إساءة الاستخدام سهلة تمامًا، فالقاعدة هنا قصيرة: لا ترفع شبه أحد إلا بموافقته.
- الوجوهفيديو لشخص حقيقي يحتاج موافقته — لا الشخصيات العامة، ولا صورة شخص غريب.
- الأصواتمرجع الطابع يستنسخ كيف يبدو صوت شخص بعينه. استخدم صوتك، أو صوتًا مرخّصًا، أو صوتًا اصطناعيًا.
- الشخصياتالشخصية المحمية بحقوق النشر لا تصير ملكك لأن نموذجًا أعاد توليدها.
- القاصرونلا ترفع أبدًا مراجع تصوّر قاصرين.
- الرقابةالوسائط المرسلة تُفحص آليًا، والبلاغات تصل إلى صندوق بريد مراقَب، وطلبات الإزالة تُعالَج سريعًا لا في وقت لاحق. وتقع أخطاء في الاتجاهين.
أسئلة من صورة مرجعية إلى فيديو مع Wan 3.0
ما الذي يثبّته التحويل من صورة مرجعية إلى فيديو عبر اللقطة، وما الذي تضيفه ثواني المراجع إلى الفاتورة
هل يلزم التسجيل لتجربة التحويل من صورة مرجعية إلى فيديو مع Wan 3.0؟
كم صورة مرجعية يقبل Wan 3.0؟
هل يمكنني استخدام صورة مرجعية وإطار أول معًا في Wan 3.0؟
لماذا تبدو شخصيتي مختلفة عن مرجع Wan 3.0؟
هل يجعل المقطع المرجعي مقطع Wan 3.0 أغلى؟
هل يستطيع Wan 3.0 إبقاء الصوت متسقًا كما يبقي الوجه؟
كم شخصية يمكن أن تتشارك لقطة Wan 3.0 واحدة؟
هل تنتقل المراجع عبر عمليات إنشاء منفصلة في Wan 3.0؟
ما الصيغ التي يقبلها Wan 3.0 للمراجع؟
هل يمكنني استخدام مقاطع الفيديو تجاريًا؟
وزّع أدوار أول مشهد لك على Wan 3.0
ارفع وجهًا واحدًا، وأعطه مهمة واحدة، وصف اللقطة. Wan 3.0 في وضع المراجع يعمل بالرصيد، من 480P فما فوق — وموادك بلا رسم إضافي، والعملية الفاشلة يُعاد رصيدها تلقائيًا.
كتبه ويحافظ عليه فريق التحرير في wan-3.runنُشر في آخر تحديث إصدار الأداة 2026.09.4
