لكل مشهد: 4 صور (واسعة / متوسطة / كلوز-أب / لقطة ذروة) — كل برومبت مستقل بذاته مع negative prompt داخلي. وكل صورة لها برومبت موشن/أنيميشن بنفس المعرّف، ولهناك voice-over بنفس الترقيم — لتربطها وتدمجها (mux) بلا لبس.
كل برومبت وحده يكفي لتوليد الصورة: وصف كامل + قفل الستايل + وجه صمّاء باللقب + NEGATIVE PROMPT في النهاية. انسخ المطلوب فرديًا أو الكل كدفعة واحدة.
كل برومبت موشن مربوط بنفس رقم ومسمى الصورة (…-IMGn → …-IMGn-MOTION) مع timeline وربط بالـ VO بنفس الترقيم — وكيل التوليد يعرف أي أنيميشن تُشغَّل على أي صورة.
صناديق نصية مرقّمة بنفس معرّفات الصور والموشن: EP-Sn-VOm — كل صندوق: المتحدث + التوقيت + نص الكلام فقط. ولّد الأصوات منفصلة ثم سمِّها بالمعرّف وادمجها (mux) مع الفيديو مباشرة.
انسخ دفعة الصور ومررها للـ AI media generator. كل برومبت ينتهي بـ NEGATIVE PROMPT — لا تفصله عن الوصف.
لكل صورة استخدم برومبت الموشن الذي يحمل المعرّف نفسه (IMG1 → IMG1-MOTION). المدد: 3–5 ثوانٍ لكل مقطع، مركّبة على التايم-لاين داخل برومبت كل مشهد.
صناديق الـ VO تحمل المعرّفات نفسها: VO1 يوضع فوق IMG1-MOTION في وقته المكتوب. سمِّ الملفات بالمعرّفات ثم mux.