النقاط الرئيسية
- AnimateDiff (github.com/guoyww/AnimateDiff) وحدة حركة جاهزة للتشغيل الفوري لنقاط فحص Stable Diffusion 1.5 وSDXL — لا حاجة لضبط دقيق للنموذج الأساسي.
- يُستخدم حصرياً تقريباً عبر تكاملين يصونهما المجتمع: ComfyUI-AnimateDiff-Evolved (يصونه Kosinkadink) وامتداد AUTOMATIC1111 المسمى sd-webui-animatediff (يصونه continue-revolution).
- يعمل AnimateDiff المعتمد على SD1.5 عادة بـ 8-12 جيجابايت VRAM لتوليد نص إلى فيديو أساسي؛ يحتاج دعم SDXL (mm_sdxl_v10_beta) نحو 13 جيجابايت أو أكثر وفقاً للمستودع الرسمي.
- المخرج الافتراضي لوحدة الحركة هو مقطع من 16 إطاراً، نحو ثانيتين — تستخدم المقاطع الأطول تقنية نافذة منزلقة يطوّرها المجتمع، تكلف بعض الاتساق الزمني عند حدود النوافذ.
- توجد 8 من motion LoRAs رسمية (تكبير للداخل/للخارج، تحريك أفقي يساراً/يميناً، إمالة لأعلى/لأسفل، دوران باتجاه عقارب الساعة/عكسه) تضيف حركة كاميرا أساسية، نحو 77 ميجابايت لكل منها.
- AnimateDiff-Lightning (ByteDance، arXiv:2403.12706) نسخة مقطّرة منفصلة تولّد بـ 1 أو 2 أو 4 أو 8 خطوات بدلاً من 20-50 خطوة المعتادة، مقايضة السرعة ببعض الجودة.
- كود AnimateDiff مرخّص بموجب Apache 2.0، لكن ملف README الرسمي ينص على أن الإصدار مخصص للاستخدام الأكاديمي — ونقطة فحص SD1.5 التي تحرّكها عادة ما تحمل ترخيصها الخاص (غالباً CreativeML OpenRAIL-M)، لذا فإن القول بأنه "مجاني بالكامل للاستخدام التجاري" دون التحقق من كليهما ليس ادعاءً دقيقاً.
📍 في جملة واحدة
AnimateDiff وحدة حركة مجانية مرخّصة بموجب Apache 2.0 تحرّك نقطة فحص Stable Diffusion موجودة دون إعادة تدريبها، تعمل محلياً عبر ComfyUI أو AUTOMATIC1111.
💬 بعبارات بسيطة
تخيّلها كإضافة تُركّبها على نموذج Stable Diffusion تستخدمه بالفعل — يستمر النموذج في الرسم بأسلوبه المعتاد، لكن AnimateDiff يضيف الحركة بين الإطارات لتخرج النتيجة كمقطع قصير بدلاً من صورة ثابتة.
ما هو AnimateDiff؟
AnimateDiff وحدة حركة، وليس نموذج توليد فيديو مستقلاً. يُركَّب على نقطة فحص Stable Diffusion 1.5 أو SDXL تملكها بالفعل — بما في ذلك عمليات الضبط الدقيق وLoRAs الخاصة بالمجتمع — ويضيف اتساقاً زمنياً (بين الإطارات) بحيث ينتج ذلك النموذج مقاطع متحركة قصيرة بأسلوبه البصري الحالي، دون إعادة تدريب نقطة الفحص نفسها.
المشروع هو التنفيذ الرسمي للورقة البحثية Guo et al., "AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning", ICLR 2024 Spotlight, arXiv:2307.04725، ويُصان على GitHub في github.com/guoyww/AnimateDiff.
هذا سلسلة تقنية مختلفة عن نماذج الفيديو الأصلية الأحدث مثل Wan 2.2 وLTX-2 وHunyuanVideo، المدرَّبة من الصفر على بيانات فيديو — راجع توليد الفيديو المحلي بالذكاء الاصطناعي مقابل السحابة لتلك المقارنة. القيمة الخاصة بـ AnimateDiff هي الحفاظ على الأسلوب: نظراً لأنه يعيد استخدام نقطة الفحص الموجودة بدلاً من نموذج فيديو مدرَّب بشكل منفصل، تحافظ المخرجات على الشخصية أو الأسلوب الفني أو LoRA نفسه الذي تعتمد عليه بالفعل في الصور الثابتة.
يوجد إصدار مقطّر منفصل — AnimateDiff-Lightning (Lin وYang، ByteDance، "Cross-Model Diffusion Distillation"، arXiv:2403.12706) — يقايض بعض الجودة بالسرعة، فيولّد بعدد خطوات انتشار لا يتجاوز 1 أو 2 أو 4 أو 8 بدلاً من 20-50 خطوة المعتادة، باستخدام تقطير انتشار تنافسي تدريجي.
كيف تعمل وحدة الحركة؟
وحدة الحركة هي مجموعة منفصلة من الأوزان المدرَّبة تُدرَج داخل شبكة U-Net الخاصة بـ Stable Diffusion جنباً إلى جنب مع طبقات نقطة الفحص الموجودة، دون تعديل تلك النقطة. أثناء التوليد، تنسّق طبقات الانتباه الزمني الخاصة بوحدة الحركة ما كان سيكون دفعة من عمليات توليد صور ثابتة مستقلة إلى تسلسل إطارات متسق.
توجد ثلاثة إصدارات لوحدة الحركة الخاصة بـ SD1.5: mm_sd_v15_v2.ckpt (نحو 1.7 جيجابايت) والأحدث v3_sd15_mm.ckpt (نحو 1.56 جيجابايت)، الذي يحسّن سعة الحركة ويضيف توافقاً مع motion LoRAs. توجد وحدة حركة منفصلة لـ SDXL تسمى mm_sdxl_v10_beta.ckpt (نحو 950 ميجابايت)، تستهدف عائلة نقاط فحص SDXL الأكبر عبر فرع تجريبي (بيتا).
بما أن وحدة الحركة مكوّن جاهز للتركيب وليست ضبطاً دقيقاً لنقطة فحصك، يمكن تحريك أي نقطة فحص SD1.5 متوافقة ومعظم LoRAs الخاصة بـ SD1.5 المثبَّتة بالفعل مباشرة، دون تنزيل نسخة "فيديو" منفصلة من ذلك النموذج — والمقايضة هي أن وحدة الحركة نفسها، وليس نقطة الفحص، هي التي تحدد مقدار الحركة التي يمكن أن تعبّر عنها المخرجات.
كيف تُعِدّ AnimateDiff؟
يمر معظم استخدام AnimateDiff في 2026 عبر أحد تكاملَين يصونهما المجتمع، نظراً لأن المستودع الأساسي قاعدة كود بحثية أكثر منه تطبيقاً مصقولاً. ComfyUI-AnimateDiff-Evolved هو الخيار الأكثر تطويراً بنشاط؛ ويغطي امتداد AUTOMATIC1111 القراء المعتادين بالفعل على تلك الواجهة.
- 1ثبّت ComfyUI إذا لم يكن لديك بالفعل، ثم افتح ComfyUI Manager وابحث عن "AnimateDiff Evolved" (المستودع: Kosinkadink/ComfyUI-AnimateDiff-Evolved) — ثبّت وأعد التشغيل.
- 2نزّل نقطة فحص لوحدة الحركة (
v3_sd15_mm.ckptلـ SD1.5، أوmm_sdxl_v10_beta.ckptلـ SDXL) إلى مجلدComfyUI/custom_nodes/ComfyUI-AnimateDiff-Evolved/models/. - 3حمّل أو ابنِ سير عمل: أداة تحميل نقطة فحص SD1.5 أو SDXL تغذّي عقدة AnimateDiff Loader، ثم عقدة KSampler قياسية وعقدة video-combine أو مخرج GIF بدلاً من عقدة حفظ صورة واحدة.
- 4اضبط عدد الإطارات (16 هي النافذة الأصلية للوحدة) ومعدل الإطارات، واكتب مطالبتك كما تفعل لصورة ثابتة، ثم أدخل التوليد في قائمة الانتظار — توقع عدة دقائق على وحدة معالجة رسومات استهلاكية حسب الدقة وعدد الإطارات.
- 5بالنسبة لـ AUTOMATIC1111 بدلاً من ذلك: ثبّت continue-revolution/sd-webui-animatediff من تبويب Extensions، نزّل نفس وحدة الحركة إلى مجلد النماذج الخاص بالامتداد، ثم فعّل لوحة AnimateDiff ضمن تبويب txt2img وولّد كالمعتاد.
ComfyUI-AnimateDiff-Evolved
- الأفضل لـ:
- تحكم قائم على العُقد، تطوير نشط، خيارات motion LoRA ونافذة السياق
- خطوات الإعداد:
- التثبيت عبر ComfyUI Manager أو الاستنساخ في custom_nodes؛ تنزيل نقطة فحص لوحدة الحركة؛ بناء/تحميل مخطط سير عمل من نص إلى فيديو
sd-webui-animatediff (AUTOMATIC1111)
- الأفضل لـ:
- القراء الذين يستخدمون بالفعل واجهة AUTOMATIC1111 للصور الثابتة ويريدون واجهة مألوفة
- خطوات الإعداد:
- التثبيت عبر تبويب Extensions في الواجهة (أو الاستنساخ في extensions/)؛ تنزيل وحدة حركة؛ تفعيل لوحة AnimateDiff ضمن تبويب txt2img
مسارات المجلدات وتسميات القوائم الدقيقة تتغير بين إصدارات ComfyUI والامتداد — تحقق من ملف README الخاص بالمستودع المرتبط لمعرفة مسار التثبيت الحالي قبل استكشاف خطأ عقدة مفقودة وإصلاحه. تم التحقق مقارنة بوثائق المستودعات بتاريخ 2026-09-02.
كم من VRAM يحتاج AnimateDiff؟
تعمل سير عمل AnimateDiff المعتمدة على SD1.5 عادة بـ 8-12 جيجابايت VRAM لتوليد نص إلى فيديو أساسي بدقة متوسطة (نحو 512×512، نافذة الوحدة الأصلية المكونة من 16 إطاراً)؛ يحتاج دعم SDXL أكثر من ذلك بكثير.
يذكر المستودع الرسمي أن استدلال SDXL "يتطلب عادة نحو 13 جيجابايت VRAM"، حسب نقطة الفحص المخصصة وإعدادات التوليد المستخدمة. تتفاوت تقارير المجتمع بشأن سير عمل SD1.5 حسب الدقة وعدد الإطارات، وما إذا كان ControlNet مضافاً — توقع الحد الأدنى من نطاق 8-12 جيجابايت لمقطع قصير واحد بإعدادات افتراضية، والحد الأعلى (أو أكثر، نحو 16 جيجابايت وما فوق) عند إضافة دقة أعلى، أو مزيد من الإطارات، أو عدة ControlNets في خط أنابيب فيديو إلى فيديو. هذه نطاقات مُبلَّغ عنها من المجتمع بحذر وليست معياراً واحداً مُتحقَّقاً منه، لأن استخدام VRAM الفعلي يعتمد بشدة على سير العمل المحدد.
إرشاد عملي: بطاقة 8 جيجابايت نقطة انطلاق قابلة للتطبيق للتجريب مع نص إلى فيديو SD1.5 بالإعدادات الافتراضية؛ بطاقة 12 جيجابايت تمنح هامشاً مريحاً لسير عمل SD1.5 مع ControlNet؛ بطاقة 16 جيجابايت (مثل RTX 4070 Ti Super) هي الحد الأدنى الأكثر راحة عند الانتقال إلى AnimateDiff المعتمد على SDXL أو خطوط أنابيب فيديو إلى فيديو أثقل. القراء الذين تقل وحدة معالجة الرسومات لديهم عن هذه المستويات، أو لا يملكون وحدة معالجة رسومات محلية، يجب أن يقارنوا الاستئجار — راجع دليل استئجار وحدات معالجة الرسومات السحابية 2026 — بالشراء، في أفضل دليل شراء وحدة معالجة رسومات للنماذج اللغوية المحلية 2026 (تنطبق نفس إرشادات مستويات VRAM على AnimateDiff كما تنطبق على أعباء عمل الذكاء الاصطناعي التوليدي المحلي الأخرى).
ما هي motion LoRAs، وما هي قيود AnimateDiff؟
**motion LoRAs هي أوزان إضافية صغيرة (نحو 77 ميجابايت) توجّه AnimateDiff نحو حركة كاميرا محددة — تكبير للداخل، تكبير للخارج، تحريك أفقي يساراً، تحريك أفقي يميناً، إمالة لأعلى، إمالة لأسفل، دوران باتجاه عقارب الساعة، أو عكس عقارب الساعة — متوافقة مع وحدة الحركة mm_sd_v15_v2.** تعمل بنفس طريقة LoRAs الصور: تُحمَّل واحدة منها إلى جانب وحدة الحركة لتوجيه المخرجات نحو تلك الحركة، دون تغيير الأسلوب البصري لنقطة الفحص.
أكثر القيود ذكراً، المستمدة من متتبع المشكلات الخاص بالمشروع نفسه ومراجعات المجتمع، تتجمع حول ثلاثة مجالات:
- مدة مقطع أصلية قصيرة. نافذة وحدة الحركة المدرَّبة هي 16 إطاراً (نحو ثانيتين عند 8 إطارات في الثانية). تُطيل تقنيات النافذة المنزلقة التي يطوّرها المجتمع (معالجة نوافذ متداخلة من 16 إطاراً ودمج النتائج) المدة الإجمالية، لكن الاتساق الزمني يتدهور عادة عند كل حد نافذة، وتصبح النتائج غير موثوقة بشكل كبير بعد نحو 30-60 إطاراً.
- الوميض، خاصة في الوجوه والتفاصيل الدقيقة. ينهار الاتساق الزمني في أغلب الأحيان مع الحركة السريعة، والوجوه المفصّلة بدقة منخفضة، والخلفيات المزدحمة بعدة موضوعات — قيد معروف ومناقَش بكثرة وليس حالة استثنائية.
- نطاق حركة محدود. خاصة في وحدة الحركة الأصلية v1، يميل تحرك الكاميرا والموضوع نحو التحريك البطيء والحركات الصغيرة بدلاً من الأحداث الدرامية؛ تحسّن الوحدات اللاحقة (v2، v3) وmotion LoRAs من ذلك دون إزالته كلياً.
- تدهور مطابقة المطالبة مقارنة بصورة ثابتة من نفس نقطة الفحص. بما أن وحدة الحركة يجب أن توفّق كل إطار مع الإطارات المجاورة، فإن المطالبات التي تُصيَّر بدقة كصورة ثابتة واحدة قد تُصيَّر بدقة أقل بمجرد فرض الاتساق الزمني عبر 16 إطاراً.
المفاضلات: المزايا مقابل القيود
مجاني وكود Apache 2.0
- ماذا تعني في الاستخدام الفعلي:
- لا اشتراك، ولا تكلفة لكل توليد، وقاعدة الكود مفتوحة للفحص والتعديل.
- القيد / التحفظ:
- يذكر المستودع الرسمي إصداراً للاستخدام الأكاديمي — تحقق من قسم الترخيص قبل افتراض حقوق تجارية غير مقيدة.
لا حاجة لإعادة التدريب
- ماذا تعني في الاستخدام الفعلي:
- يمكن تحريك أي نقطة فحص SD1.5 متوافقة أو LoRA تستخدمها بالفعل مباشرة.
- القيد / التحفظ:
- تعتمد جودة المخرجات وإخلاص الأسلوب كلياً على مدى جودة تلك النقطة بالفعل في الصور الثابتة.
يعمل على وحدات معالجة رسومات استهلاكية
- ماذا تعني في الاستخدام الفعلي:
- سير عمل SD1.5 قابل للتطبيق من نحو 8 جيجابايت VRAM؛ لا حاجة لحساب سحابي.
- القيد / التحفظ:
- يحتاج دعم SDXL أكثر بكثير (~13 جيجابايت وما فوق)، وتزيد خطوط أنابيب ControlNet أو فيديو إلى فيديو الأثقل المتطلبات أكثر.
motion LoRAs للتحكم بالكاميرا
- ماذا تعني في الاستخدام الفعلي:
- تمنح 8 LoRAs رسمية حركة أساسية للتكبير والتحريك الأفقي والإمالة والدوران دون إعادة تدريب أي شيء.
- القيد / التحفظ:
- تغطي حركات كاميرا أساسية فقط — بلا تحكم دقيق بمسار الكاميرا حسب الطابع الزمني كما تقدمه بعض الأدوات التجارية.
أدوات مجتمعية نشطة
- ماذا تعني في الاستخدام الفعلي:
- تتم صيانة ComfyUI-AnimateDiff-Evolved وامتداد AUTOMATIC1111 كلاهما بنشاط وتوثيقهما على نطاق واسع.
- القيد / التحفظ:
- المستودع الأساسي الرسمي نفسه قاعدة كود بحثية، وليس تطبيقاً مصقولاً للمستخدم النهائي — تعتمد على تكاملات المجتمع للحصول على سير عمل قابل للاستخدام.
AnimateDiff-Lightning من أجل السرعة
- ماذا تعني في الاستخدام الفعلي:
- تولّد النسخة المقطّرة بـ 1-8 خطوات بدلاً من 20-50، ما يقلص وقت التوليد بشكل كبير.
- القيد / التحفظ:
- خطوات انتشار أقل تقايض بعض الجودة والتفاصيل مقابل تلك السرعة.
AnimateDiff مقابل البدائل
AnimateDiff
- المنهج:
- وحدة حركة مُركَّبة على نقطة فحص SD1.5/SDXL موجودة، دون إعادة تدريب
- الأفضل لـ:
- حلقات حركة ذات طابع فني أو أسلوب أنمي تعيد استخدام نقطة فحص أو LoRA موجودة بالفعل
- القيد الرئيسي مقارنة بـ AnimateDiff:
- —
مقالات حول AnimateDiff (1)
- AnimateDiff Guide 2026: Animate Any Stable Diffusion Modelمحدَّث ٢ سبتمبر ٢٠٢٦
مذكور أيضًا في:
- Invideo vs Local AI Video: One Costs $0 Plus Your Weekend — the Other Costs $17محدَّث ١ سبتمبر ٢٠٢٦
- Local AI Images Are Free. Cloud AI Images Are Instant. Your GPU Decides.محدَّث ٢١ أغسطس ٢٠٢٦
Stable Video Diffusion (SVD)
- المنهج:
- نموذج صورة إلى فيديو مدرَّب بشكل منفصل من Stability AI، سلسلة تقنية مختلفة عن خط نص إلى صورة الخاص بـ Stable Diffusion
- الأفضل لـ:
- تحريك صورة موجودة إلى حركة قصيرة، بدلاً من توليد مقاطع متسقة الأسلوب من نقطة فحص
- القيد الرئيسي مقارنة بـ AnimateDiff:
- لا يحافظ على الأسلوب البصري الدقيق لنقطة فحص أو LoRA محددة كما يفعل AnimateDiff — فهو يحرّك صورة الإدخال، وليس الأسلوب المتعلَّم لنموذج نص إلى صورة.
Deforum
- المنهج:
- تقنية أقدم لاستيفاء الإطارات المفتاحية والمعاملات — تحويلات كاميرا ثنائية/ثلاثية الأبعاد تُطبَّق بين إطارات الانتشار المتتالية
- الأفضل لـ:
- رسوم متحركة موجَّهة بمسار كاميرا على نمط "التكبير إلى ما لا نهاية" وانحرافات معاملات بطيئة
- القيد الرئيسي مقارنة بـ AnimateDiff:
- لا يوجد تصور حركة متعلَّم مسبقاً — يعتمد الاتساق على استيفاء المعاملات من إطار لآخر بدلاً من وحدة انتباه زمني مدرَّبة، لذا فإن حركة الموضوع (بخلاف حركة الكاميرا) أقل طبيعية بكثير.
نماذج فيديو سحابية تجارية (Runway، Pika، نماذج من فئة Sora)
- الرابط:
- —
- المنهج:
- توليد فيديو مملوك ومستضاف سحابياً عبر اشتراك أو أرصدة
- الأفضل لـ:
- فيديو أطول، وأعلى إخلاصاً، وأكثر اتساقاً زمنياً، ومخرجات واقعية فوتوغرافياً أو سينمائية
- القيد الرئيسي مقارنة بـ AnimateDiff:
- تكلفة اشتراك مستمرة، وانعدام الخصوصية المحلية، ولا وسيلة لإعادة استخدام الأسلوب المدرَّب الدقيق لنقطة فحص مفتوحة المصدر محددة — راجع توليد الفيديو المحلي بالذكاء الاصطناعي مقابل السحابة لمقارنة كاملة للتكلفة والجودة مقابل نماذج الفيديو المحلية الأحدث.
هذا الجدول يقارن المنهج والملاءمة، وليس ترتيباً مُقيَّماً — كل أداة تحل مشكلة مختلفة. بالنسبة لنماذج الفيديو الأصلية الأحدث (Wan 2.2، LTX-2، HunyuanVideo) التي تنافس بشكل مباشر أكثر الفيديو السحابي التجاري بمقاطع أطول، راجع المقارنة المخصصة المرتبطة أعلاه بدلاً من هذا الدليل المرتكز على AnimateDiff.
هل AnimateDiff مجاني للاستخدام التجاري؟
كود AnimateDiff نفسه يُصدَر بموجب ترخيص Apache 2.0، لكن ملف README الخاص بالمشروع نفسه ينص على أن الإصدار مخصص للاستخدام الأكاديمي — لذا فإن القول بأنه "مجاني بالكامل للاستخدام التجاري" ليس ادعاءً دقيقاً دون مزيد من التحقق. هذا بالضبط نوع الادعاء المبالغ فيه الذي يجب تجنبه: يسمح Apache 2.0 عادة بالاستخدام التجاري للكود، لكن الإطار الأكاديمي الذي أضافه المؤلفون فوقه يعني أن القراء الذين يخططون لبيع المخرجات أو توزيعها تجارياً يجب أن يقرأوا شروط الترخيص الحالية في المستودع مباشرة، بدلاً من الاعتماد على تسمية Apache 2.0 وحدها.
تنطبق طبقة ترخيص ثانية منفصلة على أي نقطة فحص Stable Diffusion تحرّكها. تُوزَّع نقطة فحص Stable Diffusion 1.5 الأصلية (والعديد من عمليات الضبط الدقيق المجتمعية المشتقة منها) بموجب ترخيص CreativeML OpenRAIL-M، الذي يسمح بالاستخدام التجاري لكنه يحمل قيوداً خاصة به قائمة على الاستخدام (مثل حظر توليد فئات معينة من المحتوى الضار) — منفصلة عن ترخيص AnimateDiff نفسه ولا يتم إلغاؤها بواسطته.
من الناحية العملية: تحقق من كلا الترخيصين قبل أي استخدام تجاري — شروط إصدار AnimateDiff في مستودعه، والترخيص المرفق بنقطة الفحص المحددة التي تحرّكها (شروط OpenRAIL-M بالنسبة لنقطة فحص SD1.5 الأصلية، أو أي ترخيص تحدده نسخة ضبط دقيق مجتمعية معينة، إذ يمكن أن تحمل عمليات الضبط الدقيق شروطاً مختلفة عن النموذج الأساسي). هذا ليس استشارة قانونية؛ استشر نص الترخيص الحالي أو محترفاً قانونياً قبل أي نشر تجاري.
من يجب أن يستخدم AnimateDiff
- القارئ الذي يملك بالفعل نقطة فحص أو LoRA لـ Stable Diffusion يعجبه. القيمة الأساسية لـ AnimateDiff هي إعادة استخدام ذلك الأسلوب البصري بالتحديد في صورة متحركة، دون إعادة تدريب أي شيء.
- القارئ الذي يريد حلقات حركة ذات طابع فني أو أسلوب أنمي أو توضيحي. تعمل التقنية بشكل أفضل مع نوع المحتوى الذي تتفوق فيه نقاط فحص Stable Diffusion بالفعل — الأساليب الفنية بدلاً من الواقعية الفوتوغرافية.
- القارئ المرتاح مع ComfyUI أو AUTOMATIC1111. يفترض الإعداد إلماماً بإحدى هاتين الواجهتين؛ لا يوجد تطبيق AnimateDiff مستقل مخصص.
- القارئ الذي يريد مقاطع قصيرة (بضع ثوانٍ) بدلاً من فيديو طويل. تناسب النافذة الأصلية المكونة من 16 إطاراً الحلقات وصور GIF والمقاطع القصيرة ذات الطابع الفني أكثر من التسلسل السردي.
- القارئ الذي يملك وحدة معالجة رسومات استهلاكية متوسطة (8 جيجابايت وما فوق من VRAM) ويريد تكلفة متكررة صفرية. لا اشتراك، ولا أرصدة، ولا حساب سحابي للتوليد المحلي.
من لا يجب أن يستخدم AnimateDiff
- القارئ الذي يحتاج فيديو واقعياً فوتوغرافياً أو طويلاً أو بتحكم دقيق بالكاميرا. تتعامل نماذج الفيديو الأصلية بشكل أفضل مع ذلك — المحلية منها مثل Wan 2.2 أو LTX-2، أو التجارية مثل Runway أو Pika؛ راجع توليد الفيديو المحلي بالذكاء الاصطناعي مقابل السحابة.
- القارئ الذي لا يملك نقطة فحص Stable Diffusion يعجبه بالفعل. بدون نقطة انطلاق تستحق التحريك، هناك ميزة قليلة مقارنة بنموذج فيديو أصلي يولّد مباشرة من مطالبة نصية.
- القارئ الذي يحتاج حقوق استخدام تجارية مضمونة دون قراءة نص الترخيص. إطار الاستخدام الأكاديمي في ملف README الخاص بـ AnimateDiff نفسه، بالإضافة إلى ترخيص نقطة الفحص المنفصل، يعني أن هذه ليست أداة "مجانية للاستخدام التجاري" بلا عناية واجبة — راجع قسم وضوح الترخيص أعلاه.
- القارئ الذي لا يملك وحدة معالجة رسومات محلية، أو يملك بطاقة أقل من نحو 8 جيجابايت VRAM. AnimateDiff المعتمد على SD1.5 قابل للتطبيق من 8 جيجابايت، لكن القراء دون ذلك المستوى يجب أن ينظروا في استئجار وحدة معالجة رسومات سحابية أو خدمة فيديو سحابية بدلاً من ذلك.
- القارئ الذي يريد تجربة تطبيق بنقرة واحدة. يفترض كل من ComfyUI وAUTOMATIC1111 قدراً من الارتياح مع مخططات العُقد أو إعدادات الامتدادات — إنه ليس منتجاً استهلاكياً مصقولاً.
الأسئلة الشائعة
ما هو AnimateDiff؟
AnimateDiff وحدة حركة مفتوحة المصدر تضيف قدرة على التحريك إلى نقطة فحص Stable Diffusion 1.5 أو SDXL موجودة دون إعادة تدريب تلك النقطة. إنه التنفيذ الرسمي لورقة Guo et al.، "AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning" (ICLR 2024 Spotlight، arXiv:2307.04725)، ويُصان على github.com/guoyww/AnimateDiff بموجب ترخيص كود Apache 2.0.
هل AnimateDiff مجاني؟
نعم — الكود مجاني للتنزيل والتشغيل، ولا يوجد اشتراك للتوليد المحلي على أجهزتك الخاصة. تكلفة التوليد هي الكهرباء ووقت وحدة معالجة الرسومات التي تملكها بالفعل، وليست رسوماً لـ AnimateDiff نفسه.
هل AnimateDiff مجاني للاستخدام التجاري؟
ليس تلقائياً. الكود مرخّص بموجب Apache 2.0، لكن ملف README الخاص بالمشروع نفسه ينص على أن الإصدار مخصص للاستخدام الأكاديمي، ونقطة فحص Stable Diffusion التي تحرّكها عادة ما تحمل ترخيصها المنفصل الخاص (غالباً CreativeML OpenRAIL-M بالنسبة لـ SD1.5)، الذي يسمح بالاستخدام التجاري لكن مع قيود محتوى خاصة به. تحقق من كلا نصي الترخيص قبل أي نشر تجاري — هذا ليس استشارة قانونية.
كيف أثبّت AnimateDiff في ComfyUI؟
ثبّت عقدة ComfyUI-AnimateDiff-Evolved التي يصونها المجتمع (github.com/Kosinkadink/ComfyUI-AnimateDiff-Evolved) عبر ComfyUI Manager أو باستنساخها في مجلد custom_nodes الخاص بك، ثم نزّل نقطة فحص لوحدة الحركة (v3_sd15_mm.ckpt لـ SD1.5 أو mm_sdxl_v10_beta.ckpt لـ SDXL) إلى مجلد النماذج الخاص بتلك العقدة قبل بناء سير عمل من نص إلى فيديو.
هل يعمل AnimateDiff مع AUTOMATIC1111؟
نعم، عبر امتداد sd-webui-animatediff الذي يصونه المجتمع (github.com/continue-revolution/sd-webui-animatediff)، ويُثبَّت من تبويب Extensions في الواجهة. يضيف لوحة AnimateDiff ضمن تبويب txt2img القياسي.
كم من VRAM يحتاج AnimateDiff؟
يعمل AnimateDiff المعتمد على SD1.5 عادة بـ 8-12 جيجابايت VRAM لتوليد نص إلى فيديو أساسي بدقة متوسطة ونافذة الوحدة الأصلية المكونة من 16 إطاراً. يحتاج دعم SDXL أكثر بكثير — يذكر المستودع الرسمي أن استدلال SDXL يتطلب عادة نحو 13 جيجابايت VRAM، حسب نقطة الفحص والإعدادات المستخدمة. تزيد الدقة الأعلى والمقاطع الأطول أو تكديس ControlNet المتطلبات أكثر.
ما مدة مقاطع AnimateDiff؟
النافذة المدرَّبة الأصلية لوحدة الحركة هي 16 إطاراً — نحو ثانيتين عند 8 إطارات في الثانية. يمكن لتقنيات النافذة المنزلقة التي يطوّرها المجتمع إطالة المدة الإجمالية عبر معالجة نوافذ متداخلة من 16 إطاراً ودمجها، لكن الاتساق الزمني يتدهور عادة عند كل حد نافذة، وتصبح النتائج غير موثوقة بشكل كبير بعد نحو 30-60 إطاراً.
ما هي motion LoRAs؟
motion LoRAs هي ملفات أوزان إضافية صغيرة (نحو 77 ميجابايت)، متوافقة مع وحدة الحركة mm_sd_v15_v2، توجّه التوليد نحو واحدة من 8 حركات كاميرا أساسية: تكبير للداخل، تكبير للخارج، تحريك أفقي يساراً، تحريك أفقي يميناً، إمالة لأعلى، إمالة لأسفل، دوران باتجاه عقارب الساعة، أو عكس عقارب الساعة. تُحمَّل إلى جانب وحدة الحركة بنفس الطريقة التي تُحمَّل بها LoRA صورة إلى جانب نقطة فحص.
لماذا يومض مخرج AnimateDiff الخاص بي؟
الوميض — خاصة في الوجوه والتفاصيل الدقيقة — قيد مُبلَّغ عنه على نطاق واسع، وليس خطأ في الإعداد. ينهار الاتساق الزمني في أغلب الأحيان مع الحركة السريعة، والوجوه المفصّلة بدقة منخفضة، والخلفيات المزدحمة بعدة موضوعات؛ تقلل وحدات الحركة اللاحقة (v2، v3) وmotion LoRAs من ذلك دون إزالته كلياً.
ما هو AnimateDiff-Lightning؟
AnimateDiff-Lightning إصدار مقطّر منفصل من ByteDance (Lin وYang، "AnimateDiff-Lightning: Cross-Model Diffusion Distillation"، arXiv:2403.12706) يستخدم تقطير انتشار تنافسي تدريجي للتوليد بعدد خطوات انتشار لا يتجاوز 1 أو 2 أو 4 أو 8 بدلاً من 20-50 خطوة المعتادة — أسرع بشكل كبير، مع بعض التكلفة في الجودة والتفاصيل.
كيف يختلف AnimateDiff عن Stable Video Diffusion؟
يُركِّب AnimateDiff وحدة حركة على نقطة فحص نص إلى صورة موجودة من Stable Diffusion، محافظاً على الأسلوب البصري الدقيق لتلك النقطة. Stable Video Diffusion (SVD) نموذج صورة إلى فيديو مدرَّب بشكل منفصل من Stability AI، بسلسلة تقنية مختلفة — فهو يحرّك صورة إدخال معطاة بدلاً من إعادة استخدام الأسلوب المتعلَّم لنقطة فحص نص إلى صورة. اختر AnimateDiff للحفاظ على مظهر نقطة فحص أو LoRA محددة؛ اختر SVD لتحريك صورة موجودة محددة.
الحكم النهائي
يكتسب AnimateDiff مكانته باعتباره الطريقة الأكثر مباشرة لتحريك نقطة فحص Stable Diffusion تعجبك بالفعل، دون إعادة تدريب أي شيء أو مغادرة أجهزتك الخاصة. المقايضة حقيقية ومحددة: المقاطع قصيرة افتراضياً (16 إطاراً، نحو ثانيتين، قابلة للإطالة لكن بفقدان جودة عند مدد أطول)، ويتدهور نطاق الحركة ومطابقة المطالبة إلى حد ما مقارنة بصورة ثابتة من نفس نقطة الفحص، وتتطلب صورة الترخيص تحققين منفصلين — إطار الاستخدام الأكاديمي الخاص بالمشروع فوق كوده المرخّص بموجب Apache 2.0، والترخيص الذي تحمله نقطة الفحص التي تحرّكها — قبل أي استخدام تجاري. بالنسبة للقراء الذين يملكون بالفعل نقطة فحص SD1.5 أو SDXL ذات طابع فني ويريدون حلقات حركة قصيرة ومتسقة الأسلوب على وحدة معالجة الرسومات الخاصة بهم دون تكلفة متكررة، يُعد AnimateDiff عبر ComfyUI-AnimateDiff-Evolved أو امتداد AUTOMATIC1111 نقطة الانطلاق العملية. أما القراء الذين يحتاجون فيديو أطول أو أكثر اتساقاً أو واقعياً فوتوغرافياً فيجب أن يقارنوه بدلاً من ذلك بنماذج الفيديو الأصلية الأحدث في توليد الفيديو المحلي بالذكاء الاصطناعي مقابل السحابة.
المصادر
- مستودع AnimateDiff الرسمي — الكود، تنزيلات وحدات الحركة، شروط الترخيص.
- Guo et al.، "AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning"، ICLR 2024 Spotlight، arXiv:2307.04725 — الورقة البحثية الأصلية.
- Lin وYang (ByteDance)، "AnimateDiff-Lightning: Cross-Model Diffusion Distillation"، arXiv:2403.12706 — النسخة المقطّرة قليلة الخطوات.
- ComfyUI-AnimateDiff-Evolved (Kosinkadink) — تكامل ComfyUI المجتمعي.
- sd-webui-animatediff (continue-revolution) — امتداد AUTOMATIC1111 المجتمعي.
