Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/مراجعة FunClip: مونتاج فيديو بالذكاء الاصطناعي مستضاف ذاتيًا عبر FunASR
Voice, Speech & Multimodal

مراجعة FunClip: مونتاج فيديو بالذكاء الاصطناعي مستضاف ذاتيًا عبر FunASR

·9 دقائق للقراءة·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

FunClip هي أداة مجانية ومفتوحة المصدر ومستضافة ذاتيًا لمونتاج الفيديو، طورتها ModelScope (منصة النماذج المفتوحة التابعة لعلي بابا)، وتقوم بتفريغ الفيديو نصيًا باستخدام نماذج التعرف على الكلام FunASR، ثم تستخدم نموذج LLM لإيجاد المقاطع المطلوبة وقصها، مع توليد ترجمات تلقائيًا. رخصتها MIT (أوزان نموذج FunASR الأساسي مرخّصة بموجب Apache 2.0)، وتعمل كواجهة ويب محلية عبر Gradio أو من سطر الأوامر، وتقوم افتراضيًا بتفريغ اللغة الصينية الماندرين نصيًا، مع توفر وضع للغة الإنجليزية ودعم متعدد اللغات عبر SenseVoice أيضًا.

FunClip (github.com/modelscope/FunClip) هي أداة مجانية ومفتوحة المصدر ومستضافة ذاتيًا لمونتاج الفيديو، طورتها ModelScope، منصة النماذج المفتوحة التابعة لعلي بابا. تقوم الأداة بتفريغ الفيديو نصيًا باستخدام نماذج التعرف على الكلام FunASR، ثم تستخدم نموذج LLM لتحديد المقاطع المطلوبة وقصها، مع توليد ترجمات تلقائيًا في هذه العملية — وقد تجاوزت نجومها على GitHub 6,300 نجمة. تتناول هذه المراجعة ما تفعله الأداة فعليًا، وكيفية تثبيتها وتشغيلها، ودعمها للغات، ولمن تناسب.

النقاط الرئيسية

  • FunClip (github.com/modelscope/FunClip) هي أداة مجانية ومفتوحة المصدر ومستضافة ذاتيًا لمونتاج الفيديو — وليست خدمة ويب مستضافة
  • طوّرتها ModelScope، منصة النماذج المفتوحة التابعة لعلي بابا، كجزء من عمل مختبر الصوت TONGYI التابع لها
  • مرخّصة بموجب MIT للشيفرة المصدرية، وهو ما تم تأكيده من خلال ملف LICENSE في مستودع GitHub؛ وأوزان نموذج FunASR الأساسي مرخّصة بشكل منفصل بموجب Apache 2.0
  • التحويل من الكلام إلى نص عبر نموذج Paraformer-Large التابع لـ FunASR، مع التعرف على المتحدثين عبر CAM++ وتخصيص الكلمات المفتاحية عبر SeACo-Paraformer
  • اختيار المقاطع بمساعدة الذكاء الاصطناعي: صف المقطع الذي تريده وسيحدد نموذج LLM الطوابع الزمنية المطابقة
  • الواجهات: واجهة ويب محلية عبر Gradio (افتراضيًا على localhost:7860) ونص برمجي من سطر الأوامر، videoclipper.py
  • دعم اللغات: الصينية الماندرين افتراضيًا، ووضع للغة الإنجليزية عبر الخيار -l en، ودعم متعدد اللغات (بالإضافة إلى كشف المشاعر) عبر نموذج SenseVoice
  • أحدث إصدار وقت كتابة هذه المراجعة: v2.2.1
  • أكثر من 6,300 نجمة على GitHub وقت كتابة هذه المراجعة

📍 في جملة واحدة

FunClip هي أداة مجانية ومفتوحة المصدر (MIT) ومستضافة ذاتيًا لمونتاج الفيديو من ModelScope، بأكثر من 6,300 نجمة على GitHub، تقوم بتفريغ الفيديوهات نصيًا باستخدام نماذج التعرف على الكلام FunASR وتستخدم نموذج LLM لإيجاد المقاطع المطلوبة وقصها، مع توليد ترجمات تلقائيًا والتعرف على المتحدثين.

💬 بعبارات بسيطة

تشاهد FunClip فيديو طويلًا نيابة عنك، وتدوّن كل ما يُقال (التفريغ النصي)، وعندما تصف اللحظة التي تريدها، يجد نموذج ذكاء اصطناعي تلك اللحظة ويقص المقطع تلقائيًا، مع ترجمات مدمجة أو مرفقة مسبقًا. تعمل الأداة على جهاز الكمبيوتر أو الخادم الخاص بك عبر صفحة ويب محلية أو سطر الأوامر — وهي مجانية، لكن عليك تثبيتها بنفسك، وتحتاج أجزاء الذكاء الاصطناعي إلى عتاد كافٍ لتشغيل نماذج الكلام واللغة.

📌ملاحظة: تستند هذه المراجعة إلى مستودع GitHub الخاص بـ FunClip وملف README الخاص بها. لا تدّعي هذه المراجعة أن PromptQuorum أجرت اختبارات عملية لدقة تفريغ FunClip نصيًا، وتعرض دور ModelScope/علي بابا كجهة مطوّرة بشكل موضوعي دون أي تأطير جيوسياسي.

ما هي FunClip؟

FunClip أداة مستضافة ذاتيًا ومفتوحة المصدر تُؤتمت عملية مونتاج الفيديو من خلال الجمع بين التفريغ النصي للكلام واختيار اللحظات بمساعدة الذكاء الاصطناعي، بدلًا من مطالبتك بمراجعة المادة الخام يدويًا. طوّرتها ModelScope، منصة النماذج المفتوحة التابعة لعلي بابا، وتبني على نماذج التعرف على الكلام FunASR الخاصة بذلك الفريق.

  • نوع المنتج: أداة ويب/سطر أوامر مستضافة ذاتيًا — تُثبَّت عبر git clone وبايثون، وليست تطبيق سطح مكتب قابلًا للتنزيل ولا منتج SaaS مستضافًا
  • الجهة المطوّرة: ModelScope (منصة النماذج المفتوحة التابعة لعلي بابا)، وتحديدًا عمل مختبر الصوت TONGYI التابع لها
  • الترخيص: MIT للشيفرة المصدرية الخاصة بـ FunClip نفسها، وهو ما تم تأكيده من خلال ملف LICENSE في مستودع GitHub؛ وأوزان نموذج FunASR الأساسي الذي تعتمد عليه مرخّصة بشكل منفصل بموجب Apache 2.0
  • الاعتمادية الأساسية: FunASR، مجموعة أدوات التعرف على الكلام المفتوحة المصدر الخاصة بـ ModelScope نفسها، والتي تستخدمها FunClip للتفريغ النصي بدلًا من بناء نموذج ASR خاص بها من الصفر
  • الحجم: أكثر من 6,300 نجمة على GitHub وقت كتابة هذه المراجعة
  • أحدث إصدار: v2.2.1، الذي يصفه سجل التغييرات الخاص بالمشروع بأنه يحافظ على ألوان الترجمات المختارة عبر أداة عرض مبنية على مكتبة Pillow

ماذا تفعل FunClip فعليًا؟

تأخذ FunClip ملف فيديو، وتفرّغ الكلام الوارد فيه نصيًا، ثم تتيح لك (أو لنموذج LLM بناءً على وصفك) اختيار لحظات محددة لقصها إلى مقاطع مستقلة مع ترجمات مولَّدة مسبقًا.

  • التفريغ النصي التلقائي: يقوم نموذج Paraformer-Large التابع لـ FunASR بتفريغ كلام الفيديو نصيًا مع التنبؤ المدمج بالطوابع الزمنية، بحيث يُربط كل مقطع منطوق بنقطة زمنية دقيقة في الفيديو
  • التعرف على المتحدثين: يتيح تحديد هوية المتحدثين عبر CAM++ قص مقاطع حسب متحدث معين، وهو مفيد للمقابلات أو الجلسات الحوارية أو التسجيلات التي تضم عدة أشخاص
  • تخصيص الكلمات المفتاحية: يتيح دمج SeACo-Paraformer تحديد أسماء كيانات أو مصطلحات معينة مسبقًا لتحسين دقة التعرف على تلك الكلمات
  • اختيار المقاطع بمساعدة الذكاء الاصطناعي: بدلًا من مراجعة النص الكامل للتفريغ يدويًا، يمكنك وصف اللحظة التي تريدها ليحدد نموذج LLM الطوابع الزمنية المطابقة المراد قصها
  • توليد الترجمات تلقائيًا: تولّد FunClip ترجمات بصيغة SRT لكل من الفيديو الكامل وكل مقطع مقصوص على حدة
  • عرض الترجمات: أضاف الإصدار 2.2.1 أداة عرض مبنية على مكتبة Pillow تحافظ على ألوان الترجمات المختارة في فيديو الإخراج
  • إخراج متعدد المقاطع: يمكن لـ FunClip توليد عدة مقاطع من فيديو مصدر واحد في تمريرة واحدة، دون الحاجة لتشغيل منفصل لكل مقطع

أمثلة على الاستخدام: طريقتان لاستخدام FunClip

هذه سير عمل مبنية على الميزات الموثقة الخاصة بـ FunClip نفسها — وليست حالات استخدام افتراضية.

المنصة والتسعير والترخيص

المنصة

ما تذكره FunClip:
تطبيق بايثون مستضاف ذاتيًا؛ واجهة ويب محلية عبر Gradio بالإضافة إلى نص برمجي من سطر الأوامر. متعددة المنصات من حيث المبدأ، رغم أن دعم أنظمة التشغيل المحددة غير مُدرج في التوثيق.

التكلفة

ما تذكره FunClip:
مجانية ومفتوحة المصدر. لا توجد خطة مدفوعة أو خدمة مستضافة؛ تقوم بتشغيلها على جهازك الخاص.

الترخيص

ما تذكره FunClip:
MIT للشيفرة المصدرية، وهو ما تم تأكيده من خلال ملف LICENSE في مستودع GitHub؛ وأوزان نموذج FunASR مرخّصة بشكل منفصل بموجب Apache 2.0.

طريقة التثبيت

ما تذكره FunClip:
وفقًا لملف README الخاص بالمشروع، استنسخ مستودع GitHub وثبّت الاعتماديات من requirements.txt داخل بيئة افتراضية بلغة بايثون 3.12 أو أحدث. تتوفر أيضًا أرشيفات إصدارات مرقّمة (مثل FunClip-2.2.1.tar.gz/.zip) مع قيم تحقق SHA256.

تحقق من إصدار بايثون الموصى به حاليًا وقائمة الاعتماديات مباشرة في مستودع GitHub قبل التثبيت، لأن المتطلبات قد تتغير بين الإصدارات.

FunClip مقابل Whisper.cpp

تعمل كل من FunClip وwhisper.cpp على تشغيل التحويل من الكلام إلى نص محليًا، لكنهما تحلان مشكلتين مختلفتين. Whisper.cpp محرك تفريغ نصي خفيف بلغة C/C++ وقليل الاعتماديات تدمجه في مشاريع أخرى؛ أما FunClip فهي طبقة تطبيق كاملة فوق تفريغ FunASR النصي، تضيف اختيار المقاطع بمساعدة الذكاء الاصطناعي، والتعرف على المتحدثين، وتصدير فيديو بترجمات مدمجة.

الجانب
FunClip
Whisper.cpp
الغرض الأساسيتطبيق مونتاج فيديو شامل من طرف إلى طرف مبني على التفريغ النصيمحرك تفريغ نصي قابل للدمج في أدوات أخرى
نموذج الكلامFunASR Paraformer-Large / SenseVoiceأوزان OpenAI Whisper (منفذة بلغة C/C++)
الإخراجمقاطع فيديو مقصوصة مع ترجمات مولَّدةنص التفريغ/الترجمة فقط
الواجهةواجهة ويب محلية عبر Gradio + نص برمجي CLIسطر الأوامر وربط المكتبات
اعتمادية التشغيلبايثون 3.12 أو أحدث، وFunASR، ونموذج LLMلا يتطلب بيئة تشغيل بايثون
الجهة المطوّرةModelScope (علي بابا)Georgi Gerganov / ggml-org

إذا كان هدفك الحصول على مقاطع فيديو جاهزة بترجمات مع أقل قدر من التحرير اليدوي، فإن خط أنابيب اختيار المقاطع والتصدير المدمج في FunClip يقدّم المزيد بشكل جاهز. أما إذا كنت تحتاج فقط إلى نص تفريغ خام أو ترجمات لإدخالها في خط أنابيبك الخاص، دون بايثون أو طبقة مونتاج فيديو كاملة، فراجع مراجعة whisper.cpp. تحقق من مجموعة الميزات الحالية لكل مشروع في مستودعه الخاص قبل الاختيار.

لمن تناسب FunClip؟

تناسب FunClip من يحتاجون إلى تحويل تسجيلات طويلة إلى مقاطع قصيرة بانتظام ويريدون أتمتة تلك العملية عبر التفريغ النصي ونموذج LLM، بدلًا من المراجعة اليدوية.

ما لا تصلح له FunClip

لا تصلح FunClip إذا كنت تريد خدمة مستضافة دون تثبيت أو محرر فيديو عام الغرض يتجاوز اختيار المقاطع والترجمات.

  • ليست منتجًا مستضافًا — لا توجد خطة سحابية مُدارة؛ تقوم بتثبيتها وتشغيلها بنفسك عبر git clone وبيئة بايثون
  • ليست محرر فيديو عام الغرض — تركز تحديدًا على اختيار المقاطع القائم على التفريغ النصي وتوليد الترجمات، وليس على تحرير الخط الزمني أو تصحيح الألوان أو المؤثرات
  • ليست صفرية الإعداد — لجعل اختيار المقاطع بمساعدة الذكاء الاصطناعي يعمل، عليك تهيئة نموذج LLM بنفسك، بالإضافة إلى تثبيت بايثون/FunASR
  • لا تضمن دعمًا مُدرجًا على مستوى نظام التشغيل — لا يُدرج توثيق المشروع نفسه أنظمة تشغيل محددة مدعومة بخلاف وصفه بأنه تطبيق بايثون/Gradio، لذا تحقق من التوافق مع بيئتك الخاصة قبل الاعتماد عليه
  • لم تختبرها PromptQuorum بشكل مستقل من حيث دقة التفريغ النصي — تستند هذه المراجعة إلى مستودع GitHub وملف README الخاصين بـ FunClip، لا إلى اختبارات دقة عملية

أخطاء شائعة عند تقييم FunClip

ينشأ معظم اللبس حول FunClip من توقع محرر فيديو كامل، أو إغفال خيار وضع اللغة، أو افتراض أنها لا تحتاج إلى إعداد إضافي لنموذج LLM.

المنافسون والبدائل

غالبًا ما تُقارَن FunClip بأدوات محلية أخرى مستضافة ذاتيًا للتحويل من الكلام إلى نص مثل whisper.cpp وfaster-whisper وMacWhisper — وأبرز ما يميزها هو تجاوزها التفريغ النصي الخام إلى اختيار مقاطع كامل بمساعدة الذكاء الاصطناعي وتصدير فيديو بترجمات مدمجة.

Tool
Best known for
Link
whisper.cppنسخة C/C++ مجانية ومرخّصة بموجب MIT من OpenAI Whisper للتفريغ النصي على الجهازمراجعة Whisper.cpp
faster-whisperإعادة تنفيذ لـ Whisper مبنية على CTranslate2 ومحسّنة للسرعة على وحدة معالجة الرسوميات/المعالجمراجعة Faster-Whisper
MacWhisperتطبيق تفريغ نصي أصلي مصقول لنظام macOS مبني على نماذج Whisperمراجعة MacWhisper

تعكس هذه القائمة الأدوات التي تُقارَن بها FunClip عادةً من جانب التفريغ النصي، وليست تصنيفًا مستقلًا من PromptQuorum — تحقق من مجموعة الميزات الحالية لكل أداة قبل الاختيار. لا تضيف أي من هذه الأدوات الثلاث طبقة اختيار المقاطع بمساعدة الذكاء الاصطناعي وتصدير الفيديو التي تتمتع بها FunClip؛ فهي محركات/تطبيقات تفريغ نصي وليست أدوات مونتاج. راجع أيضًا مقارنة FunClip مقابل Whisper.cpp أعلاه.

الأسئلة الشائعة

ما هي FunClip؟

FunClip (github.com/modelscope/FunClip) هي أداة مجانية ومفتوحة المصدر ومستضافة ذاتيًا لمونتاج الفيديو طوّرتها ModelScope، تقوم بتفريغ الفيديوهات نصيًا باستخدام نماذج التعرف على الكلام FunASR وتستخدم نموذج LLM لإيجاد المقاطع المطلوبة وقصها.

هل FunClip مجانية؟

نعم، FunClip مجانية ومفتوحة المصدر (الشيفرة المصدرية مرخّصة بموجب MIT؛ وأوزان نموذج FunASR مرخّصة بشكل منفصل بموجب Apache 2.0). لا توجد خطة مدفوعة أو خدمة مستضافة — تقوم بتشغيلها على جهازك الخاص.

كيف أثبّت FunClip؟

وفقًا لملف README الخاص بالمشروع، استنسخ مستودع GitHub وثبّت الاعتماديات من requirements.txt داخل بيئة افتراضية بلغة بايثون 3.12 أو أحدث. تتوفر أيضًا أرشيفات إصدارات مرقّمة مع قيم تحقق SHA256 على صفحة الإصدارات.

هل تدعم FunClip اللغة الإنجليزية؟

نعم، تفرّغ FunClip افتراضيًا اللغة الصينية الماندرين نصيًا، لكنها توثّق وضعًا للغة الإنجليزية عبر الخيار -l en، إلى جانب دعم متعدد اللغات عبر نموذج SenseVoice.

هل تعمل FunClip من سطر الأوامر؟

نعم، بالإضافة إلى واجهة ويب Gradio المحلية (افتراضيًا على localhost:7860)، توفر FunClip نصًا برمجيًا من سطر الأوامر، videoclipper.py، للتعرف على الفيديو وقصه مباشرة.

هل تولّد FunClip الترجمات تلقائيًا؟

نعم، تولّد FunClip تلقائيًا ترجمات بصيغة SRT لكل من الفيديو الكامل وكل مقطع مقصوص على حدة، باستخدام تفريغ FunASR النصي مع طوابع زمنية مدمجة.

من يطوّر FunClip؟

تطوّر ModelScope، منصة النماذج المفتوحة التابعة لعلي بابا، FunClip كجزء من عمل مختبر الصوت TONGYI التابع لها. المستودع الرسمي على GitHub هو modelscope/FunClip.

هل تحتاج FunClip إلى نموذج LLM لتعمل؟

تعمل ميزات التفريغ النصي الأساسية وتصدير المقاطع اليدوي دون الحاجة إلى نموذج LLM. أما ميزة اختيار المقاطع بمساعدة الذكاء الاصطناعي، حيث تصف لحظة معينة وتجدها الأداة، فتتطلب تهيئة نموذج LLM بشكل منفصل.

هل يمكن لـ FunClip التعرف على متحدثين مختلفين في تسجيل واحد؟

نعم، تتضمن FunClip ميزة التعرف على المتحدثين عبر CAM++، مما يتيح قص مقاطع حسب متحدث معين — وهو مفيد للمقابلات أو الجلسات الحوارية أو التسجيلات التي تضم عدة أشخاص.

هل اختبرت PromptQuorum بشكل مستقل دقة تفريغ FunClip النصي؟

تستند هذه المراجعة إلى مستودع GitHub وملف README الخاصين بـ FunClip، لا إلى اختبار عملي لدقة التفريغ النصي أجرته PromptQuorum.

المصادر

← العودة إلى LLM المحلية المتقدمة