Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/مراجعة XTTS v2 (2026): استنساخ صوتي متعدد اللغات من 6 ثوانٍ من الصوت
Voice, Speech & Multimodal

مراجعة XTTS v2 (2026): استنساخ صوتي متعدد اللغات من 6 ثوانٍ من الصوت

·وقت القراءة 12 دقيقة·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

XTTS v2 هو نموذج استنساخ صوتي متعدد اللغات من Coqui يستنسخ صوتًا من 6 ثوانٍ فقط من صوت مرجعي ويولّد كلامًا بهذا الصوت بـ17 لغة. يعمل عبر أدوات Coqui TTS (pip install coqui-tts، ثم TTS("tts_models/multilingual/multi-dataset/xtts_v2")). رخصته، وهي Coqui Public Model License (CPML)، غير تجارية — ولأن شركة Coqui AI أوقفت خدماتها المدفوعة في ديسمبر 2023، لا يوجد حاليًا مسار نشط للحصول على رخصة تجارية. للاطلاع على مقارنة كاملة للرخص بين محركات TTS المحلية، راجع دليل رخص TTS المحلية من PromptQuorum.

XTTS v2 هو نموذج استنساخ صوتي متعدد اللغات أصدرته Coqui، ومتوفر على Hugging Face، يستنسخ صوتًا من 6 ثوانٍ فقط من صوت مرجعي ويجعله يتحدث بـ17 لغة. يعمل عبر أدوات Coqui TTS — والنسخة المُصانة بنشاط هي idiap/coqui-ai-TTS — أو يمكن استخدامه بشكل مستقل عبر أوزان النموذج مباشرة. تتناول هذه المراجعة ما يفعله XTTS v2 فعليًا، وأوامر استخدام حقيقية، ورخصته (رخصة Coqui Public Model License، أو CPML، وهي رخصة غير تجارية)، ومتى يكون الأداة المناسبة ومتى لا يكون كذلك، إذ إن شركة Coqui AI التي أصدرته في الأصل أوقفت خدماتها المدفوعة في ديسمبر 2023.

مراجعة XTTS v2 (2026): استنساخ صوتي متعدد اللغات من 6 ثوانٍ من الصوت

النقاط الرئيسية

  • يستنسخ صوتًا من 6 ثوانٍ فقط من صوت مرجعي، بـ17 لغة.
  • يعمل عبر أدوات Coqui TTS (pip install coqui-tts) أو مباشرة عبر أوزان النموذج على Hugging Face.
  • الرخصة: Coqui Public Model License (CPML) — غير تجارية فقط.
  • لا يوجد مسار تجاري نشط: أوقفت Coqui AI خدماتها المدفوعة في ديسمبر 2023.
  • زمن استجابة بث موثّق أقل من 200 مللي ثانية حتى أول صوت؛ يوصى بشدة باستخدام GPU.
  • يتطلب قبول رخصة CPML — عيّن COQUI_TOS_AGREED=1 للقيام بذلك بشكل غير تفاعلي في Docker أو CI.

📍 في جملة واحدة

XTTS v2 هو نموذج Coqui للاستنساخ الصوتي متعدد اللغات الذي يستنسخ صوتًا من 6 ثوانٍ من صوت مرجعي ويجعله يتحدث بـ17 لغة، وهو مرخّص بموجب Coqui Public Model License (CPML) غير التجارية، دون مسار تجاري نشط منذ أن أوقفت Coqui AI، الشركة المُصدرة، خدماتها المدفوعة في ديسمبر 2023.

💬 بعبارات بسيطة

إنه نموذج ذكاء اصطناعي يستمع إلى مقطع قصير لشخص يتحدث، ثم يمكنه توليد جمل جديدة بنفس الصوت، بـ17 لغة مختلفة — مجاني للاستخدام الشخصي والبحثي، لكن ليس لمنتج مدفوع دون اتفاقية منفصلة غير موجودة حاليًا.

📌ملاحظة: رخصة CPML ليست نفس رخصة أدوات Coqui TTS التي تشغّل XTTS v2 — الأدوات مرخّصة بموجب MPL-2.0، لكن أوزان ومخرجات هذا النموذج تحديدًا غير تجارية. راجع قسم الرخصة والاستخدام التجاري أدناه.

ما الذي يفعله XTTS v2 فعليًا

XTTS v2 هو نموذج تحويل نص إلى كلام قائم على GPT يدعم الاستنساخ الصوتي عبر اللغات. بمعطيات مقطع صوتي مرجعي قصير ونص مستهدف، يولّد كلامًا بالصوت المستنسخ، حتى بلغة مختلفة عن لغة الصوت المرجعي.

  • استنساخ صوتي في ثوانٍ معدودة. يكفي مقطع صوتي مرجعي واحد مدته 6 ثوانٍ لاستنساخ صوت، وفقًا لبطاقة النموذج الرسمية من Coqui — دون الحاجة إلى ضبط دقيق أو عملية تدريب لصوت جديد.
  • دعم 17 لغة مع استنساخ عبر اللغات. اللغات المدعومة هي الإنجليزية والإسبانية والفرنسية والألمانية والإيطالية والبرتغالية والبولندية والتركية والروسية والهولندية والتشيكية والعربية والصينية (zh-cn) واليابانية والمجرية والكورية والهندية — يمكنك استنساخ صوت من صوت إنجليزي وتوليد كلام بأي من اللغات الـ16 الأخرى بنفس الصوت المستنسخ.
  • الاستدلال عبر البث. يدعم XTTS v2 التوليد المتزامن (streaming) بزمن استجابة أقل من 200 مللي ثانية حتى أول صوت، موثّق منذ إدخال هذه الميزة في Coqui TTS الإصدار 0.20.0 — مفيد لتطبيقات الصوت التفاعلية حيث يكون انتظار ملف صوتي كامل بطيئًا جدًا.
  • يعمل عبر أدوات Coqui TTS. الطريقة الرئيسية والمدعومة لتشغيل XTTS v2 هي عبر Coqui TTS (pip install coqui-tts)، الذي يتيحه باسم TTS("tts_models/multilingual/multi-dataset/xtts_v2").
  • إعادة استخدام تضمين المتحدث. بالإضافة إلى تمرير مقطع مرجعي خام في كل مرة، تدعم الأدوات حساب التضمين الكامن للمتحدث وإعادة استخدامه، مما يتجنب إعادة الحساب عند التوليد المتكرر بنفس الصوت المستنسخ.

أمثلة استخدام حقيقية

تستخدم هذه الأوامر واجهة برمجة تطبيقات بايثون الموثّقة الخاصة بأدوات Coqui TTS، وهي الطريقة الرئيسية والمدعومة لتشغيل XTTS v2.

  • جودة الصوت المرجعي مهمة. مقطع نظيف مدته 6 ثوانٍ لمتحدث واحد دون ضوضاء خلفية أو موسيقى ينتج استنساخًا أفضل بشكل ملحوظ من مقطع قصير أو صاخب أو متعدد المتحدثين.
  • قبول رخصة CPML بشكل غير تفاعلي مطلوب عند تحميل XTTS v2 لأول مرة في بيئة غير مراقَبة (Docker، CI) — عيّن COQUI_TOS_AGREED=1 قبل ذلك التحميل الأول.
python
# تثبيت الأدوات
pip install coqui-tts

# قبول رخصة CPML بشكل غير تفاعلي (مطلوب لبيئات Docker/CI؛ وإلا
# ستظهر مطالبة تفاعلية عند التحميل الأول)
export COQUI_TOS_AGREED=1

# واجهة برمجة بايثون: استنساخ صوت وتوليد كلام
import torch
from TTS.api import TTS

device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)

# استنساخ بنفس اللغة
tts.tts_to_file(
    text="This is a cloned voice speaking a new sentence.",
    speaker_wav="reference_voice.wav",
    language="en",
    file_path="output_en.wav",
)

# استنساخ عبر اللغات: الاستنساخ من صوت إنجليزي والتحدث بالإسبانية
tts.tts_to_file(
    text="Esta es la misma voz clonada, ahora hablando en español.",
    speaker_wav="reference_voice.wav",
    language="es",
    file_path="output_es.wav",
)

# التوليد المتزامن (زمن استجابة منخفض حتى أول صوت)
for chunk in tts.tts_stream(
    text="Streaming audio, chunk by chunk, for interactive use.",
    speaker_wav="reference_voice.wav",
    language="en",
):
    play_audio(chunk)

الرخصة والاستخدام التجاري

أوزان نموذج XTTS v2 ومخرجات الصوت المولَّدة مرخّصة بموجب Coqui Public Model License (CPML) 1.0.0، وقد تم التأكد من ذلك عبر ملف الرخصة المنشور مع النموذج على Hugging Face. تنص رخصة CPML صراحةً على أنها "تسمح فقط بالاستخدام غير التجاري لنموذج تعلم آلي ومخرجاته" — تشمل الاستخدامات المسموح بها المشاريع الشخصية والأبحاث الأكاديمية والعمل كهواية، طالما أنك لا تتلقى أجرًا مباشرًا أو غير مباشر مرتبطًا بذلك الاستخدام.

لا يوجد حاليًا مسار تجاري نشط لـ XTTS v2. تدرج بطاقة النموذج عنوان اتصال، info@coqui.ai، للاستفسارات عن الترخيص التجاري، لكن Coqui AI، الشركة، أوقفت خدماتها المدفوعة في ديسمبر 2023 — لم تتمكن PromptQuorum من التأكد من أن هذا العنوان لا يزال نشطًا أو أن رخصة تجارية متاحة اليوم. عامل XTTS v2 على أنه غير تجاري حصرًا ما لم تؤكد خلاف ذلك بشكل مستقل قبل إطلاق منتج مدفوع.

تنطبق رخصة CPML تحديدًا على أوزان نموذج XTTS v2 ومخرجاته — وليس على كود أدوات Coqui TTS التي تشغّل النموذج، وهي مرخّصة بشكل منفصل بموجب MPL-2.0 وتسمح فعليًا بالاستخدام التجاري بشروط الإفصاح عن الكود الخاصة بتعديلات الأدوات. تشرح هذه الفقرة الشكل العام للرخصة؛ وهي ليست استشارة قانونية — اقرأ رخصة CPML بنفسك واستشر محاميًا قبل أي نشر تجاري.

ما الرخصة التي يستخدمها XTTS v2؟

يُصدر XTTS v2 بموجب Coqui Public Model License (CPML) 1.0.0، وهي رخصة غير تجارية تنطبق على أوزان النموذج ومخرجاته الصوتية المولَّدة. تسمح بالاستخدام الشخصي والبحثي والهواية، لكنها تحظر الاستخدام التجاري — أي منتج مدفوع أو أداة SaaS أو تسليم لعميل — دون اتفاقية منفصلة. هذا ليس استشارة قانونية؛ اقرأ رخصة CPML بنفسك قبل أي استخدام تجاري.

ما لا يصلح له XTTS v2

XTTS v2 نموذج استنساخ صوتي عالي الجودة، وليس محرك TTS عام الغرض قابلاً للنشر التجاري. إنه الأداة الخاطئة للحالات التالية:

  • أي منتج تجاري دون رخصة مؤكدة. رخصة CPML غير تجارية، ولا يوجد حاليًا مسار مؤكد ونشط للحصول على رخصة تجارية بعد إغلاق Coqui AI في 2023. لا تُطلق XTTS v2 في منتج مدفوع أو تطبيق مدعوم بالإعلانات أو تسليم لعميل دون التأكد بشكل مستقل من شروط الترخيص أولاً.
  • الاستخدام في الوقت الفعلي على CPU فقط مع موارد محدودة. يدعم XTTS v2 البث بزمن استجابة منخفض، لكن هذا الأداء يفترض تسريع GPU؛ على CPU وحده يكون أبطأ بشكل ملحوظ من محرك خفيف مثل Piper، وقد لا يكون عمليًا للاستخدام في الوقت الفعلي على أجهزة متواضعة مثل Raspberry Pi.
  • استنساخ صوت من صوت قصير جدًا أو صاخب. رغم أن 6 ثوانٍ هي الحد الأدنى الموثّق، فإن مقطعًا مرجعيًا صاخبًا أو مضغوطًا أو متعدد المتحدثين ينتج استنساخًا أسوأ بشكل ملحوظ من تسجيل نظيف لمتحدث واحد.
  • لغة خارج اللغات الـ17 المدعومة. يدعم XTTS v2 بالضبط الإنجليزية والإسبانية والفرنسية والألمانية والإيطالية والبرتغالية والبولندية والتركية والروسية والهولندية والتشيكية والعربية والصينية (zh-cn) واليابانية والمجرية والكورية والهندية — ولا توجد خارطة طريق رسمية للغات إضافية حتى تاريخ نشر هذه المراجعة.
  • انتحال شخصية دون موافقة. استنساخ صوت شخص حقيقي دون علمه أو موافقته يثير مخاوف تتعلق بالموافقة وحق الصورة، وربما الاحتيال أو الانتحال، وهي مخاوف مستقلة عن قيد رخصة CPML غير التجاري — وتنطبق بغض النظر عن شروط الرخصة، سواء في الاستخدام الشخصي أو التجاري.

بدائل XTTS v2

Piper

الأنسب لـ:
أسرع توليد على CPU فقط، دون استنساخ صوتي، وقت فعلي على Raspberry Pi
الرخصة:
GPL-3.0-or-later

أدوات Coqui TTS

الأنسب لـ:
البرنامج الذي يشغّل XTTS v2 (ونماذج أخرى) بقاعدة كود أوسع وذات رخصة متساهلة
الرخصة:
MPL-2.0 (الأدوات فقط)

Bark

الأنسب لـ:
صوت تعبيري غير كلامي — ضحك، تنهدات، صوت محيطي
الرخصة:
MIT

StyleTTS 2

الأنسب لـ:
أعلى جودة سرد إنجليزي طبيعي (دون استنساخ صوتي)
الرخصة:
MIT

ElevenLabs

الأنسب لـ:
واجهة سحابية مُدارة مع استنساخ صوتي تجاري وترخيص تجاري واضح
الرخصة:
ملكية خاصة (واجهة سحابية مدفوعة)

الأسئلة الشائعة

ما هو XTTS v2؟

XTTS v2 هو نموذج تحويل نص إلى كلام باستنساخ صوتي متعدد اللغات أصدرته Coqui، يستنسخ صوتًا من 6 ثوانٍ فقط من صوت مرجعي ويولّد كلامًا بهذا الصوت بـ17 لغة، بما في ذلك الاستنساخ عبر اللغات.

هل يمكنني استخدام XTTS v2 تجاريًا؟

ليس دون اتفاقية منفصلة. XTTS v2 مرخّص بموجب Coqui Public Model License (CPML)، التي تسمح بالاستخدام الشخصي والبحثي والهواية لكنها تحظر الاستخدام التجاري — أي منتج مدفوع أو SaaS أو محتوى مدعوم بالإعلانات أو عمل لعميل. أوقفت Coqui AI، الشركة التي أصدرته، خدماتها المدفوعة في ديسمبر 2023، ولم تتمكن PromptQuorum من التأكد من وجود مسار تجاري نشط اليوم. عامل XTTS v2 على أنه غير تجاري حصرًا.

كم من الصوت المرجعي يحتاجه XTTS v2 لاستنساخ صوت؟

6 ثوانٍ فقط من صوت مرجعي نظيف لمتحدث واحد، وفقًا لبطاقة النموذج الرسمية على Hugging Face. يُنتج المقطع الأطول والأنظف عادةً استنساخًا أكثر دقة.

كم عدد اللغات التي يدعمها XTTS v2؟

17 لغة بالضبط: الإنجليزية والإسبانية والفرنسية والألمانية والإيطالية والبرتغالية والبولندية والتركية والروسية والهولندية والتشيكية والعربية والصينية (zh-cn) واليابانية والمجرية والكورية والهندية. يدعم الاستنساخ عبر اللغات — استنسخ صوتًا من صوت بإحدى هذه اللغات وولّد كلامًا بأي من اللغات الأخرى.

كيف أشغّل XTTS v2؟

ثبّت أدوات Coqui TTS باستخدام pip install coqui-tts، ثم حمّل النموذج باستخدام TTS("tts_models/multilingual/multi-dataset/xtts_v2"). عيّن متغيّر البيئة COQUI_TOS_AGREED=1 أولاً إذا كنت بحاجة إلى قبول رخصة CPML بشكل غير تفاعلي، مثل داخل حاوية Docker أو خط أنابيب CI.

هل أحتاج إلى GPU لتشغيل XTTS v2؟

يوصى بشدة باستخدام GPU. يعمل XTTS v2 على CPU، لكن بشكل أبطأ ملحوظًا — يفترض زمن استجابة البث الموثّق الأقل من 200 مللي ثانية تسريع GPU، والاستخدام على CPU فقط غير عملي للتطبيقات في الوقت الفعلي.

ما الفرق بين XTTS v2 وأدوات Coqui TTS؟

XTTS v2 هو نموذج استنساخ صوتي محدد، مرخّص بموجب رخصة CPML غير التجارية. أدوات Coqui TTS هي البرنامج — حزمة بايثون وواجهة سطر أوامر — التي تشغّل XTTS v2 ونماذج أخرى، مرخّصة بشكل منفصل بموجب MPL-2.0، والتي تسمح فعليًا بالاستخدام التجاري لكود الأدوات نفسه.

الحكم النهائي

يظل XTTS v2 واحدًا من أعلى نماذج الاستنساخ الصوتي المحلي جودة المتاحة في 2026، والجمع بين متطلب استنساخ مدته 6 ثوانٍ ودعم 17 لغة عبر الاستنساخ المتعدد اللغات وزمن استجابة بث أقل من 200 مللي ثانية قدرات حقيقية للاستخدام الشخصي والبحثي والنماذج الأولية. القرار الذي يهم معظم القراء فعليًا هو الرخصة: رخصة Coqui Public Model License غير تجارية بشكل لا لبس فيه، ولأن Coqui AI أغلقت في ديسمبر 2023، لا يوجد اليوم مسار مؤكد ونشط للحصول على رخصة تجارية. إذا كان استخدامك شخصيًا أو أكاديميًا أو نموذجًا أوليًا غير تجاري، فإن XTTS v2 خيار قوي وموثّق جيدًا. إذا كنت بحاجة إلى استنساخ صوتي تجاري، تحقق من شروط الترخيص بشكل مستقل قبل البناء عليه، أو اجمع بين هذه المراجعة وتغطية PromptQuorum لـPiper وBark كبدائل ذات رخصة متساهلة، أو مقارنة ElevenLabs كخيار تجاري مُدار.

المصادر

← العودة إلى LLM المحلية المتقدمة