النقاط الرئيسية
- 17 أداة وثلاث مهام: تحويل النص إلى كلام (8)، وتحويل الكلام إلى نص (7)، والوكلاء الصوتيون الفوريون (4). تجمع Izwi وWillow Inference Server بين تحويل النص إلى كلام وتحويل الكلام إلى نص، لذلك تظهران في الجدولين.
- يُولَّد الجدول من سجل كل أداة ويُدقَّق مقابل ملف README الرسمي أو الموقع الرسمي لها؛ والشرطة تعني «غير مذكور في الوثائق»، ولا تعني «لا» أبدًا.
- تختلف التراخيص بطرق مهمة: فمثلًا Piper وOpenAI Edge TTS بترخيص GPL-3.0، وCoqui TTS بترخيص MPL-2.0، وXTTS-v2 يستخدم رخصة Coqui Public Model License، وBark وStyleTTS 2 وwhisper.cpp وfaster-whisper بترخيص MIT.
- يرتبط اسم كل أداة في الجدول بمراجعتها الخاصة في PromptQuorum، حيث تُغطى خطوات التثبيت والحدود.
📍 في جملة واحدة
أدوات الصوت المحلية ثلاث مهام مختلفة — تحويل النص إلى كلام، وتحويل الكلام إلى نص، والوكلاء الصوتيون الفوريون — لذا تُقارَن الأدوات الـ17 في دليل PromptQuorum داخل كل مهمة، بجدول مولَّد من بيانات الأدوات نفسها التي تعتمد عليها مراجعة كل أداة.
💬 بعبارات بسيطة
بعض الأدوات تقرأ النص بصوت مسموع، وبعضها يكتب ما تقوله، وبعضها يجري محادثة منطوقة مع الذكاء الاصطناعي. ومقارنة أداة قراءة بأداة نسخ من حيث «استنساخ الصوت» لا معنى لها، ولهذا يقارن هذا الدليل بين الأدوات المتجانسة.
كيف أجرينا المقارنة
تُخزَّن حقائق كل أداة — السعر والرخصة والمنصات ومتطلبات العتاد والسمات الخاصة بالفئة — مرة واحدة في سجل الأداة بالدليل. ويُولَّد جدول المقارنة أدناه من هذه السجلات، وتعتمد مراجعة الأداة نفسها على السجل ذاته، فلا يمكن أن يذكرا قيمًا مختلفة.
أُخذت السمات الخاصة بالفئة (مثل استنساخ الصوت أو النسخ الفوري) من ملف README الرسمي لكل مشروع أو موقعه، وتم التحقق منها مقابل الصياغة الدقيقة هناك. وحيث تصمت الوثائق، يعرض الجدول شرطة بدل التخمين؛ وحيث يكون الادعاء مقيّدًا (تجريبيًا، أو في الخطة المدفوعة فقط، أو معتمدًا على GPU)، تُترك السمة خارج الجدول وتُغطى في مراجعة الأداة.
تُدرج المقارنة الأدوات التي تعمل على جهازك الخاص. وهي لا ترتّبها: فالأنسب لك يعتمد على قيدك، وتبيّن الأقسام أدناه مواضع الفروق الحقيقية.
جدول المقارنة
اختر مهمة أدناه، ثم اقرأ عبر الصف. انقر على اسم أداة لفتح مراجعتها الكاملة في PromptQuorum.
| الأداة | السعر | الرخصة | المنصات | التشغيل | العتاد | الإصدار | اللغات | استنساخ الصوت | إخراج متدفق | قابل للاستخدام على CPU فقط | خادم API محلي | مراجعة | رابط منتج · مُفصح عنه |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Bark | مجاني | MIT | macOS, Windows, Linux | محلي | يكفي CPU | — | 13 | لا | — | — | — | اقرأ المراجعة → | Bark |
| Coqui TTS | مجاني | MPL-2.0 | macOS, Windows, Linux | محلي | يكفي CPU | v0.27.5 | — | نعم | نعم | — | نعم | اقرأ المراجعة → | Coqui TTS |
| Izwi | مجاني | MIT | macOS, Windows, Linux | محلي | يختلف حسب النموذج | v0.1.0-beta-17 | — | نعم | — | نعم | نعم | اقرأ المراجعة → | Izwi |
| openai-edge-tts | مجاني | GPL-3.0 | macOS, Windows, Linux | هجين | يكفي CPU | — | — | — | نعم | — | نعم | اقرأ المراجعة → | openai-edge-tts |
| Piper TTS | مجاني | GPL-3.0 | macOS, Windows, Linux | محلي | يكفي CPU | — | — | — | — | — | نعم | اقرأ المراجعة → | Piper TTS |
| StyleTTS 2 | مجاني | MIT | macOS, Windows, Linux | محلي | يكفي CPU | — | — | — | — | — | — | اقرأ المراجعة → | StyleTTS 2 |
| Willow Inference Server | مجاني | Apache-2.0 | Linux, Windows | محلي | يكفي CPU | — | — | نعم | نعم | — | نعم | اقرأ المراجعة → | Willow Inference Server |
| XTTS v2 | مجاني | CPML | macOS, Windows, Linux | محلي | — | — | 17 | نعم | — | — | — | اقرأ المراجعة → | XTTS v2 |
"—" تعني أن وثائق المشروع نفسه لا تذكر هذه السمة، ولا تعني أن الميزة غير موجودة. تؤخذ القيم من ملف README الرسمي لكل مشروع أو موقعه، وتُعاد مراجعتها عند تحديث مراجعة الأداة.
تحويل النص إلى كلام: ما الذي يختلف
- الرخصة. Bark وStyleTTS 2 بترخيص MIT. وCoqui TTS بترخيص MPL-2.0. أما XTTS-v2 فيستخدم رخصة Coqui Public Model License (CPML)، وهي رخصة مخصصة بشروطها الخاصة وليست رخصة مفتوحة المصدر قياسية — اقرأها قبل أي استخدام تجاري. وPiper وOpenAI Edge TTS بترخيص GPL-3.0، الذي يفرض شروطًا على توزيع النسخ المعدّلة. تحقّق من الرخصة قبل بناء منتج على أي منها — انظر Piper TTS وXTTS v2.
- استنساخ الصوت. توثّق Coqui TTS (مراجعة) وXTTS-v2 (مراجعة) وIzwi (مراجعة) وWillow Inference Server (مراجعة) استنساخ الصوت أو الأصوات المخصصة. أما Bark فتنص على أنها لا تدعم استنساخ الأصوات المخصصة.
- خادم API محلي. توثّق Coqui TTS وIzwi وOpenAI Edge TTS وPiper وWillow Inference Server مكوّن خادم، بحيث تستطيع تطبيقات أخرى استدعاءها عبر HTTP؛ وOpenAI Edge TTS مبنية حول ذلك.
- اللغات. توثّق Bark دعم 13 لغة وتوثّق XTTS-v2 دعم 17. أما الأدوات الأخرى فلا تذكر عددًا قابلًا للمقارنة، لذلك يعرض الجدول شرطة بدل رقم.
تحويل الكلام إلى نص: ما الذي يختلف
- النسخ الفوري. توثّق whisper.cpp مثالًا للبث الفوري، وتوثّق Izwi وWillow Inference Server الاستخدام الفوري. أما faster-whisper فهي مكتبة نسخ؛ ولا يوثّق ملف README الخاص بها وضعًا فوريًا.
- تمييز المتحدثين. توثّق Izwi وFunClip تمييز المتحدثين. وتقدّم Meetily تمييز المتحدثين (speaker diarization) في خطة Pro المدفوعة فقط. أما وسم تغيّر المتحدثين في whisper.cpp فتجريبي، ويُغطى في مراجعتها لا في الجدول.
- السعر والمنصة. MacWhisper تطبيق macOS مملوك بمستوى مجاني وترقية مدفوعة؛ ومعظم الأدوات الأخرى هنا مجانية ومفتوحة المصدر. ونسخة Meetily المجتمعية (Community Edition) مجانية وبترخيص MIT، مع خطة Pro مدفوعة.
- خادم API محلي. تأتي whisper.cpp بخادم، وتوثّق Izwi وWillow Inference Server واجهات HTTP API.
الوكلاء الصوتيون: ما الذي يختلف
- محلي بالكامل مقابل سحابة اختيارية. توثّق Jarvis حزمة محلية من الكلام الداخل ونموذج LLM والكلام الخارج؛ وتوثّق Parlor مسارًا محليًا مع ميزة بحث سحابية اختيارية. ويمكن لـ Voxa استخدام مزوّد صوت محلي أو مزوّدين سحابيين، فلا تكون محلية بالكامل إلا إذا اخترت المزوّد المحلي.
- المقاطعة (barge-in). توثّق Jarvis وParlor وVoxa إمكانية مقاطعة الوكيل أثناء كلامه.
- نموذج LLM من اختيارك والمكالمات الهاتفية. توثّق Dograh إمكانية اختيار نموذج LLM وتكاملات الاتصال الهاتفي؛ وتوثّق Voxa ربط نموذجك الخاص عبر خدمة محلية (daemon).
ما لا تخبرك به هذه المقارنة
- تقارن القدرات الموثّقة لا الجودة. ولا تقول شيئًا عن مدى طبيعية الصوت أو دقة النص المنسوخ — فهذا يتطلب تسجيلاتك الصوتية وعتادك الخاص.
- لا تتضمن اختبارات سرعة: لم تقسها PromptQuorum لهذه الأدوات.
- الشرطات فجوات في وثائق المشاريع، وليست نتائج سلبية. قد تدعم بعض الأدوات ميزة لا يذكرها ملف README الخاص بها.
- تتغير الأدوات بسرعة. تذكر مراجعة كل أداة الإصدار الذي جرى التحقق منه، ويُحدَّث هذا الدليل عند تحديث مراجعة.
الأسئلة الشائعة
لماذا تُقارَن أدوات تحويل النص إلى كلام وتحويل الكلام إلى نص والوكلاء الصوتيون كلٌّ على حدة؟
لأنها تؤدي مهام مختلفة، فمعظم السمات لا معنى لها إلا داخل مهمة واحدة — استنساخ الصوت يخص تحويل النص إلى كلام، وتمييز المتحدثين يخص النسخ، والمقاطعة تخص الوكلاء الصوتيين. أما جمعها في جدول واحد فسيترك معظم الخلايا فارغة أو بلا معنى.
ماذا تعني الشرطة في جدول المقارنة؟
تعني أن وثائق المشروع نفسه لا تذكر هذه السمة. ولا تعني أن الميزة غير موجودة؛ راجع مراجعة الأداة أو مستودعها.
هل هذه الأدوات محلية فعلًا؟
هي مصممة للعمل على جهازك الخاص، لكن بعضها يقدّم ميزات سحابية اختيارية — مثل البحث السحابي الاختياري في Parlor، أو مزوّدي الصوت السحابيين في Voxa — وبعضها يحتاج إلى الإنترنت عند التشغيل الأول لتنزيل النماذج. وتغطي مراجعة كل أداة ذلك.
هل لأي من هذه الأدوات رابط أفلييت؟
لا. لا تربط PromptQuorum أي علاقة أفلييت بأي أداة في هذه المقارنة وقت الكتابة، ولا يحقق أي رابط هنا عمولة.
كم مرة تُحدَّث هذه المقارنة؟
تُحدَّث مرتين في السنة، وكلما حُدِّثت مراجعة إحدى الأدوات المدرجة، لأن الجدول مولَّد من البيانات نفسها التي تعتمد عليها تلك المراجعات.
المصادر
- ملف README الرسمي لكل أداة أو موقعها الرسمي، المذكور في مراجعة PromptQuorum لتلك الأداة (المرتبطة من جدول المقارنة).
- دليل PromptQuorum لتطبيقات الذكاء الاصطناعي المحلية — السجل الذي يُولَّد منه كل صف في الجدول.
- شرح تراخيص أدوات الذكاء الاصطناعي — معنى عائلات التراخيص المذكورة أعلاه.