النقاط الرئيسية
- openai-edge-tts (github.com/travisvn/openai-edge-tts) خادم API مجاني ومفتوح المصدر ومُستضاف ذاتيًا — وليس نموذج كلام محليًا
- من إنشاء المطور travisvn؛ تم إنشاء المستودع في 9 أكتوبر 2024
- مرخّص بموجب GPL-3.0، مؤكَّد عبر حقل الترخيص في مستودع GitHub
- يوفّر
/v1/audio/speech، مطابقًا لشكل طلب/استجابة واجهة تحويل النص إلى كلام في OpenAI، بحيث يمكن لكود العميل الحالي المخصص لـ OpenAI-TTS الإشارة إليه بمجرد تغيير عنوان URL الأساسي - يتم تمرير عملية التركيب إلى أصوات "القراءة بصوت عالٍ" المجانية عبر الإنترنت في Microsoft Edge عبر مكتبة
edge-ttsبلغة Python — لا يعمل أي نموذج كلام محلي على جهازك - أكثر من 2,100 نجمة على GitHub و316 تفرعًا وقت كتابة هذه المراجعة
📍 في جملة واحدة
openai-edge-tts خادم API مجاني ومفتوح المصدر (GPL-3.0) من إنشاء travisvn يوفّر نقطة نهاية /v1/audio/speech متوافقة مع OpenAI، لكن بدلاً من تشغيل نموذج كلام محليًا، يمرّر كل طلب إلى أصوات Microsoft Edge المجانية عبر الإنترنت باستخدام مكتبة edge-tts.
💬 بعبارات بسيطة
إنه خادم صغير تُشغّله بنفسك (عادةً عبر Docker) يجعل أدوات تحويل النص إلى كلام المُصمَّمة لواجهة OpenAI تعمل مع مصدر أصوات مجاني بدلاً منها — لكن "النطق" الفعلي يحدث على خوادم Microsoft، وليس على جهازك. إذا كانت الخصوصية من Microsoft مهمة بالنسبة لنصوصك، فهذه الأداة لا توفرها؛ أما إذا كانت المشكلة التي تحلّها هي تكلفة واجهة OpenAI/Azure/ElevenLabs TTS، فهذه الأداة تحلّها.
📌ملاحظة: تستند هذه المراجعة إلى مستودع openai-edge-tts على GitHub وملف README وملاحظات الإصدارات الخاصة به. لا تدّعي أن PromptQuorum أجرت اختبارات فعلية لزمن الاستجابة أو الجودة مقابل أصوات Microsoft Edge الأساسية.
ما هو openai-edge-tts؟
openai-edge-tts خادم API مُستضاف ذاتيًا يحاكي واجهة تحويل النص إلى كلام في OpenAI، بحيث يمكن توجيه الأدوات المُصمَّمة للاتصال بـ OpenAI أو Azure AI Speech أو ElevenLabs إليه بدلاً من ذلك — دون فاتورة لكل طلب. يقوم بذلك عبر تغليف مكتبة edge-tts، التي تتواصل بدورها مع خدمة أصوات "القراءة بصوت عالٍ" المجانية القائمة على متصفح Microsoft Edge عبر الإنترنت.
- نوع المنتج: خادم API مُستضاف ذاتيًا (Docker أو Python)، وليس تطبيقًا قابلاً للتنزيل للمستخدم النهائي ولا نموذج كلام محليًا
- المُنشئ: travisvn، مطوّر منفرد؛ مستودع GitHub مستضاف على github.com/travisvn/openai-edge-tts
- تم إنشاء المستودع في 9 أكتوبر 2024، وفق بيانات GitHub الوصفية للمستودع
- الترخيص: GPL-3.0، مؤكَّد عبر البيانات الوصفية للترخيص في مستودع GitHub؛ ينص ملف README أيضًا على أن عمليات النشر المؤسسية/التجارية يجب أن تتواصل مباشرة مع المؤلف
- المحلية: هجين، وليس محليًا — عملية الخادم مُستضافة ذاتيًا، لكن عملية تحويل النص إلى كلام الفعلية تُمرَّر إلى خدمة أصوات Microsoft Edge عبر الإنترنت، ولا تُحسَب على جهازك الخاص
- الحجم: أكثر من 2,100 نجمة على GitHub و316 تفرعًا وقت كتابة هذه المراجعة
تاريخ المشروع ومحطات الإصدارات
تم إنشاء مستودع GitHub في 9 أكتوبر 2024، وأبرز محطة إصدار عامة له هي v2.0.0، الصادرة في 28 ديسمبر 2024، والتي أضافت تصفية Markdown، وتوافقًا تجريبيًا مع نقطتي نهاية ElevenLabs/Azure AI Speech، وإعدادًا مبسطًا.
- 19 أكتوبر 2024: إنشاء المستودع
Why it matters: يمثّل بداية المشروع، وفق بيانات GitHub الوصفية للمستودع. - 2v2.0.0 — 28 ديسمبر 2024: تصفية Markdown، ودعم API موسّع، وإعداد مبسط
Why it matters: أضاف تصفية اختيارية لصيغة Markdown في نص الإخراج، وتوافقًا تجريبيًا مباشرًا مع نقطتي نهاية ElevenLabs وAzure AI Speech (إلى جانب نقطة نهاية صيغة OpenAI الحالية)، وجعل بادئة المسار `/v1` اختيارية، وفق ملاحظات إصدار GitHub الرسمية.
ماذا يفعل openai-edge-tts فعليًا؟
يستقبل openai-edge-tts طلب تحويل نص إلى كلام بصيغة واجهة OpenAI، ويربط الصوت والإعدادات المطلوبة بصوت مكافئ من Microsoft Edge، ويجلب الصوت المُركَّب من خدمة Microsoft عبر الإنترنت باستخدام مكتبة edge-tts، ثم يُعيده بالصيغة التي يتوقعها العميل.
- نقطة نهاية متوافقة مع OpenAI:
/v1/audio/speech(بادئة/v1اختيارية اعتبارًا من الإصدار v2.0.0)، مطابقة لشكل طلب/استجابة TTS في OpenAI بحيث لا يحتاج كود العميل الحالي سوى تغيير عنوان URL الأساسي - ربط الأصوات: تُربط أسماء أصوات OpenAI (alloy وecho وfable وonyx وnova وshimmer) افتراضيًا بأصوات edge-tts محددة؛ يوثّق ملف README أيضًا إمكانية اختيار أي صوت من edge-tts مباشرة، متجاوزًا ربط أسماء OpenAI
- طبقات توافق تجريبية: نقاط نهاية بديلة مباشرة تحاكي واجهتي ElevenLabs وAzure AI Speech، إلى جانب نقطة النهاية الأساسية بصيغة OpenAI، أُدخلت في الإصدار v2.0.0
- صيغ الصوت: إخراج بصيغ mp3 وopus وaac وflac وwav وpcm، وفق ملف README
- البث: بث أحداث مرسلة من الخادم (SSE) بمقاطع صوتية مُرمَّزة بـ base64، للعملاء الذين يريدون صوتًا تدريجيًا بدلاً من انتظار ملف كامل
- التحكم في السرعة: سرعة تشغيل قابلة للتعديل من 0.25x إلى 4.0x
- تصفية Markdown اختيارية: تُزيل صياغة Markdown من نص الإدخال قبل التركيب افتراضيًا، إذ يحتوي النص المصدر غالبًا (على سبيل المثال، من استجابة نموذج لغوي) على صياغة Markdown لا ينبغي قراءتها حرفيًا؛ يمكن تعطيل هذا عبر متغيّر بيئة
REMOVE_FILTER - الإعداد: يضبط ملف
.envمفتاح API، والمنفذ (5050 افتراضيًا)، والصوت الافتراضي، والسرعة الافتراضية، واللغة الافتراضية
أمثلة استخدام: طريقتان لاستخدام openai-edge-tts
هذه سير عمل ملموسة مبنية على الميزات الموثقة للمشروع أعلاه.
تثبيت openai-edge-tts
يُثبَّت openai-edge-tts مجانًا عبر Docker (الموصى به) أو مباشرة عبر Python، وكوده المصدري متاح على GitHub.
المصدر | الرابط |
|---|---|
| صورة Docker (Docker Hub) | travisvn/openai-edge-tts |
| مستودع GitHub (الكود المصدري، GPL-3.0) | github.com/travisvn/openai-edge-tts |
| عينات صوتية / موقع المشروع | tts.travisvn.com |
بداية سريعة عبر Docker: docker run -d -p 5050:5050 -e API_KEY=your_api_key_here -e PORT=5050 travisvn/openai-edge-tts:latest. يوثّق ملف README أيضًا إعداد docker-compose مع دعم اختياري لـ FFmpeg، ومسار تثبيت مباشر عبر Python/pip — تحقق من الأوامر الحالية على GitHub قبل تشغيلها، لأن تعليمات التثبيت قد تتغير بين الإصدارات.
المنصة والتسعير والترخيص
المنصة
- ما يذكره openai-edge-tts:
- خادم API مُستضاف ذاتيًا (Docker أو Python) — بلا واجهة رسومية وبلا تطبيق قابل للتنزيل للمستخدم النهائي؛ يعمل على أي مضيف يمكنه تشغيل Docker أو Python.
التكلفة
- ما يذكره openai-edge-tts:
- مجاني ومفتوح المصدر للاستخدام الشخصي. ينص README على أن عمليات النشر المؤسسية/التجارية يجب التواصل بشأنها مباشرة مع المؤلف (travisvn).
الترخيص
- ما يذكره openai-edge-tts:
- GPL-3.0، مؤكَّد عبر البيانات الوصفية للترخيص في مستودع GitHub.
طريقة التثبيت
- ما يذكره openai-edge-tts:
- يُوثَّق Docker (
docker runأو docker-compose) كمسار أساسي؛ كما يُوثَّق مسار بيئة Python الافتراضية + pip للتشغيل دون Docker.
تحقق من شروط الترخيص والاستخدام التجاري الحالية مباشرة في مستودع GitHub قبل نشر هذه الأداة على نطاق مؤسسي، لأن ملاحظة README بشأن التواصل المؤسسي هي نية مُعلنة، وليست نص ترخيص تجاري منشور بشكل منفصل يمكن لهذه المراجعة التحقق منه بشكل مستقل.
openai-edge-tts مقابل Piper TTS
يحل openai-edge-tts وPiper TTS نفس مشكلة "نقطة نهاية TTS مجانية متوافقة مع OpenAI" بطريقتين متعاكستين: أحدهما يُمرّر الطلبات إلى خدمة صوت سحابية مجانية، والآخر يُشغّل نموذج TTS عصبيًا حقيقيًا بالكامل على جهازك الخاص. يُقارَن الاثنان لأنهما يظهران في نفس عمليات البحث عن "كيف أضيف TTS مجانيًا إلى حزمة الذكاء الاصطناعي المستضافة ذاتيًا لدي".
الجانب | openai-edge-tts | Piper TTS |
|---|---|---|
| مكان التركيب | خدمة أصوات Microsoft Edge، عبر الشبكة | بالكامل على وحدة المعالجة المركزية الخاصة بك، بلا استدعاء شبكي |
| المحلية | هجين — خادم مستضاف ذاتيًا، تركيب معتمد على السحابة | محلي بالكامل — يعمل دون اتصال بعد تنزيل النموذج |
| جودة/نمط الصوت | أصوات Microsoft Edge عبر الإنترنت بجودة تجارية، بلغات عديدة | نماذج أصوات عصبية أصغر، تختلف الجودة حسب الصوت، تنزيل لكل صوت |
| مخاطر الاعتماد | يعتمد على استمرار Microsoft في تقديم هذه الخدمة المجانية | يعتمد فقط على استمرار عمل ملف النموذج المُنزَّل |
| الترخيص | GPL-3.0 | MIT |
إذا كان إرسال النص إلى Microsoft مقبولًا لحالة استخدامك وتريد مجموعة واسعة من الأصوات المصقولة بلا تكلفة حوسبة محلية، فـ openai-edge-tts هو المسار الأبسط. أما إذا وجب أن يبقى التركيب بالكامل على جهاز تتحكم فيه، فـ Piper TTS (أو محرك محلي حقيقي آخر) هو الخيار الصحيح، لا هذه الأداة.
لمن يناسب openai-edge-tts؟
يناسب openai-edge-tts المطورين الذين يريدون التخلص من تكلفة كل طلب لواجهة TTS تجارية دون التخلي عن تكامل بشكل OpenAI، والذين لا يمانعون إرسال النص إلى خدمة أصوات Microsoft Edge.
ما لا يصلح له openai-edge-tts
openai-edge-tts ليس خيارًا جيدًا إذا كان تركيب الكلام المحلي حقًا أو دون اتصال أو الحساس للخصوصية متطلبًا أساسيًا.
- ليس دون اتصال — يتطلب كل طلب تركيب اتصالًا فعّالًا بالإنترنت للوصول إلى خدمة أصوات Microsoft Edge؛ لن يعمل على جهاز معزول عن الشبكة
- ليس خاصًا بالطريقة التي يوفرها نموذج محلي — النص المُرسَل للتركيب يصل إلى خوادم Microsoft، لذا لا تُبقي هذه الأداة النص المُركَّب محصورًا على جهازك
- لا يستند إلى واجهة API رسمية وموثقة من Microsoft — يعتمد على نفس آلية "القراءة بصوت عالٍ" المجانية التي يستخدمها متصفح Edge، والتي قد تغيّرها أو تُقيّدها Microsoft دون إشعار؛ لا يوثّق ملف README نفسه حدًا رسميًا لمعدل الطلبات أو ضمان شروط خدمة لهذا الاعتماد
- ليس أداة استنساخ صوت — يوفّر فقط أصوات Microsoft Edge الجاهزة، دون دعم لتدريب أو استنساخ صوت مخصص من تسجيلاتك الصوتية
- ليس مرخّصًا تجاريًا افتراضيًا — يطلب README من عمليات النشر المؤسسية/التجارية التواصل مباشرة مع المؤلف بدلاً من افتراض أن شروط GPL-3.0 وحدها تغطي هذا الاستخدام
الأخطاء الشائعة عند تقييم openai-edge-tts
معظم الالتباس حول openai-edge-tts ينشأ من افتراض أنه يتصرف كنموذج محلي لأنه مستضاف ذاتيًا، أو من إغفال الحالة التجريبية لأوضاع نقاط النهاية غير التابعة لـ OpenAI.
المنافسون والبدائل
يُقارَن openai-edge-tts غالبًا بمحركات تحويل نص إلى كلام محلية حقًا وتعمل دون اتصال والتي توفّر أيضًا نقطة نهاية متوافقة مع OpenAI — أبرز ما يميزه هو التنازل عن الخصوصية الكاملة دون اتصال مقابل مجموعة أصوات Microsoft Edge الأوسع والأكثر صقلًا بتكلفة حوسبة محلية صفرية.
الأداة | أشهر ما تشتهر به | الرابط |
|---|---|---|
| Piper TTS | محرك TTS عصبي سريع ومحلي بالكامل يعمل على المعالج فقط من مشروع Rhasspy | مراجعة Piper TTS |
| Coqui TTS | مجموعة أدوات TTS محلية مفتوحة المصدر تدعم استنساخ الصوت ولغات عديدة | مراجعة Coqui TTS |
| XTTS-v2 | نموذج TTS محلي لاستنساخ الصوت بدون أمثلة تدريبية من Coqui | مراجعة XTTS-v2 |
| Bark | نموذج TTS محلي قائم على المحولات مع توليد صوت تعبيري/غير كلامي | مراجعة Bark |
تعكس هذه القائمة الأدوات التي تُقارَن عادةً بـ openai-edge-tts في مجال TTS المحلي/المستضاف ذاتيًا، وليست تصنيفًا مستقلًا من PromptQuorum — تحقق من مجموعة ميزات كل أداة ومتطلبات الأجهزة الحالية قبل الاختيار.
الأسئلة الشائعة
ما هو openai-edge-tts؟
openai-edge-tts (github.com/travisvn/openai-edge-tts) هو خادم API مجاني ومفتوح المصدر (GPL-3.0) ومُستضاف ذاتيًا يوفّر نقطة نهاية /v1/audio/speech مطابقة لواجهة تحويل النص إلى كلام في OpenAI، معتمدًا على أصوات Microsoft Edge المجانية عبر الإنترنت بدلاً من نموذج كلام محلي.
هل openai-edge-tts محلي أم يستخدم السحابة؟
إنه هجين، وليس محليًا بالكامل. الخادم نفسه مستضاف ذاتيًا، لكن كل طلب تحويل نص إلى كلام يُمرَّر عبر الإنترنت إلى خدمة أصوات "القراءة بصوت عالٍ" المجانية في Microsoft Edge عبر مكتبة edge-tts.
هل openai-edge-tts مجاني؟
نعم، للاستخدام الشخصي. إنه مجاني ومفتوح المصدر بموجب GPL-3.0. ينص README على أن عمليات النشر المؤسسية/التجارية يجب التواصل بشأنها مباشرة مع المؤلف، travisvn.
هل يحمي openai-edge-tts خصوصيتي؟
ليس بالطريقة التي يفعلها نموذج محلي. بما أن التركيب يُمرَّر إلى خدمة أصوات Microsoft Edge، فإن النص الذي ترسله لا يبقى محصورًا على جهازك — لا تستخدمه لنص لا تريد أن تعالجه خدمة سحابية تابعة لجهة خارجية.
كيف أثبّت openai-edge-tts؟
البداية السريعة الموثقة هي Docker: docker run -d -p 5050:5050 -e API_KEY=your_api_key_here -e PORT=5050 travisvn/openai-edge-tts:latest. كما يوثّق ملف README الخاص بمستودع GitHub إعداد docker-compose وتثبيتًا مباشرًا عبر Python/pip.
ما الأصوات التي يدعمها openai-edge-tts؟
يربط افتراضيًا أسماء أصوات OpenAI الستة القياسية (alloy وecho وfable وonyx وnova وshimmer) بأصوات Microsoft Edge المكافئة، كما يتيح لك اختيار أي صوت من edge-tts مباشرة، مغطيًا لغات عديدة.
هل يمكن لـ openai-edge-tts أن يحل محل ElevenLabs أو Azure AI Speech، وليس فقط OpenAI؟
أضاف المشروع نقاط نهاية توافق تجريبية مباشرة لـ ElevenLabs وAzure AI Speech في الإصدار v2.0.0 (ديسمبر 2024)، إلى جانب نقطة نهايته الأساسية بصيغة OpenAI. تحقق من السلوك الحالي مقابل عميلك المحدد قبل الاعتماد على هذا في الإنتاج.
من أنشأ openai-edge-tts؟
مطوّر منفرد يُعرف باسم travisvn أنشأ openai-edge-tts ويصونه. تم إنشاء مستودع GitHub في 9 أكتوبر 2024.
هل يدعم openai-edge-tts استنساخ الصوت؟
لا. يوفّر فقط أصوات Microsoft Edge الجاهزة الموجودة؛ لا توجد ميزة لتدريب أو استنساخ صوت مخصص من عينات صوتية خاصة بك.
هل اختبرت PromptQuorum ادعاءات openai-edge-tts بشكل مستقل؟
تستند هذه المراجعة إلى مستودع المشروع على GitHub وملف README وملاحظات الإصدارات، وليس إلى اختبار فعلي لزمن الاستجابة أو جودة الصوت أجرته PromptQuorum.