النقاط الرئيسية
- Piper: بُني خصيصًا للأجهزة المدمجة/التي تعتمد على CPU فقط، لا يحتاج إلى GPU، ويعمل في الوقت الفعلي على Raspberry Pi 4.
- Kokoro (82 مليون معامل، Apache-2.0): جودة صوت أكثر طبيعية، دون اختبار أداء موثق في الوقت الفعلي على Pi — أكثر واقعية على Pi 5 من Pi 4.
- Coqui TTS / XTTS v2: يضيف استنساخ الصوت، ويفترض وجود تسريع GPU، وليس خيارًا مناسبًا لـ Pi الذي يعتمد على CPU فقط.
- espeak-ng: الخيار الأخف وزنًا، ذو صوت آلي، وهو بديل احتياطي وليس الخيار الأول.
- يُعد Pi 5 (Cortex-A76، 2.4GHz) أسرع بشكل ملحوظ من Pi 4 (Cortex-A72، حتى 1.8GHz) كمعالج في أي من هذه الحالات.
- تثبيت Piper هو أمر واحد:
pip install piper-tts، ثم تحميل نموذج صوت.
📍 في جملة واحدة
يُعد Piper أفضل محرك TTS محلي لجهاز Raspberry Pi لأنه بُني داخل مشروع المساعد الصوتي غير المتصل Rhasspy خصيصًا للأجهزة المدمجة التي تعتمد على CPU فقط، ولا يحتاج إلى GPU، ولهذا السبب هو الصوت المحلي الافتراضي في Home Assistant؛ بينما يبدو Kokoro أكثر طبيعية لكن دون اختبار أداء موثق في الوقت الفعلي على Pi، ويفترض Coqui TTS/XTTS v2 وجود تسريع GPU.
💬 بعبارات بسيطة
إذا كنت تريد أن يتحدث جهاز Raspberry Pi بصوت عالٍ دون اتصال بالإنترنت، فإن Piper هو الأداة المصنوعة تحديدًا لهذه المهمة — ثبّته، حمّل صوتًا، وسيتحدث في الوقت الفعلي على لوحة تبدأ أسعارها من نحو 35 دولارًا. الخيارات الأكثر تطورًا (Kokoro، XTTS v2) تبدو أفضل صوتيًا، لكنها لم تُصمَّم مع وضع CPU المحدودة في Raspberry Pi في الاعتبار.
📌ملاحظة: يغطي هذا الدليل سرعة التركيب باستخدام CPU فقط ومدى الملاءمة لـ Pi، وليس استنساخ الصوت. لاستنساخ الصوت تحديدًا، راجع مراجعة PromptQuorum المخصصة لـ XTTS v2، والتي تنص صراحةً على عدم التوصية به لمعالجات من فئة Pi.
ما الذي يجعل محرك TTS مناسبًا لـ Raspberry Pi؟
يحتاج محرك TTS المناسب لـ Raspberry Pi إلى العمل دون GPU، وأن يتسع النموذج وبيئة التشغيل الخاصة به في بضع مئات من ميغابايتات RAM، وأن يُنتج الصوت بسرعة أكبر من الوقت الفعلي على معالج ARM رباعي النواة. لا يمتلك Raspberry Pi وحدة GPU منفصلة تستحق الاستخدام لاستدلال TTS — فكل محرك هنا يعمل على CPU، لذا فإن العامل الحاسم هو مدى كفاءة بناء كل منها لهذا القيد، وليس جودة النموذج الخام بمعزل عن ذلك.
- عدم الاعتماد على GPU. لا يمتلك Raspberry Pi وحدة GPU متوافقة مع CUDA؛ أي محرك يفترض تسريع GPU لتحقيق سرعة مقبولة يُستبعد من الاستخدام في الوقت الفعلي، حتى لو كان يعمل تقنيًا على CPU كبديل.
- استهلاك RAM. يصل الحد الأقصى لذاكرة Raspberry Pi 4 إلى 8 جيجابايت من إجمالي RAM، مشتركة مع نظام التشغيل وأي خدمات أخرى قيد التشغيل (Home Assistant، أو كاشف كلمة التنبيه)؛ محرك TTS يحتاج إلى عدة جيجابايتات فقط للتحميل يترك مساحة ضئيلة لأي شيء آخر.
- تعقيد التثبيت. أمر واحد من
pip installمع حزم ARM مُجمَّعة مسبقًا يختلف تمامًا عن مجموعة أدوات تتوقع سلسلة اعتماديات موجهة نحو GPU (CUDA، cuDNN) لا تنطبق على Pi. - المقايضة في جودة الصوت. كل محرك في هذه القائمة يضحي بجزء من الجودة مقابل السرعة؛ والسؤال هو أي مقايضة تناسب حالة استخدامك — فإعلانات السماعات الذكية لها متطلبات جودة مختلفة عن مشروع استنساخ الصوت.
Piper مقابل Kokoro مقابل Coqui TTS/XTTS v2 مقابل espeak-ng من حيث الملاءمة لـ Raspberry Pi
يحصل Piper على أفضل تقييم في كل معيار خاص بـ Pi باستثناء جودة الصوت الخام، حيث يتصدر فيها Kokoro وXTTS v2. يُقيِّم الجدول أدناه كل محرك وفق المعايير الأربعة المهمة فعليًا لاستخدام Raspberry Pi، وليس وفق اختبارات أداء TTS العامة التي تُجرى على أجهزة سطح المكتب أو الخوادم.
المحرك | استهلاك RAM | إمكانية العمل بـ CPU فقط | تعقيد التثبيت | جودة الصوت |
|---|---|---|---|---|
| Piper | منخفض (ملفات النموذج عادةً أقل بكثير من 100 ميغابايت لكل صوت) | مصمم لهذا الغرض؛ تقارير واسعة عن عمله في الوقت الفعلي على Pi 4 | أمر واحد: pip install piper-tts | جيدة، أصوات عصبية طبيعية بما يكفي؛ لا استنساخ |
| Kokoro | متوسط (نموذج بـ82 مليون معامل، ~327 ميغابايت من الأوزان) | يعمل على CPU؛ دون اختبار أداء موثق في الوقت الفعلي على Pi | حزمة Python + تحميل نموذج؛ اعتماديات أكثر من Piper | أعلى — قريبة من قمة تصنيفات جودة TTS المستقلة |
| Coqui TTS / XTTS v2 | مرتفع؛ أرقام زمن الاستجابة الموثقة تفترض ذاكرة VRAM لـ GPU | ضعيفة؛ تشير مراجعة PromptQuorum الخاصة لـ XTTS v2 إلى أن استخدام Pi بـ CPU فقط غير عملي | تثبيت مجموعة الأدوات بالإضافة إلى قبول الترخيص (CPML لـ XTTS v2) | الأعلى — تشمل استنساخ الصوت في 6 ثوانٍ عبر 17 لغة |
| espeak-ng | ضئيل جدًا (بضعة ميغابايتات) | بسيطة جدًا؛ تعمل على أي جهاز تقريبًا بما في ذلك المتحكمات الدقيقة | متوفرة مباشرة عبر معظم مديري حزم Linux | صوت تركيب صيغي آلي — ليس كلامًا طبيعيًا |
لماذا يُعد Piper التوصية الافتراضية لـ Raspberry Pi
يُعد Piper التوصية الافتراضية لأنه صُمِّم لهذه الفئة بالتحديد من الأجهزة، لا أنه كُيِّف معها لاحقًا. نشأ داخل Rhasspy، وهي مجموعة أدوات مفتوحة المصدر لبناء مساعدين صوتيين يعملان بالكامل دون اتصال بالإنترنت — مشروع تقوم فكرته الكاملة على تشغيل التعرف على الكلام وتركيبه على أجهزة محلية، غالبًا متواضعة الإمكانات، بما في ذلك لوحات Raspberry Pi، دون الحاجة إلى الاتصال بواجهة برمجة تطبيقات سحابية.
- مصمم للأجهزة المدمجة ومحدودة الموارد. يستخدم Piper بنية عصبية بأسلوب VITS، مُصدَّرة إلى ONNX Runtime لاستدلال سريع على CPU — خيار متعمد للأجهزة التي لا تملك GPU تلجأ إليه.
- لا يزال الخيار الافتراضي في Home Assistant. يُعد Piper محرك تحويل النص إلى كلام المحلي الافتراضي في خط أنابيب الصوت في Home Assistant، الذي تُشرف عليه Open Home Foundation، وهي المنظمة غير الربحية نفسها التي تُشرف على Home Assistant — وتعمل نسبة كبيرة من تركيبات Home Assistant على Raspberry Pi.
- لا يحتاج إلى GPU أبدًا. يوجد تسريع اختياري بواسطة GPU وCUDA لتحقيق معدل أعلى من الإنتاجية على أجهزة سطح المكتب، لكنه غير مطلوب — فقد صُمِّم Piper للعمل في الوقت الفعلي بالاعتماد على CPU وحده.
- لا يوجد استنساخ للصوت — بل كتالوج ثابت من الأصوات. يأتي Piper مع عشرات الأصوات المدرَّبة مسبقًا عبر أكثر من 20 لغة بدلًا من استنساخ صوت من عينة؛ وهذه مقايضة حقيقية مقابل XTTS v2، لكنها أيضًا ما يُبقي استهلاك Piper للموارد صغيرًا بما يكفي لـ Raspberry Pi.
Kokoro: جودة أعلى، تكلفة أكبر
Kokoro هو نموذج TTS بـ82 مليون معامل، مرخّص بموجب Apache-2.0، ومشتق من StyleTTS2، وينتج كلامًا أكثر طبيعية بشكل ملحوظ من Piper، مقابل تكلفة موارد حقيقية لم تُوثَّق خصيصًا على أجهزة Raspberry Pi. خلافًا لـ Piper، لم يُبنَ Kokoro مستهدفًا في الأساس أجهزة ARM المدمجة — بل بُني ليكون صغيرًا وسريعًا مقارنةً بنماذج TTS الأكبر على أجهزة ذات غرض عام، وهو هدف تصميم مختلف عن الأداء في الوقت الفعلي على معالج Raspberry Pi تحديدًا.
- 82 مليون معامل، ~327 ميغابايت من الأوزان. هذا صغير مقارنةً بنموذج استنساخ صوت كبير، لكنه لا يزال أثقل بشكل ملحوظ من صوت Piper الواحد، الذي يقل عادةً كثيرًا عن 100 ميغابايت.
- ترخيص Apache-2.0. متساهل وملائم للاستخدام التجاري — دون قيود غير تجارية على غرار CPML الموجودة في XTTS v2.
- دون اختبار أداء موثق في الوقت الفعلي على Raspberry Pi. لم تجد PromptQuorum اختبار أداء منشورًا وموثقًا يُظهر عمل Kokoro في الوقت الفعلي تحديدًا على أجهزة Raspberry Pi 4 أو Raspberry Pi 5. تعامل مع أي ادعاء بالعمل في الوقت الفعلي لـ Kokoro على Pi على أنه غير مؤكد حتى تختبره بنفسك.
- يُعد Raspberry Pi 5 الهدف الأكثر واقعية. يوفر معالج Cortex-A76 بتردد 2.4GHz الخاص به قدرة حوسبة أكبر بشكل ملحوظ من Cortex-A72 في Raspberry Pi 4، وهو أمر أكثر أهمية بالنسبة لنموذج أثقل مثل Kokoro منه بالنسبة إلى Piper الأخف وزنًا.
Coqui TTS وXTTS v2: متى يكون استنساخ الصوت مهمًا
يضيف Coqui TTS ونموذجه XTTS v2 إمكانية استنساخ الصوت من عينة مرجعية لا تتجاوز 6 ثوانٍ فقط، لكن كليهما يفترض وجود تسريع GPU، وهما ليسا خيارًا واقعيًا لأجهزة Raspberry Pi التي تعتمد على CPU فقط. إذا كان مشروعك يحتاج فعليًا إلى استنساخ صوت معين بدلًا من استخدام صوت مدرَّب مسبقًا، فهذا هو الخيار الوحيد في هذه القائمة الذي يوفر ذلك — لكن خطّط لتشغيله في مكان آخر وبث الصوت إلى Pi، وليس تشغيله على Pi نفسه.
- يستنسخ XTTS v2 صوتًا من 6 ثوانٍ من الصوت عبر 17 لغة، وفقًا لـبطاقة النموذج الرسمية على Hugging Face — راجع مراجعة PromptQuorum الكاملة لـ XTTS v2 للاطلاع على أوامر التثبيت وتفاصيل الترخيص.
- يُوصى بشدة باستخدام GPU، والاستخدام بـ CPU فقط غير عملي للتطبيقات في الوقت الفعلي، وفقًا لمراجعة PromptQuorum الخاصة لـ XTTS v2 — لا يمتلك Raspberry Pi وحدة GPU منفصلة، لذا فإن استدلال XTTS v2 في الوقت الفعلي على الجهاز نفسه غير واقعي.
- ترخيص XTTS v2، وهو Coqui Public Model License (CPML)، غير تجاري — وهذا اعتبار منفصل عن مدى ملاءمة الجهاز. راجع دليل تراخيص TTS المحلي للمقارنة الكاملة.
- نمط شائع لمشاريع Pi التي تحتاج إلى أصوات مستنسخة: شغّل XTTS v2 على خادم منفصل يعمل باستمرار أو جهاز سطح مكتب مزوَّد بـ GPU، وولّد الصوت هناك، وأرسل ملف الصوت الناتج أو تدفقه إلى Raspberry Pi للتشغيل — بدلًا من تنفيذ الاستدلال على Pi نفسه.
espeak-ng: البديل الخفيف
espeak-ng هو محرك TTS يعتمد على التركيب الصيغي، ويعمل على أي جهاز تقريبًا، بما في ذلك المتحكمات الدقيقة، لكن صوته آلي وليس طبيعيًا. يسبق محركات TTS العصبية في هذه القائمة بأكثر من عقد من الزمن، وليس منافسًا حقيقيًا من حيث جودة الصوت — أُدرج لأنه يمثل الحد الأدنى: الخيار الذي يكاد لا يحتاج إلى أي موارد على الإطلاق.
- يعمل على أي جهاز تقريبًا. لا يحتاج espeak-ng إلا إلى بضعة ميغابايتات من الذاكرة ولا يتطلب بيئة تشغيل شبكة عصبية، ما يجعله قابلاً للاستخدام حتى على أجهزة أقل بكثير من مواصفات Raspberry Pi.
- صوته آلي. يُنتج أسلوب التركيب الصيغي الخاص به — توليد الكلام من قواعد صوتية بدلًا من نموذج عصبي مُدرَّب — كلامًا مفهومًا لكنه اصطناعي بوضوح، وهو خيار ضعيف لمساعد صوتي أو نظام إعلانات يُراد له أن يبدو طبيعيًا.
- لا يزال مفيدًا كمحوِّل صوتي. يستخدم Piper نفسه espeak-ng داخليًا لتحويل النص إلى فونيمات، مع أن إخراج الصوت الخاص بـ Piper نفسه يأتي من نموذجه العصبي، وليس مباشرةً من espeak-ng.
- اختره فقط عندما تكون RAM أو CPU محدودتين للغاية بحيث لا يكون حتى Piper قابلاً للتطبيق — كجهاز من فئة المتحكمات الدقيقة بدلًا من Raspberry Pi.
كيفية تثبيت Piper على Raspberry Pi
تثبيت Piper على Raspberry Pi هو أمر واحد من pip install يليه تحميل نموذج صوت واحد — دون برامج تشغيل GPU، ودون CUDA، ودون خطوة تجميع. هذه هي الأوامر نفسها الموثقة في مراجعة PromptQuorum المخصصة لـ Piper TTS، مطبَّقة هنا تحديدًا على Raspberry Pi يعمل بنظام Raspberry Pi OS (أو توزيعة Linux أخرى لـ ARM مبنية على Debian).
- 1تحديث النظام وتثبيت Python 3
Why it matters: يأتي Raspberry Pi OS مع تثبيت مسبق لـ Python 3 في الصور الحديثة، لكن شغّل `sudo apt update && sudo apt upgrade` أولًا للتأكد من أن pip وحزم النظام محدَّثة قبل تثبيت أي شيء جديد. - 2تثبيت Piper باستخدام pip
Why it matters: شغّل `pip install piper-tts` (أو `pip3 install piper-tts` حسب الصورة لديك). يُثبِّت هذا حزمة `piper` إلى جانب اعتمادية ONNX Runtime الخاصة بها — تعني حزم ARM المُجمَّعة مسبقًا عدم وجود خطوة تجميع على Raspberry Pi. - 3تحميل نموذج صوت
Why it matters: شغّل `piper --download-dir voices --update-voices --voice en_US-lessac-medium` (استبدله بأي صوت من كتالوج أصوات Piper على Hugging Face). صوت بجودة متوسطة هو الخيار الافتراضي الصحيح لـ Raspberry Pi — فهو أسرع من صوت بجودة عالية، مع فرق في الإخراج يكاد لا يُلاحظ عبر سماعة نموذجية. - 4توليد كلام من نص
Why it matters: مرّر نصًا إلى Piper من سطر الأوامر، على سبيل المثال `echo "Hello from the Raspberry Pi." | piper --model voices/en_US-lessac-medium.onnx --output_file output.wav`، ثم شغّل ملف WAV الناتج باستخدام `aplay output.wav`. - 5دمجه في مشروع
Why it matters: لخط أنابيب مساعد صوتي كامل (كلمة تنبيه، تعرف على الكلام، نموذج LLM، وPiper للرد)، راجع [دليل PromptQuorum خطوة بخطوة لبناء مساعد صوتي غير متصل](/ar/power-local-llm/build-local-voice-assistant-2026)؛ وبالنسبة لـ Home Assistant تحديدًا، فإن Piper هو بالفعل محرك TTS الافتراضي في إعدادات خط أنابيب الصوت.
Raspberry Pi 4 مقابل Raspberry Pi 5 لتحويل النص إلى كلام
يمتلك Raspberry Pi 5 معالجًا أسرع بشكل ملحوظ من Raspberry Pi 4، وهو أمر أكثر أهمية للمحركات الأثقل مثل Kokoro منه بالنسبة لـ Piper الخفيف أصلًا. تعمل كلتا اللوحتين على تشغيل Piper في الوقت الفعلي، لكن الفجوة في المعالج توسّع مجموعة الخيارات الواقعية بمجرد التفكير في شيء أثقل.
- Raspberry Pi 4: معالج Arm Cortex-A72 رباعي النواة يعمل حتى 1.8GHz، مع إعدادات RAM تصل إلى 8 جيجابايت. كافٍ لتركيب Piper في الوقت الفعلي؛ وليس هدفًا واقعيًا لـ Kokoro أو XTTS v2 في الوقت الفعلي.
- Raspberry Pi 5: معالج Arm Cortex-A76 رباعي النواة (BCM2712) يعمل بتردد 2.4GHz، مع إعدادات RAM تصل إلى 16 جيجابايت — زيادة موثقة بمقدار 2 إلى 3 أضعاف في أداء المعالج مقارنةً بـ Raspberry Pi 4. هذه هي اللوحة المناسبة إذا أردت تجربة Kokoro بدلًا من Piper.
- لا تغيّر أي من اللوحتين واقع تسريع GPU. تفتقر كلتاهما إلى GPU منفصلة متوافقة مع CUDA، لذا يظل Coqui TTS وXTTS v2 غير عمليين للاستدلال في الوقت الفعلي على الجهاز في كلا الجيلين.
- تتجاوز أهمية RAM محرك TTS نفسه. إذا كانت اللوحة نفسها تشغّل أيضًا Home Assistant، أو كاشف كلمة تنبيه، أو نموذج LLM محلي لخط أنابيب مساعد صوتي كامل، فإن المحركات الخفيفة (Piper، ثم espeak-ng) تترك مساحة أكبر لتلك العمليات الأخرى مقارنةً بـ Kokoro أو Coqui TTS.
الأسئلة الشائعة
ما هو أفضل محرك TTS محلي لجهاز Raspberry Pi؟
يُعد Piper أفضل محرك TTS محلي لجهاز Raspberry Pi في معظم حالات الاستخدام. بُني داخل مشروع المساعد الصوتي غير المتصل Rhasspy خصيصًا للأجهزة المدمجة التي تعتمد على CPU فقط، ولا يحتاج إلى GPU، ولهذا السبب بالتحديد لا يزال محرك TTS المحلي الافتراضي في Home Assistant. تُشير تقارير واسعة إلى أنه يعمل في الوقت الفعلي على Raspberry Pi 4.
هل يحتاج Piper إلى GPU ليعمل على Raspberry Pi؟
لا. صُمِّم Piper للعمل في الوقت الفعلي على أجهزة تعتمد على CPU فقط، بما في ذلك Raspberry Pi. يوجد تسريع اختياري بواسطة GPU وCUDA لتحقيق إنتاجية أعلى على أجهزة سطح المكتب، لكنه غير مطلوب، كما أن Raspberry Pi أصلًا لا يمتلك GPU منفصلة يمكن استخدامها لذلك.
هل يمكن لـ Kokoro العمل في الوقت الفعلي على Raspberry Pi؟
لم تجد PromptQuorum اختبار أداء موثقًا وموثوقًا في الوقت الفعلي لـ Kokoro تحديدًا على أجهزة Raspberry Pi. Kokoro نموذج بـ82 مليون معامل يعمل على CPU بشكل عام، لكنه لم يُبنَ خصيصًا لأجهزة ARM المدمجة بالطريقة التي بُني بها Piper. من الأكثر واقعية اختباره على Raspberry Pi 5 بمعالجه الأسرع Cortex-A76 مقارنةً بـ Raspberry Pi 4 — اختبر أداءه بنفسك قبل الاعتماد عليه في حالة استخدام تفاعلية مباشرة.
لماذا لا نستخدم XTTS v2 لاستنساخ الصوت على Raspberry Pi؟
يفترض XTTS v2 وجود تسريع GPU لتحقيق أدائه الموثق ذي زمن الاستجابة المنخفض، وتنص مراجعة PromptQuorum الخاصة لـ XTTS v2 على أن الاستخدام بـ CPU فقط غير عملي للتطبيقات في الوقت الفعلي. لا يمتلك Raspberry Pi وحدة GPU منفصلة، لذا فإن استدلال XTTS v2 في الوقت الفعلي على الجهاز نفسه غير واقعي. من الحلول البديلة الشائعة تشغيل XTTS v2 على خادم منفصل مزوَّد بـ GPU وبث الصوت الناتج إلى Raspberry Pi.
هل Piper مجاني للاستخدام التجاري؟
مستودع Piper الذي يُصان بنشاط، OHF-Voice/piper1-gpl، مرخَّص بموجب GPL-3.0-or-later، وهو تغيير عن ترخيص MIT الخاص بمستودع rhasspy/piper الأصلي المؤرشف الآن. تسمح GPL-3.0 بالاستخدام التجاري لـ Piper كأداة، لكنها تتطلب إتاحة أي تعديلات على شيفرة Piper المصدرية نفسها بموجب الترخيص نفسه إذا وزّعتها. راجع مراجعة PromptQuorum الكاملة لـ Piper TTS للاطلاع على تاريخ الترخيص الكامل — هذا ليس استشارة قانونية.
ما الفرق بين Raspberry Pi 4 وRaspberry Pi 5 لتحويل النص إلى كلام؟
يستخدم Raspberry Pi 5 معالج Arm Cortex-A76 رباعي النواة (BCM2712) بتردد 2.4GHz مع إعدادات RAM تصل إلى 16 جيجابايت، وهي زيادة موثقة بمقدار 2 إلى 3 أضعاف في أداء المعالج مقارنةً بمعالج Cortex-A72 رباعي النواة في Raspberry Pi 4 الذي يصل حتى 1.8GHz وبذاكرة RAM تصل إلى 8 جيجابايت. يعمل كلاهما على تشغيل Piper في الوقت الفعلي؛ والمساحة الإضافية في Pi 5 تكون أكثر أهمية إذا أردت تجربة محرك أثقل مثل Kokoro.
هل يدعم Piper لغات أخرى غير الإنجليزية؟
نعم. يأتي Piper مع أصوات مدرَّبة مسبقًا عبر أكثر من 20 لغة، رغم أنه لا يستنسخ صوت شخص معين — فهو يستخدم أصواتًا ثابتة مدرَّبة مسبقًا لكل لغة بدلًا من الاستنساخ من عينة كما يفعل XTTS v2.
ما هو espeak-ng ومتى يجب استخدامه بدلًا من Piper؟
espeak-ng هو محرك TTS يعتمد على التركيب الصيغي ويعمل على أي جهاز تقريبًا، بما في ذلك أجهزة أقل من مواصفات Raspberry Pi، لكن صوته آلي وليس طبيعيًا. استخدمه فقط عندما تكون RAM أو CPU محدودتين للغاية بحيث لا يكون حتى Piper قابلاً للتطبيق — بالنسبة لمعظم مشاريع Raspberry Pi، يُعد Piper الخيار الافتراضي الأفضل. يستخدم Piper نفسه espeak-ng داخليًا لتحويل النص إلى فونيمات.
كم من RAM يحتاجه Piper على Raspberry Pi؟
ملفات نموذج Piper لكل صوت تقل عادةً بكثير عن 100 ميغابايت، ولا يتطلب المحرك عدة جيجابايتات من RAM للتشغيل، وهو ما يُعد ميزة حقيقية على Raspberry Pi 4 بذاكرة قد لا تتجاوز 2 جيجابايت من إجمالي RAM، مشتركة مع نظام التشغيل وأي خدمات أخرى قيد التشغيل.
الخلاصة
يُعد Piper الخيار الافتراضي الصحيح لتحويل النص إلى كلام المحلي على Raspberry Pi، وهذا ليس قرارًا متقاربًا: فقد صُمِّم داخل مشروع المساعد الصوتي غير المتصل Rhasspy خصيصًا للأجهزة المدمجة التي تعتمد على CPU فقط، ولا يحتاج إلى GPU، ويُثبَّت بأمر واحد، ولهذه الأسباب بالتحديد لا يزال الصوت المحلي الافتراضي في Home Assistant. استخدم Kokoro بدلًا منه إذا كانت جودة الصوت أهم من ضمان استجابة في الوقت الفعلي، وفقط بعد اختباره بنفسك على طراز Raspberry Pi المحدد لديك — فأداؤه الموثق في الوقت الفعلي مُقاس على أجهزة عامة، وليس تحديدًا على لوحات ARM من فئة Pi. استخدم Coqui TTS أو XTTS v2 فقط إذا كنت تحتاج فعليًا إلى استنساخ الصوت، وخطّط لتشغيل الاستدلال على جهاز منفصل مزوَّد بـ GPU بدلًا من Pi نفسه. الجأ إلى espeak-ng فقط كملاذ أخير على أجهزة محدودة للغاية حتى بالنسبة لـ Piper. إذا لم تكن متأكدًا، ابدأ بـ Piper — فهو الأداة التي صُمِّمت هذه الفئة من الأجهزة للعمل بها.
المصادر
- مراجعة Piper TTS — مراجعة PromptQuorum الكاملة، بما في ذلك تاريخ الترخيص وأوامر التثبيت والتكامل مع Home Assistant.
- OHF-Voice/piper1-gpl على GitHub — مستودع Piper الذي تُشرف عليه بنشاط Open Home Foundation.
- Kokoro-82M على Hugging Face — بطاقة النموذج الرسمية: عدد المعاملات والترخيص والبنية.
- مراجعة XTTS v2 — مراجعة PromptQuorum، بما في ذلك أداء CPU فقط وملاحظات الترخيص المشار إليها هنا.
- صفحة منتج Raspberry Pi 5 — المواصفات الرسمية لمعالج BCM2712 وإعدادات RAM.
- بناء مساعد صوتي غير متصل بالكامل — دليل PromptQuorum خطوة بخطوة، بما في ذلك زمن الاستجابة المقاس على Raspberry Pi 5 لخط أنابيب Whisper + LLM + Piper الكامل.
