النقاط الرئيسية
- Willow Inference Server مجاني ومفتوح المصدر؛ ملف LICENSE الرسمي على GitHub هو رخصة Apache 2.0
- يشغّل التعرف التلقائي على الكلام (ASR) وتحويل النص إلى كلام (TTS) القائمَين على Whisper، ويمكن الوصول إليهما عبر WebRTC وREST وWebSockets
- يُنشر عبر Docker Compose على Linux (وWindows عبر WSL)؛ كما يتوفر ملف Docker Compose للتشغيل بواسطة المعالج فقط، رغم أن الأداء على المعالج موثق بأنه أبطأ بشكل ملحوظ من وحدة معالجة الرسومات
- يعمل على وحدات معالجة رسومات NVIDIA تتراوح من GTX 1060 بذاكرة 3 غيغابايت إلى RTX 4090؛ ويُنصح بحوالي 6 غيغابايت من ذاكرة VRAM لتشغيل جميع أحجام نماذج Whisper الافتراضية إلى جانب TTS
- يدعم إنشاء أصوات TTS مخصصة من تسجيل عينة قصير نسبيًا
- من تطوير Tovera كخلفية لمشروع أجهزة مساعد الصوت مفتوح المصدر Willow
- لم يعد يدعم استدلال LLM/المحادثة العام — أُزيلت هذه الميزة صراحةً في تعديل (commit) بتاريخ فبراير 2026؛ ويوجّه القائمون على المشروع أنفسهم المستخدمين لتشغيل أداة منفصلة مثل Ollama جنبًا إلى جنب لتلبية هذه الحاجة
- يُظهر مستودع GitHub (github.com/toverainc/willow-inference-server) نحو 510 نجمة اعتبارًا من سبتمبر 2026؛ ونشاط التعديلات متقطع وليس مستمرًا — اعتبر هذا مشروعًا أصغر وأبطأ وتيرة مقارنة بمشروع تجاري ذي طاقم كبير
📍 في جملة واحدة
Willow Inference Server خادم مجاني ومفتوح المصدر ومستضاف ذاتيًا يشغّل التعرف على الكلام القائم على Whisper وتحويل النص إلى كلام على وحدة معالجة الرسومات NVIDIA الخاصة بك، دون أي خطة مدفوعة.
💬 بعبارات بسيطة
بدلاً من إرسال تسجيلاتك الصوتية إلى واجهة برمجة صوتية سحابية، يشغّل Willow Inference Server نماذج تحويل الكلام إلى نص وتحويل النص إلى كلام على حاسوب تتحكم فيه أنت، عادةً مزود ببطاقة رسومات NVIDIA. صُمم في الأصل لتشغيل مشروع أجهزة مساعد Willow الصوتي، لكن يمكنه العمل بمفرده لأي تطبيق يحتاج إلى تحويل الكلام إلى نص أو النص إلى كلام دون الاعتماد على السحابة.
📌ملاحظة: هذه المراجعة هي النسخة المتعمقة المرافقة لمدخل Willow Inference Server في دليل برمجيات الذكاء الاصطناعي المحلي — راجع تلك الصفحة لمعرفة كيف يقارن بلمحة سريعة بعشرات أدوات الذكاء الاصطناعي المحلية الأخرى.
ما هو Willow Inference Server؟
Willow Inference Server خادم مستضاف ذاتيًا يشغّل نماذج التعرف على الكلام وتركيب الصوت على أجهزتك الخاصة، ويمكن الوصول إليه عبر WebRTC وREST وWebSockets. ينص الوصف الخاص به على GitHub على: "Open source, local, and self-hosted highly optimized language inference server supporting ASR/STT, TTS, and LLM across WebRTC, REST, and WS" — وهو وصف رأت هذه المراجعة أنه أصبح جزئيًا قديمًا، إذ أُزيل الدعم العام لـLLM من الكود في فبراير 2026 (انظر قسم التاريخ أدناه). حتى وقت كتابة هذه المراجعة، يوصَف WIS بدقة كخادم ASR/TTS، لا كخادم LLM عام.
- الوظيفة الأساسية: خادم استدلال صوتي يستقبل الصوت أو النص عبر WebRTC أو REST أو WebSockets ويعيد نصًا مكتوبًا أو صوتًا مركبًا
- محرك التعرف على الكلام: نماذج Whisper من OpenAI، وقد ضبطها المشروع لاستخدامات البث ذات زمن الاستجابة المنخفض
- محرك تحويل النص إلى كلام: خط أنابيب TTS مدمج (يتضمن المستودع ملف
Dockerfile.xttsومجلدxttsمخصصين) يدعم إنشاء أصوات مخصصة من تسجيلات عينة قصيرة - الهدف من النشر: وحدات معالجة رسومات NVIDIA متوافقة مع CUDA، مع مسار احتياطي موثق للتشغيل بواسطة المعالج فقط بأداء أقل
- المطوّر: Tovera، المنظمة القائمة على مشروع أجهزة مساعد الصوت مفتوح المصدر Willow
- المستودع الرسمي: github.com/toverainc/willow-inference-server — اسم المشروع والمنظمة المستخدم حاليًا وبنشاط للكود المصدري للخادم وإصداراته ومتابعة المشكلات
تاريخ مشروع Willow Inference Server
أُنشئ مستودع GitHub الخاص بـ Willow Inference Server في فبراير 2023، ويُظهر سجل تعديلاته دفعات من النشاط تتخللها فترات هدوء طويلة بدلاً من تطوير أسبوعي مستمر — وهو نمط يستحق معرفته قبل الاعتماد عليه في الإنتاج.
- 1فبراير 2023 — إنشاء المستودع
Why it matters: بدأ Willow Inference Server كخلفية مرافقة لمشروع أجهزة مساعد الصوت Willow، الذي تحافظ عليه منظمة Tovera أيضًا. - 2أبريل 2024 — تحديثات محرك TTS
Why it matters: حدّثت التعديلات في هذه الفترة خط أنابيب استنساخ الصوت XTTS المدمج، وفقًا لسجل تعديلات المستودع. - 3يونيو 2025 — مراجعة جودة الكود
Why it matters: استبدلت مجموعة من التعديلات فحص flake8 الخاص بالمشروع بتنسيق الكود black وأعادت تنسيق قاعدة كود Python — وهي مراجعة صيانة وليست إصدارًا لميزة جديدة، بعد نحو 14 شهرًا بلا تعديلات عامة. - 4فبراير 2026 — إزالة دعم LLM/المحادثة
Why it matters: ينص تعديل بعنوان "README: drop LLM/chat references" بوضوح على: "We no longer support that. People can run ollama next to WIS." هذا هو التغيير الأكثر أهمية في تاريخ المشروع الحديث — إذ يضيّق نطاق WIS من خادم مدمج ASR/TTS/LLM إلى خادم مخصص لـASR/TTS فقط، وهو أحدث تعديل على الفرع الرئيسي للمستودع حتى وقت كتابة هذه المراجعة.
ماذا يمكنك أن تفعل بـ Willow Inference Server؟
تتركز مجموعة ميزات Willow Inference Server على معالجة صوتية سريعة ومستضافة ذاتيًا، وليس على محادثة عامة قائمة على نموذج لغوي. فيما يلي ما تفعله كل ميزة فعليًا، وفقًا لـوثيقة README على GitHub الخاصة بالمشروع.
- التعرف التلقائي على الكلام (ASR) — يحوّل الصوت المنطوق إلى نص باستخدام نماذج قائمة على Whisper، ضبطها المشروع للتعرف عبر البث "بأقرب ما يمكن إلى الوقت الفعلي" وليس فقط للتفريغ الدفعي
- أحجام متعددة من نماذج Whisper في آن واحد — تنص الوثيقة README على أن أحجام نماذج Whisper الثلاثة الافتراضية (base وmedium وlarge-v2) يمكن تحميلها معًا في نطاق 6 غيغابايت من ذاكرة VRAM، مما يتيح لعملية النشر الموازنة بين الدقة والسرعة لكل طلب بدلاً من الالتزام بحجم نموذج واحد
- تحويل النص إلى كلام (TTS) مع استنساخ الصوت — يركّب كلامًا من نص، مع دعم إنشاء صوت مخصص من تسجيل عينة قصير نسبيًا، عبر خط أنابيب مدمج قائم على XTTS
- وصول متعدد البروتوكولات — يمكن الوصول إليه عبر WebRTC (لبث صوتي في الوقت الفعلي بعرض نطاق ترددي منخفض) وREST وWebSockets، مما يتيح للعميل اختيار وسيلة النقل الأنسب لحالة استخدامه
- اكتشاف تلقائي للأجهزة — الخادم موثق بأنه يكتشف تلقائيًا الأجهزة المتاحة ويضبط سلوكه وفقًا لذلك، بدلاً من طلب إعداد يدوي لكل طراز وحدة معالجة رسومات
- خلفية مساعد Willow الصوتي — WIS هو خلفية الاستدلال التي يتصل بها مشروع أجهزة مساعد الصوت مفتوح المصدر Willow لتحويل الأوامر الصوتية إلى نص، واختياريًا تحويل الردود مرة أخرى إلى كلام
أمثلة على الاستخدام: ثلاث طرق لاستخدام Willow Inference Server
هذه تدفقات عمل ملموسة مبنية على ميزات Willow Inference Server الموثقة أعلاه — وليست حالات استخدام افتراضية.
تثبيت Willow Inference Server
يُثبَّت Willow Inference Server عبر Docker Compose، وكوده المصدري متاح على GitHub. الروابط والأوامر أدناه مأخوذة من مستودع GitHub الرسمي — تحقق دائمًا مباشرة من تلك الصفحة، إذ يمكن أن تتغير تعليمات التثبيت بين التعديلات.
مستودع GitHub (الكود المصدري، Apache 2.0)
استنساخ المستودع
- الرابط:
git clone https://github.com/toverainc/willow-inference-server.git
النشر بوحدة معالجة الرسومات
- الرابط:
docker compose upباستخدام ملفdocker-compose.ymlالخاص بالمستودع
النشر بواسطة المعالج فقط
- الرابط:
docker compose -f docker-compose-cpu.yml up(موثق بأنه أبطأ بشكل ملحوظ من وحدة معالجة الرسومات)
مشروع مساعد Willow الصوتي
- الرابط:
- github.com/toverainc — مستودعات المنظمة الأم الأخرى، بما في ذلك مشروع أجهزة/برامج Willow الثابتة الذي بُني WIS أصلاً لخدمته
يحتاج Willow Inference Server إلى وحدة معالجة رسومات NVIDIA متوافقة مع CUDA لتحقيق أرقام الأداء الموثقة — تُعد GTX 1060 بذاكرة 3 غيغابايت الحد الأدنى المذكور، مع التوصية بحوالي 6 غيغابايت من ذاكرة VRAM لتشغيل ASR وTTS معًا. يوجد مسار Docker Compose للتشغيل بواسطة المعالج فقط وموثق في المستودع، لكن المشروع يذكر أن أداء المعالج يتخلف كثيرًا عن جميع وحدات معالجة الرسومات المدرجة؛ اعتبر وضع المعالج فقط حلاً احتياطيًا وظيفيًا للاختبار، وليس هدفًا للنشر في الإنتاج.
أسعار Willow Inference Server: هل هو مجاني حقًا؟
نعم — لا توجد لدى Willow Inference Server أي خطة مدفوعة. لا يحتوي مستودع GitHub على صفحة تسعير، وينطبق ملف LICENSE.md على التطبيق بأكمله. نص الترخيص هو رخصة Apache، الإصدار 2.0 — وهي رخصة متساهلة، تتضمن منحًا لبراءات الاختراع ولا تفرض التزام copyleft بنشر تعديلاتك الخاصة.
- لا اشتراك، لا خطة مدفوعة، لا حدود استخدام يفرضها Willow Inference Server نفسه
- لا حاجة إلى حساب أو تسجيل لنشر البرنامج أو استخدامه
- لا يزال تشغيل WIS يتطلب أجهزة وحدة معالجة الرسومات الخاصة بك وتكلفة الكهرباء/الاستضافة لتشغيلها — البرنامج نفسه مجاني، لكن الاستضافة الذاتية ليست بلا تكلفة كما يمكن أن تكون واجهة برمجية مستضافة
- تشغّل Tovera أيضًا خادم مثال مستضافًا لمشروع أجهزة مساعد الصوت المنفصل Willow — تغطي هذه المراجعة تحديدًا برنامج WIS المستضاف ذاتيًا والمجاني للتشغيل؛ تحقق مباشرة من Tovera لأي تفاصيل حول عرض مستضاف منفصل وما إذا كانت له تكلفة خاصة به
Willow Inference Server مقابل whisper.cpp
يشغّل كل من Willow Inference Server وwhisper.cpp نماذج التعرف الصوتي Whisper من OpenAI محليًا، وغالبًا ما تتم مقارنتهما لأن كليهما يتجنب إرسال الصوت إلى واجهة برمجية سحابية. تكمن الاختلافات الأوضح في نموذج النشر والنطاق.
الجانب | WIS | whisper.cpp |
|---|---|---|
| النطاق | خادم ASR + TTS مع WebRTC/REST/WS | ASR (تفريغ) فقط، دون خادم/TTS |
| النشر | Docker Compose، يركّز على وحدة معالجة الرسومات | ملف تنفيذي/مكتبة مُجمّعة، مناسب للمعالج |
| الأجهزة المستهدفة | وحدة معالجة رسومات NVIDIA CUDA (3–6+ غيغابايت VRAM) | يعمل على المعالج؛ تسريع GPU اختياري |
| البث في الوقت الفعلي | مصمم لذلك، عبر WebRTC | ممكن بعمل إضافي من جانب العميل |
| تكامل الأجهزة | مصمم كخلفية لـWillow | مكتبة عامة الغرض، دون ارتباط بأجهزة محددة |
| وتيرة الصيانة | متقطعة؛ آخر تعديل فبراير 2026 | يُصان بنشاط، تعديلات متكررة |
إذا كانت أولويتك خادمًا جاهزًا مزودًا بدعم مدمج لبث WebRTC وTTS، ولديك وحدة معالجة رسومات NVIDIA فارغة، فإن مجموعة ميزات Willow Inference Server هي الأوسع بين الاثنين. أما إذا كانت أولويتك أخف مكتبة تفريغ ممكنة ومناسبة للمعالج لدمجها في تطبيقك الخاص، فإن whisper.cpp يستحق التقييم المباشر — راجع مراجعة whisper.cpp لكل التفاصيل.
لمن يناسب Willow Inference Server؟
يعتمد مدى ملاءمة Willow Inference Server لك على امتلاكك وحدة معالجة رسومات NVIDIA متوافقة، وحاجتك إلى كل من ASR وTTS في خادم واحد، ومدى ارتياحك لمشروع يصدر تحديثاته على دفعات لا باستمرار.
Willow Inference Server مقابل أدوات صوتية أخرى
Willow Inference Server هو أحد عدة خيارات مستضافة ذاتيًا للتعرف على الكلام وتركيبه محليًا. إليك كيف يتموضع مقارنة بأدوات أخرى في هذا المجال — راجع دليل برمجيات الذكاء الاصطناعي المحلي للحصول على الكتالوج الكامل، والمقارنة المخصصة Willow Inference Server مقابل whisper.cpp أعلاه لأقرب مواجهة مباشرة.
- whisper.cpp — منفذ خفيف الوزن ومناسب للمعالج بلغتَي C/C++ لنموذج Whisper من OpenAI مخصص للتفريغ فقط، دون خادم مدمج أو WebRTC أو TTS؛ راجع قسم المقارنة المخصص أعلاه.
- Faster Whisper — إعادة تنفيذ لـWhisper مبنية على CTranslate2 وتركز على سرعة الاستدلال؛ مكتبة يمكن دمجها بدلاً من خادم ASR/TTS جاهز مثل WIS.
- Piper TTS — محرك محلي خفيف الوزن ومناسب للمعالج لتحويل النص إلى كلام؛ أضيق نطاقًا من خادم WIS المدمج لـASR+TTS، لكنه أخف بكثير من حيث متطلبات الأجهزة.
- Coqui TTS — مجموعة أدوات مفتوحة المصدر لتحويل النص إلى كلام مع دعم استنساخ الصوت، تضاهي في نطاق TTS خط أنابيب XTTS المدمج في WIS، لكنها تُوزَّع كمكتبة بدلاً من خادم جاهز لـWebRTC.
- Bark TTS — نموذج توليدي لتحويل النص إلى كلام قادر على إنتاج صوت غير كلامي (ضحك، توقفات)؛ خيار محرك TTS مختلف عن خط أنابيب XTTS المدمج في WIS.
- MacWhisper — تطبيق سطح مكتب أصلي لنظام macOS لتفريغ Whisper؛ بديل واجهة رسومية لسطح المكتب للمستخدمين الذين لا يحتاجون إطلاقًا إلى نموذج النشر عبر خادم/WebRTC الخاص بـWIS.
أخطاء شائعة عند تقييم Willow Inference Server
ينشأ معظم الالتباس حول Willow Inference Server من أوصاف قديمة لدعمه لنماذج LLM، أو توقعات أجهزة غير واضحة، أو المبالغة في تقدير مدى نشاط إصدار تحديثاته حاليًا.
الأسئلة الشائعة
ما هو Willow Inference Server؟
Willow Inference Server (اختصارًا WIS، github.com/toverainc/willow-inference-server) هو خادم مجاني ومفتوح المصدر ومستضاف ذاتيًا يشغّل التعرف على الكلام وتحويل النص إلى كلام القائمَين على Whisper، ويمكن الوصول إليه عبر WebRTC وREST وWebSockets. طوّرته Tovera كخلفية لمشروع أجهزة مساعد الصوت Willow.
هل Willow Inference Server مجاني؟
نعم. لا يحتوي مستودع GitHub على صفحة تسعير، وملف LICENSE.md هو رخصة Apache 2.0، وينطبق على التطبيق بأكمله دون أي خطة مدفوعة. ستظل بحاجة إلى توفير أجهزة وحدة معالجة الرسومات الخاصة بك ودفع تكلفتها لتشغيله.
هل يدعم Willow Inference Server استدلال LLM/المحادثة؟
لا، ليس حتى وقت كتابة هذه المراجعة. أزال تعديل بتاريخ فبراير 2026 دعم LLM/المحادثة العام من المشروع، حيث صرّح القائمون عليه: "We no longer support that. People can run ollama next to WIS." يعد Willow Inference Server حاليًا خادم ASR/TTS فقط.
ما وحدة معالجة الرسومات التي يحتاجها Willow Inference Server؟
وحدة معالجة رسومات NVIDIA متوافقة مع CUDA. يوثّق المشروع GTX 1060 بذاكرة 3 غيغابايت كحد أدنى عملي، مع التوصية بحوالي 6 غيغابايت من ذاكرة VRAM لتشغيل أحجام نماذج Whisper الثلاثة الافتراضية (base وmedium وlarge-v2) إضافة إلى TTS معًا. يوجد مسار Docker Compose للتشغيل بواسطة المعالج فقط، لكنه موثق بأنه أبطأ بشكل ملحوظ.
كيف أُثبِّت Willow Inference Server؟
استنسخ مستودع GitHub وشغّل docker compose up باستخدام ملف docker-compose.yml المرفق للنشر بوحدة معالجة الرسومات، أو docker compose -f docker-compose-cpu.yml up لمسار التشغيل بواسطة المعالج فقط. راجع المستودع مباشرة للحصول على التعليمات الحالية قبل التثبيت، إذ يمكن أن تتغير بين التعديلات.
هل تتم صيانة Willow Inference Server بنشاط؟
يُظهر سجل تعديلاته دفعات من النشاط تفصلها فجوات تمتد لعدة أشهر بدلاً من تطوير مستمر — على سبيل المثال، نحو 14 شهرًا دون تعديلات عامة بين أبريل 2024 ويونيو 2025. حتى وقت كتابة هذه المراجعة، كان أحدث تعديل على الفرع الرئيسي من فبراير 2026، ولا يحتوي المستودع على أي إصدارات موسومة. لم تتم أرشفته، لكنه مشروع أصغر يسير بوتيرة مجتمعية، لا مشروعًا ذا وتيرة إصدار مستمرة.
ما العلاقة بين Willow Inference Server وWillow؟
Willow مشروع منفصل مفتوح المصدر لأجهزة/برامج ثابتة لمساعد صوتي، تحافظ عليه أيضًا Tovera. Willow Inference Server هو برنامج الخلفية الذي يعالج الصوت لأجهزة Willow، لكنه يمكن أيضًا أن يعمل بشكل مستقل لحالات استخدام أخرى لتحويل الكلام إلى نص أو النص إلى كلام.
هل يمكن لـ Willow Inference Server استنساخ صوت مخصص لـTTS؟
نعم. يدعم خط أنابيب TTS المدمج القائم على XTTS، وفقًا لوثائق المشروع، إنشاء ملف تعريف صوتي مخصص من تسجيل عينة قصير نسبيًا.
ما الترخيص الذي يستخدمه Willow Inference Server؟
رخصة Apache، الإصدار 2.0، وفقًا لـملف LICENSE.md الرسمي — وهي رخصة متساهلة، تتضمن منحًا لبراءات الاختراع ولا تشترط نشر تعديلاتك الخاصة كمصدر مفتوح.
هل يدعم Willow Inference Server البث في الوقت الفعلي؟
نعم، عبر WebRTC، الذي بناه المشروع خصيصًا لحالات استخدام صوتية في الوقت الفعلي منخفضة زمن الاستجابة، مثل مساعد صوتي يستمع باستمرار إلى الأوامر. تتوفر أيضًا نقاط نهاية REST وWebSocket للتكاملات غير المبثوثة أو الأبسط.