Key Takeaways
- يحتوي LM Studio على إعدادات متقدمة في علامة تبويب الإعدادات ← الخادم (خيارات GPU وطول السياق).
- يمكن ضبط ذاكرة GPU يدويًا من 10% إلى 100% من VRAM -- تُحرر القيم الأصغر GPU للتطبيقات الأخرى.
- يمكن تمديد نافذة السياق (عدد الـ token التي يراها النموذج) حتى حد النموذج، لكنها تستهلك مزيدًا من VRAM.
- تعرض واجهة API المحلية (التجريبية) نقاط نهاية متوافقة مع OpenAI على localhost:1234 للتكامل.
- اعتبارًا من أبريل 2026، الضبط الدقيق باستخدام LoRA غير مدمج في LM Studio؛ استخدم Text-Generation-WebUI أو سكربتات التدريب.
كيف تُعِد ذاكرة GPU في LM Studio؟
يتيح لك LM Studio التحكم في مقدار VRAM الخاص بـ GPU الذي يستخدمه النموذج:
- 1. انقر على الإعدادات (أيقونة الترس في أسفل اليسار).
- 2. ابحث عن شريط تمرير تسريع GPU (الافتراضي: 100%).
- 3. اسحب إلى 50% إذا أردت أن تستخدم GPU نسبة 50% من VRAM، مُحررًا الباقي للتطبيقات الأخرى.
- 4. تخصيص أقل لـ GPU = سرعة استدلال أقل، لكن هامش أكبر للتطبيقات المتزامنة.
- 5. انقر على إعادة التحميل لتطبيق التغييرات.
كيف تُمدِّد نافذة السياق؟
نافذة السياق هي الحد الأقصى لعدد الـ token (النص) التي يمكن للنموذج قراءتها. يتيح تمديدها محادثات أطول، لكنه يستهلك مزيدًا من VRAM.
- 1. افتح الإعدادات ← الخادم.
- 2. ابحث عن طول السياق (الافتراضي: الحد المدمج للنموذج).
- 3. زِد إلى 4k أو 8k أو 16k أو 32k (وفقًا لدعم النموذج).
- 4. كل مضاعفة لطول السياق تُضاعف تقريبًا استخدام VRAM.
- 5. اختبر سياقك الممدَّد ببدء محادثة وتقديم مطالبات طويلة.
كيف تُفعِّل واجهة API المحلية لـ LM Studio (تجريبية)؟
تحاكي واجهة API المحلية لـ LM Studio (تجريبية اعتبارًا من أبريل 2026) واجهة OpenAI:
# 1. Open LM Studio Settings → Server
# 2. Turn on "Enable local API server"
# 3. API runs at http://localhost:1234/v1
# 4. Use it like Ollama:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:1234/v1",
api_key="not-needed"
)
response = client.chat.completions.create(
model="llama-3.2-3b-gguf",
messages=[{"role": "user", "content": "Hello"}]
)
print(response.choices[0].message.content)شاهد: تشغيل Claude Code مع LM Studio على أجهزة محلية
في هذا الدليل المجتمعي، يوضح أحد المطورين كيفية تشغيل Claude Code مع Qwen 3.5 على RTX 5090، مستخدمًا LM Studio Link لربط جهاز Linux مزوَّد بـ GPU بجهاز MacBook، دون الحاجة إلى مفاتيح API سحابية. يغطي الفيديو الإعداد الكامل ويبني لوحة تحكم في Next.js باستخدام الاستدلال المحلي للذكاء الاصطناعي فقط.
هل يمكنك إجراء الضبط الدقيق للنماذج باستخدام LM Studio؟
اعتبارًا من أبريل 2026، لا يحتوي LM Studio على ضبط دقيق مدمج باستخدام LoRA. للضبط الدقيق، استخدم:
- Text-Generation-WebUI (الخيار الأبسط لـ LoRA)
- LLaMA-Factory (متقدم، بمستوى الإنتاج)
- unsloth (الأسرع، الأمثل لاستخدام VRAM)
يُعد LM Studio مناسبًا لتطبيق محوِّلات LoRA المُدرَّبة مسبقًا، لكن ليس لتدريب محوِّلات جديدة. قد تضيف الإصدارات المستقبلية تدريب LoRA مباشرةً.
كيف تُشغِّل الاستدلال على دفعات في LM Studio؟
يعني الاستدلال على دفعات معالجة عدة مطالبات دون انتظار الردود فيما بينها. لا يحتوي LM Studio على وضع دفعات مدمج، لكن يمكنك محاكاته عبر واجهة API أو حلقة في Python:
# Python: batch inference via LM Studio API
from openai import OpenAI
import json
client = OpenAI(base_url="http://localhost:1234/v1", api_key="x")
prompts = [
"What is 2+2?",
"Explain quantum computing",
"How do transformers work?"
]
results = []
for prompt in prompts:
response = client.chat.completions.create(
model="llama-3.2-3b-gguf",
messages=[{"role": "user", "content": prompt}]
)
results.append({
"prompt": prompt,
"response": response.choices[0].message.content
})
with open("batch_results.json", "w") as f:
json.dump(results, f, indent=2)كيف تقيس أداء النموذج في LM Studio؟
يتضمن LM Studio أداة قياس أداء مدمجة:
- 1. حمِّل نموذجًا في LM Studio.
- 2. انقر على الإعدادات ← علامة تبويب Benchmark.
- 3. انقر على تشغيل قياس الأداء -- يقيس عدد الـ token/الثانية لأجهزتك تحديدًا.
- 4. تُظهر النتائج الأداء الأساسي دون عبء المحادثة.
- يساعدك هذا على فهم السرعة المتوقعة قبل النشر في الإنتاج.
الأخطاء الشائعة مع الميزات المتقدمة في LM Studio
- خفض تخصيص GPU كثيرًا ولوم النموذج على البطء. إذا ضبطت GPU على 10%، فسيكون الاستدلال أبطأ بمقدار 5-10× لأنه يعمل بشكل رئيسي على CPU. جرِّب أولًا تخصيص GPU بنسبة 80% أو أكثر.
- تمديد نافذة السياق إلى ما يتجاوز دعم النموذج. للنماذج حدود قصوى مدعومة لطول السياق. تجاوز ذلك الحد لا يضيف سعة؛ بل يهدر VRAM فحسب.
- توقُّع تدريب LoRA في LM Studio. اعتبارًا من أبريل 2026، غير متاح. استخدم Text-Generation-WebUI أو مكتبات التدريب.
- نسيان أن واجهة API تحتاج إلى تفعيل صريح. واجهة API المحلية معطلة افتراضيًا. فعِّلها في الإعدادات ← الخادم.
الأسئلة الشائعة حول الميزات المتقدمة في LM Studio
ما الفرق بين واجهة API الخاصة بـ LM Studio وواجهة API الخاصة بـ Ollama؟
كلتاهما تعرض نقاط نهاية متوافقة مع OpenAI. تستخدم واجهة API الخاصة بـ LM Studio العنوان localhost:1234، وتستخدم واجهة Ollama العنوان localhost:11434. كلتاهما تعملان بشكل متطابق. اختر الأداة التي تفضلها للمحادثة.
هل يمكنني استخدام واجهة API الخاصة بـ LM Studio في الإنتاج؟
تعمل، لكن واجهة API الخاصة بـ Ollama أكثر نضجًا. واجهة API الخاصة بـ LM Studio في مرحلة تجريبية. للإنتاج، يُعد Ollama الخيار الأكثر أمانًا.
هل يقلل خفض تخصيص GPU من متطلبات VRAM؟
نعم. خفض تخصيص GPU إلى 50% تقريبًا يقلل استخدام VRAM إلى النصف، لكن الاستدلال يصبح أبطأ بمقدار 2-5× لأن النموذج يعمل جزئيًا على CPU.
المصادر
- توثيق LM Studio -- lmstudio.ai/docs
- LM Studio Local Server (Beta) -- lmstudio.ai/docs/local-server/overview
- توافق واجهة API الخاصة بـ OpenAI -- platform.openai.com/docs/api-reference
- تُمكِّن معاملات النموذج المتقدمة من تقنيات المطالبة المتقدمة. لإطلاقها: المطالبة بسلسلة التفكير يوضح كيفية هيكلة الاستدلال متعدد الخطوات في النماذج المحلية.