دليل إعداد الذكاء الاصطناعي المحلي: Ollama، وOpen WebUI، وAnythingLLM
صار تشغيل الذكاء الاصطناعي على عتادكم عملياً حقاً. فبياناتكم تبقى محلية، والاستدلال لا يكلّف شيئاً لكل رمز بعد الإعداد، والنموذج يعمل بلا اتصال متى نُزّل. والإعداد يأخذ ساعة، وربما ساعتين إن واجهتم مسائل في شبكة Docker. والأدوات التي تجعله يعمل، أي Ollama للاستدلال وOpen WebUI أو AnythingLLM للواجهة، كلها مصانة بنشاط وتعمل جيداً على عتاد المستهلكين.
يغطي هذا الدليل متطلبات العتاد بحسب الفئة، وعملية التثبيت كاملة، واختيار النموذج بحسب نوع المهمة، وأين يكفّ الإعداد الشخصي عن أن يكون كافياً.
لماذا يستحق تشغيل الذكاء الاصطناعي محلياً وقت الإعداد#
بياناتكم لا تفارق جهازكم قط#
الاستدلال المحلي يعني أن الموجّهات التي ترسلونها والاستجابات التي تتلقونها تبقى على عتادكم. بلا شروط خدمة، وبلا إعدادات انسحاب، وبلا تدريب على بياناتكم، لأن بياناتكم لا تفارق الجهاز قط. ولكل من يتعامل مع معلومات عملاء، أو بحوث خاصة، أو مستندات داخلية، هذا هو السبب الأول للاهتمام بالأمر.
تذكر 44% من المؤسسات خصوصية البيانات وأمنها بوصفهما الحاجز الأول أمام تبني نماذج اللغة (Kong Enterprise AI Report / Hostinger LLM Statistics، 2025). والاستدلال المحلي هو المعالجة المباشرة لتلك المشكلة بعينها.
بلا كلفة واجهات برمجة: شغّلوا الاستدلال بالحجم دون فوترة لكل رمز#
كلفة واجهات البرمجة تتراكم. فمعالجة دفعات مستندات كبيرة، أو تشغيل الاستدلال في مسار عمل تطويري، أو استخدام نموذج لمهام تحليل متكررة، قد يصير مكلفاً في الفوترة لكل رمز. وبإعداد محلي، تكون الكلفة الحدية لكل استعلام بعد الاستثمار العتادي الأول صفراً.
يعمل بلا اتصال تماماً متى نُزّلت النماذج#
متى سحبتم نموذجاً بـ Ollama، عمل دون وصول إلى الإنترنت. وهذا يهم في البيئات المعزولة عن الشبكة، وفي السفر، وفي كل موضع يكون الاتصال الشبكي فيه غير موثوق. ولا استدعاءات واجهات برمجة مطلوبة أثناء الاستدلال.
انخفضت عتبة العتاد: ما تحتاجونه فعلاً في 2026#
صيغ التكميم الكفؤة، ومعمارية الذاكرة الموحّدة في Apple Silicon، والنماذج الصغيرة المتزايدة المقدرة، جعلت الاستدلال المحلي المفيد بالذكاء الاصطناعي ممكناً على عتاد يملكه معظم المطورين وقادة تقنية المعلومات أصلاً. فحاسوب MacBook Pro من 2022، أو حاسوب مكتبي بـ 32GB RAM، أو جهاز بمعالج رسومي متوسط الفئة، كلها كافية لاستدلال نموذج 7B بجودة إنتاجية.
متطلبات العتاد#
الحد الأدنى العملي (المعالج المركزي وحده): معالج بثمانية أنوية، و16GB RAM، و50GB SSD#
الاستدلال بالمعالج المركزي وحده أبطأ لكنه يعمل. فمعالج حديث بثمانية أنوية مع 16GB من RAM يستطيع تشغيل نموذج 7B بتكميم Q4، بواقع 5 إلى 15 رمزاً في الثانية عادة. وذلك مقروء في الزمن الحقيقي. ولتحليل المستندات، والمهام ذات الطلقة الواحدة، ومسارات العمل التي تتحمل ثوانٍ قليلة لكل استجابة، هذا كاف.
وتقدير 50GB SSD يغطي تثبيت Ollama، ونموذجين من فئة 7B بتكميم Q4 (نحو 4 إلى 5GB لكل منهما)، وOpen WebUI أو AnythingLLM.
الإعداد الموصى به (بتسريع المعالج الرسومي): 8GB VRAM أو أكثر، و32GB RAM#
معالج رسومي مخصص بـ 8GB VRAM أو أكثر يقدّم 40 إلى 50 رمزاً في الثانية على نماذج 7B. وذلك تحسّن في الإنتاجية بمقدار 3 إلى 8 أضعاف على المعالج المركزي وحده في النموذج ذاته (Arsturn Hardware Guide / LocalLLM.in، 2026). فتبدو الاستجابات فورية لا موقوتة.
ومع 32GB من RAM النظام ومعالج رسومي بـ 8GB VRAM، تستطيعون تشغيل نموذج 7B بتفريغ كامل إلى المعالج الرسومي مع بقاء سعة لنظام التشغيل، والمتصفح، والتطبيقات الأخرى.
Apple Silicon: لماذا حواسيب Mac من فئة M كفؤة على نحو غير معتاد في الاستدلال المحلي#
حواسيب Mac بمعالجات Apple Silicon تستخدم الذاكرة الموحّدة: فمجمع RAM ذاته متاح للمعالج المركزي والمعالج الرسومي معاً، بلا غرامة نقل بيانات بينهما. وحاسوب M3 MacBook Pro بـ 24GB من الذاكرة الموحّدة يستطيع تجاوز كثير من إعدادات المعالجات الرسومية المخصصة التي لها VRAM أقل.
ونموذج 7B بتكميم Q4 يقتضي نحو 4 إلى 5GB من RAM (Ollama VRAM Guide / LocalLLM.in، 2026). ومعالج M3 Max بـ 64GB يستطيع تشغيل نماذج 13B أو حتى 30B دون أن تنفد الذاكرة، والأداء أحسن مما قد تتوقعونه من حاسوب محمول. وللمطورين الذين يريدون ذكاءً اصطناعياً محلياً يسافر معهم، Apple Silicon هو الخيار الأعمل لكل دولار في الوقت الحاضر.
فئات معالجات NVIDIA الرسومية وما يفتحه كل منها#
| المعالج الرسومي | VRAM | ما يشغّله جيداً |
|---|---|---|
| RTX 3060 / 4060 | 8-12GB | نماذج 7B، بتفريغ كامل إلى المعالج الرسومي |
| RTX 3080 / 4070 | 10-12GB | نماذج 7B إلى 13B بحسب التكميم |
| RTX 3090 / 4090 | 24GB | نماذج 13B إلى 34B، واستدلال سريع |
| A100 / H100 (مراكز البيانات) | 40-80GB | نماذج 70B وأكبر بالدقة الكاملة |
وفي توصيات معالجات المستهلكين الرسومية لعام 2026، يقدّم RTX 4060 Ti (16GB) أحسن نسبة سعر إلى VRAM في الفئة المتوسطة.
قاعدة تقريبية عملية: 4 إلى 5GB من RAM لكل نموذج 7B بتكميم Q4#
- نموذج 7B بتكميم Q4: نحو 4-5GB
- نموذج 13B بتكميم Q4: نحو 8-9GB
- نموذج 34B بتكميم Q4: نحو 20GB
- نموذج 70B بتكميم Q4: نحو 40GB
تخبركم هذه الأرقام هل يتسع النموذج في VRAM المعالج الرسومي عندكم لتفريغ كامل إليه (سريع) أم يتعين عليه استخدام استدلال جزئي بالمعالج الرسومي والمركزي معاً (أبطأ). وإن لم يتسع النموذج كاملاً في VRAM، نزل Ollama إلى استدلال المعالج المركزي للفائض نزولاً سلساً.
الخطوة 1: ثبّتوا Ollama#
تجاوز Ollama 162,000 نجمة على GitHub حتى أوائل 2026، صعوداً من 28,900 في الربع الأول من 2024 (GitHub / Runa Capital ROSS Index، 2024-2026). وهو محرك الاستدلال المعتاد لنشر النماذج محلياً، والأساس الذي يُبنى عليه Open WebUI وAnythingLLM معاً.
التثبيت: macOS، وLinux، وWindows (WSL2)#
macOS:
curl -fsSL https://ollama.com/install.sh | shأو نزّلوا تطبيق macOS من ollama.com للتثبيت بواجهة رسومية. والتطبيق يثبّت سطر الأوامر تلقائياً.
Linux:
curl -fsSL https://ollama.com/install.sh | shWindows: نزّلوا المثبّت من ollama.com. وWSL2 موصى به إن أردتم تشغيل Open WebUI أو AnythingLLM عبر Docker إلى جانب Ollama. والتثبيت الأصيل على Windows جيد لاستخدام Ollama وحده.
اسحبوا نموذجكم الأول#
ollama pull llama3.2 # Meta's Llama 3.2 (3B) -- fast, general purpose
ollama pull phi4-mini # Microsoft Phi-4 Mini (3.8B) -- strong at reasoning
ollama pull gemma3 # Google Gemma 3 (4B) -- efficient multilingual supportوللتثبيت الأول، llama3.2 أو phi4-mini خياران متينان. وبعد السحب، اختبروا:
ollama run llama3.2ينبغي أن تروا موجّهاً. اكتبوا رسالة، واضغطوا Enter. فإن حصلتم على استجابة، فطبقة الاستدلال تعمل.
فهم مستويات التكميم: Q4_K_M هو نقطة البداية المعتادة#
التكميم يقلّص دقة النموذج ليصغّر حجم الملف وأثر الذاكرة. والمقايضة انخفاض صغير في جودة الناتج.
Q8 قريب من الدقة الكاملة، وأعلى جودة، وأكبر حجماً. استخدموه إن كان لديكم VRAM فائض. وQ4_K_M هو التوازن المعتاد: تكميم بأربع بتات بتحسين K-means، وحجم صغير، وجودة جيدة، وهو الافتراضي لمعظم حالات الاستخدام. أما Q2 وQ3 فينتجان تدهوراً ملحوظاً في الجودة ولا يستحقان النظر إلا على عتاد شديد التقييد.
وعند استخدام ollama pull، يكون التنزيل الافتراضي Q4_K_M عادة. ابدأوا بالافتراضي. ولا تجرّبوا Q8 إلا إن لاحظتم مسائل في الجودة وكان لديكم فائض VRAM.
اختيار واجهتكم: Open WebUI في مقابل AnythingLLM#
Open WebUI: الأحسن للمطورين، والمستخدمين المتمكنين، والتبديل بين نماذج متعددة#
Open WebUI واجهة محادثة كاملة الخصائص لـ Ollama ولمزوّدي النماذج المتوافقين مع واجهات البرمجة. وهي تعمل كتطبيق محادثة مصقول: التبديل بين النماذج، وتاريخ المحادثات، ورفع المستندات للسؤال والجواب داخل السياق، ودعم تعدد المستخدمين. وأكثر من 126,000 نجمة على GitHub حتى أوائل 2026 (GitHub / OpenAlternative، 2026)، وهو ما يجعلها أوسع واجهة ذكاء اصطناعي محلي تبنّياً.
استخدموا Open WebUI إن كنتم:
- تريدون التبديل بين نماذج محلية متعددة مثبتة في الواجهة ذاتها
- تحتاجون إلى واجهة محادثة تعمل مثل Claude.ai أو ChatGPT لكن على نماذجكم المحلية
- المستخدم الأول وتريدون تحكماً مباشراً في الإعدادات ومعاملات النموذج
- تريدون مشاركة الوصول مع عدد صغير من مستخدمين آخرين (مصادقة تعدد المستخدمين مبنية فيها)
AnythingLLM: الأحسن للفرق، وللسؤال والجواب على المستندات، ولتنظيم مساحات العمل#
AnythingLLM منظم حول مساحات العمل، لكل منها متن مستنداتها، وتهيئة نموذج اللغة الخاصة بها، وتاريخ محادثاتها. وهذا نافع حين تديرون عدة مجالات معرفية ولا تريدون تسرّبها بعضها في بعض. تصوّروا: مساحة عمل لمستندات العملاء، وأخرى لقاعدة شيفرتكم.
و55,794 نجمة على GitHub حتى أوائل 2026 (GitHub / OpenAlternative، 2026). وهي أقل من Open WebUI، لكن لـ AnythingLLM تقدم أوضح في عمليات النشر الموجهة للفرق وللمستندات.
استخدموا AnythingLLM إن كنتم:
- تحتاجون إلى رفع ملفات PDF وطرح أسئلة على محتواها
- تعدّون لفريق صغير يحتاج إلى مجموعات مستندات منفصلة لكل مستخدم أو مشروع
- تريدون عزلاً على مستوى مساحة العمل بين مجالات معرفية مختلفة
- تفضّلون تطبيق سطح مكتب على واجهة شبكية
متى تستخدمون كليهما: أعمال مختلفة، وأدوات مختلفة#
بصراحة، معظم الناس لا يحتاجون إلى كليهما. لكن تشغيل Open WebUI للمحادثة العامة وAnythingLLM لمتن مستندات بعينه انقسام معقول. وهما يتصلان بخلفية Ollama ذاتها، فلا تكرار في جانب الاستدلال.
أيهما تثبّتون أولاً#
إن كانت حاجتكم الأولى محادثة ذكاء اصطناعي محلي عامة الغرض: ابدأوا بـ Open WebUI.
وإن كانت حاجتكم الأولى السؤال والجواب على ملفات بعينها: ابدأوا بتطبيق سطح المكتب من AnythingLLM.
وإن لم تكونوا متأكدين، فلـ Open WebUI مسار الإعداد الأقصر وهي تغطي أرضاً أوسع.
الخطوة 2أ: ثبّتوا Open WebUI#
التثبيت بـ Docker (موصى به لمعظم المستخدمين)#
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:mainيشغّل هذا Open WebUI على المنفذ 3000. وتصلون إليها على http://localhost:3000.
وإن كنتم على Mac وكان Docker يعمل داخل جهاز افتراضي (Docker Desktop)، فاستبدلوا host.docker.internal:host-gateway بعنوان مضيفكم الفعلي. فقد لا يوجّه host-gateway الافتراضي إلى نسخة Ollama عندكم توجيهاً صحيحاً.
وصل Open WebUI بنسخة Ollama المحلية عندكم#
عند الإطلاق الأول، ستطلب Open WebUI عنوان Ollama الأساسي. أدخلوا http://localhost:11434 (منفذ Ollama الافتراضي). وتجلب Open WebUI قائمة النماذج المتاحة تلقائياً.
وإن كانت Open WebUI تعمل في Docker ولم تستطع الوصول إلى Ollama على localhost، فجرّبوا http://host.docker.internal:11434 (على Docker Desktop في macOS أو Windows) أو http://172.17.0.1:11434 (على جسر Docker في Linux).
تمكين رفع المستندات والتوليد المعزّز بالاسترجاع للملفات المحلية#
تشمل Open WebUI نظام توليد معزّز بالاسترجاع مبنيّاً فيها. ارفعوا المستندات عبر أيقونة مشبك الورق في واجهة المحادثة واطرحوا أسئلة عليها. وهو جيد للسؤال والجواب السريع على مستند واحد. أما لمسارات عمل المستندات الإنتاجية التي تحتاجون فيها إلى مجموعات منظمة عبر ملفات متعددة، فنموذج مساحات العمل في AnythingLLM أكثر بنية.
إعداد الوصول متعدد المستخدمين والمصادقة الأساسية#
عند الإطلاق الأول، تطلب Open WebUI منكم إنشاء حساب مسؤول. ويستطيع المستخدمون اللاحقون التسجيل عبر العنوان ذاته. ولتقييد التسجيل بحيث لا يصل إلا المستخدمون المدعوون، اذهبوا إلى Admin Panel > Settings > General > وعطّلوا تسجيل المستخدمين الجدد.
الخطوة 2ب: ثبّتوا AnythingLLM#
تطبيق سطح المكتب في مقابل الخادم: أيهما تستخدمون#
تطبيق سطح المكتب تطبيق Electron مستقل. ثبّتوه كأي تطبيق سطح مكتب. وهو الأحسن للاستخدام الفردي: شخص واحد، وجهاز واحد، وبلا Docker، وبلا ملفات تهيئة.
وإصدار الخادم نشر قائم على Docker، وهو أحسن للفرق الصغيرة التي يحتاج فيها عدة أشخاص إلى الوصول من أجهزة مختلفة. ويقتضي خادماً أو جهازاً يعمل دائماً.
وللتثبيت الأول، تطبيق سطح المكتب هو المسار الأسرع.
وصل AnythingLLM بـ Ollama مزوّداً لنموذج اللغة#
عند الإطلاق الأول، تسأل AnythingLLM عن مزوّد نموذج اللغة. اختاروا "Ollama"، وأدخلوا http://localhost:11434 عنواناً أساسياً، وانتقوا نموذجكم من القائمة المنسدلة. وستستخدم AnythingLLM محرك Ollama لكل الاستدلال.
إنشاء مساحات العمل ورفع المستندات للسؤال والجواب#
أنشئوا مساحة عمل (انقروا "+ New Workspace")، وأعطوها اسماً، ثم ارفعوا المستندات عبر واجهة السحب والإفلات. وتقطّع AnythingLLM المستندات، وتضمّنها، وتخزّن المتجهات في قاعدة بياناتها المحلية. واطرحوا الأسئلة في واجهة المحادثة: فيسترجع الوكيل القطع ذات الصلة ويبني جواباً من مستنداتكم.
ولمجموعات المستندات الكبيرة، مفهوم مساحة العمل أنظف بكثير من رفع المستندات لكل محادثة في Open WebUI.
إعداد تخزين المتجهات: LanceDB (الافتراضي)، أو ChromaDB، أو Weaviate#
تستخدم AnythingLLM قاعدة LanceDB افتراضياً، وهي قاعدة بيانات متجهية مضمّنة لا تقتضي أي إعداد إضافي. ولمعظم المستخدمين، الافتراضي جيد.
ولمتون المستندات الأكبر أو للفرق التي تحتاج إلى تخزين متجهات مشترك، تدعم AnythingLLM قاعدتي ChromaDB وWeaviate خلفيتين بديلتين. هيّئوا ذلك في قسم Settings > Vector Database.
اختيار النموذج: ما تشغّلونه على عتادكم#
أقل من 16GB RAM: Phi-4 Mini (3.8B)، وGemma 3 4B، وLlama 3.2 3B#
تعمل هذه على عتاد مقيّد بسرعات قابلة للاستخدام. وPhi-4 Mini يلاكم فوق وزنه في مهام الاستدلال. وGemma 3 4B يتولى المهام متعددة اللغات جيداً. وLlama 3.2 3B أسرع الثلاثة وأكثرها اختباراً.
من 16 إلى 32GB RAM: Llama 3.1 8B، وMistral 7B، وDeepSeek-R1 7B#
هنا تستقر معظم إعدادات المطورين وتقنية المعلومات. وLlama 3.1 8B افتراضي آمن عام الغرض. وMistral 7B أحسن ملحوظاً في البرمجة. وDeepSeek-R1 7B هو ما تجرّبونه إن كنتم تعملون على مهام استدلال أو منطق.
32GB RAM أو أكثر، أو 16GB VRAM أو أكثر: Llama 3.3 70B (بتكميم Q4)، وQwen2.5 32B#
في هذه الفئة تستطيعون تشغيل نماذج تنافس النماذج المتقدمة على واجهات البرمجة في كثير من المقاييس. وLlama 3.3 70B بتكميم Q4 يحتاج إلى 32GB RAM أو أكثر وهو بطيء دون معالج رسومي بـ 24GB VRAM أو أكثر، لكن جودة الناتج في دوري مختلف عن نماذج 7B. وQwen2.5 32B الانتقاء الأقوى للعمل متعدد اللغات أو البرمجي.
توصيات النماذج بحسب نوع المهمة#
| المهمة | النموذج الموصى به |
|---|---|
| المحادثة العامة والسؤال والجواب | Llama 3.1 8B أو Llama 3.3 70B |
| توليد الشيفرة | Mistral 7B أو DeepSeek-R1 7B |
| تحليل المستندات / التوليد المعزّز بالاسترجاع | Llama 3.1 8B أو Phi-4 Mini |
| الاستدلال / المنطق | DeepSeek-R1 7B أو Phi-4 |
| تعدد اللغات | Gemma 3 4B أو Qwen2.5 |
كيف تقيسون: الرموز في الثانية إشارتكم العملية#
الرموز في الثانية هي الرقم الذي يهم في الاستخدام اليومي. فأقل من 5 رموز في الثانية يبدو متثاقلاً. و15 إلى 25 رمزاً في الثانية مريح. وفوق 40 رمزاً في الثانية تكفّون عن ملاحظة التوليد.
اختبروا نموذجاً بعد سحبه:
ollama run llama3.1 "Summarize the history of the Roman Empire in 200 words."راقبوا سرعة توليد الرموز المعروضة بعد التشغيل. فإن كانت أقل من عتبتكم القابلة للاستخدام، فجرّبوا نموذجاً أصغر أو تكميماً أدنى.
أين يصطدم الذكاء الاصطناعي المحلي بيدكم بحدوده#
وصول الفريق: مشاركة نموذج محلي بين مستخدمين متعددين تقتضي بنية تحتية#
نسخة Ollama محلية على جهاز واحد تعمل لشخص واحد. ومشاركتها بين فريق تعني تهيئة الوصول الشبكي، وإدارة الاتصالات المتزامنة، وإعداد المصادقة، وتولي تنازع الموارد حين يشغّل عدة مستخدمين الاستدلال في الوقت ذاته. وذلك قابل للإدارة، لكنه لم يعد إعداداً شخصياً.
و55% من استدلال الذكاء الاصطناعي في المؤسسات يُجرى الآن على البنية المحلية أو في الطرف، صعوداً من 12% في 2023 (dasroot.net / بيانات IDC، 2026). والبنية التحتية اللازمة لذلك أعقد على نحو ذي معنى من تثبيت Ollama شخصي.
الامتثال: HIPAA وGDPR يقتضيان ضوابط موثّقة تفوق تثبيتاً شخصياً#
إعداد Ollama شخصي على حاسوبكم المحمول ليس نشراً ممتثلاً لـ HIPAA. ولا يهم كم هو محلي. فالامتثال يقتضي ضوابط وصول موثّقة، وسجل تدقيق، وتهيئة تشفير للبيانات في السكون، وأدلة على إنفاذ السياسات. والتثبيت الشخصي لا يملك شيئاً من ذلك.
التوليد المعزّز بالاسترجاع عند الحجم: متون المستندات الكبيرة تحتاج إلى بنية متجهات سليمة#
للسؤال والجواب الشخصي على عشرات المستندات، تعمل قاعدة LanceDB المبنية في AnythingLLM جيداً. أما لمؤسسة بآلاف المستندات، أو حيث تهم جودة استدعاء البحث في القرارات فعلاً، فتحتاجون إلى بنية متجهات مخصصة: مسارات تقطيع سليمة، واختيار نموذج تضمين، واستراتيجيات فهرسة، وضبط استرجاع. والإعداد الافتراضي غير مبني لذلك.
الموثوقية: العتاد المحلي يفتقر إلى زمن التشغيل والتكرار الاحتياطي في نشر مُدار#
الإعداد الشخصي على محطة عمل يتوقف حين يُعاد تشغيل الجهاز، وحين ينقطع التيار، وحين يغلق أحد الحاسوب المحمول. ولمسارات العمل التي تحتاج إلى توافر مطرد، تحتاجون إلى بنية تحتية، لا إلى جهاز شخصي.
متى تنتقلون إلى نشر مُدار#
إعداد Ollama شخصي هو نقطة البداية الصحيحة: للأفراد الذين يقيّمون الذكاء الاصطناعي المحلي، وللمطورين الذين يبنون على نماذج محلية، وللفرق التي تستكشف مبكراً قبل أن تعرف ما تحتاجه.
وحين تنمو المتطلبات، من تعدد المستخدمين، والامتثال، والتكامل مع أدوات العمل، وزمن التشغيل الموثوق، يبدأ الإعداد على جهاز واحد في خلق مشكلات أكثر مما يعالج.
تبني Silverthread Labs عمليات نشر مُدارة على بنية تحتية تتحكمون فيها: خوادم معالجات رسومية، وتقديم النماذج، وإدارة الوصول، ومسارات التوليد المعزّز بالاسترجاع، والتكامل مع أدواتكم القائمة، دون أن تذهب البيانات إلى أي موضع لا تريدونه. انظروا صفحة خدمة الذكاء الاصطناعي ذاتي الاستضافة أو تواصلوا معنا مباشرة لمناقشة متطلبات فريقكم.
أسئلة متكررة#
كيف أشغّل نموذج ذكاء اصطناعي محلياً على حاسوبي؟
ثبّتوا Ollama من ollama.com، وشغّلوا ollama pull llama3.2 لتنزيل نموذج، ثم شغّلوا ollama run llama3.2 لبدء جلسة. ولواجهة شبكية، ثبّتوا Open WebUI عبر Docker وأوصلوها بنسخة Ollama عندكم على http://localhost:11434.
كم من RAM أحتاج لتشغيل نموذج 7B محلياً؟
16GB هي الحد الأدنى العملي. فبتكميم Q4، يستخدم نموذج 7B نحو 4 إلى 5GB من RAM، وذلك يترك سعة على نظام بـ 16GB لنظام التشغيل والتطبيقات الأخرى. وتحت 16GB، استخدموا نموذجاً أصغر: Phi-4 Mini (3.8B) أو Llama 3.2 (3B).
هل تشغيل الذكاء الاصطناعي محلياً بـ Ollama مجاني؟
برمجية Ollama وكل النماذج مفتوحة الأوزان المتاحة عبرها مجانية. وتدفعون مقابل العتاد، أي جهاز يلبي متطلبات RAM والمعالج الرسومي اختياراً. بلا كلفة واجهات برمجة، وبلا رسوم اشتراك، وبلا مقابل لكل استعلام.
ما الفرق بين Open WebUI وAnythingLLM؟
Open WebUI واجهة محادثة عامة الغرض: مصقولة، ومرنة في النماذج، وجيدة للمحادثة اليومية والسؤال والجواب. وAnythingLLM منظمة حول مساحات عمل المستندات، وهو ما يجعلها الأنسب للسؤال والجواب على المستندات وللفرق التي تحتاج إلى إبقاء مجالات معرفية مختلفة منفصلة. وكلتاهما تستخدم Ollama خلفية للاستدلال.
هل أستطيع استخدام الذكاء الاصطناعي المحلي دون اتصال بالإنترنت؟
نعم. متى ثُبّت Ollama ونُزّلت النماذج، عملت المنظومة بلا اتصال تماماً. ولا استدعاءات واجهات برمجة أثناء الاستدلال. والوقت الوحيد الذي يُطلب فيه الإنترنت هو عند سحب نماذج جديدة.
ما هو تكميم Q4 وهل ينبغي أن أستخدمه؟
Q4_K_M تكميم بأربع بتات بتحسين K-means. وهو يقطع حجم الملف إلى النصف تقريباً في مقابل الدقة الكاملة، بمقايضة جودة صغيرة. ولمعظم المهام في الاستخدام اليومي، فرق الجودة غير ملحوظ. ابدأوا بـ Q4_K_M. ولا تنتقلوا إلى Q8 إلا إن لاحظتم مسائل جودة بعينها وكان لديكم VRAM فائض.
