پایگاه دانش مدل های محلی
راهنمای جامع راهاندازی مدلهای هوش مصنوعی روی سیستم شخصی؛ از Ollama و LM Studio تا vLLM، به همراه جدول نیازمندیهای سختافزاری.
چرا مدل محلی؟
دادههای شما از سیستم خارج نمیشوند. مناسب برای پزشکی، حقوقی و سازمانی.
بدون اشتراک ماهانه. یکبار سختافزار بخرید، مادامالعمر رایگان استفاده کنید.
بدون تاخیر شبکه. پاسخدهی آنی بدون وابستگی به اینترنت.
fine-tune کنید، پرامپت سفارشی بزنید و مدل را کاملاً کنترل کنید.
ابزارهای راهاندازی
🦙 Ollama
سادهترین روش برای اجرای مدلهای محلی. مشابه Docker برای LLMها. یک دستور نصب، یک دستور اجرا.
🖥️ LM Studio
رابط گرافیکی زیبا برای دانلود، اجرا و مدیریت مدلها. مناسب مبتدیها و کاربرانی که ترمینال دوست ندارند.
🚀 vLLM
برای استقرار حرفهای و production. پشتیبانی از PagedAttention، batching خودکار و multi-GPU.
شروع سریع با Ollama
نصب Ollama
از سایت رسمی دانلود و نصب کنید:
curl -fsSL https://ollama.com/install.sh | sh
یا از ollama.com/download برای macOS/Windows دانلود کنید.
دانلود و اجرای مدل
محبوبترین مدلها با یک دستور:
# Llama 3.1 8B — محبوبترین مدل عمومی ollama run llama3.1 # Qwen 2.5 7B — بهترین برای کدنویسی و فارسی ollama run qwen2.5:7b # Mistral 7B — سریع و سبک ollama run mistral # Gemma 2 9B — ساخت گوگل ollama run gemma2:9b # DeepSeek Coder V2 — تخصصی کدنویسی ollama run deepseek-coder-v2:16b
استفاده از API
Ollama یک API سازگار با OpenAI ارائه میدهد:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1",
"prompt": "سلام! خودت رو معرفی کن",
"stream": false
}'
مدیریت مدلها
# لیست مدلهای دانلود شده ollama list # حذف مدل ollama rm llama3.1 # اطلاعات مدل ollama show llama3.1
شروع سریع با LM Studio
دانلود و نصب
از lmstudio.ai دانلود کنید. نسخه macOS، Windows و Linux موجود است.
جستجو و دانلود مدل
در تب Search، نام مدل را جستجو کنید و نسخه مناسب سیستمتان را دانلود کنید.
اجرای چت
در تب Chat، مدل را انتخاب کنید و شروع به چت کنید. سرور API داخلی نیز فعال میشود.
شروع سریع با vLLM
نصب
pip install vllm
اجرای سرور
# اجرای Llama 3.1 8B با OpenAI-compatible API vllm serve meta-llama/Meta-Llama-3.1-8B-Instruct # با تعداد GPU خاص vllm serve meta-llama/Meta-Llama-3.1-8B-Instruct --tensor-parallel-size 2 # با حداکثر context طولانی vllm serve meta-llama/Meta-Llama-3.1-8B-Instruct --max-model-len 32768
استفاده از API
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "meta-llama/Meta-Llama-3.1-8B-Instruct",
"messages": [{"role": "user", "content": "سلام!"}]
}'
نیازمندیهای سختافزاری
حداقل و پیشنهادی سختافزار بر اساس اندازه مدل (بر اساس نسخه Q4_K_M کوانتیز شده):
| مدل | پارامتر | وزن (Q4) | حداقل RAM | پیشنهادی GPU | سلامت اجرا |
|---|---|---|---|---|---|
| Gemma 2 2B / Phi-3 Mini | 2B–3B | ~2 GB | 4 GB | CPU کافیست | هر سیستم |
| Llama 3.1 8B / Mistral 7B | 7B–8B | ~5 GB | 8 GB | RTX 3060 12GB | سیستم معمولی |
| Qwen 2.5 14B | 14B | ~9 GB | 16 GB | RTX 4060 Ti 16GB | گیمینگ |
| CodeLlama 34B / Yi 34B | 34B | ~20 GB | 32 GB | RTX 4090 24GB | حرفهای |
| Llama 3.1 70B / Qwen 2.5 72B | 70B–72B | ~40 GB | 64 GB | A100 80GB / 2×RTX 4090 | پیشرفته |
| Llama 3.1 405B | 405B | ~230 GB | 256 GB+ | 4×A100 / H100 | سرور |
محبوبترین مدلها برای اجرای محلی
Llama 3.1 8B
محبوبترین مدل عمومی. تعادل عالی بین سرعت و کیفیت. مناسب چت، ترجمه و خلاصهسازی.
Qwen 2.5 7B
بهترین مدل برای کدنویسی و درک فارسی. پشتیبانی عالی از چند زبانه.
Mistral 7B
سریع و کارآمد. عالی برای مصارف روزمره و پردازش متن.
Gemma 2 9B
ساخت گوگل. کیفیت بالا در اندازه متوسط. مناسب تحلیل متن.
DeepSeek Coder V2 16B
تخصصی کدنویسی. پشتیبانی از ۳۰۰+ زبان برنامهنویسی.
Phi-3 Mini
کوچک و سبک از مایکروسافت. مناسب اجرا روی لپتاپ و موبایل.
نکات کلیدی
۷۵٪ کاهش اندازه با فقط ۲–۳٪ افت کیفیت. برای اکثر کاربران بهترین انتخاب است.
اگر GPU کافی ندارید، حداقل ۲ برابر وزن مدل RAM داشته باشید.
مدلهای 7B روی اکثر سیستمها اجرا میشوند و کیفیت قابل قبولی دارند.
M1/M2/M3/M4 با Unified Memory عملکرد بسیار خوبی دارند. ۱۶GB یونیفاید ≈ ۱۶GB VRAM.