پایگاه دانش مدل های محلی

راهنمای جامع راه‌اندازی مدل‌های هوش مصنوعی روی سیستم شخصی؛ از Ollama و LM Studio تا vLLM، به همراه جدول نیازمندی‌های سخت‌افزاری.

چرا مدل محلی؟

🔒 حریم خصوصی

داده‌های شما از سیستم خارج نمی‌شوند. مناسب برای پزشکی، حقوقی و سازمانی.

💰 هزینه

بدون اشتراک ماهانه. یک‌بار سخت‌افزار بخرید، مادام‌العمر رایگان استفاده کنید.

⚡ سرعت

بدون تاخیر شبکه. پاسخ‌دهی آنی بدون وابستگی به اینترنت.

🛠️ سفارشی‌سازی

fine-tune کنید، پرامپت سفارشی بزنید و مدل را کاملاً کنترل کنید.

ابزارهای راه‌اندازی

🦙 Ollama

پیشنهادی متن‌باز

ساده‌ترین روش برای اجرای مدل‌های محلی. مشابه Docker برای LLMها. یک دستور نصب، یک دستور اجرا.

Linux / macOS / Windows CPU + GPU REST API

وب‌سایت رسمی Ollama ↗

🖥️ LM Studio

GUI رایگان

رابط گرافیکی زیبا برای دانلود، اجرا و مدیریت مدل‌ها. مناسب مبتدی‌ها و کاربرانی که ترمینال دوست ندارند.

macOS / Windows / Linux GUI + Chat OpenAI-compatible

وب‌سایت رسمی LM Studio ↗

🚀 vLLM

پیشرفته متن‌باز

برای استقرار حرفه‌ای و production. پشتیبانی از PagedAttention، batching خودکار و multi-GPU.

Linux (CUDA) Python High-throughput

مستندات رسمی vLLM ↗

شروع سریع با Ollama

۱

نصب Ollama

از سایت رسمی دانلود و نصب کنید:

curl -fsSL https://ollama.com/install.sh | sh

یا از ollama.com/download برای macOS/Windows دانلود کنید.

۲

دانلود و اجرای مدل

محبوب‌ترین مدل‌ها با یک دستور:

# Llama 3.1 8B — محبوب‌ترین مدل عمومی
ollama run llama3.1

# Qwen 2.5 7B — بهترین برای کدنویسی و فارسی
ollama run qwen2.5:7b

# Mistral 7B — سریع و سبک
ollama run mistral

# Gemma 2 9B — ساخت گوگل
ollama run gemma2:9b

# DeepSeek Coder V2 — تخصصی کدنویسی
ollama run deepseek-coder-v2:16b
۳

استفاده از API

Ollama یک API سازگار با OpenAI ارائه می‌دهد:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1",
  "prompt": "سلام! خودت رو معرفی کن",
  "stream": false
}'
۴

مدیریت مدل‌ها

# لیست مدل‌های دانلود شده
ollama list

# حذف مدل
ollama rm llama3.1

# اطلاعات مدل
ollama show llama3.1

شروع سریع با LM Studio

۱

دانلود و نصب

از lmstudio.ai دانلود کنید. نسخه macOS، Windows و Linux موجود است.

۲

جستجو و دانلود مدل

در تب Search، نام مدل را جستجو کنید و نسخه مناسب سیستم‌تان را دانلود کنید.

۳

اجرای چت

در تب Chat، مدل را انتخاب کنید و شروع به چت کنید. سرور API داخلی نیز فعال می‌شود.

شروع سریع با vLLM

۱

نصب

pip install vllm
۲

اجرای سرور

# اجرای Llama 3.1 8B با OpenAI-compatible API
vllm serve meta-llama/Meta-Llama-3.1-8B-Instruct

# با تعداد GPU خاص
vllm serve meta-llama/Meta-Llama-3.1-8B-Instruct --tensor-parallel-size 2

# با حداکثر context طولانی
vllm serve meta-llama/Meta-Llama-3.1-8B-Instruct --max-model-len 32768
۳

استفاده از API

curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
  "model": "meta-llama/Meta-Llama-3.1-8B-Instruct",
  "messages": [{"role": "user", "content": "سلام!"}]
}'

نیازمندی‌های سخت‌افزاری

حداقل و پیشنهادی سخت‌افزار بر اساس اندازه مدل (بر اساس نسخه Q4_K_M کوانتیز شده):

مدل پارامتر وزن (Q4) حداقل RAM پیشنهادی GPU سلامت اجرا
Gemma 2 2B / Phi-3 Mini 2B–3B ~2 GB 4 GB CPU کافیست هر سیستم
Llama 3.1 8B / Mistral 7B 7B–8B ~5 GB 8 GB RTX 3060 12GB سیستم معمولی
Qwen 2.5 14B 14B ~9 GB 16 GB RTX 4060 Ti 16GB گیمینگ
CodeLlama 34B / Yi 34B 34B ~20 GB 32 GB RTX 4090 24GB حرفه‌ای
Llama 3.1 70B / Qwen 2.5 72B 70B–72B ~40 GB 64 GB A100 80GB / 2×RTX 4090 پیشرفته
Llama 3.1 405B 405B ~230 GB 256 GB+ 4×A100 / H100 سرور

محبوب‌ترین مدل‌ها برای اجرای محلی

Llama 3.1 8B

محبوب‌ترین مدل عمومی. تعادل عالی بین سرعت و کیفیت. مناسب چت، ترجمه و خلاصه‌سازی.

8B FP16: 16GB Q4: 5GB

Qwen 2.5 7B

بهترین مدل برای کدنویسی و درک فارسی. پشتیبانی عالی از چند زبانه.

7B FP16: 14GB Q4: 4.5GB

Mistral 7B

سریع و کارآمد. عالی برای مصارف روزمره و پردازش متن.

7B FP16: 14GB Q4: 4.5GB

Gemma 2 9B

ساخت گوگل. کیفیت بالا در اندازه متوسط. مناسب تحلیل متن.

9B FP16: 18GB Q4: 6GB

DeepSeek Coder V2 16B

تخصصی کدنویسی. پشتیبانی از ۳۰۰+ زبان برنامه‌نویسی.

16B FP16: 32GB Q4: 10GB

Phi-3 Mini

کوچک و سبک از مایکروسافت. مناسب اجرا روی لپ‌تاپ و موبایل.

3.8B FP16: 8GB Q4: 2.5GB

نکات کلیدی

کوانتیزیشن Q4_K_M بهترین تعادل را دارد

۷۵٪ کاهش اندازه با فقط ۲–۳٪ افت کیفیت. برای اکثر کاربران بهترین انتخاب است.

RAM مهم‌تر از GPU است (برای CPU)

اگر GPU کافی ندارید، حداقل ۲ برابر وزن مدل RAM داشته باشید.

با 7B شروع کنید

مدل‌های 7B روی اکثر سیستم‌ها اجرا می‌شوند و کیفیت قابل قبولی دارند.

macOS از Metal GPU بهره می‌برد

M1/M2/M3/M4 با Unified Memory عملکرد بسیار خوبی دارند. ۱۶GB یونیفاید ≈ ۱۶GB VRAM.