اصطلاح intermediate

کوانتیزیشن | Quantization

فشرده‌سازی وزن‌های مدل با کاهش دقت عددی (مثلاً از ۱۶ بیت به ۴ بیت) برای کاهش حافظه و افزایش سرعت.

Quantization — کوانتیزیشن | Quantization

فشرده‌سازی وزن‌های مدل با کاهش دقت عددی (مثلاً از ۱۶ بیت به ۴ بیت) برای کاهش حافظه و افزایش سرعت.

تعریف

فشرده‌سازی وزن‌های مدل با کاهش دقت عددی (مثلاً از ۱۶ بیت به ۴ بیت) برای کاهش حافظه و افزایش سرعت.

توضیح کامل

روش‌های اصلی شامل GPTQ، AWQ و GGUF هستند. کوانتیزیشن ۴ بیت حجم مدل رامولاً زیر ۵٪. این تکنیک اجرای مدل‌های بزرگ روی سخت‌افزار مصرفی را ممکن می‌کند.

مثال کاربردی

مدل Llama-3 70B با GGUF Q4_K_M روی یک لپ‌تاپ ۳۲GB RAM قابل اجراست.

موارد مرتبط

LoRA | Low-Rank Adaptation (LoRA)
اصطلاح
یادگیری زیرو‌شات | Zero-shot Learning
اصطلاح
یادگیری تقویتی از بازخورد انسانی | RLHF
اصطلاح
حافظه مدل | LLM Memory
اصطلاح