تعریف
فشردهسازی وزنهای مدل با کاهش دقت عددی (مثلاً از ۱۶ بیت به ۴ بیت) برای کاهش حافظه و افزایش سرعت.
توضیح کامل
روشهای اصلی شامل GPTQ، AWQ و GGUF هستند. کوانتیزیشن ۴ بیت حجم مدل رامولاً زیر ۵٪. این تکنیک اجرای مدلهای بزرگ روی سختافزار مصرفی را ممکن میکند.
مثال کاربردی
مدل Llama-3 70B با GGUF Q4_K_M روی یک لپتاپ ۳۲GB RAM قابل اجراست.