تعریف
فرآیند استفاده از مدل آموزشدیده برای پردازش ورودی جدید و تولید خروجی؛ مرحله مقابل آموزش.
توضیح کامل
استنتاج معمولاً سریعتر و ارزانتر از آموزش است اما در مقیاس بزرگ بخش اصلی هزینه عملیاتی است. سرعت با tokens/second و تأخیر با Time-To-First-Token سنجیده میشود. بهینهسازیهای استنتاج: کوانتیزیشن، KV Cache، Speculative Decoding.
مثال کاربردی
هر بار که پیام میفرستید و مدل پاسخ میدهد، یک inference اجرا میشود.