تعریف
تکنیک تسریع استنتاج که یک مدل کوچک (Draft) پیشبینیهای موقت میکند و مدل بزرگ (Verifier) آنها را تأیید یا رد میکند.
توضیح کامل
مدل Draft چند توکن سریع پیشبینی میکند؛ مدل اصلی همه را موازی تأیید میکند. در بهترین حالت سرعت ۲-۳ برابر افزایش مییابد بدون افت کیفیت. Self-speculative decoding از لایههای اولیه همان مدل بهعنوان Draft استفاده میکند.
مثال کاربردی
Gemini و Claude از نسخههایی از Speculative Decoding برای کاهش تأخیر در API استفاده میکنند.