معرفی مدلهای پیشنویس LFM2.5 DSpark
شرکتهای Liquid AI و Hugging Face رسماً از مدلهای پیشنویس LFM2.5 DSpark رونمایی کردند. این مجموعه شامل سه مدل کلیدی است: LFM2.5-1.2B-Instruct، LFM2.5-2.6B و LFM2.5-8B-A1B. فناوری جدید به کار رفته در این مدلها، با بهرهگیری از مسیر رمزگشایی حدسی (speculative decoding)، توان پردازش استنتاج (inference throughput) را به میزان قابل توجهی افزایش میدهد.
افزایش چشمگیر سرعت استنتاج
آزمایشهای عملی نشاندهنده تأثیرات شتابدهنده چشمگیر مدل پیشنویس DSpark است. در پردازندههای گرافیکی (GPU)، توان پردازش کلی تا 3.18 برابر افزایش یافته است. این رقم در دستگاههای لبه (edge devices) به حداکثر 2.87 برابر میرسد.
کارایی در سناریوهای عامل لبه
بهطور خاص در سناریوهای استنتاج عامل لبه، تأخیر فراخوانی تابع (function call latency) در مدل LFM2.5-2.6B بهطور متوسط 57% کاهش یافته است. با استفاده از MacBook Pro M4Max بهعنوان پلتفرم تست لبه، سرعت خروجی این مدل به 139 توکن در ثانیه میرسد. این امر آستانه اجرای برنامههای عامل (agent applications) بهصورت محلی را به شدت کاهش داده و تجربه کاربری آن حتی از برخی مدلهای ابری اختصاصی نیز فراتر میرود.
نحوه عملکرد DSpark
استنتاج مدلهای زبان بزرگ سنتی عمدتاً با محدودیت پهنای باند حافظه مواجه است. تأخیرها بیشتر ناشی از انتقال وزنهای مدل از حافظه DRAM به SRAM است. رمزگشایی حدسی با استفاده از یک مدل پیشنویس سبک، توکنهای نامزد را بهسرعت تولید میکند. سپس مدل اصلی این توکنها را در یک مرحله پردازش واحد (single forward pass) اعتبارسنجی میکند و هزینه بارگذاری وزنها را بهطور مؤثر توزیع میکند.
معماری DSpark
DSpark از سه جزء اصلی تشکیل شده است:
- شبکه ستون فقرات موازی (Parallel Backbone Network): این بخش، شبیه به DFlash، حالات پنهان (hidden states) را برای تمام توکنهای پیشنویس در یک مرحله پردازش واحد بر اساس ویژگیهای زمینه مدل هدف تولید میکند.
- سر متوالی (Sequential Head): با شبیهسازی زنجیرههای مارکوف بین توکنهای مجاور، وابستگیها را افزایش داده و نرخ پذیرش توکنهای بعدی را بهبود میبخشد.
- اعتبارسنج اطمینان (Confidence Scheduling Validator): احتمال بقای هر توکن را پیشبینی کرده و بهطور خودکار پسوندهای با اطمینان پایین را در صورت تجاوز هزینه اعتبارسنجی از هزینه ذخیره شده، حذف میکند.
آموزش و پارامترهای مدل پیشنویس
مدل پیشنویس با استفاده از ترکیبی متنوع از دادههای بزرگ شامل SFT، چت، کد و فراخوانی تابع آموزش دیده است. نسخه اولیه با معماری تنها-توجه (attention-only) شامل 5 لایه و 9 بلوک انتخاب شده است و تعداد کل پارامترها حدود 300 میلیون است.
کیفیت خروجی و پشتیبانی اکوسیستم
به دلیل ماهیت مکانیسم رمزگشایی حدسی، در صورت تطابق کامل توکن پیشنویس با توزیع مدل هدف، پذیرفته میشود. در غیر این صورت، توکن از مدل هدف جایگزین میشود. این امر تضمین میکند که توالی خروجی تولید شده، ساختاری مشابه با رمزگشایی حریصانه (greedy decoding) پایه داشته و دقت در هیچ آزمون معیاری کاهش نمییابد.
پشتیبانی از فریمورکهای استنتاج
DSpark از روز انتشار، سازگاری با فریمورکهای اصلی استنتاج را به دست آورده است:
- SGLang: پشتیبانی از اجرا بر روی شتابدهندهها از طریق ادغام اختصاصی و تنظیمات راهاندازی.
- llama.cpp: پیادهسازی پشتیبانی ساخت رسمی و امکان بارگذاری وزنهای GGUF و فایلهای مدل پیشنویس مربوطه از طریق خط فرمان.