هوش مصنوعی ۳ دقیقه مطالعه

معرفی مدل LFM2.5 DSpark: تا ۳.۱۸ برابر سرعت استنتاج بیشتر

هادی داتلی بیگی هادی داتلی بیگی

معرفی مدل‌های پیش‌نویس LFM2.5 DSpark

شرکت‌های Liquid AI و Hugging Face رسماً از مدل‌های پیش‌نویس LFM2.5 DSpark رونمایی کردند. این مجموعه شامل سه مدل کلیدی است: LFM2.5-1.2B-Instruct، LFM2.5-2.6B و LFM2.5-8B-A1B. فناوری جدید به کار رفته در این مدل‌ها، با بهره‌گیری از مسیر رمزگشایی حدسی (speculative decoding)، توان پردازش استنتاج (inference throughput) را به میزان قابل توجهی افزایش می‌دهد.

افزایش چشمگیر سرعت استنتاج

آزمایش‌های عملی نشان‌دهنده تأثیرات شتاب‌دهنده چشمگیر مدل پیش‌نویس DSpark است. در پردازنده‌های گرافیکی (GPU)، توان پردازش کلی تا 3.18 برابر افزایش یافته است. این رقم در دستگاه‌های لبه (edge devices) به حداکثر 2.87 برابر می‌رسد.

کارایی در سناریوهای عامل لبه

به‌طور خاص در سناریوهای استنتاج عامل لبه، تأخیر فراخوانی تابع (function call latency) در مدل LFM2.5-2.6B به‌طور متوسط 57% کاهش یافته است. با استفاده از MacBook Pro M4Max به‌عنوان پلتفرم تست لبه، سرعت خروجی این مدل به 139 توکن در ثانیه می‌رسد. این امر آستانه اجرای برنامه‌های عامل (agent applications) به‌صورت محلی را به شدت کاهش داده و تجربه کاربری آن حتی از برخی مدل‌های ابری اختصاصی نیز فراتر می‌رود.

نحوه عملکرد DSpark

استنتاج مدل‌های زبان بزرگ سنتی عمدتاً با محدودیت پهنای باند حافظه مواجه است. تأخیرها بیشتر ناشی از انتقال وزن‌های مدل از حافظه DRAM به SRAM است. رمزگشایی حدسی با استفاده از یک مدل پیش‌نویس سبک، توکن‌های نامزد را به‌سرعت تولید می‌کند. سپس مدل اصلی این توکن‌ها را در یک مرحله پردازش واحد (single forward pass) اعتبارسنجی می‌کند و هزینه بارگذاری وزن‌ها را به‌طور مؤثر توزیع می‌کند.

معماری DSpark

DSpark از سه جزء اصلی تشکیل شده است:

  • شبکه ستون فقرات موازی (Parallel Backbone Network): این بخش، شبیه به DFlash، حالات پنهان (hidden states) را برای تمام توکن‌های پیش‌نویس در یک مرحله پردازش واحد بر اساس ویژگی‌های زمینه مدل هدف تولید می‌کند.
  • سر متوالی (Sequential Head): با شبیه‌سازی زنجیره‌های مارکوف بین توکن‌های مجاور، وابستگی‌ها را افزایش داده و نرخ پذیرش توکن‌های بعدی را بهبود می‌بخشد.
  • اعتبارسنج اطمینان (Confidence Scheduling Validator): احتمال بقای هر توکن را پیش‌بینی کرده و به‌طور خودکار پسوندهای با اطمینان پایین را در صورت تجاوز هزینه اعتبارسنجی از هزینه ذخیره شده، حذف می‌کند.

آموزش و پارامترهای مدل پیش‌نویس

مدل پیش‌نویس با استفاده از ترکیبی متنوع از داده‌های بزرگ شامل SFT، چت، کد و فراخوانی تابع آموزش دیده است. نسخه اولیه با معماری تنها-توجه (attention-only) شامل 5 لایه و 9 بلوک انتخاب شده است و تعداد کل پارامترها حدود 300 میلیون است.

کیفیت خروجی و پشتیبانی اکوسیستم

به دلیل ماهیت مکانیسم رمزگشایی حدسی، در صورت تطابق کامل توکن پیش‌نویس با توزیع مدل هدف، پذیرفته می‌شود. در غیر این صورت، توکن از مدل هدف جایگزین می‌شود. این امر تضمین می‌کند که توالی خروجی تولید شده، ساختاری مشابه با رمزگشایی حریصانه (greedy decoding) پایه داشته و دقت در هیچ آزمون معیاری کاهش نمی‌یابد.

پشتیبانی از فریم‌ورک‌های استنتاج

DSpark از روز انتشار، سازگاری با فریم‌ورک‌های اصلی استنتاج را به دست آورده است:

  • SGLang: پشتیبانی از اجرا بر روی شتاب‌دهنده‌ها از طریق ادغام اختصاصی و تنظیمات راه‌اندازی.
  • llama.cpp: پیاده‌سازی پشتیبانی ساخت رسمی و امکان بارگذاری وزن‌های GGUF و فایل‌های مدل پیش‌نویس مربوطه از طریق خط فرمان.
هادی داتلی بیگی

نوشته‌شده توسط

هادی داتلی بیگی

دنیای من ترکیبی از خطوط کد و تحلیل‌های هوش مصنوعیه. به عنوان کسی که سال‌هاست درگیر توسعه نرم‌افزار و چالش‌های فنی دنیای وب و موبایله، معتقدم هوش مصنوعی صرفاً یک ترند نیست، بلکه زبان جدید دنیاست.

دیدگاه خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *