شرکت سنستایم (SenseTime) به طور رسمی از مدل زبانی بزرگ چندوجهی یکپارچه و سبکوزن جدید خود با نام SenseNova U1.5Lite رونمایی کرد. این مدل که تنها 8 میلیارد پارامتر دارد، عملکردی برتر در وظایف بصری کلیدی از خود نشان میدهد و در پردازش طرحبندیهای پیچیده و رندر متن، با مدلهای تجاری در مقیاس بزرگ رقابت میکند.
قابلیتهای پیشرفته SenseNova U1.5Lite
مدل SenseNova U1.5Lite به طور بومی از طول زمینه (context length) 3 تا 4 هزار پیکسل پشتیبانی میکند. این ویژگی امکان پردازش همزمان چندین محدودیت مانند سوژه، تعداد، روابط فضایی، متن، طرحبندی و سبک را فراهم میآورد و پایداری را در اجرای وظایف بصری پیچیده به طور قابل توجهی افزایش میدهد.
ارتقاهای کلیدی در تولید و ویرایش بصری
این مدل با ارتقاهای چشمگیری در تولید بصری همراه است. کیفیت کلی ترکیببندی، رنگ، مواد، نورپردازی، واقعگرایی و جزئیات محلی بهبود یافته است. این امر به جلوگیری از تولید نتایج نادرست در مدلهای سنتی کمک میکند که در آنها بخشهای محلی صحیح اما تصویر کلی ناقص است.
همچنین، قابلیتهای ویرایش تصویر بومی قابل اعتمادتری ارائه میدهد. این مدل در حفظ هویت سوژه، ساختار فضایی، روابط طرحبندی و نواحی غیرقابل ویرایش، عملکرد بهتری دارد. بهبود جامع عملکرد در ویرایشهای محلی، جایگزینی عناصر، اصلاح متن و ویرایش با تصاویر مرجع متعدد نیز از دیگر ویژگیهای آن است.
پردازش متن و طرحبندیهای پیچیده
مدل SenseNova U1.5Lite در پردازش متن و طرحبندیهای پیچیده نیز موفق عمل کرده است. قابلیتهای آن در متنهای چینی و انگلیسی، پوسترها، اینفوگرافیکها، تصاویر برند و قالببندی چندمتنی تقویت شده است. این پیشرفتها، تولید محتوا را به سمت بیان بصری کامل سوق میدهد.
کنترل بصری دقیق و خروجی 4K
این مدل از روشهای متنوعی مانند کادر (Bounding Box)، نشانگر بصری (Visual Marker) و ارجاع به یک یا چند تصویر پشتیبانی میکند. این امکان، ویرایش دقیقتر مناطق و اشیاء مشخص شده را فراهم میآورد. نکته قابل توجه، دستیابی به خروجی بومی با وضوح بالا 4K است که هم ترکیببندی کلان و هم جزئیات بسیار ریز مانند بافتها، متون کوچک و جلوههای نوری را در تولیدات با وضوح بالا حفظ میکند.
آدرس پروژه: GitHub SenseNova U1

