مدل بینایی DeepSeek بهروز شد: پشتیبانی از پردازش چندوجهی و ورودی تصویر
شرکت DeepSeek زنجیره ابزار مدل زبانی خود (DeepSeek Harness) را به نسخه 0.1.1-rc.1 ارتقا داد. این بهروزرسانی شامل افزودن نسخه آزمایشی مدل بینایی V4Flash Vision-Exp بر پایه مدلهای V4Flash و V4Pro است.
نسخه پیشین، 0.1.0-rc.8، قابلیتهای پردازش چندوجهی (multimodal) را فعال کرده بود. این قابلیتها امکان پردازش ورودیهای ترکیبی متن و تصویر را فراهم میآورد. دستوراتی مانند /goal و /plan اکنون میتوانند تصاویر را همراه با متن دریافت کنند.
قابلیتهای جدید مدل بینایی DeepSeek
کاربران میتوانند با ارسال همزمان اسکرینشاتها و نیازمندیهای کاری خود، به هوش مصنوعی امکان “کار با مشاهده تصاویر” را بدهند. این امر فرآیند توسعه و عملیات را به طور قابل توجهی سادهتر میکند.
در حالی که DeepSeek پیش از این حالت تشخیص تصویر را در وب ارائه میداد، ادغام عمیق آن در زنجیره ابزار توسعه، تکمیلکننده پردازش چندوجهی است.
نحوه ارتقا و تجربه مدل جدید
توسعهدهندگان میتوانند با اجرای یک دستور npm ساده، این مدل بینایی جدید را که ترکیبی از سرعت و دقت است، تجربه کنند.
