مدل هوش مصنوعی mimo-v2.5-tts-voicedesign محصول پیشرفتهای از شرکت شیائومی است که در زمینه تبدیل متن به گفتار و طراحی صدا فعالیت میکند. این مدل با تکیه بر الگوریتمهای مدرن یادگیری ماشین، توانایی تولید صداهای طبیعی، باکیفیت و سفارشیسازیشده را با بالاترین دقت دارد. توسعهدهندگان میتوانند از این فناوری قدرتمند برای ساخت دستیارهای صوتی هوشمند، تولید محتوای چندرسانهای و پروژههای پردازش گفتار بهره ببرند. مدل شیائومی عملکردی روان، سریع و قابل اتکا در سناریوهای مختلف صوتی ارائه میدهد.
mimo-v2.5-tts-voicedesign
Xiaomi
mimo-v2-5-tts-voicedesign
اطلاعات مدل
- شناسه (Slug)
mimo-v2-5-tts-voicedesign- تاریخ انتشار
- سازمان
- Xiaomi
- دسترسی
- پولی
- سایت رسمی
- www.mi.com
دادههای تحلیلی
- شمار پارامترها
- ۳۱۰,۸B پارامتر
- مجوز
- MIT
- ورودی
- متن، تصویر، صدا، ویدئو
- خروجی
- متن
- پنجرهٔ زمینه
- ۱,۱ میلیون توکن
- میانگین قیمت ورودی (در ۱ میلیون توکن)
- $0,14
- میانگین قیمت خروجی (در ۱ میلیون توکن)
- $0,28
- نوع استفاده
- درک تصویردرک ویدیودرک صدا
منابع: LLM Stats OpenRouter
بنچمارکها
عاملها (Agentic)
Finance Agent v2
۳۶,۷%
#21
ResearchClawBench
۱۶,۹%
#1
کدنویسی
MiMo Coding Bench
۷۱,۸%
#2
Claw-Eval
۶۳,۲%
#7
زمینهٔ بلند
GraphWalks
۸۷,۰%
#2
چندحالته
Video-MME
۸۷,۷%
#4
استدلال
CharXiv-R
۸۱,۰%
#21
Terminal-Bench 2.0
۶۵,۸%
#16
SWE-Bench Pro
۵۶,۱%
#31
ویدیو
DailyOmni
۸۳,۵%
#1
VideoHolmes
۶۴,۰%
#3
بینایی
HR-Bench (4k)
۸۸,۵%
#1
OmniDocBench
۸۷,۲%
#2
MMMU-Pro
۷۷,۹%
#22