مایکروسافت در تاریخ ۳ سپتامبر، جدیدترین و قدرتمندترین مدل تشخیص گفتار خود با نام MAI Transcribe 2 را معرفی کرد. این فناوری با دستیابی به نرخ خطای کلمه متوسط ۵.۲% در بنچمارک FLEURS برای ۶۰ زبان، جایگاه دوم را در رتبهبندی Artificial Analysis کسب نمود.
سرعت پردازش بیسابقه در تشخیص گفتار
یکی از چشمگیرترین ویژگیهای MAI-Transcribe-2، سرعت پردازش آن است. این مدل قادر است یک ساعت صوت را در حدود ۱۰ ثانیه پردازش کند که تا ۱۰ برابر سریعتر از رقبای خود عمل میکند. این قابلیت، پردازش حجم بالای دادههای صوتی را در زمان کوتاه امکانپذیر میسازد.
دسترسی و قیمتگذاری ویژه
مدل MAI-Transcribe-2 هماکنون از طریق پلتفرمهای Microsoft Foundry، MAI Playground و Open Router در دسترس است. مایکروسافت برای مدت محدود، این سرویس را با قیمتی استثنایی ۰.۱۰ دلار به ازای هر ساعت صوت ارائه میدهد.
قابلیتهای پیشرفته برای سناریوهای واقعی
این مدل برای مواجهه با سناریوهای پیچیده دنیای واقعی بهطور کامل ارتقا یافته است. قابلیتهایی نظیر تفکیک گوینده، زمانبندی در سطح کلمه، اولویتبندی کلمات کلیدی و تشخیص خودکار زبان، در MAI-Transcribe-2 گنجانده شده است.
پشتیبانی از زبانهای ترکیبی و مقاومت در برابر نویز
MAI-Transcribe-2 از پدیدههای کدسوئیچینگ مانند Hinglish (ترکیب انگلیسی و هندی) و Spanglish (ترکیب اسپانیایی و انگلیسی) پشتیبانی میکند و مقاومت بالایی در برابر نویز دارد. همچنین، توسعهدهندگان میتوانند بین سبکهای «رونویسی کلمه به کلمه» و «رونویسی مختصر» جابجا شوند تا با محیطهای تولیدی متنوعی مانند امور حقوقی، بالینی، زیرنویس و تحلیلهای با انطباق بالا، سازگار شوند.
نقش MAI-Transcribe-2 در اکوسیستم هوش گفتاری
با تکامل کاربردهای هوش مصنوعی از تعاملات تکوجهی به سمت هوش گفتاری چندوجهی و بلادرنگ، زیرساختهای گفتاری با توان عملیاتی بالا، تأخیر کم و هزینه پایین، به مانعی کلیدی برای رقابت تبدیل شدهاند. MAI-Transcribe-2 مرزهای دقت و تأخیر را در رونویسی گفتار بازتعریف کرده و آستانه استقرار را برای صوت چندزبانه بهطور قابل توجهی کاهش میدهد و نیروی تازهای به توسعه اکوسیستمهای گفتاری بلادرنگ تزریق میکند.
