شیائومی مدل پیشرفته تشخیص صدای سخنگوی هدف صنعتی با نام CocktailASR-1 را به صورت متنباز ارائه کرد. این اقدام با هدف حل چالش دیرینه «مشکل مهمانی کوکتل» انجام شده است، جایی که چندین نفر به طور همزمان صحبت میکنند.
تغییر رویکرد در تشخیص صدا
مدل CocktailASR-1 روش ورودی سنتی در وظایف تشخیص گفتار خودکار (ASR) را دگرگون میکند. این مدل با بهرهگیری از مکانیزم شناسایی سخنگوی هدف بر اساس اثر انگشت صوتی مرجع، قادر است در محیطهای پر سر و صدا، صدای فرد مورد نظر را به دقت شناسایی و تفکیک کند. کاربران تنها با ارائه یک صدای مرجع، امکان تمرکز مدل بر روی سخنگوی خاص و حذف خودکار دیگر صداها، پژواک و نویز پسزمینه را فراهم میآورند.
معماری پیشرفته و کاربردپذیری بالا
این مدل از معماری مدل زبانی بزرگ سرتاسری (end-to-end) شامل یک رمزگذار صوتی D2V2، آداپتور و رمزگشای مدل بزرگ تشکیل شده است. طراحی یکپارچه آن، انعطافپذیری بالایی را برای پردازش سناریوهای تکنفره و پیچیده چندنفره بدون نیاز به تعویض مدل فراهم میآورد.
عملکرد درخشان در بنچمارکها
آزمایشهای متعدد بر روی دادههای استاندارد، تواناییهای چشمگیر CocktailASR-1 را تایید کردهاند. این مدل در تستهای شبیهسازی شده چند سخنگو، نرخ خطای کلمه (WER) را به طور قابل توجهی کاهش داده است. در مقایسه با مدلهای رقیب در سناریوهای پیچیده، CocktailASR-1 عملکردی انقلابی از خود نشان داده و حتی در ضبط جلسات واقعی نیز بر راهحلهای موجود برتری یافته است.
ویژگیهای کاربردی و مهندسی
علاوه بر دقت بینظیر، این مدل دارای دو قابلیت برجسته دیگر است: توانایی رد قوی نمونههای منفی که از فعالسازی اشتباه دستگاههای هوشمند جلوگیری میکند و پشتیبانی از قابلیت استدلال زنجیرهای فکری (chain-of-thought) که تفسیر و اشکالزدایی سیستم را تسهیل میبخشد.
دسترسی متنباز و آینده تشخیص صدا
کد مربوط به CocktailASR-1 تحت مجوز Apache 2.0 در GitHub به صورت متنباز منتشر شده است. این اقدام نشاندهنده تغییر پارادایم در فناوری گفتار شیائومی است؛ گذار از «ضبط تمام صداها» به مرحله جدیدی از توسعه با تمرکز بر «قفل کردن بر روی یک صدا».