هوش مصنوعی ۲ دقیقه مطالعه

اوپن‌ای‌آی از مدل سخنگوی دوطرفه GPT-Live-1 رونمایی کرد: مکالمه روان و سریع

آیدا استاد شریف آیدا استاد شریف

شرکت اوپن‌ای‌آی (OpenAI) مدل جدید سخنگوی دوطرفه خود با نام GPT-Live-1 را معرفی کرده است. این مدل با معماری تک‌مدلی، فرآیند سنتی تبدیل گفتار به متن، استدلال و سپس تبدیل متن به گفتار را جایگزین می‌کند. نتیجه این تغییر، کاهش چشمگیر تاخیر و ایجاد تعامل صوتی روان و شبیه به انسان است.

GPT-Live-1: پایان تاخیر در تعاملات صوتی

معماری‌های آبشاری سنتی در تعاملات صوتی هوش مصنوعی، به دلیل پردازش متوالی گفتار به متن، استنتاج مدل و تبدیل متن به گفتار، تاخیر قابل توجهی ایجاد می‌کنند. اوپن‌ای‌آی با عرضه GPT-Live-1 از طریق API، این مشکل را به طور کامل برطرف کرده و تجربه‌ای شبیه به مکالمات انسانی را برای توسعه‌دهندگان فراهم می‌آورد.

قابلیت‌های پیشرفته در مکالمات پیچیده

عاملان صوتی سنتی اغلب در سناریوهای مکالمه پیچیده، به‌ویژه هنگام مواجهه با مکث‌ها، وقفه یا تغییر موضوع، با مشکل روبرو می‌شوند. GPT-Live-1 با استفاده از یک مدل واحد برای پردازش همزمان صدای ورودی و خروجی، معماری را به طور انقلابی ساده‌سازی کرده است. این مدل نه تنها از وقفه‌های پاسخ فوری پشتیبانی می‌کند، بلکه استدلال عمیق و فراخوانی ابزارها را به مدل‌های متنی پس‌زمینه واگذار کرده و امکان ادامه مکالمات در پس‌زمینه را با حفظ انعطاف‌پذیری بالا فراهم می‌سازد.

مزایای کلیدی و کاربردهای GPT-Live-1

این مدل مزایای قابل توجهی در عملکرد و سناریوهای کاربردی ارائه می‌دهد:

مدیریت عالی وقفه‌ها

آزمایش‌های اولیه نشان داد که پلتفرم یادگیری زبان Speak با استفاده از GPT-Live-1، کاهش نزدیک به ۸۰ درصدی وقفه‌ها در مکث‌های فکری را تجربه کرده است.

سفارشی‌سازی و انعطاف‌پذیری

توسعه‌دهندگان می‌توانند از طریق اعلان‌های سیستمی (system prompts)، لحن، ریتم و سبک مکالمه عامل را سفارشی کنند. این مدل قادر به مدیریت کامل نویز پس‌زمینه و سکوت است و آن را برای خدماتی مانند پشتیبانی تلفنی مشتریان، رزرو رستوران و مکالمات طولانی ایده‌آل می‌سازد. در تست‌های استاندارد، عملکرد بسیار خوبی در ترکیب با GPT-6 Astra نشان داده است.

دسترسی و بازخورد صنعت

GPT-Live-1 اکنون به طور کامل در API موجود است و هزینه لایه صوتی آن ۵ سنت در دقیقه است. شرکای صنعتی مانند Yelp و Intercom تأیید کرده‌اند که این مدل دقت تعویض نوبت را به طور قابل توجهی بهبود بخشیده و امکان مکالمات صوتی هوش مصنوعی طبیعی و روان، مشابه تعاملات رو در رو با انسان را فراهم می‌آورد.

source:

نوشته‌شده توسط

آیدا استاد شریف

کار من رصد کردن سریع‌ترین تغییرات دنیای تکنولوژیه. عاشق اینم که وسط ترندهای جدید و گجت‌های معرفی‌نشده شیرجه بزنم و زودتر از بقیه سر دربیارم که آینده قراره چه شکلی باشه.

دیدگاه خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *