شرکت اوپنایآی (OpenAI) مدل جدید سخنگوی دوطرفه خود با نام GPT-Live-1 را معرفی کرده است. این مدل با معماری تکمدلی، فرآیند سنتی تبدیل گفتار به متن، استدلال و سپس تبدیل متن به گفتار را جایگزین میکند. نتیجه این تغییر، کاهش چشمگیر تاخیر و ایجاد تعامل صوتی روان و شبیه به انسان است.
GPT-Live-1: پایان تاخیر در تعاملات صوتی
معماریهای آبشاری سنتی در تعاملات صوتی هوش مصنوعی، به دلیل پردازش متوالی گفتار به متن، استنتاج مدل و تبدیل متن به گفتار، تاخیر قابل توجهی ایجاد میکنند. اوپنایآی با عرضه GPT-Live-1 از طریق API، این مشکل را به طور کامل برطرف کرده و تجربهای شبیه به مکالمات انسانی را برای توسعهدهندگان فراهم میآورد.
قابلیتهای پیشرفته در مکالمات پیچیده
عاملان صوتی سنتی اغلب در سناریوهای مکالمه پیچیده، بهویژه هنگام مواجهه با مکثها، وقفه یا تغییر موضوع، با مشکل روبرو میشوند. GPT-Live-1 با استفاده از یک مدل واحد برای پردازش همزمان صدای ورودی و خروجی، معماری را به طور انقلابی سادهسازی کرده است. این مدل نه تنها از وقفههای پاسخ فوری پشتیبانی میکند، بلکه استدلال عمیق و فراخوانی ابزارها را به مدلهای متنی پسزمینه واگذار کرده و امکان ادامه مکالمات در پسزمینه را با حفظ انعطافپذیری بالا فراهم میسازد.
مزایای کلیدی و کاربردهای GPT-Live-1
این مدل مزایای قابل توجهی در عملکرد و سناریوهای کاربردی ارائه میدهد:
مدیریت عالی وقفهها
آزمایشهای اولیه نشان داد که پلتفرم یادگیری زبان Speak با استفاده از GPT-Live-1، کاهش نزدیک به ۸۰ درصدی وقفهها در مکثهای فکری را تجربه کرده است.
سفارشیسازی و انعطافپذیری
توسعهدهندگان میتوانند از طریق اعلانهای سیستمی (system prompts)، لحن، ریتم و سبک مکالمه عامل را سفارشی کنند. این مدل قادر به مدیریت کامل نویز پسزمینه و سکوت است و آن را برای خدماتی مانند پشتیبانی تلفنی مشتریان، رزرو رستوران و مکالمات طولانی ایدهآل میسازد. در تستهای استاندارد، عملکرد بسیار خوبی در ترکیب با GPT-6 Astra نشان داده است.
دسترسی و بازخورد صنعت
GPT-Live-1 اکنون به طور کامل در API موجود است و هزینه لایه صوتی آن ۵ سنت در دقیقه است. شرکای صنعتی مانند Yelp و Intercom تأیید کردهاند که این مدل دقت تعویض نوبت را به طور قابل توجهی بهبود بخشیده و امکان مکالمات صوتی هوش مصنوعی طبیعی و روان، مشابه تعاملات رو در رو با انسان را فراهم میآورد.
source: