Пряма обробка звукового сигналу без текстового ланцюжка
Британсько-американська компанія PolyAI випустила голосову модель Dialog-RSN-1, розроблену для миттєвої взаємодії з людьми телефоном. На відміну від класичних систем, новий алгоритм працює напряму з аудіопотоком, не витрачаючи час на перетворення мови у текст і зворотну генерацію голосу.
Традиційні голосові боти виконують три послідовні кроки: розпізнавання мовлення, обробка через мовну модель та синтез голосу. Саме через таку архітектуру виникає відчутна пауза в 1-2 секунди, яка руйнує природність діалогу. Алгоритм Dialog-RSN-1 сприймає звукову хвилю як єдиний масив даних і формує відповідь за кілька мілісекунд.
Аналіз інтонацій та реакція на паузи в розмові
Прямий аналіз аудіо дає змогу нейромережі враховувати параметри, які втрачаються під час текстової транскрипції. Нейромережа аналізує гучність, висоту тону, зітхання та емоційне забарвлення мовлення співрозмовника.
Розробники PolyAI виділяють кілька ключових технологічних можливостей моделі:
- Миттєва зупинка мовлення, якщо людина перебиває асистента на пів слова;
- Розпізнавання роздратування або нерішучості в голосі для корекції тону відповіді;
- Збереження контексту розмови навіть у разі фонового шуму або нечіткої вимови;
- Скорочення затримки відповіді до рівня 200 мілісекунд, що відповідає швидкості людського спілкування.
Виконавчий директор PolyAI Нікола Мршич зазначив: «Ми прибрали бар'єр між сприйняттям звуку та мисленням алгоритму, зробивши машинний діалог невідрізненним від живої розмови».
Що означає поява Dialog-RSN-1 для звичайних користувачів
Впровадження таких систем розв'язує головну проблему телефонних служб підтримки — роздратування клієнтів від спілкування з забудькуватими роботами. Асистент на базі Dialog-RSN-1 здатний підлаштовувати темп розмови під співрозмовника, вчасно замовкати й уловлювати приховану іронію або тривогу.
У перспективі ця технологія вийде за межі call-центрів і стане основою для персональних голосових помічників у смартфонах, автомобілях та розумних будинках. Люди отримають співрозмовників, які сприймають не лише значення слів, а й емоційний стан людини в момент звернення.