Gander на Tencent поддържа непрекъснат гласов диалог по време на фонови задачи

Изображение: Svetni.me / Авторско изображение
Китайският технологичен конгломерат Tencent публикува изследване за новия си гласов модел Gander, който преодолява ключов недостатък на съвременните гласови асистенти – замръзването на разговора по време на изчислителни операции, съобщава The Decoder [1].
Конвенционалните гласови модели прекъсват аудио връзката или налагат дълги паузи, докато търсят в мрежата или изпълняват софтуерни задачи. Архитектурата на Gander позволява поддържането на естествен непрекъснат диалог с потребителя, паралелно с фоновото изпълнение на сложни процеси [1].

Изображение: Svetni.me / ИИ генерирана инфографика
Разделяне на комуникационния и изпълнителния поток
За да постигнат това поведение, инженерите на Tencent разделят системата на два независими, но координирани слоя. Единият модул отговаря за гласовата мултимодалност и обратната връзка в реално време, докато вторият функционира като специализиран ИИ агент за обработка на данни.
Когато потребителят поиска комплексна справка или резервация, Gander потвърждава заявката и продължава разговора, задавайки уточняващи въпроси или обсъждайки съпътстващи теми [1]. След като фоновият процес приключи, асистентът плавно интегрира резултата в диалога.
Практическо приложение в интелигентните устройства
Разработката открива нови възможности за автомобилни навигационни системи, умни очила и домашни роботи, където внезапните паузи в комуникацията влошават потребителското преживяване.
Tencent демонстрира, че разделянето на диалоговата латентност от времето за изпълнение на външни заявки създава значително по-интуитивно усещане за интеракция с машината, доближавайки я до естествената човешка реч.
Източници:
[1]: Tencent's Gander aims to keep talking while it works in the background - The Decoder