Новый бенчмарк DSB-IFEval оценил, как голосовые ИИ следуют неявным инструкциям

Научная группа опубликовала в архиве препринтов arXiv описание нового бенчмарка DuplexSpeechBench-IFEval (DSB-IFEval). Он предназначен для проверки способности голосовых ИИ-агентов следовать неявным инструкциям в реальном времени при полнодуплексном общении, когда нужно одновременно слушать, перебивать, поддерживать диалог и управлять очередностью реплик.

Существующие тесты в основном оценивают явные команды по управлению беседой. Однако в реальных продуктах агент часто настраивается через роль или персону, из которой нужное поведение нужно вывести самостоятельно. DSB-IFEval закрывает этот пробел, предлагая 1038 тестовых примеров и восемь различных амплуа ассистента.

Авторы выделили пять протоколов проверки: стандартное поведение, явные поведенческие инструкции, поведение, подразумеваемое персоной, комбинацию персоны и правил, а также конфликтующие указания. Для оценки используются две метрики: детерминированный балл соблюдения инструкций (IAS) и оценка согласованности с персоной (PAS) на основе суждений языковой модели.

В эксперименте приняли участие шесть систем реального времени. Выяснилось, что полнодуплексные модели F-Actor и PersonaPlex сильнее зависят от того, задано ли поведение явно или его нужно выводить из роли. При опоре только на персону точность соблюдения инструкций у них падает на 9,7% и 4,5% соответственно.

Другие системы — GPT-Realtime, MiniCPM-o и Fun-Audio-Chat — хорошо удерживают согласованность с персоной, но их поведение при управлении диалогом почти не меняется в зависимости от типа инструкции. Также эти модели оказались ограничены в ряде проактивных действий, например при инициативе говорящего.

Дополнительно тесты показали: даже если системы успешно следуют конфликтующим директивам, предписанным их роли, они с трудом отменяют их при конфликте с требованиями безопасности. Исследователи отмечают, что вывод поведения из роли, его реализация в нужный момент и разрешение противоречивых команд остаются отдельными сложными задачами для голосовых агентов.