
На arXiv вышла статья DuplexSpeechBench-IFEval (DSB-IFEval) — новый бенчмарк для оценки способности full-duplex голосовых агентов следовать неявным инструкциям, выводимым из роли или персоны, а не заданным явно. В отличие от существующих тестов, которые проверяют явные команды управления репликой (когда начинать, перебивать, отвечать), DSB-IFEval имитирует реальную эксплуатацию: агент настраивается через описание роли, а нужное поведение должен вывести сам.
Что такое DSB-IFEval
Набор включает 1038 тестовых сценариев, охватывающих восемь различных ролей ассистента (помощник, секретарь, наставник и другие). Для каждой роли определено пять протоколов следования инструкциям:
– дефолтное поведение (без дополнительных указаний);
– явные поведенческие инструкции (например, «всегда перебивай, если пользователь замолкает»);
– поведение, подразумеваемое персоной (только описание роли);
– комбинированное — персона плюс явные правила;
– конфликт инструкций (противоречащие друг другу указания).
Для оценки используются две метрики: Instruction Adherence Score (IAS) — детерминированная проверка корректности управления диалогом (взятие паузы, перебивание, уступка), и Persona Adherence Score (PAS) — оценка согласованности содержания ответов с персоной, выставляемая LLM-судьёй.
Как тестировали
Авторы протестировали шесть real-time речевых систем. В статье подробно описаны пять: F-Actor, PersonaPlex, GPT-Realtime, MiniCPM-o и Fun-Audio-Chat. Каждая система проходила все 1038 сценариев, фиксировались значения IAS и PAS.
Результаты и архитектурные компромиссы
Главный вывод: успех следования неявным инструкциям сильно зависит от архитектуры модели.
| Система | Чувствительность к явности инструкций | Адаптация поведения пола | Следование содержанию персоны |
|---|---|---|---|
| F-Actor | Высокая (падение IAS на 9.7% при персона-только) | Средняя | Хорошая |
| PersonaPlex | Средняя (падение на 4.5%) | Средняя | Хорошая |
| GPT-Realtime | Низкая (IAS стабилен) | Нет | Отличная |
| MiniCPM-o | Низкая | Нет | Отличная |
| Fun-Audio-Chat | Низкая | Нет | Отличная |
Полнодуплексные модели F-Actor и PersonaPlex более чувствительны к тому, задано ли поведение явно или выводится из персоны. При переходе на персона-только их adherence падает на 9.7% и 4.5% соответственно. В то же время GPT-Realtime, MiniCPM-o и Fun-Audio-Chat отлично удерживают содержание, соответствующее персоне, но их поведение по управлению диалогом (пола, перебивание) не адаптируется под разные протоколы и остаётся ограниченным по ряду проактивных действий.
Особенно интересен тест на конфликт инструкций. Даже когда системы надежно следуют предписанной персоне, они с трудом переопределяют её при конфликте с соображениями безопасности. Это указывает на то, что инференция поведения из роли, его исполнение в нужный момент диалога и разрешение конкурирующих команд — три разных вызова для современных голосовых агентов.
Почему это важно
На практике full-duplex агенты редко настраиваются через десятки явных правил — чаще используется описание роли («ты вежливый секретарь», «ты строгий наставник»). DSB-IFEval впервые систематически измеряет, насколько хорошо агент может вывести из такой роли конкретные паттерны поведения (когда перебить, когда промолчать, когда предложить помощь). Бенчмарк выявляет разрыв между пониманием роли на уровне контента и её исполнением в реальном времени.
Ограничения
Тесты проводятся на английском языке; мультиязычные сценарии не рассматриваются. Метрика PAS использует LLM-судью, что может вносить субъективность и зависимость от выбранной модели-оценщика. Также неясно, как масштабируются результаты на более длинные диалоги и нестандартные роли.
Источники
– Оригинальная статья: arXiv:2609.03423 — DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents (https://arxiv.org/abs/2609.03423)
