
Исследователи изучили, как адаптировать системы распознавания речи к детским голосам, не ухудшая распознавание взрослой речи. В работе на arXiv сравниваются полное дообучение, LoRA и слияние весов моделей после адаптации; эксперименты охватывают арабский и английский языки.
Проблема в том, что ASR-модели нередко хуже распознают детскую речь и речь неносителей языка, чем взрослую речь. Но дообучение на детских записях может снизить качество на взрослых голосах — этот компромисс авторы и измеряют.
Как сравнивали подходы
В исследовании использованы модели трёх типов: encoder–decoder, encoder–CTC и системы распознавания на основе AudioLLM. Данные включают арабскую речь детей — носителей и неносителей языка, английский детский корпус MyST, а также взрослые тестовые наборы MGB-2 и LibriSpeech test-clean.
Качество оценивали по WER — доле ошибок в распознанных словах. Помимо неё авторы ввели показатели, позволяющие сопоставить выигрыш на детской речи с сохранением качества на взрослой: Retention Index, Child Adaptation Gain и Adaptation Recovery.
Что показали результаты
По выводам авторов, адаптация необходима, особенно для английской детской речи и арабской речи детей-неносителей. Однако прямое дообучение часто ухудшает распознавание взрослой речи. Обучение сразу на нескольких языках оказалось стабильнее, чем адаптация только к одному языку.
Слияние весов нередко улучшало баланс между адаптацией и сохранением исходных навыков — особенно для encoder–CTC, Whisper и AudioLLM-систем. Вариант LERP чаще сохранял качество на взрослых голосах, а TIES позволял получить более выраженный выигрыш на детской речи. Но универсального победителя нет: для encoder–decoder-модели лучшее значение обычного WER на детской речи дало прямое двуязычное дообучение.
Практический вывод и ограничения
Для разработчиков речевых систем результат важен как напоминание: улучшение на целевой группе само по себе не гарантирует, что модель не стала хуже на прежних данных. Сравнивать методы стоит на обеих группах голосов, а выбор между дообучением и слиянием зависит от архитектуры и приоритета — максимальной адаптации или сохранения взрослого качества.
Это эмпирическое сравнение на конкретных языках, наборах данных и архитектурах, а не доказательство того, что слияние весов всегда лучше. В представленном описании также нет численных значений WER, поэтому оценить размер выигрыша по нему нельзя.
Источники










