Запись архива

Emirati Arabic LLM-бенчмарк Alyah: оценка диалектов выявила слабость даже у лучших моделей

Исследователи из TII представили бенчмарк Alyah для оценки понимания эмиратского диалекта арабского языка. Тестирование 53 моделей показало, что даже лучшие LLM значительно уступают носителям в распознавании идиом, повседневных выражений и культурно обусловленных смыслов.

Обложка COMRAD404 — логотип бенчмарка Alyah на фоне карты ОАЭ и графики распределения категорий вопросов
Обложка COMRAD404 — логотип бенчмарка Alyah на фоне карты ОАЭ и графики распределения категорий вопросов
Изображение из исходного материала

27 января 2026 года команда Technology Innovation Institute (TII, Абу-Даби) опубликовала на Hugging Face бенчмарк Alyah (الياه, «Полярная звезда» на эмиратском диалекте) — первый целенаправленный набор данных для оценки способности больших языковых моделей (LLM) понимать эмиратский диалект арабского языка. Результаты тестирования 53 моделей, включая Jais, Allam, Qwen, LLaMA, Fanar и AceGPT, показали, что ни одна из них не приближается к уровню носителя: наиболее сложные категории — повседневные выражения и языковые нюансы — остаются практически нерешённой задачей.

Проблема диалектов в оценке арабских LLM

Арабский язык, на котором говорят сотни миллионов человек в более чем двадцати странах, не является монолитным. Наряду с литературным арабским (Modern Standard Arabic, MSA) существует множество региональных диалектов, значительно различающихся по лексике, синтаксису, фонетике и культурной привязке. Именно диалекты служат основным средством повседневного общения, устного storytelling, поэзии и социального взаимодействия. Однако существующие бенчмарки для арабских LLM, такие как ArabicMMLU, ARAT или ORCA, фокусируются почти исключительно на MSA, оставляя диалектную арабскую речь без должной оценки. Модель, отлично работающая с формальными новостными текстами, может полностью провалить понимание простого приветствия или идиомы на местном диалекте.

Структура и сбор данных Alyah

Бенчмарк Alyah содержит 1173 тщательно отобранных примера, каждый из которых представляет собой вопрос с множественным выбором (четыре варианта, один правильный). Все примеры собраны вручную от носителей эмиратского диалекта, что гарантирует лингвистическую аутентичность и культурную обоснованность. Дистракторы (неправильные варианты) были сгенерированы с помощью LLM, но затем проверены редакторами на правдоподобие и семантическую близость к правильному ответу. Для исключения позиционного смещения правильный ответ распределён по случайным индексам.

Данные охватывают широкий спектр категорий: от повседневных выражений и приветствий до культурно чувствительных тем, образной речи, пословиц и отсылок к эмиратской поэзии. Разработчики намеренно тестируют не поверхностное лексическое знание, а способность модели интерпретировать культурно обусловленные смыслы, прагматику употребления и диалектные нюансы.

Результаты: кто справился, а кто провалился

В ходе эксперимента были оценены 53 модели (22 базовые и 31 инструктивно-настроенная), представляющие разные архитектуры и подходы к обучению. Среди них — арабоязычные LLM (Jais, Allam), мультиязычные модели с сильной поддержкой арабского (Qwen, LLaMA) и регионально адаптированные системы (Fanar, AceGPT).

Основные выводы:

  • Инструктивно-настроенные модели превосходят базовые, особенно в категориях «Этикет и ценности» и «Образная речь». Это подтверждает гипотезу о том, что дообучение на инструкциях помогает модели лучше улавливать контекст и социальные нормы.
  • Наиболее сложными категориями для всех моделей оказались «Язык и диалект» (Language and Dialect) и «Приветствия и повседневные выражения» (Greetings and Daily Expressions). Это объясняется тем, что эмиратский диалект в основном является устным, а не письменным, и его особенности редко встречаются в обучающих данных.
  • Ни одна модель не показала приемлемого уровня для практического использования в диалектной среде. Даже лучшие результаты далеки от точности, ожидаемой от носителя языка.

Авторы отмечают, что результаты следует рассматривать как референсные измерения в рамках Alyah, а не как абсолютный рейтинг по всем арабским бенчмаркам.

Ограничения и значение для разработчиков

Бенчмарк Alyah — важный шаг к более репрезентативной оценке арабских LLM. Однако у него есть ограничения, которые необходимо учитывать:

  • Охват только одним диалектом. Эмиратский диалект — лишь один из многих десятков арабских диалектов. Результаты не экстраполируются на египетский, левантийский или магрибский арабский.
  • Формат множественного выбора. Хотя он удобен для автоматической оценки, он не отражает реальную способность модели генерировать связный диалектный текст или вести диалог.
  • Синтетические дистракторы. Хотя они были проверены, генерация неправильных вариантов с помощью LLM может вносить систематические смещения.

Что это меняет для разработчиков и пользователей

Выбор модели для арабоязычных продуктов. Если ваше приложение ориентировано на пользователей из ОАЭ или региона Персидского залива, стандартные бенчмарки по MSA недостаточны. Необходимо проводить дополнительное тестирование на диалектных данных, используя Alyah или аналогичные наборы.
2. Необходимость диалектных данных. Результаты подчёркивают критическую нехватку качественных диалектных данных в обучающих корпусах. Разработчикам, желающим улучшить диалектную компетенцию своих моделей, придётся инвестировать в ручной сбор и аннотацию таких данных, что является дорогостоящим и трудоёмким процессом.
3. Практическая проверка. Для команды Comrad404 практический вывод таков: если вы тестируете арабскую LLM для чат-бота или голосового ассистента в ОАЭ, не полагайтесь на общие бенчмарки. Запустите Alyah на своей модели — это займёт несколько часов, но даст гораздо более реалистичную картину её способности общаться с реальными пользователями.

Что дальше

Разработчики Alyah планируют расширять бенчмарк, добавляя новые диалекты и форматы заданий. Для сообщества это сигнал: диалектная компетенция LLM — не опциональное улучшение, а критически важное требование для реального развёртывания в арабоязычных регионах. Пока же пользователям и разработчикам стоит помнить: даже самая продвинутая модель, блестяще справляющаяся с литературным арабским, может оказаться беспомощной перед простым вопросом «كيف الحال؟» (как дела?), произнесённым с эмиратским акцентом и с использованием местных идиом.

Источники