
Что случилось
На arXiv появился препринт, посвящённый практическому тестированию локальных LLM в задачах машинного перевода. Авторы намеренно отходят от стандартного сценария «один промпт — один язык» и изучают, как влияют разные форматы запросов на итоговое качество. В центре внимания — scope промпта (один язык против семейства языков в JSON) и стратегии few-shot выбора демонстраций.
Подтверждённые детали
Эксперименты проводились на полном датасете FLORES devtest (9 официальных языков ЕС, романская и германская группы). Сравнивались три локальные LLM — llama3.2:3b, mistral:latest и qwen2.5:14b — против базовых систем OPUS-MT и NLLB-200. Исследователи тестировали zero-shot и k=5 few-shot с разными стратегиями отбора примеров: случайной, лексической и на основе эмбеддингов.
| Punkt | Detail |
|---|---|
| Модели | llama3.2:3b, mistral:latest, qwen2.5:14b |
| Базовые линии | OPUS-MT, NLLB-200 |
| Языки | 9 языков ЕС (романская и германская группы) |
| Типы промптов | Single-target, Family-scope (JSON) |
| Few-shot стратегии | random, lexical-similarity, embedding-similarity |
Ключевой вывод: dedicated MT системы остаются сильнее, особенно для германских языков. Few-shot помогает mistral:latest и qwen2.5:14b, но вредит llama3.2:3b. Среди методов отбора эмбеддинги дают лучший результат, хотя преимущество над случайным выбором невелико.
Что остаётся неясным
Работа опубликована как препринт, поэтому данные, код и полные метрики пока не доступны для независимой верификации. Не раскрываются конкретные модели эмбеддингов, использованные для отбора демонстраций, и степень вариативности результатов при повторении экспериментов. Также неясно, как ведут себя более крупные локальные модели (например, 70B) в семейных промптах.
На что обратить внимание
Статья поднимает важный для разработчиков вопрос: при настройке пайплайнов перевода на локальных LLM стоит учитывать не только модель, но и структуру промпта. Family-scope промпты с JSON — это удобно, но маленькие модели могут с ними не справиться. Для production-задач лучше ориентироваться на dedicated MT системы, а LLM оставить для сценариев, где нужна гибкость или постобработка.
Источник: arXiv:2607.26286
Verification lead: https://mistral.ai/news/
