Запись архива

Оценка влияния промптов и демонстраций на перевод локальными LLM (arXiv)

Исследователи сравнили локальные LLM в задачах перевода, тестируя single-target и family-scope промпты, а также разные стратегии few-shot обучения. Результаты: dedicated MT системы остаются сильнее, но грамотный выбор промпта и примеров может улучшить качество перевода на средних LLM.

Схематичное изображение LLM, переводящей текст на несколько языков с разными стратегиями промптов.
Схематичное изображение LLM, переводящей текст на несколько языков с разными стратегиями промптов.
Student Studying in ACES Library (11056363313).jpg | by University of Illinois Library | wikimedia_commons | CC BY 2.0

Что случилось

На arXiv появился препринт, посвящённый практическому тестированию локальных LLM в задачах машинного перевода. Авторы намеренно отходят от стандартного сценария «один промпт — один язык» и изучают, как влияют разные форматы запросов на итоговое качество. В центре внимания — scope промпта (один язык против семейства языков в JSON) и стратегии few-shot выбора демонстраций.

Подтверждённые детали

Эксперименты проводились на полном датасете FLORES devtest (9 официальных языков ЕС, романская и германская группы). Сравнивались три локальные LLM — llama3.2:3b, mistral:latest и qwen2.5:14b — против базовых систем OPUS-MT и NLLB-200. Исследователи тестировали zero-shot и k=5 few-shot с разными стратегиями отбора примеров: случайной, лексической и на основе эмбеддингов.

Punkt Detail
Модели llama3.2:3b, mistral:latest, qwen2.5:14b
Базовые линии OPUS-MT, NLLB-200
Языки 9 языков ЕС (романская и германская группы)
Типы промптов Single-target, Family-scope (JSON)
Few-shot стратегии random, lexical-similarity, embedding-similarity

Ключевой вывод: dedicated MT системы остаются сильнее, особенно для германских языков. Few-shot помогает mistral:latest и qwen2.5:14b, но вредит llama3.2:3b. Среди методов отбора эмбеддинги дают лучший результат, хотя преимущество над случайным выбором невелико.

Что остаётся неясным

Работа опубликована как препринт, поэтому данные, код и полные метрики пока не доступны для независимой верификации. Не раскрываются конкретные модели эмбеддингов, использованные для отбора демонстраций, и степень вариативности результатов при повторении экспериментов. Также неясно, как ведут себя более крупные локальные модели (например, 70B) в семейных промптах.

На что обратить внимание

Статья поднимает важный для разработчиков вопрос: при настройке пайплайнов перевода на локальных LLM стоит учитывать не только модель, но и структуру промпта. Family-scope промпты с JSON — это удобно, но маленькие модели могут с ними не справиться. Для production-задач лучше ориентироваться на dedicated MT системы, а LLM оставить для сценариев, где нужна гибкость или постобработка.

Источник: arXiv:2607.26286
Verification lead: https://mistral.ai/news/