Запись архива

TAPR: RL-переписчик промптов для LLM заявляет рост на Natural Questions и GSM8K

Новый arXiv-препринт TAPR: отдельная модель на базе Phi-4-mini переписывает пользовательские промпты под задачу через GRPO и LLM-as-judge. Заявлен стабильный прирост точности, код открыт.

Схема работы TAPR: переписывание пользовательского промпта для улучшения ответа LLM
Схема работы TAPR: переписывание пользовательского промпта для улучшения ответа LLM
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что произошло

На arXiv выложен препринт TAPR (Task-Aware Prompt Rewriter). Авторы предлагают отдельную модель, которая переписывает запрос пользователя в более эффективный вид, ориентируясь на тип задачи: ответы на вопросы, суммаризация, арифметические рассуждения. Целевая LLM затем работает уже с оптимизированным промптом. Модель обучается через RL с GRPO, а награда выставляется LLM-as-judge — оцениваются и сам переписанный промпт, и итоговый ответ модели.

Почему это обсуждают

Формулировка промпта остается главным барьером для неэкспертов. TAPR пытается убрать эту ручную работу и перенести ее на отдельную обученную модель. В отличие от универсальных переписывателей, TAPR учитывает задачу, а это заметно влияет на результат. Направление автоматической оптимизации промптов активно развивается, поэтому подход с GRPO и LLM-as-judge привлекает внимание.

Что подтверждено

В статье заявлены стабильные улучшения на QA, суммаризации и арифметике. База — Phi-4-mini-instruct; переписанные промпты получаются более ясными и инструктивными. Авторы сообщают о росте точности на Natural Questions и GSM8K. Код открыт на GitHub, что позволяет проверить заявления.

Что осталось проверить

Независимых воспроизведений пока нет. Не до конца ясны расходы на LLM-as-judge при масштабировании, поведение на длинных и неанглийских промптах, сравнение с другими методами переписывания. Стоит следить за дополнениями в репозитории и сторонними тестами.

Punkt Detail
Суть Переписывание промптов под задачу
Метод GRPO + LLM-as-judge
Базовая модель Phi-4-mini-instruct
Бенчмарки Natural Questions, GSM8K
Роль в пайплайне Перед целевой LLM

Источники: препринт — https://arxiv.org/abs/2607.28657 ; код — https://github.com/OliverSavolainen/task-specific-prompt-rewriter ; проверка статуса и обновлений — https://github.blog/