
Что произошло
На arXiv выложен препринт TAPR (Task-Aware Prompt Rewriter). Авторы предлагают отдельную модель, которая переписывает запрос пользователя в более эффективный вид, ориентируясь на тип задачи: ответы на вопросы, суммаризация, арифметические рассуждения. Целевая LLM затем работает уже с оптимизированным промптом. Модель обучается через RL с GRPO, а награда выставляется LLM-as-judge — оцениваются и сам переписанный промпт, и итоговый ответ модели.
Почему это обсуждают
Формулировка промпта остается главным барьером для неэкспертов. TAPR пытается убрать эту ручную работу и перенести ее на отдельную обученную модель. В отличие от универсальных переписывателей, TAPR учитывает задачу, а это заметно влияет на результат. Направление автоматической оптимизации промптов активно развивается, поэтому подход с GRPO и LLM-as-judge привлекает внимание.
Что подтверждено
В статье заявлены стабильные улучшения на QA, суммаризации и арифметике. База — Phi-4-mini-instruct; переписанные промпты получаются более ясными и инструктивными. Авторы сообщают о росте точности на Natural Questions и GSM8K. Код открыт на GitHub, что позволяет проверить заявления.
Что осталось проверить
Независимых воспроизведений пока нет. Не до конца ясны расходы на LLM-as-judge при масштабировании, поведение на длинных и неанглийских промптах, сравнение с другими методами переписывания. Стоит следить за дополнениями в репозитории и сторонними тестами.
| Punkt | Detail |
|---|---|
| Суть | Переписывание промптов под задачу |
| Метод | GRPO + LLM-as-judge |
| Базовая модель | Phi-4-mini-instruct |
| Бенчмарки | Natural Questions, GSM8K |
| Роль в пайплайне | Перед целевой LLM |
Источники: препринт — https://arxiv.org/abs/2607.28657 ; код — https://github.com/OliverSavolainen/task-specific-prompt-rewriter ; проверка статуса и обновлений — https://github.blog/