
Что произошло
На arXiv опубликована работа, предлагающая принципиально иной подход к сжатию промптов для больших языковых моделей. Вместо обучения вспомогательных моделей (как в LLMLingua или Selective Context) авторы собрали детерминированный пайплайн из 11 классических лексических преобразований, работающий исключительно на CPU.
Суть метода
Пайплайн включает набор переключаемых операций: удаление стоп-слов, удаление слов-паразитов, замена сокращений и аббревиатур, обрезка на основе частей речи, лемматизация, замена синонимов через WordNet и обязательное сохранение именованных сущностей. Все 15 конфигураций протестированы на 1242 англоязычных промптах из шести датасетов (Dolly-15k, LMSYS-Chat-1M, WildChat-1M, MMLU, GSM8K, HellaSwag), охватывающих одиннадцать категорий задач.
Ключевые результаты
Максимальная конфигурация достигает среднего сокращения токенов на 40,3% (стандартное отклонение 9,2%) при BERTScore-F1 0,876 относительно ответов на исходных промптах. Простая конфигурация только с удалением стоп-слов дает 29,6% сжатия при BERTScore-F1 0,913.
| Конфигурация | Сжатие токенов | BERTScore-F1 |
|---|---|---|
| Только стоп-слова | 29,6% | 0,913 |
| Максимальная | 40,3% | 0,876 |
Почему это важно
Основное преимущество — полная детерминированность и отсутствие необходимости в GPU. В отличие от методов на основе обученных моделей, этот пайплайн гарантирует воспроизводимость результата и может работать на любом оборудовании. Это критично для production-сред, где важны предсказуемость и низкая задержка.
Практические ограничения
Метод протестирован только на английских промптах. Commonsense reasoning оказался систематическим уязвимым местом при агрессивном сжатии — качество ответов на задачи здравого смысла падает заметно быстрее. Кроме того, авторы используют GPT-4o-mini для оценки качества, что может не отражать поведение других моделей. Пайплайн не учитывает семантику — только лексику.
Вывод
Работа показывает, что классический NLP без какого-либо обучения способен конкурировать с обученными методами сжатия промптов, особенно в сценариях, где важны детерминированность и низкие вычислительные затраты. Код и все результаты опубликованы для воспроизведения.
Источники
— Оригинальная статья на arXiv: 2609.13154
— Репозиторий с кодом: указан в статье
— Дата публикации: 15 сентября 2026
