Запись архива

Классический NLP без обучения сжимает промпты на 40%: новый подход к снижению затрат на LLM

Исследователи представили детерминированный пайплайн лексического сжатия промптов, не требующий обучения и GPU. Метод позволяет сократить токены на 40% с минимальной потерей качества ответа, используя только CPU и классические NLP-преобразования.

Диаграмма пайплайна лексического сжатия промптов с 11 преобразованиями
Диаграмма пайплайна лексического сжатия промптов с 11 преобразованиями
Three female students studying in the library at Mankato State Normal School, Mankato, Minnesota — DPLA — 0704e723ee935142bbde01e37e2cd7fb.jpg | by Snow, John R | wikimedia_commons | Public domain

Что произошло

На arXiv опубликована работа, предлагающая принципиально иной подход к сжатию промптов для больших языковых моделей. Вместо обучения вспомогательных моделей (как в LLMLingua или Selective Context) авторы собрали детерминированный пайплайн из 11 классических лексических преобразований, работающий исключительно на CPU.

Суть метода

Пайплайн включает набор переключаемых операций: удаление стоп-слов, удаление слов-паразитов, замена сокращений и аббревиатур, обрезка на основе частей речи, лемматизация, замена синонимов через WordNet и обязательное сохранение именованных сущностей. Все 15 конфигураций протестированы на 1242 англоязычных промптах из шести датасетов (Dolly-15k, LMSYS-Chat-1M, WildChat-1M, MMLU, GSM8K, HellaSwag), охватывающих одиннадцать категорий задач.

Ключевые результаты

Максимальная конфигурация достигает среднего сокращения токенов на 40,3% (стандартное отклонение 9,2%) при BERTScore-F1 0,876 относительно ответов на исходных промптах. Простая конфигурация только с удалением стоп-слов дает 29,6% сжатия при BERTScore-F1 0,913.

Конфигурация Сжатие токенов BERTScore-F1
Только стоп-слова 29,6% 0,913
Максимальная 40,3% 0,876

Почему это важно

Основное преимущество — полная детерминированность и отсутствие необходимости в GPU. В отличие от методов на основе обученных моделей, этот пайплайн гарантирует воспроизводимость результата и может работать на любом оборудовании. Это критично для production-сред, где важны предсказуемость и низкая задержка.

Практические ограничения

Метод протестирован только на английских промптах. Commonsense reasoning оказался систематическим уязвимым местом при агрессивном сжатии — качество ответов на задачи здравого смысла падает заметно быстрее. Кроме того, авторы используют GPT-4o-mini для оценки качества, что может не отражать поведение других моделей. Пайплайн не учитывает семантику — только лексику.

Вывод

Работа показывает, что классический NLP без какого-либо обучения способен конкурировать с обученными методами сжатия промптов, особенно в сценариях, где важны детерминированность и низкие вычислительные затраты. Код и все результаты опубликованы для воспроизведения.

Источники

— Оригинальная статья на arXiv: 2609.13154
— Репозиторий с кодом: указан в статье
— Дата публикации: 15 сентября 2026