Классический NLP без обучения сжимает промпты на 40%: новый подход к снижению затрат на LLM

Исследователи представили детерминированный пайплайн лексического сжатия промптов, не требующий обучения и GPU. Метод позволяет сократить токены на 40% с минимальной потерей качества ответа, используя только CPU и классические NLP-преобразования.

Открыть материал →