Запись архива

CORVUS: синхронизация контекста для LLM-агентов кода — меньше токенов, меньше циклов

Новая архитектура траекторий CORVUS для LLM-агентов кода, представленная на arXiv, устраняет проблему «устаревших снимков» файлов в истории агента. Результат: до 50% меньше входных токенов, до 37% меньше циклов рассуждений при сохранении точности.

Схема архитектуры CORVUS для синхронизации контекста кодинг-агентов
Схема архитектуры CORVUS для синхронизации контекста кодинг-агентов
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что произошло

На arXiv опубликована статья CORVUS: Context Optimization and Reduction Via Underlying Synchronization. Авторы предлагают альтернативу стандартной «append-only» траектории (протоколу действий агента), в которой каждое чтение файла создаёт статичную копию его содержимого в хронологии. Проблема: при редактировании файлов агентом или человеком такие копии устаревают, вызывая ошибки рассуждений и избыточные повторные чтения. CORVUS заменяет их синхронизированным реестром файлов, чьё содержимое подтягивается актуальным на каждом шаге.

Почему это обсуждают

Проблема «разрастания контекста» — одна из ключевых для практических кодинг-агентов. Современные агенты (Cline, CodeAct, OpenHands) страдают от дублирования содержания одних и тех же файлов в истории. CORVUS предлагает структурное решение: не хранить снапшоты, а держать реестр файлов и подставлять их текущую версию при каждом вызове модели. Это принципиально иной дизайн, а не просто усечение контекста.

Что подтверждено

Исследователи протестировали CORVUS на SWE-PolyBench Verified и SWE-Bench Pro для четырёх моделей (конкретные не указаны). Результаты:

Punkt Detail
Сокращение входных токенов 9–50% в среднем на задачу
Сокращение длина финального промпта 15–32%
Сокращение циклов рассуждений до 37%
Частота прохождения (pass rate) сопоставима с baseline

Метрики получены на наборах задач по исправлению ошибок в реальных репозиториях. Работа прошла рецензирование в процедуре arXiv cs.LG.

Что остаётся неясным

Архитектура описана на уровне концепции и прототипа; код не опубликован (на момент сигнала). Не раскрыто, какие именно LLM тестировались, и как CORVUS ведёт себя в долгоживущих сессиях с множеством файлов. Также не указано влияние на время выполнения – экономия токенов может частично нивелироваться дополнительными запросами к реестру.

Что проверить дальше

Стоит следить за репозиторием проекта (если появится), а также за тестами на более сложных бенчмарках вроде SWE-Bench LITE. Практикам полезно сравнить CORVUS с существующими подходами: Agentic RAG, самоконтейнирование контекста и sliding window.

Источник: оригинальная статья на arXiv https://arxiv.org/abs/2607.22711
Верификация: страница arXiv Labs https://arxiv.org/