Запись архива

Legora проверила 41 финансовый документ с GPT-6 Astra

Агент Legora за минуты сверил 41 документ и нашёл четыре заложенные ошибки. Почему 40% улучшения относится только к одному сценарию, а не ко всей юридической работе.

AI-система проверяет стопку финансовых документов и отмечает четыре расхождения

Платформа Legora прогнала GPT-6 Astra через реальную по форме, но контролируемую задачу: сверку финансовой отчётности по 41 документу. Агент завершил проход за несколько минут и нашёл все четыре заранее внесённые ошибки, включая расхождение на £500 000 в примечании о выручке. Самое важное здесь не скорость чтения, а способность сохранить связи между десятками документов и оставить специалисту журнал каждой проверки.

Кейс опубликован OpenAI совместно с клиентом, поэтому цифры нельзя считать независимым аудитом модели. Однако Legora сообщила не только сильный результат, но и показатель, который охлаждает хайп: в выбранном workflow прирост относительно предыдущей модели составил почти 40%, а в среднем по всем заданиям внутреннего бенчмарка BAR — около 3%.

Что произошло

Financial-statement tie-out — это построчная сверка черновой отчётности с оборотно-сальдовой ведомостью, консолидационным графиком и данными прошлого года. Человеку такая работа может занять вечер или несколько дней. Ошибка опасна не только величиной: она может прятаться в примечании, сноске или несогласованной версии таблицы.

Legora загрузила в один запуск агента 41 документ. Система сравнила балансы с подтверждающими графиками, отметила разрывы и сохранила запись по каждому пункту. В тестовые данные заранее внесли четыре ошибки. Astra нашла все четыре, сохранила проверки, которые предыдущая модель выполняла правильно, и, по данным компании, провела примерно на 50 проверок больше.

Демонстрация Legora и OpenAI: агент сверяет финансовую отчётность, решение остаётся за человеком.

Почему это обсуждают

Юридические и финансовые задачи долго считались неудобными для агентов: цена пропущенной цифры высока, документы велики, а правильный ответ должен сопровождаться доказуемым маршрутом. Здесь модель не просто выдала резюме, а сформировала проверяемый первый проход. Специалист может открыть конкретное расхождение и решить, является ли оно ошибкой, допустимым округлением или особенностью раскрытия.

Такой формат меняет экономику внедрения. AI не обязан заменять профессиональное суждение, чтобы окупиться. Если система снимает механическое сопоставление строк, а человек тратит время на исключения, ценность появляется даже при обязательной финальной проверке. Для регулируемой отрасли это реалистичнее обещания полностью автономного «AI-юриста».

Одновременно разница между 40% в одном сценарии и 3% по всей батарее показывает, насколько опасно переносить локальный успех на продукт целиком. Модель может резко улучшить работу с длинной финансовой связностью и почти не изменить другие юридические операции.

Что подтверждено

  • В одном запуске агент обработал 41 документ и, по данным Legora, завершил работу за минуты.
  • Найдены четыре из четырёх заранее заложенных ошибок, включая разрыв на £500 000.
  • В узком сценарии финансовой сверки Legora измерила почти 40% улучшения относительно предыдущей модели.
  • Средний прирост по всем заданиям Legora Benchmark for Agentic Reasoning составил около 3%.
  • Финальное решение сознательно оставлено юридическому или финансовому специалисту.

Утверждения относятся к системе Legora, где модель окружена интерфейсом, правилами и инструментами компании. Они не означают, что загрузка 41 файла в обычный чат даст тот же результат.

Что пока не ясно

Legora не опубликовала полный набор документов, точную методику BAR, промпты и логи всех прогонов. Не указаны число повторов, доля ложных тревог, стоимость сессии и время экспертной проверки ответа. Четыре намеренно внесённые ошибки — полезный контроль, но слишком малая выборка для оценки редких отказов.

До производственного использования нужны проверки на документах с плохим сканированием, конфликтующими версиями, нестандартными таблицами и неполными приложениями. Особенно важно измерять не только recall — сколько ошибок найдено, — но и precision: сколько отмеченных проблем окажутся настоящими. Десятки ложных тревог способны вернуть человеку всю сэкономленную работу.

Безопасная схема остаётся консервативной: доступ только к копиям, журнал источников для каждого числа, запрет на отправку и изменение документов, обязательное подтверждение специалиста и выборочная двойная проверка.

Где смотреть

Все приведённые показатели и видео находятся в официальном кейсе OpenAI и Legora. Возможности модели и ограничения API — в карточке GPT-6 Astra для разработчиков.

Для сравнения с другими ранними тестами откройте наш экспертный обзор Astra. Главный вывод для финансового отдела: пилотировать стоит конкретный процесс с известными ошибками и человеческой приёмкой, а не абстрактную «работу с документами».