Запись архива

FinProBench: как оценивать финансовых ИИ-агентов по стандартам профессионалов

Препринт FinProBench предлагает строить рубрики оценки для финансовых ИИ-агентов на основе реальных профессиональных deliverables. Для узких ролей это заметно эффективнее обычных промптов.

Схема оценки финансового ИИ-агента по профессиональным стандартам
Схема оценки финансового ИИ-агента по профессиональным стандартам
Kurdish people protest against the Turkiish government at Hay Hill, Norwich | by Roger Blackwell | openverse | by

Что произошло

На arXiv появился препринт FinProBench — бенчмарка для оценки финансовых ИИ-агентов. Авторы предлагают метод RGRC (Role-Grounded Rubric Construction): рубрики оценки строятся не из промптов или выходов моделей, а из реальных рабочих артефактов профессионалов. В FinProBench собрано 1 723 экспертных deliverables по 57 профессиям, 8 финансовым суб-отраслям и 161 типу deliverables; стартовый оценочный набор — 20 задач на 20 ролей в 7 суб-отраслях.

Почему это важно

Вопрос не в том, умеет ли модель писать «похоже на аналитика», а в том, соответствует ли результат неявным профессиональным стандартам. Авторы разделили 57 профессий на 30 «обычных» ролей с богатым контекстом в обучающих данных и 27 узкоспециализированных. Для обычных ролей простой промптинг почти догнал RGRC (89.2% против 90.7%), а для специализированных — проиграл (78.0% против 99.1%). Это эмпирический аргумент: когда стандарт не представлен в данных, нужна профессиональная привязка, а не инженерия промптов.

Что подтверждено и что неясно

Punkt Detail
Статус Препринт arXiv:2608.04077v1, анонс new, рецензирование не указано
Данные 1 723 артефакта, 57 профессий, 8 суб-отраслей, 161 тип
Оценка Человеческие deliverables в среднем 73.7 против 70.3–69.6 у четырёх систем; доверительные интервалы перекрываются
Экономия Повторное использование рубрик на уровне роли сокращает затраты на их построение примерно в 6.7 раза
Полнота Выложен только начальный оценочный набор (20 задач); полный набор, код и сами рубрики нужно проверять отдельно

Стоит следить

Неясно, опубликуют ли авторы код и рубрики, как именно устроены гетерогенные LLM-судьи и останется ли RGRC применимым вне финансов. Это препринт: выводы основаны на авторских экспериментах, независимая проверка ещё впереди.

Источник: https://arxiv.org/abs/2608.04077
Lead для проверки: https://arxiv.org/