
Что произошло
На arXiv появился препринт FinProBench — бенчмарка для оценки финансовых ИИ-агентов. Авторы предлагают метод RGRC (Role-Grounded Rubric Construction): рубрики оценки строятся не из промптов или выходов моделей, а из реальных рабочих артефактов профессионалов. В FinProBench собрано 1 723 экспертных deliverables по 57 профессиям, 8 финансовым суб-отраслям и 161 типу deliverables; стартовый оценочный набор — 20 задач на 20 ролей в 7 суб-отраслях.
Почему это важно
Вопрос не в том, умеет ли модель писать «похоже на аналитика», а в том, соответствует ли результат неявным профессиональным стандартам. Авторы разделили 57 профессий на 30 «обычных» ролей с богатым контекстом в обучающих данных и 27 узкоспециализированных. Для обычных ролей простой промптинг почти догнал RGRC (89.2% против 90.7%), а для специализированных — проиграл (78.0% против 99.1%). Это эмпирический аргумент: когда стандарт не представлен в данных, нужна профессиональная привязка, а не инженерия промптов.
Что подтверждено и что неясно
| Punkt | Detail |
|---|---|
| Статус | Препринт arXiv:2608.04077v1, анонс new, рецензирование не указано |
| Данные | 1 723 артефакта, 57 профессий, 8 суб-отраслей, 161 тип |
| Оценка | Человеческие deliverables в среднем 73.7 против 70.3–69.6 у четырёх систем; доверительные интервалы перекрываются |
| Экономия | Повторное использование рубрик на уровне роли сокращает затраты на их построение примерно в 6.7 раза |
| Полнота | Выложен только начальный оценочный набор (20 задач); полный набор, код и сами рубрики нужно проверять отдельно |
Стоит следить
Неясно, опубликуют ли авторы код и рубрики, как именно устроены гетерогенные LLM-судьи и останется ли RGRC применимым вне финансов. Это препринт: выводы основаны на авторских экспериментах, независимая проверка ещё впереди.
Источник: https://arxiv.org/abs/2608.04077
Lead для проверки: https://arxiv.org/