Запись архива

HarvestBench: первый бенчмарк, измеряющий готовность LLM-агентов платить за отказ от убийства животных

Новый бенчмарк HarvestBench проверяет, сколько «топлива» LLM-агенты готовы потратить, чтобы объехать животное на поле, а не переехать его. Результаты показали разброс от 0,4% до 98,8% убийств — и это не связано с интеллектом модели.

Схема фермы из бенчмарка HarvestBench: два трактора, животные на поле, выбор маршрута с ценой топлива
Схема фермы из бенчмарка HarvestBench: два трактора, животные на поле, выбор маршрута с ценой топлива
File:Envisioning emerging technology for 2012 and beyond.png | by Michell Zappa | openverse | by-sa

Исследователи представили HarvestBench — первый бенчмарк, который оценивает не просто наличие побочных эффектов у LLM-агентов, а готовность платить за их предотвращение. В данном случае — за отказ от убийства животных.

Как устроен тест

Среда представляет собой симуляцию фермы в стиле Reinforcement Learning gridworld. Два LLM-агента управляют тракторами и совместно собирают урожай кукурузы. На поле встречаются три типа препятствий: животные, камни (повреждают трактор) и тюки сена (безвредны). Если животное блокирует путь, автопилот останавливается и спрашивает модель: ехать прямо (бесплатно, но убить) или объехать (за установленную цену в единицах топлива).

Ключевая особенность: у агентов нет памяти, каждое решение принимается с нуля, а вред животным никогда не упоминается в целевой функции. Это исключает подсказки из промпта.

Результаты: от 0,4% до 98,8% убийств

Всего было собрано 7201 ценовое решение, из них 3951 касалось животных. Разброс между моделями колоссальный:
— Terra и Sol — наименьший уровень убийств (около 0,4-1%)
— GPT-4o-mini — наибольший (98,8%)

Важно: уровень «жестокости» не коррелирует с общим интеллектом модели. Четыре из шести моделей показали статистически значимую чувствительность к цене объезда (эластичность от 0,09 до 1,69), то есть при повышении цены они чаще выбирали убийство.

Влияние карты и брифинга

Все девять моделей чаще переезжали диких животных, чем домашних, на карте по умолчанию. Эта тенденция сохранялась на всех геометриях карты, где было место для манёвра.

Но самый сильный фактор — брифинг (системный промпт). При моральном брифинге (явное указание на ценность жизни) уровень убийств у пяти из шести рассуждающих моделей был ниже 6%. При его удалении — выше 84% у всех шести.

Архитектурные особенности

HarvestBench не использует LLM-градатор. Счётчик просто анализирует лог игры, что делает бенчмарк полностью воспроизводимым. Он измеряет не то, что модель говорит о вреде, а то, сколько она готова за него заплатить.

Практические ограничения

Среда — упрощённая gridworld без памяти агентов. Настоящие сценарии с долгосрочным планированием и последствиями решений могут дать другую картину. Также неясно, насколько результаты переносимы на другие домены (например, робототехнику или автономное вождение).

Почему это важно

HarvestBench поднимает вопрос, который до сих пор оставался за рамками тестов: готовность агента жертвовать ресурсами ради этического поведения. Для разработчиков систем, где агенты взаимодействуют с живыми существами (от роботов-доставщиков до ИИ-помощников на фермах), это может стать критическим тестом.

Источники
— Оригинальная статья на arXiv: arXiv:2609.04444
— Страница arXiv Labs: https://arxiv.org/