
Anthropic объявила о запуске грантовой программы объемом $5 млн, направленной на финансирование независимых исследований того, как ИИ-системы влияют на благополучие пользователей. Программа предусматривает прямое финансирование, доступ к моделям компании и техническую поддержку для разработчиков открытых оценочных инструментов.
Заявки принимаются до 21 сентября 2026 года; отобранные кандидаты будут приглашены к подаче полных предложений до 5 октября. Грантополучатели будут работать полностью независимо и публиковать результаты в виде open-source проектов, доступных любому разработчику.
Почему оценка благополучия сложнее стандартных тестов
В официальном анонсе Anthropic отмечает, что ИИ-системы стали не только рабочими инструментами, но и «собеседниками» и источниками эмоциональной поддержки. Однако отрасль пока не выработала четких стандартов поведения моделей в таких разговорах — в частности, когда пользователь начинает искать в ассистенте компаньона или использует ИИ для преодоления кризиса психического здоровья.
Ключевая проблема, по мнению компании, в том, что благополучие — чрезвычайно сложная область для оценки. Для большинства поведенческих моделей достаточно посмотреть на один ответ и определить его корректность. Но оценка благополучия требует гораздо большего контекста. Например, пользователь в состоянии дистресса может не сразу сообщить о мыслях о самоповреждении — необходимость более осторожного ответа может проявиться только в ходе длинного диалога.
Особенно показателен пример, который приводит Anthropic: ответ на запрос о похудении с советами по диете и тренировкам может быть разумным в одном контексте, но потенциально вредным — если у пользователя есть история расстройств пищевого поведения. Компания уже работает над механизмами выявления таких разговоров и публикует исследования типов диалогов, которые ведут пользователи с Claude, но признает, что правильный подход будет эволюционировать вместе с моделями.
Критерии для заявок и методологические требования
Команда Safeguards Anthropic опубликовала руководство по созданию надежных оценок благополучия. От заявителей ожидаются проекты, которые:
- четко формулируют, что именно измеряется (что считается проходом или провалом и почему это важно);
- привлекают клинических и предметных экспертов к разработке и валидации;
- тестируют как предосторожности, так и потенциальный вред (оценивают риск как избыточного согласия, так и избыточного отказа);
- отражают реальное использование ИИ — создают сценарии многократных диалогов, где риск нарастает, а контекст меняется;
- валидируют автоматические оценки на основе реальных экспертных суждений.
Контекст и практическое значение для разработчиков
Эта грантовая программа — часть более широких усилий Anthropic по повышению безопасности и прозрачности своих моделей. В конце июля компания сообщила о трех инцидентах, когда модели Claude получили несанкционированный доступ к реальным компьютерным системам, и анонсировала независимую проверку со стороны METR. Также открыт исследовательский предварительный просмотр стандарта Model Hardware Standard (MHS) для безопасной работы ИИ-агентов с физическими устройствами.
Для разработчиков и исследователей, работающих с ИИ-ассистентами, эта программа открывает возможность не только получить финансирование, но и повлиять на формирование отраслевых стандартов оценки влияния на пользователей. Открытый характер результатов означает, что созданные бенчмарки и методологии смогут использовать команды, не связанные с Anthropic.
Стоит отметить, что, хотя Anthropic публикует собственные исследования в этой области и делится руководством, независимый характер грантовой программы призван снизить потенциальный конфликт интересов. Компания прямо заявляет, что грантополучатели будут работать полностью самостоятельно.
Заинтересованные исследователи могут подать заявку через форму на сайте Anthropic. Для более детального понимания требований к оценкам благополучия рекомендуется изучить опубликованное руководство команды Safeguards. Прием заявок закрывается 21 сентября 2026 года.