
18 сентября 2026 года Anthropic объявила о партнёрстве с Accenture по созданию механизма встроенной оценки передовых ИИ-моделей. Проверки будет проводить Faculty — специализированное подразделение Accenture в области искусственного интеллекта.
Ключевое отличие новой схемы от обычного внешнего тестирования — доступ к процессам внутри лаборатории. По заявлению Anthropic, оценщики смогут наблюдать за обучением моделей, изучать решения об их разработке и развёртывании, а также напрямую общаться с сотрудниками компании.
Anthropic и Accenture ожидают, что каждая из сторон инвестирует в развитие этого направления не менее $1 млрд в течение следующих пяти лет. Таким образом, заявленный совокупный объём вложений может составить как минимум $2 млрд. Это не следует путать со стоимостью одного контракта: компании говорят о создании соответствующей инфраструктуры и компетенций, но не раскрывают структуру расходов.
Оценщики получат доступ, сопоставимый с доступом сотрудника
Согласно официальному анонсу Anthropic, встроенные оценщики должны подключаться к работе до выпуска модели, а не проверять только готовый продукт через публичный интерфейс или API.
Предполагается, что такой доступ позволит проследить, как модель меняется в процессе обучения, какие ограничения для неё выбирает разработчик и как принимаются решения о выпуске. Оценщики также смогут проверять выполнение заявленных обязательств по безопасности и указывать на риски, которые сложно обнаружить при тестировании финальной версии.
Фраза «доступ, сопоставимый с доступом сотрудника» пока не означает неограниченного доступа ко всем внутренним системам. Anthropic не уточнила, какие данные, журналы экспериментов, веса моделей или элементы инфраструктуры будут доступны Faculty. Не раскрыты и правила работы с коммерческой тайной и чувствительной информацией.
Компания связывает инициативу с предложением генерального директора Дарио Амодеи допускать независимых специалистов внутрь ведущих ИИ-лабораторий. При этом Anthropic подчёркивает, что участие внешней организации не переносит на неё ответственность за безопасность: она по-прежнему остаётся на разработчике модели.
Что именно будет проверять Faculty
Руководить работой со стороны Accenture будет Faculty, которую компания называет своим специализированным ИИ-бизнесом. Заявленный перечень задач включает:
- оценку возможностей и поведения моделей;
- red-teaming — поиск уязвимостей и способов обхода ограничений;
- проверки согласованности поведения модели с заданными требованиями;
- тестирование защитных механизмов;
- анализ процессов, связанных с разработкой и развёртыванием моделей.
Anthropic рассчитывает использовать опыт Accenture во внедрении ИИ для бизнеса и государственных организаций. Практическая ценность такого опыта может заключаться в проверке сценариев, характерных для корпоративной эксплуатации: подключении моделей к внутренним данным, инструментам и автоматизированным рабочим процессам.
При этом анонс не называет конкретные модели, которые первыми пройдут встроенную оценку. Из него также не следует, что проверка автоматически распространится на каждую версию Claude или на все продукты Anthropic. Сроки первых тестов и публикации результатов не указаны.
По $1 млрд от каждой компании — не цена аудита
Anthropic и Accenture заявили, что каждая рассчитывает инвестировать не менее $1 млрд за пять лет в создание мощностей для этой работы. Формулировка охватывает более широкое направление, чем оплата отдельных проверок.
Компании пока не сообщили, какая доля средств пойдёт на команды оценщиков, вычислительную инфраструктуру, разработку тестов или другие задачи. Неизвестно и то, являются ли заявленные суммы твёрдыми договорными обязательствами либо инвестиционными ориентирами.
На начальном этапе Anthropic будет напрямую оплачивать работу Accenture. Компания признаёт, что это не идеальная долгосрочная схема для независимой оценки. В перспективе она предлагает финансировать подобные проверки через общие фонды или государственные механизмы, однако действующей системы такого рода пока нет.
Прямое финансирование создаёт очевидный вопрос о независимости проверяющей стороны. В анонсе не описаны гарантии редакционной самостоятельности оценщиков, порядок разрешения разногласий и возможность опубликовать критический вывод без согласования с Anthropic.
Единых правил для встроенной оценки пока нет
Anthropic называет формат экспериментальным. В отрасли ещё не установлены общие требования к тому, какой доступ должен получать встроенный оценщик, как долго он может наблюдать за разработкой и какие результаты обязан раскрывать публично.
Не определены и критерии, по которым такую проверку можно считать завершённой. Из сообщения компании нельзя установить:
- получит ли Faculty право требовать переноса релиза;
- сможет ли оценщик самостоятельно сообщать об инцидентах;
- будут ли публиковаться полные отчёты или только согласованные резюме;
- как стороны будут обрабатывать конфликт интересов;
- будут ли результаты привязаны к конкретной версии модели.
Партнёрство не является эксклюзивным. Anthropic намерена привлекать и другие организации, а Accenture сможет работать с другими разработчиками ИИ. Компания также сообщила о переговорах с независимой исследовательской организацией METR и другими некоммерческими оценщиками. Предполагается, что они смогут испытывать отдельные элементы встроенной оценки на собственном финансировании.
Такой подход потенциально снижает зависимость от одного подрядчика, но общей методики сопоставления результатов пока нет. Проверки разных организаций могут отличаться по доступу, продолжительности и набору тестов.
Что проверять пользователям Claude и корпоративным заказчикам
Само объявление о партнёрстве ещё не является сертификатом безопасности Claude. Anthropic не представила результатов тестирования, перечня обнаруженных проблем или подтверждения того, что Faculty уже участвовала в подготовке конкретного релиза.
Разработчикам и компаниям, использующим модели Anthropic, стоит обращать внимание на четыре детали будущих отчётов:
- точное название и версия проверенной модели;
- уровень доступа, предоставленный оценщикам;
- перечень проведённых тестов и обнаруженных ограничений;
- влияние выводов оценки на решение о выпуске модели.
Отдельно следует проверить, сможет ли Accenture публиковать собственные заключения и описывать разногласия с Anthropic. Без этого встроенная оценка рискует остаться расширенным внутренним аудитом, даже если его проводит внешняя компания.
До появления первых отчётов практическое значение инициативы ограничено заявленной моделью сотрудничества и инвестиционными планами. Главными показателями станут не объём вложений, а прозрачность доступа, независимость выводов и подтверждённое влияние оценщиков на выпуск передовых моделей.
