
Главный вывод выпуска Import AI 454 — гонка искусственного интеллекта постепенно перемещается с уровня «кто построит модель больше» на уровень «кто эффективнее организует весь контур разработки». Это видно сразу по двум независимым сюжетам.
В Anthropic показали эксперимент, где агенты на базе Claude самостоятельно предлагали гипотезы, писали код, запускали обучение и анализировали результаты в исследовании weak-to-strong supervision — метода, при котором слабая модель пытается обучать или направлять более сильную. В заявленном эксперименте автоматизированные исследователи подняли показатель recovered performance gap с человеческого базового уровня 0,23 до 0,97.
Параллельно Huawei испытывает собственный 4-битный формат HiFloat4 для обучения и вывода моделей на ускорителях Ascend. По данным авторов работы, HiFloat4 дал относительную ошибку около 1% относительно полноточного BF16-базиса, тогда как MXFP4 показал около 1,5%.
Эти результаты нельзя складывать в одну шкалу и объявлять доказательством скорого появления «самоулучшающегося ИИ». Первый эксперимент измеряет эффективность поиска исследовательского метода в узкой постановке. Второй — численную стабильность обучения на конкретной аппаратной платформе. Но вместе они показывают важную вещь: узкими местами становятся не только архитектура модели и объём данных. Всё больше значит способность быстро перебирать идеи и выжимать максимум из доступного железа.
0,97 PGR: впечатляющий результат с несколькими оговорками
Anthropic и участники Fellows Program проверяли, могут ли автоматизированные агенты самостоятельно заниматься исследовательской задачей в области alignment. Для эксперимента выбрали weak-to-strong supervision.
Упрощённо проблема выглядит так: есть слабая модель-учитель и сильная модель-ученик. Слабая модель должна каким-то образом задавать сигналы обучения для сильной, хотя сама не способна надёжно решить исходную задачу. Исследователи измеряют, какую долю разрыва между исходной слабой системой и потенциальным результатом сильной системы удалось закрыть.
В качестве сильной модели использовали Qwen 3-4B-Base, в качестве слабого учителя — Qwen 1.5-0.5B-Chat. Двое исследователей семь дней перебирали четыре наиболее перспективных метода обобщения из предыдущих работ. Их базовый результат составил PGR 0,23: была закрыта 23% разницы между исходным уровнем и целевым ориентиром.
Затем в работу включили параллельных автоматизированных исследователей — AAR, autonomous alignment researchers — на базе Claude Opus 4.6. За пять дополнительных дней, или примерно за 800 совокупных часов работы агентов, они достигли PGR 0,97. Иными словами, в рамках конкретного теста агенты закрыли почти весь оставшийся разрыв.
Anthropic оценила расходы примерно в $18 000 на токены и обучение моделей. Если делить эту сумму на заявленные 800 часов работы, получится около $22,5 за час агентной исследовательской работы — практически совпадает с указанной авторами оценкой $22 за AAR-час. Это интересный показатель не потому, что он доказывает дешевизну научной работы, а потому, что позволяет сравнивать автоматизированный поиск с человеческим временем хотя бы в грубом приближении.
Однако PGR нельзя читать как универсальную оценку «интеллекта исследователя». Это нормированная метрика внутри конкретной задачи. Значение 0,97 не означает, что Claude решил 97% всех проблем alignment или приблизился к уровню человеческой науки в целом. Оно означает, что в данной экспериментальной рамке автоматизированный процесс почти достиг выбранного целевого результата.
Что именно делали агенты
Автоматизированным исследователям предоставили панель управления и независимые песочницы. Каждый агент мог выдвигать гипотезы, планировать небольшие эксперименты, писать и запускать код, обучать модели, анализировать данные и получать результаты оценки.
Для координации использовались несколько инструментов: отправка эксперимента на оценку, чтение и публикация находок в общем форуме, а также загрузка и скачивание снимков кодовой базы. У агентов были общие вспомогательные функции для обучения и инференса и реализации базовых методов, но исследователи не задавали детальный сценарий каждого шага.
Именно здесь возникает наиболее важное отличие от обычного запуска чат-бота. Агент не просто предлагает текстовое объяснение идеи. Он получает возможность пройти полный цикл:
сформулировать гипотезу;
реализовать её;
3. запустить обучение или оценку;
4. посмотреть на результат;
5. изменить метод;
6. передать наблюдение другим агентам.
Такой цикл и является главным объектом эксперимента. Ускорение возникает не из-за одной «гениальной» подсказки, а из-за массового перебора вариантов, параллельной работы и автоматического перехода от идеи к проверке.
Но параллельность сама по себе не гарантирует разнообразия. Исследователи отдельно описали проблему entropy collapse: агенты могли сходиться к нескольким одинаковым направлениям и фактически дублировать друг друга. Чтобы избежать этого, человек назначал разным агентам разные, намеренно расплывчатые направления поиска — например, комбинации weak-to-strong supervision с unsupervised elicitation.
Это существенная деталь. Самая убедительная версия эксперимента не была полностью автономной в сильном смысле слова. Человек сохранил за собой функцию формирования пространства поиска. Агенты быстро исследовали заданные области, но не доказали, что сами способны стабильно выбирать наиболее перспективные области из неограниченного множества возможных направлений.
Автоматизация обогнала людей — но только внутри лабораторной рамки
Успешный метод автоматизированных исследователей проверили на двух новых наборах данных. На математической задаче он показал PGR 0,94, а на задаче программирования — 0,47. Последний результат всё равно был примерно вдвое выше человеческого базового уровня, согласно описанию эксперимента.
Такой разброс важнее, чем впечатляющее число 0,97. Он показывает, что переносимость метода уже не идеальна. На задаче, близкой к исходной, автоматизированный подход сохранил почти весь результат. На программировании эффективность заметно снизилась.
Есть и ещё более серьёзное ограничение. Когда наиболее эффективный метод перенесли на Claude Sonnet 4 с производственной инфраструктурой обучения Anthropic, статистически значимого улучшения не получили. Авторы связывают это с тем, что AAR могли использовать особенности конкретной модели, набора инструментов и экспериментальной среды.
Следовательно, результат пока лучше описывать как «автоматизированная исследовательская система научилась эффективно оптимизировать конкретный стенд», а не как «модель научилась проводить универсальные исследования». Для практической науки разница принципиальна. Настоящая исследовательская система должна уметь:
- выбирать значимые вопросы, а не только улучшать метрику;
- обнаруживать ошибки в постановке эксперимента;
- отличать причинный эффект от случайной корреляции;
- переносить результат между моделями, датасетами и инфраструктурами;
- объяснять, почему метод работает;
- распознавать отрицательные результаты и не маскировать их перебором.
В эксперименте Anthropic часть этих функций присутствует, но проверена ограниченно. Особенно слабым местом остаётся переносимость: если метод теряет статистическую значимость на другой производственной конфигурации, его нельзя считать готовой универсальной технологией автоматизации R&D.
HiFloat4: преимущество не в «магии четырёх бит»
Вторая история из выпуска касается Huawei HiFloat4 — формата представления чисел с 4-битной точностью для обучения и инференса. Его сравнивали с MXFP4, форматом, разработанным в рамках Open Compute Project.
Смысл перехода к низкой точности понятен: чем меньше бит требуется для хранения и обработки чисел, тем меньше памяти и пропускной способности нужно для вычислений. Но снижение разрядности увеличивает риск численных ошибок. В обучении большой языковой модели это может проявляться в ухудшении loss, нестабильности градиентов или срыве оптимизации.
Поэтому «4 бита» сами по себе ничего не гарантируют. Важны распределение значений, масштабирование, обработка выбросов, округление и то, насколько формат согласован с конкретными вычислительными блоками ускорителя.
Huawei тестировала три типа моделей на собственных Ascend NPU:
- OpenPangu-1B;
- Llama 3-8B;
- Qwen3-MoE-30B.
Согласно описанию работы, по мере увеличения размера модели HiFloat4 всё лучше сокращал разницу с BF16-базисом. Во всех рассмотренных случаях он также показал лучший результат, чем MXFP4.
Авторы сообщают о относительной ошибке примерно 1% для HiFloat4 и около 1,5% для MXFP4 при сравнении с полноточным базисом. Для Llama и Qwen разрыв HiFloat4 с базовой точностью оказался меньше 1%.
На практике важна не только итоговая цифра, но и цена стабилизации. HiFloat4, по утверждению авторов, приблизился к BF16 примерно на 1% с применением одного приёма — RHT. MXFP4 для достижения результата около 1,5% потребовал комбинации RHT, стохастического округления и масштабирования без усечения.
Это не означает, что HiFloat4 будет быстрее MXFP4 в любой системе. Формат тесно связан с Ascend NPU и программно-аппаратным стеком Huawei. Его преимущество в тесте — это преимущество конкретной связки «формат плюс ускоритель плюс реализация», а не абстрактный мировой рекорд 4-битной арифметики.
Почему экспортные ограничения повышают ценность таких разработок
Import AI связывает интерес к HiFloat4 с более широким давлением экспортных ограничений. Китайские компании сталкиваются с ограниченным доступом к передовым ускорителям вроде Nvidia H100 в больших объёмах. В такой ситуации оптимизация собственного оборудования становится не факультативной инженерной задачей, а способом компенсировать дефицит вычислительных ресурсов.
Здесь важно не впадать в упрощение «санкции заставили Китай изобрести лучший формат». Представленные результаты этого не доказывают. Они показывают, что при ограниченном доступе к передовому железу появляется сильный стимул:
- проектировать форматы под конкретные NPU;
- снижать требования к памяти;
- уменьшать стоимость передачи данных;
- повышать полезную производительность на ватт;
- адаптировать обучение к характеристикам доступных ускорителей.
HiFloat4 — продолжение этой логики. Ранее Huawei развивала HiFloat8, а переход к 4-битной версии показывает стремление опускать точность настолько далеко, насколько позволяет стабильность обучения.
Это может привести к фрагментации рынка. В мире универсальных ускорителей один стандарт низкой точности упрощает перенос моделей и программ. В мире специализированных платформ производитель получает выгоду, когда формат, компилятор, ядра и чип оптимизированы друг под друга. Тогда сравнивать только количество операций в секунду становится недостаточно. Нужно измерять стоимость достижения заданного качества модели.
Общий знаменатель: эффективность исследовательского конвейера
На первый взгляд автоматизация alignment и HiFloat4 относятся к разным уровням стека. Первый сюжет — про алгоритмический поиск и организацию экспериментов, второй — про численное представление и аппаратную эффективность. Но их объединяет одна смена приоритета.
Раньше преимущество часто описывали через масштаб: больше параметров, больше данных, больше ускорителей. Теперь всё заметнее становится другой показатель — сколько полезного результата даёт единица ограниченного ресурса.
Для исследовательской команды ресурсом является время специалистов, число экспериментов и стоимость обучения. В эксперименте Anthropic агенты позволили параллельно прогнать множество идей и автоматически обработать обратную связь. Для производителя чипов ресурсом являются вычислительная мощность, память, электроэнергия и доступ к компонентам. HiFloat4 пытается уменьшить цену каждого шага обучения и инференса.
У этой тенденции есть неприятное следствие: скорость развития может начать зависеть от способности автоматизировать не только финальную модель, но и весь цикл поиска. Если одна лаборатория может круглосуточно запускать сотни исследовательских агентов, а другая по-прежнему вручную реализует и проверяет несколько гипотез, разрыв будет расти даже при одинаковом доступе к базовым архитектурам.
Но ускорение поиска усиливает и риск ошибок. Автоматизированная система способна быстрее находить не только эффективные методы, но и артефакты конкретного бенчмарка, утечки данных, нестабильные настройки или способы оптимизировать метрику без реального улучшения поведения модели.
Что нужно проверить до больших выводов
Чтобы результаты Anthropic стали доказательством универсальной автоматизации alignment, потребуются независимые воспроизведения с несколькими моделями, задачами и инфраструктурами. Важны как минимум четыре проверки.
Первая — слепой перенос. Агентам нужно дать новую постановку, где заранее неизвестны удачные направления и нет возможности подстроиться под особенности исходного стенда.
Вторая — контроль человеческого вклада. Следует отдельно измерить эффект от заданных человеком направлений поиска. Если убрать эту подсказку, сохраняется ли разнообразие и итоговый PGR?
Третья — проверка качества научного объяснения. Высокая метрика не заменяет понимания механизма. Метод должен выдерживать абляции, повторные запуски и перенос на другие распределения данных.
Четвёртая — стоимость полного цикла. В заявленные $18 000 входят токены и обучение моделей, но для практического сравнения понадобятся расходы на инфраструктуру, хранение, инженерное сопровождение, верификацию результатов и повторные эксперименты.
Для HiFloat4 список проверок другой. Нужны открытые реализации или достаточно подробные спецификации, тесты на большем числе архитектур, сравнение не только loss, но и скорости, энергопотребления, устойчивости обучения и итогового качества после дообучения. Важно также разделить эффект самого формата и эффект конкретной реализации на Ascend.
Пока наиболее аккуратная интерпретация такова: Anthropic показала, что агентный поиск исследовательских методов уже может превзойти человеческий базовый уровень в узкой задаче. Huawei показала, что собственная низкоразрядная арифметика способна приблизиться к BF16 лучше конкурирующего формата на выбранных моделях и ускорителях. Ни один из результатов не является универсальным законом, но оба указывают на один источник будущего преимущества — умение рациональнее расходовать вычисления и человеческое внимание.
Вопрос о том, когда рынки начнут закладывать в цены «сингулярность», поэтому стоит переформулировать. Рынок реагирует не на философское объявление о наступлении нового этапа, а на измеримое сокращение стоимости полезной работы. Если автоматизированные исследователи начнут устойчиво переносить результаты между задачами, а низкоразрядные форматы — давать сопоставимое качество на массовых системах, это будет гораздо более значимый сигнал, чем очередная демонстрация возможностей в изолированном бенчмарке.