Запись архива

GPT-6 Astra: не AGI, а серьёзный тест для агентов, работающих с компьютером

Аналитики из Reddit пришли к выводу, что новая модель OpenAI — не прорыв к общему искусственному интеллекту, а специализированный инструмент для сложных агентских сценариев: браузерные задачи, написание кода, работа с CRM и документооборот.

Интерфейс GPT-6 Astra, автоматизация браузера и написание кода
Интерфейс GPT-6 Astra, автоматизация браузера и написание кода
EHouse SVG Visualization for Web Browser.png | by iSys.PL | wikimedia_commons | Attribution

Аналитики и разработчики, изучившие материалы запуска GPT-6 Astra от OpenAI, приходят к выводу: модель не следует рассматривать как шаг к AGI. Вместо этого Astra представляет собой целенаправленный инструмент для автоматизации сложных, многошаговых рабочих процессов, связанных с взаимодействием с компьютером.

Что было выпущено

OpenAI представила GPT-6 Astra — новую версию своей языковой модели, ориентированную на выполнение задач, сочетающих рассуждение, написание кода, использование инструментов и взаимодействие с интерфейсами. Согласно анализу независимого ресурса Artificial Analysis, в стандартном тесте общего интеллекта Astra набрала 61 балл, что сопоставимо с GPT-5.6 Sol в аналогичной конфигурации. Однако в специализированном индексе Coding Agent Index модель показала 67 баллов — на два пункта выше Sol, но ниже Fable 5.1 (70 баллов).

Основные характеристики и бенчмарки

OpenAI сообщает о сильных результатах Astra в тестах FrontierMath Tier 4, ARC-AGI-3 и ExploitBench. Однако картина неоднозначна: при максимальном уровне усилий модель использует меньше выходных токенов, чем Sol, но стоимость за задачу оказывается выше из-за более высокой цены на токен. Это делает Astra не универсальной заменой, а нишевым продуктом.

Практическая ценность

Astra нацелена на задачи, где требуется:
– Автоматизация работы в браузере (сбор данных, навигация)
– Написание и отладка кода
– Работа с документами и CRM
– Тестирование программного обеспечения
– Длительные профессиональные сценарии

Модель показывает преимущество в задачах, где важны длинный контекст, точное выполнение инструкций и меньшее количество неудачных попыток. Однако за это приходится платить премией.

Как тестировать Astra на практике

Автор исходного поста на Reddit предлагает конкретный подход к оценке: выбрать один дорогой и фрагментированный рабочий процесс, запустить Astra параллельно с текущим процессом и текущей моделью. Измерять следует не просто бенчмарки, а реальные метрики: завершённость задачи, принятый вывод, количество повторных попыток, время на исправление, соответствие объёму работ и общую стоимость. Ключевой вывод: решение должно приниматься на основе стоимости за принятый результат, а не только по показателям запуска.

Ограничения и выводы

Важно понимать: Astra не является универсальным решением. Её преимущества проявляются в узком классе задач. Для простых или дешёвых сценариев использование модели может быть неоправданно дорогим. Кроме того, критически важно сохранять человеческое одобрение за consequential actions — действиями, которые могут иметь серьёзные последствия.

Источники
– Оригинальное обсуждение на Reddit: r/artificial
– Официальный сайт OpenAI: openai.com/news
– Анализ Artificial Analysis