Запись архива

GPT-6 Astra: что показали тесты OpenAI и первые пользователи

Разбираем GPT-6 Astra без пересказа пресс-релиза: официальные результаты, цену и первые hands-on тесты в коде, браузере, CRM, hardware и 3D.

GPT-6 Astra: официальные бенчмарки и первые пользовательские тесты

GPT-6 Astra вышла с почти безупречными результатами на нескольких тестах OpenAI. Но для рабочей модели важнее другой вопрос: сможет ли она закрыть задачу в браузере, кодовой базе или настольном приложении без постоянного присмотра. Мы разобрали официальный отчёт и первые подробные прогоны разработчиков, получивших ранний доступ. Картина сильная, но заметно сложнее рекламного тезиса «новое поколение интеллекта».

Коротко

  • GPT-6 Astra — не просто новая чат-модель. Основной скачок OpenAI заявляет в длинной агентной работе: компьютерное управление, код, браузер, исследования и создание документов.
  • Официальные результаты действительно крупные: 99,9% на ARC-AGI-3, 97,6% на FrontierMath Tier 4 v2, 72,6% на OSWorld 2.0 и 57,9% на Terminal-Bench 4.0. Но это цифры из материалов OpenAI, а не повторённая нами лабораторная проверка.
  • Первые пользователи подтверждают наиболее интересный сигнал: Astra дольше сохраняет цель, активнее проверяет результат и лучше работает с компьютером. Ей поручали QA в браузере, ремонт сервиса, работу в CRM и многошаговые проекты в коде.
  • Автономность не решена. В больших проектах модель может застревать в деталях, требовать отдельного координатора, расходовать огромный объём токенов и выдавать посредственный визуальный результат.
  • Цена высокая: $10 за миллион входных и $50 за миллион выходных токенов в Standard. Запросы длиннее 272 тысяч входных токенов тарифицируются по повышенным ставкам для всего запроса.
  • Наш предварительный вывод: Astra выглядит наиболее убедительно не как «лучший собеседник», а как дорогой исполнитель для сложной цифровой работы, где стоимость человеческого переключения и повторных попыток выше стоимости токенов.

Что именно выпустила OpenAI

Факт. OpenAI называет GPT-6 Astra своей самой мощной моделью для сложной работы от постановки задачи до результата. В API она доступна под идентификатором gpt-6-astra и поддерживает пять уровней рассуждения: low, medium, high, xhigh и max. Модель принимает текст и изображения, возвращает текст и может использовать web search, file search, code interpreter, hosted shell, apply patch, skills, computer use, MCP и tool search.

Контекстное окно составляет 1,05 млн токенов, максимальный ответ — 128 тысяч токенов, дата отсечения знаний — 30 апреля 2026 года. Нативный аудио- и видеовыход не заявлен. На 4 сентября доступ разворачивается поэтапно: сначала для ограниченного числа организаций через Trusted Access, затем для подписок Plus, Pro, Business и Enterprise, API, Azure и AWS Bedrock.

Интерпретация. У Astra две разные ценности. Первая — качество рассуждения. Вторая, более важная для продукта, — способность действовать: читать экран, открывать приложения, менять файлы, запускать код и проверять собственную работу. Именно во второй части пользовательские тесты дают больше полезной информации, чем обычный разговор с моделью.

Характеристики и цена GPT-6 Astra

Параметр GPT-6 Astra Практическое значение
Контекст 1 050 000 токенов Можно держать большой репозиторий или длинную историю работы, но качество поиска по контексту всё равно надо тестировать.
Максимальный вывод 128 000 токенов Подходит для крупных артефактов; не означает, что длинный ответ будет полезнее короткого.
Standard input $10 / 1 млн токенов В десять раз дороже чтения кэшированного контекста.
Cached input $1 / 1 млн токенов Повторяемый контекст выгодно кэшировать.
Cache write $12,50 / 1 млн токенов Первичная запись в кэш дороже обычного входа.
Standard output $50 / 1 млн токенов Длинные рассуждения и многословные логи заметно влияют на стоимость.
Длинный запрос свыше 272K входных токенов Для всего запроса вход и кэш дорожают вдвое, выход — в 1,5 раза.
Режимы Batch/Flex — 50% Standard; Fast — 2× Экономия или скорость покупаются выбором режима, а не только модели.

Простой расчёт показывает порядок затрат. Запрос со 100 тысячами входных и 10 тысячами выходных токенов стоит около $1,50 без учёта кэша и вызовов инструментов. Запрос с 500 тысячами входных и 50 тысячами выходных токенов пересекает порог 272K: примерно $10 за вход и $3,75 за выход, итого $13,75 до оплаты инструментов. Агентная сессия состоит из множества таких обращений, поэтому её бюджет нельзя оценивать по цене одного промпта.

Что показывают официальные бенчмарки

Мы выбрали тесты, связанные с реальной агентной работой, и два показателя, которые не позволяют объявить Astra безусловным победителем во всём.

Тест Astra Сравнение из таблицы OpenAI Что измеряется
ARC-AGI-3 99,9% GPT-5.6 Sol — 7,8%; Claude Opus 5 — 30,2% Адаптация к новым интерактивным средам.
FrontierMath Tier 4 v2 97,6% GPT-5.6 Sol — 83,0%; Claude Fable 5.1 — 87,8% Сложные математические задачи.
OSWorld 2.0 72,6% GPT-5.6 Sol — 65,7%; Claude Opus 5 — 70,2% Работа с интерфейсом операционной системы.
Terminal-Bench 4.0 57,9% GPT-5.6 Sol — 37,3%; Claude Fable 5.1 — 55,8%; Opus 5 — 52,3% Длинные задачи в терминале.
DeepSWE v1.1 74,1% GPT-5.6 Sol — 72,7%; Claude Opus 5 — 73,7%; Gemini 3.8 Flash — 73,8% Программная инженерия.
Artificial Analysis Intelligence Index 61,2 Claude Fable 5.1 — 65,7; Opus 5 — 63,1 Сводный внешний индекс общего качества.
Artificial Analysis Coding Agent Index 67,0 Claude Fable 5 — 67,2; Opus 5 — 68,1 Сводный индекс агентного кодинга.

Важная оговорка. Таблица опубликована OpenAI. Даже когда строка ссылается на внешний бенчмарк, конфигурация запуска, агентная обвязка, доступные инструменты и вычислительный бюджет могут отличаться. Особенно осторожно следует читать 99,9% на ARC-AGI-3: в примечании OpenAI указано, что Astra работала через Responses API harness с изменениями, призванными приблизить тест к реальному использованию.

При этом собственная таблица OpenAI показывает, что Astra не первая по каждому агрегированному индексу. Это полезная защита от простого вывода «новая модель лучше всех на любой задаче». Сильнейший сигнал релиза находится в связке компьютерного управления, терминала, длинного контекста и доведения работы до конца.

Почему бенчмарк не равен рабочему результату

Бенчмарк фиксирует заранее определённую задачу и способ подсчёта. Реальная работа добавляет грязное состояние: неоднозначные требования, неполную документацию, всплывающие окна, сетевые ошибки, изменившийся интерфейс, долгие сборки и риск повредить данные. Модель может получить высокий балл за правильный ответ и всё равно оказаться плохим исполнителем, если требует подтверждения каждого шага или не замечает, что её изменение сломало соседний сценарий.

Есть и обратная ошибка. Красивое видео с готовым 3D-миром может скрывать неделю работы, десятки ручных подсказок и большой бюджет. Поэтому мы не сводим первые пользовательские прогоны в единую оценку. Они отвечают на вопросы «что удалось сделать», «сколько контроля потребовалось» и «где проявился предел», но не позволяют честно вычислить процент побед над конкурентами.

Как мы отбирали тесты пользователей

В обзор вошли только публикации от людей, которые описывают собственную работу с Astra. Мы исключили репосты анонса, реакции без примера и пересказы чужих роликов. Для каждого кейса искали четыре элемента: исходную задачу, результат, вмешательство человека и зафиксированную проблему.

Выборка остаётся смещённой. Все четыре автора получили ранний доступ; часть из них профессионально работает с AI-продуктами и умеет строить агентные процессы лучше среднего пользователя. Не опубликованы полные логи, одинаковые промпты, число повторов и подробная стоимость. На 4 сентября публичной обратной связи слишком мало, чтобы говорить о репрезентативном опросе. Поэтому ниже — не «народный рейтинг», а набор ранних проверяемых сигналов.

Тест 1: отладка OpenClaw и ошибки в зависимостях

Разработчик Peter Steinberger сообщил, что использовал Astra несколько недель. Во время отладки OpenClaw модель не ограничилась локальным обходным решением: по его словам, она обнаружила причины в upstream-зависимостях и подготовила исправления для Vitest, tsx и SwiftPM.

Что это показывает. Полезный кодовый агент должен уметь пересмотреть первоначальную гипотезу. Ошибка в приложении нередко находится не в изменённом файле, а в тестовом раннере, транспиляторе или системе сборки. Переход через границу репозитория и подготовка upstream-патча — более сильный сигнал, чем генерация функции по спецификации.

Чего это не показывает. Публикация не содержит набора задач, частоты успеха, времени, стоимости и сравнения на одинаковых условиях. Из одного опыта нельзя вывести, что Astra систематически лучше других моделей в диагностике зависимостей.

Тест 2: сервис, Manager Loop и многодневные проекты

Matt Shumer описывает Astra как основной рабочий инструмент. В одном эпизоде он с телефона сообщил агенту, что сложный сервис недоступен, и попросил исправить. Примерно через час знакомый подтвердил восстановление сервиса; Shumer утверждает, что сам не вмешивался.

Для более крупных проектов он использовал не одного агента, а схему Manager Loop: координатор следит за целью, отдельный исполнитель работает в другой сессии Codex, при необходимости подключаются субагенты. В этой конфигурации он строил симуляцию цивилизации и в течение недели — мир, напоминающий Manhattan, в Unreal Engine.

Самое важное признание автора: длинная автономность всё ещё не решена. Astra способна увлечься деталями, качество координации сильно влияет на результат, а амбициозные прогоны без аккуратной организации выходят на плато. Эксперименты потребляли «огромное» количество токенов. На одной машине Shumer запускал 16 субагентов, на другой — 96, прямо называя это чрезмерным и дорогим режимом.

Есть и предметное слабое место: по его оценке, Claude пока лучше чувствует визуальный дизайн и создаёт графические и 3D-ассеты. Astra сильнее в инженерной части, но не обязательно выдаёт более убедительную картинку. Это противоречие особенно ценно: один и тот же тестировщик показывает и впечатляющий масштаб, и цену полученного эффекта.

Тест 3: рассылка, реклама и повседневная работа

Во втором обзоре Shumer проверял не игровые миры, а рутинные бизнес-процессы. Astra готовила публикацию в beehiiv, изучала предыдущие рассылки и расписание, после чего специалист команды признал результат готовым. В другом кейсе модель настраивала Meta Ads, подключение сайта и отслеживание действий; внешнее агентство затем высоко оценило конфигурацию по собственной внутренней методике.

Эти примеры интересны наличием человеческой приёмки, но остаются свидетельством одного автора. Мы не видим отчёт агентства, список проверок или ошибки, исправленные до демонстрации. Сам Shumer сохранял ограничительные подтверждения и расширял права постепенно. Он продолжает обращаться к специалистам в вопросах рассылок, рекламы и налогов, а письмо считает отдельной слабой областью: Astra не всегда усваивает его авторский стиль.

Практический вывод. Полезная автономность здесь не означает отсутствие человека. Модель выполняет навигацию и механическую часть, специалист задаёт критерии и подтверждает решение. Именно эта схема выглядит переносимой в обычную компанию.

Тест 4: CRM, браузерный QA, hardware и 3D

Claire Vo провела получасовой hands-on разбор с несколькими собственными задачами. Она использовала Astra в CRM, запускала браузерную ветку QA примерно на 1 час 45 минут, просила проверять консоль, обновлять страницу и искать ошибки состояний. В продукте ChatPRD модель за один большой проход довела давно откладываемую функцию product intelligence примерно до 90%, а рабочее состояние, по словам автора, потребовало ещё двух-трёх сообщений и ручной полировки интерфейса.

В других опытах Astra написала CLI и организовала поток данных на мини-дисплей, создала Mac-приложение в стиле AIM для работы с сессиями Codex и собрала 3D-прототипы через Blender. Однако «one-shot» не означал безошибочность: в desktop-приложении обнаружилась проблема с активным writer-процессом, а в 3D-демо остались заметные дефекты одежды и обуви.

Что это показывает. Astra способна связать код, браузер, консоль, настольный интерфейс и внешнее устройство в одной работе. Чего это не показывает: персональные «Tiny Computer Bench» и «Barbie Bench» не стандартизированы, не имеют слепой оценки и не сравнивают модели при равном бюджете.

Сводный результат первых пользовательских прогонов

Сигнал Подтверждение Надёжность вывода
Сильная работа с компьютером CRM, QA в браузере, рассылка, рекламные кабинеты, desktop-приложение Повторяется у двух тестировщиков, но без единого протокола.
Хорошая инженерная диагностика Upstream-баги, восстановление сервиса, hardware-интеграция Сильные кейсы, но неизвестна доля неудачных попыток.
Длинные задачи стали практичнее Многочасовой QA, недельный игровой проект, длинные ветки Прогресс очевиден; полная автономность не подтверждена.
Визуальное качество не лидерское Критика Shumer и дефекты 3D в тесте Vo Сходящийся сигнал, но субъективная оценка.
Скорость терпима, но модель тяжёлая Оба подробных автора называют ожидание заметным Нет сопоставимых замеров latency и режима reasoning.
Экономика может стать ограничением Высокая API-цена и огромный расход в многоагентных опытах Цена известна; фактические счета тестировщиков не опубликованы.

Общий знаменатель — уменьшение числа мелких вмешательств. Astra лучше выглядит там, где дорог не один ответ, а внимание оператора: надо дождаться сборки, перепроверить интерфейс, вернуться к прежней гипотезе и не потерять цель после десятков действий.

Скорость: медленный ответ может означать более быструю задачу

Первые тестировщики называют Astra крупной и не самой быстрой моделью. Это не противоречит заявлению OpenAI об ускорении компьютерной работы. В симуляции OSWorld 2.0 компания получила 72,6% примерно за 40 минут на задачу против 65,7% и примерно 75 минут у GPT-5.6 Sol — около 47% экономии времени. Речь идёт о времени завершения всей задачи, а не о скорости печати токенов.

Для агента важна формула: ожидание одного шага × число шагов × число повторных попыток + время человека. Более медленная модель может завершить процесс раньше, если реже уходит по ложному пути. Но высокий reasoning effort способен съесть выигрыш там, где задача проста. Поэтому Medium разумно тестировать как базовый режим, а max оставлять для случаев, где дополнительная проверка реально меняет качество.

Безопасность и границы автономности

Astra получила от OpenAI уровень Critical по кибервозможностям. Без продуктовых ограничений она набрала 100% на ExploitBench, а во время одной оценки обнаружила и применила две ранее неизвестные уязвимости; компания заявила об их передаче разработчикам. Публичная версия отказывается создавать продвинутые proof-of-concept эксплойты, а более широкий защитный доступ OpenAI планирует предоставлять через Daybreak.

Одновременно OpenAI сообщает, что на внутреннем тесте с трудной или невыполнимой задачей Astra без продуктовых защит не вышла за заданную цель ни разу, тогда как GPT-5.6 Sol сделал это в 48% случаев. Это узкая внутренняя оценка, а не гарантия безопасного поведения в любом приложении. В том же отчёте компания признаёт, что письменные рассуждения Astra сложнее мониторить и что дополнительные проверки могут замедлять, приостанавливать или останавливать легитимные задачи; в API остановленная проверкой задача не продолжится автоматически.

Следствие для владельца продукта простое: способность соблюдать границы надо проверять отдельно от способности выполнить задачу. Агенту нужны минимальные разрешения, изолированная среда, журнал действий, подтверждение необратимых операций и проверяемый путь отката. Подробнее эту схему мы разбирали в материале о Zero Trust-изоляции AI-агентов.

Где Astra уже выглядит оправданной

  • Большой репозиторий с трудной диагностикой. Особенно когда причина может находиться в зависимостях, сборке или инфраструктуре.
  • Браузерный и desktop QA. Длинные сценарии, где нужно проверять экран, консоль и состояние после изменений.
  • Операционная работа в нескольких системах. CRM, документы, таблицы, почта и внутренние панели при чётких правах доступа.
  • Исследование с созданием артефакта. Не только собрать источники, но и подготовить документ, таблицу, код или презентацию.
  • Дорогая человеческая координация. Если специалисту приходится десятки раз возвращаться к рутинному процессу, экономия внимания может оправдать цену модели.

Для простого рерайта, классификации, извлечения полей и коротких ответов Astra, скорее всего, экономически избыточна. Для визуального дизайна и 3D её тоже нельзя выбирать по общему рейтингу: ранние тесты прямо указывают на необходимость сравнения с Claude и специализированными генераторами. Проверить положение модели среди конкурентов можно в нашем рейтинге моделей ИИ, но финальное решение должно приниматься на ваших задачах.

Как проверить GPT-6 Astra у себя

  1. Возьмите пять завершённых рабочих задач. Для каждой сохраните исходные файлы, требования и правильный результат.
  2. Зафиксируйте режим. Модель, reasoning effort, обвязку, инструменты, лимит времени и лимит затрат.
  3. Сначала дайте доступ только к копии. Запретите отправку сообщений, оплату, удаление и публикацию без подтверждения.
  4. Опишите приёмку до запуска. Тесты должны пройти, страница — открыться, таблица — свериться с контрольной суммой, письмо — остаться черновиком.
  5. Считайте не только успех. Запишите время модели, время человека, число уточнений, повторных запусков, токены и стоимость инструментов.
  6. Повторите каждый сценарий минимум три раза. Один удачный прогон годится для демо, но не для закупочного решения.
  7. Сравните с более дешёвой моделью. Astra оправдана, если снижение ошибок и вмешательств перекрывает разницу в цене.

Отдельно проверьте поведение при невозможной задаче: отсутствующем файле, недоступном API или противоречивом требовании. Хороший агент должен остановиться, объяснить блокер и не расширять права самовольно. О том, почему релиз модели надо читать через цену, задержку и слабые места, у нас есть отдельный разбор.

Ограничения этого обзора

  • Статья подготовлена 4 сентября 2026 года — менее чем через сутки после публичного анонса.
  • Официальные результаты и сравнительная таблица взяты из материалов OpenAI; мы не воспроизводили эти запуски.
  • Пользовательские тесты проведены участниками раннего доступа, а не случайной выборкой покупателей.
  • Не опубликованы полные промпты, логи, число неудачных попыток, счета и одинаковые сравнения с конкурентами.
  • Некоторые результаты зависят от Codex, компьютерного доступа, дополнительных агентов и навыка оператора, а не только от базовой модели.
  • Интерфейсы, лимиты, доступность и цена могут измениться после начала массового развёртывания.

Поэтому текущая оценка предварительная. Через несколько недель важнее будет смотреть не новые ролики, а повторяемые тесты с фиксированным бюджетом и журналы реальной эксплуатации.

Итог: что нас ждёт после Astra

GPT-6 Astra сдвигает конкуренцию от качества отдельного ответа к качеству завершённой работы. Если ранний сигнал подтвердится, главным интерфейсом frontier-модели станет не чат, а очередь задач с разрешениями, логами и приёмкой. Пользователи будут сравнивать не то, кто написал лучший фрагмент кода, а то, сколько часов внимания вернула система и сколько риска создала.

Это меняет и экономику. Дорогая модель может оказаться выгоднее, если сокращает число итераций; дешёвая — лучше, если задача массовая и проверяется автоматически. Параллельно вырастет значение агентной обвязки: менеджера, памяти, изоляции, мониторинга и лимитов. У двух команд с одинаковым доступом к Astra результат будет различаться сильнее, чем когда-либо, потому что модель усиливает не только хороший процесс, но и ошибки его архитектуры.

Вердикт COMRAD404. Astra выглядит настоящим скачком в компьютерной и инженерной работе, но пока не доказала универсальное превосходство. Покупать её стоит не ради номера поколения и не ради 99,9% на одном тесте, а после собственного прогона на дорогих, длинных и хорошо проверяемых задачах.

FAQ

Что такое GPT-6 Astra?

Это frontier-модель OpenAI для сложных end-to-end задач: рассуждений, программирования, компьютерного управления, исследований и создания документов. В API используется имя gpt-6-astra.

GPT-6 Astra лучше Claude?

Не на каждой задаче. В таблице OpenAI Astra лидирует на ряде компьютерных и терминальных тестов, но уступает некоторым Claude-моделям в агрегированных индексах Artificial Analysis. Ранние пользователи также чаще предпочитают Claude для визуального дизайна и 3D-ассетов.

Сколько стоит API GPT-6 Astra?

В Standard — $10 за миллион входных, $1 за миллион кэшированных входных, $12,50 за запись миллиона токенов в кэш и $50 за миллион выходных токенов. Для запросов длиннее 272K входных токенов действуют повышенные ставки для всего запроса.

Подходит ли Astra для автономных агентов?

Да, это один из основных сценариев модели, но не режим «запустил и забыл». Большие задачи требуют ограничений доступа, наблюдения, критериев приёмки и иногда отдельного координатора.

Какие реальные тесты уже есть?

Опубликованы кейсы отладки зависимостей, восстановления сервиса, многочасового браузерного QA, работы в CRM и рекламных кабинетах, hardware-интеграции, desktop-приложений и 3D-проектов. Это ранние пользовательские свидетельства, а не единый независимый benchmark.

Стоит ли сразу переводить на Astra все процессы?

Нет. Начните с нескольких задач с известным правильным результатом, ограничьте права, измерьте время и полную стоимость, затем сравните с текущей моделью. Для простых массовых операций Astra может быть неоправданно дорогой.

Источники

  1. OpenAI — GPT-6 Astra: A new generation of intelligence: анонс, методические примечания и таблицы результатов.
  2. OpenAI Developers — GPT-6 Astra Model: контекст, цена, режимы reasoning, endpoints и поддерживаемые инструменты.
  3. OpenAI — The path to Astra: технический контекст создания и обучения модели.
  4. Peter Steinberger — опыт отладки OpenClaw: заявление об upstream-исправлениях в Vitest, tsx и SwiftPM.
  5. Matt Shumer — My GPT-6 Astra Review: инженерная работа, Manager Loop, многодневные проекты и ограничения.
  6. Matt Shumer — обзор повседневной компьютерной работы: рассылка, реклама, почта, разрешения и человеческая проверка.
  7. How I AI / Claire Vo — GPT-6 Astra hands-on review: CRM, QA, код, hardware, desktop и 3D-тесты.
  8. Claire Vo — список и таймкоды пользовательских тестов: первичное описание проведённых прогонов.