Клэр Во, ведущая How I AI и руководитель продукта, проверила GPT-6 Astra не одним эффектным промптом, а серией рабочих сценариев. В её обзоре модель обновляет CRM, проводит QA в браузере, собирает продуктовую функцию, взаимодействует с мини-компьютером и создаёт настольное приложение. Такой набор полезнее одиночного бенчмарка: он показывает, где результат создаёт сама модель, а где решающую роль играют доступ к компьютеру, инструменты и грамотная постановка задачи.
Это всё ещё тест участника раннего доступа. Он не содержит одинакового сравнения с конкурентами, полной ведомости стоимости и серии повторов. Зато автор показывает экран и подробно проходит несколько разных процессов — редкая для первых дней релиза прозрачность.
Что произошло
Во опубликовала получасовой hands-on обзор. В 03:44 начинается работа с CRM, в 09:08 — создание визуала, в 13:00 — браузерный QA, в 15:20 — разработка функции для продукта, в 18:36 — hardware-сценарий с мини-компьютером и прямой трансляцией, в 22:23 — настольное приложение, а в 24:24 — тест с детской 3D-игрой.
Объединяет эти эпизоды не тип данных, а модель поведения. Astra должна понять цель, открыть нужный инструмент, выполнить последовательность действий, увидеть результат и продолжить после промежуточной ошибки. Это ближе к работе оператора, чем к генерации ответа в чате.
Почему это обсуждают
CRM и QA — хорошие стресс-тесты для computer use. Интерфейсы меняются, элементы подгружаются с задержкой, состояние распределено между страницами, а ошибка может проявиться только после нескольких кликов. Модель должна помнить исходную цель и одновременно реагировать на то, что реально появилось на экране.
Hardware-эпизод добавляет ещё один слой: физическое устройство и поток данных. Агентный результат зависит от подключения, драйверов, разрешений и обратной связи. Если система способна диагностировать цепочку целиком, ценность выходит за пределы «написать код». Но и поверхность риска растёт: неправильное действие затрагивает реальную учётную запись или устройство.
Для команд важен формат теста. Вместо вопроса «умная ли модель?» можно составить карту процессов: где есть известный результат, возможность отката и автоматическая проверка. CRM-обновление может оставаться черновиком, QA — завершаться отчётом, а код — проходить тесты до слияния.
Что подтверждено
- Опубликован полный видеопроход, а не только монтаж лучшего момента.
- Тест охватывает несколько классов задач: бизнес-интерфейс, браузер, код, продуктовый дизайн и физическое устройство.
- Автор показывает конкретные таймкоды и результаты каждого сценария.
- Официальная документация Astra подтверждает поддержку computer use, hosted shell, code interpreter, web search и других инструментов.
- Наиболее сильный общий сигнал — способность модели удерживать многошаговую цель и проверять состояние между действиями.
Последний вывод — интерпретация наблюдаемого поведения, а не измеренная метрика. Видео подтверждает отдельные успешные прогоны, но не сообщает вероятность успеха при повторении.
Что пока не ясно
Нет полного журнала токенов, стоимости и времени человеческой подготовки. Неизвестно, какие инструкции и навыки были заранее подключены, сколько неудачных запусков осталось за кадром и как те же задачи выполнили бы GPT-5.6 Sol или Claude при одинаковом доступе к инструментам.
Для CRM особенно важны права. Успешный клик в тестовой среде не доказывает безопасность в производственной базе. Агенту нужны минимальные разрешения, запрет на массовое изменение, подтверждение перед отправкой и журнал, позволяющий восстановить каждое действие.
QA тоже нельзя оценивать по красивому прохождению одного сценария. Нужна матрица браузеров, повторные прогоны, намеренно добавленные дефекты и подсчёт ложных находок. Иначе модель может уверенно «проверить» только счастливый путь.
Где смотреть
Основной источник — полный выпуск How I AI. Краткий список сценариев и таймкоды Клэр Во опубликовала в своём аккаунте X. Список доступных модели инструментов проверяется по официальной документации.
Мы сопоставили этот прогон с другими ранними тестами в экспертном обзоре GPT-6 Astra. Вывод для бизнеса простой: начинать стоит с обратимых процессов и заранее определённой приёмки — тогда эффект от computer use можно измерить, а не угадывать.
