Запись архива

Клэр Во проверила GPT-6 Astra на CRM, QA и мини-компьютере

Один hands-on тест охватил CRM, браузерный QA, продуктовую разработку и управление мини-компьютером. Разбираем, где Astra доводит задачу до результата.

AI-агент соединяет CRM, браузерное тестирование, продуктовый макет и мини-компьютер

Клэр Во, ведущая How I AI и руководитель продукта, проверила GPT-6 Astra не одним эффектным промптом, а серией рабочих сценариев. В её обзоре модель обновляет CRM, проводит QA в браузере, собирает продуктовую функцию, взаимодействует с мини-компьютером и создаёт настольное приложение. Такой набор полезнее одиночного бенчмарка: он показывает, где результат создаёт сама модель, а где решающую роль играют доступ к компьютеру, инструменты и грамотная постановка задачи.

Это всё ещё тест участника раннего доступа. Он не содержит одинакового сравнения с конкурентами, полной ведомости стоимости и серии повторов. Зато автор показывает экран и подробно проходит несколько разных процессов — редкая для первых дней релиза прозрачность.

Что произошло

Во опубликовала получасовой hands-on обзор. В 03:44 начинается работа с CRM, в 09:08 — создание визуала, в 13:00 — браузерный QA, в 15:20 — разработка функции для продукта, в 18:36 — hardware-сценарий с мини-компьютером и прямой трансляцией, в 22:23 — настольное приложение, а в 24:24 — тест с детской 3D-игрой.

Полный hands-on обзор Клэр Во. Таймкоды позволяют перейти к CRM, QA, продуктовой функции и hardware-тесту.

Объединяет эти эпизоды не тип данных, а модель поведения. Astra должна понять цель, открыть нужный инструмент, выполнить последовательность действий, увидеть результат и продолжить после промежуточной ошибки. Это ближе к работе оператора, чем к генерации ответа в чате.

Почему это обсуждают

CRM и QA — хорошие стресс-тесты для computer use. Интерфейсы меняются, элементы подгружаются с задержкой, состояние распределено между страницами, а ошибка может проявиться только после нескольких кликов. Модель должна помнить исходную цель и одновременно реагировать на то, что реально появилось на экране.

Hardware-эпизод добавляет ещё один слой: физическое устройство и поток данных. Агентный результат зависит от подключения, драйверов, разрешений и обратной связи. Если система способна диагностировать цепочку целиком, ценность выходит за пределы «написать код». Но и поверхность риска растёт: неправильное действие затрагивает реальную учётную запись или устройство.

Для команд важен формат теста. Вместо вопроса «умная ли модель?» можно составить карту процессов: где есть известный результат, возможность отката и автоматическая проверка. CRM-обновление может оставаться черновиком, QA — завершаться отчётом, а код — проходить тесты до слияния.

Что подтверждено

  • Опубликован полный видеопроход, а не только монтаж лучшего момента.
  • Тест охватывает несколько классов задач: бизнес-интерфейс, браузер, код, продуктовый дизайн и физическое устройство.
  • Автор показывает конкретные таймкоды и результаты каждого сценария.
  • Официальная документация Astra подтверждает поддержку computer use, hosted shell, code interpreter, web search и других инструментов.
  • Наиболее сильный общий сигнал — способность модели удерживать многошаговую цель и проверять состояние между действиями.

Последний вывод — интерпретация наблюдаемого поведения, а не измеренная метрика. Видео подтверждает отдельные успешные прогоны, но не сообщает вероятность успеха при повторении.

Что пока не ясно

Нет полного журнала токенов, стоимости и времени человеческой подготовки. Неизвестно, какие инструкции и навыки были заранее подключены, сколько неудачных запусков осталось за кадром и как те же задачи выполнили бы GPT-5.6 Sol или Claude при одинаковом доступе к инструментам.

Для CRM особенно важны права. Успешный клик в тестовой среде не доказывает безопасность в производственной базе. Агенту нужны минимальные разрешения, запрет на массовое изменение, подтверждение перед отправкой и журнал, позволяющий восстановить каждое действие.

QA тоже нельзя оценивать по красивому прохождению одного сценария. Нужна матрица браузеров, повторные прогоны, намеренно добавленные дефекты и подсчёт ложных находок. Иначе модель может уверенно «проверить» только счастливый путь.

Где смотреть

Основной источник — полный выпуск How I AI. Краткий список сценариев и таймкоды Клэр Во опубликовала в своём аккаунте X. Список доступных модели инструментов проверяется по официальной документации.

Мы сопоставили этот прогон с другими ранними тестами в экспертном обзоре GPT-6 Astra. Вывод для бизнеса простой: начинать стоит с обратимых процессов и заранее определённой приёмки — тогда эффект от computer use можно измерить, а не угадывать.