
Инцидент на Маунт-Шаста и запуск GPT-6 Astra — два события одной недели, которые заставляют задуматься о том, как растёт разрыв между возможностями моделей и пониманием их ограничений пользователями.
Инцидент: Gemini посоветовала взять минимум провизии
1 сентября трое альпинистов из Розвилла (Калифорния) использовали Google Gemini для планирования восхождения на Маунт-Шаста (4322 м). ИИ посоветовал взять значительно меньше еды и воды, чем требовалось для безопасного маршрута. Группа достигла вершины в 19:00 — на четыре часа позже рекомендованного времени разворота. Спуск проходил в темноте, один из участников повредил колено. Альпинисты провели ночь в каньоне, пока на следующее утро их не обнаружили спасатели.
Google заявила, что не может воспроизвести ошибочные ответы Gemini. Возможно, формулировки запросов были нечёткими, возможно, модель проявила избыточную уверенность. Суть не в этом: три человека доверились выводу LLM как экспертной рекомендации в контексте, где ошибка имела серьёзные последствия.
Запуск GPT-6 Astra: новый рубеж возможностей
Два дня спустя OpenAI анонсировала GPT-6 Astra. Показатели модели впечатляют:
— 99,9% на ARC-AGI-3 (бенчмарк абстрактного мышления)
— 97,6% на FrontierMath Tier 4 (продвинутая математика)
— 100% на ExploitBench (выявление уязвимостей)
OpenAI назвала этот запуск началом эры AGI. Независимые оценки Artificial Analysis более сдержанны: Anthropic Fable 5.1 по-прежнему опережает GPT-6 Astra в общем индексе интеллекта.
Проблема калибровки доверия
История с альпинистами и анонс GPT-6 Astra — не два параллельных события, а две стороны одной медали. Каждый раз, когда модель становится более способной, больше людей доверяют ей в более ответственных ситуациях. Разрыв между тем, что модель действительно может, и тем, что пользователь понимает о её ограничениях, не сокращается автоматически при росте возможностей. Напротив, он может увеличиваться: чем убедительнее выводы, тем сложнее пользователю заподозрить ошибку.
Автор исходного поста на Reddit, работающий с организациями по внедрению ИИ, отмечает: самая распространённая проблема — не избыточный скептицизм, а незнание, когда перестать доверять модели.
Практические выводы
Для разработчиков и пользователей LLM этот кейс — напоминание о фундаментальных ограничениях:
— Модели не оценивают достоверность собственных ответов в контексте физической безопасности.
— Уверенный тон вывода не коррелирует с фактической точностью.
— Рост бенчмарков (ARC-AGI, FrontierMath) не означает улучшения калибровки доверия в реальных сценариях.
Для продакшн-систем, особенно в критических приложениях, требуются дополнительные слои верификации — валидация фактов, внешние источники, явные указания на неопределённость.
Источники
- Оригинальный пост на Reddit: https://www.reddit.com/r/artificial/comments/1wa5i9p/three_hikers_got_rescued_off_a_mountain_this_week/
- Анонс OpenAI: https://openai.com/news/
