
Пользователь Reddit с ником Conscious_Belt_8444, представившийся ветераном разработки ПО, задал в сообществе r/artificial провокационный вопрос: что именно мы до сих пор фундаментально не понимаем в ИИ? Обсуждение собрало более 200 комментариев, и центральный тезис автора — неожиданно приземлённый: «Большинство технологических революций в итоге оказываются скорее про сантехнику, чем про магию. ИИ не исключение».
Демо ≠ production: главный разрыв
Автор поста отмечает, что команды бросаются внедрять RAG, агентов, файнтюнинг и векторные базы, но через полгода обнаруживают, что реальные проблемы лежали в иной плоскости. Среди них:
– Плохое качество данных.
– Отсутствие адекватной системы оценки (evaluation).
– Неясные требования.
– Никто не отвечает за то, что модель выдала на выходе.
– И, конечно, ситуация, когда модель уверенно делает не то, что нужно.
«Эти проблемы не так интересно обсуждать, но именно они стоят денег», — резюмирует автор.
Что говорят комментаторы: три ключевых заблуждения
Иллюзия «достаточности контекста». Многие считают, что если модель видит всю историю диалога, она будет точной. На практике контекстные окна у LLM работают как «очень длинная лента внимания» — модель может игнорировать середину или забывать важные детали. Это особенно критично в задачах юридической и медицинской аналитики.
Оценка (eval) как послесловие. Разработчики часто создают eval-сеты уже после развёртывания, подгоняя их под поведение модели. Правильный подход — проектировать метрики до того, как писать код агента. Без этого любой fine-tuning — гадание.
Агенты ≠ автономность. В сообществе отмечают: «агент» — это не волшебная палочка. Если бизнес-логика не прописана, а границы действий модели не очерчены, агент будет галлюцинировать маршруты, которые никто не сможет проконтролировать.
Практические выводы: что делать
На основе обсуждения можно выделить несколько рекомендаций для команд, внедряющих ИИ:
– Начинайте с оценки качества данных и чётких критериев успеха, а не с выбора архитектуры.
– Определите «владельца вывода» — человека, который отвечает за то, что модель отправила в продакшн.
– Не используйте LLM для задач, где ошибка стоит дороже выгоды от автоматизации.
– Проверяйте, действительно ли контекстное окно модели обрабатывается так, как вы ожидаете — тестируйте на реальных длинных документах.
Источники
– Оригинальное обсуждение на Reddit: https://www.reddit.com/r/artificial/comments/1w5gvwb/what_part_of_ai_do_you_think_we_still/
