Запись архива

ИИ и критическое мышление на работе: разбор исследования Microsoft и CMU

Разбор работы Microsoft Research и Carnegie Mellon о том, как GenAI меняет критическое мышление в работе: где усилие реально исчезает, а где только смещается к проверке и надзору.

Схема исследования CHI 2025: от 319 работников знаний и 936 кейсов использования GenAI к выводу о смещении усилия от выполнения к проверке и надзору

В апреле 2025 года Microsoft Research опубликовала, а CHI 2025 включила в программу исследование Hao-Ping Lee и соавторов о том, как генеративный ИИ влияет на критическое мышление в knowledge work. Авторы не пытались доказать, что ИИ «делает людей глупее»: вместо этого они спросили, когда пользователи сами считают, что думают критически, и в каких местах GenAI снижает или перераспределяет когнитивное усилие.

Важно, что это срез практик, характерных для инструментов и рабочих сценариев до CHI 2025, то есть до более поздней волны агентных интерфейсов 2026 года. Поэтому работу полезно читать как исследование механизма риска: не только ошибок модели, но и когнитивной разгрузки, когда часть привычной умственной работы уходит во внешний инструмент.

Коротко

  • Это не лабораторный тест навыков и не longitudinal-исследование, а смешанное опросное исследование о самовосприятии работников знаний.
  • В своей выборке авторы опросили 319 человек и после очистки данных проанализировали 936 реальных кейсов использования GenAI в работе.
  • Ключевой вывод: при более высокой уверенности в возможностях ИИ пользователи реже сообщают о критическом мышлении; при этом усилие часто не исчезает совсем, а смещается к проверке, интеграции и надзору.
  • Главный практический риск связан не только с галлюцинациями модели, но и с тем, что низкоставочные задачи перестают тренировать человеческое суждение.
  • Работа не доказывает объективное «падение интеллекта», но хорошо показывает, где в рабочих процессах возникает риск чрезмерной зависимости от ИИ.

Контекст: что именно изучали

Тема когнитивной разгрузки сама по себе не нова. В исследованиях автоматизации давно обсуждается парадокс: чем больше система берёт на себя рутинные операции, тем реже человек практикует навык суждения, а значит хуже готов к редким, сложным и аварийным случаям. Классическая статья Lisanne Bainbridge 1983 года описала это как «иронии автоматизации», а более поздние работы по GenAI перенесли эту логику на текстовые и аналитические инструменты.

Для GenAI проблема острее, чем для обычного поиска или шаблонной автоматизации. Модель не просто находит источник, а предлагает уже собранный ответ, черновик письма, аргумент, фрагмент кода или интерпретацию данных. Из-за этого у пользователя может исчезать не только ручной труд, но и часть промежуточных когнитивных шагов: вспоминание, сравнение альтернатив, разбиение задачи, формулирование критериев качества.

До работы Lee и соавторов поле уже обсуждало метакогнитивные требования GenAI: пользователю нужно понимать собственную цель, уметь формулировать запрос, оценивать ответ и решать, когда системе можно доверять. Но именно эта статья сделала критическое мышление прямым объектом исследования в контексте knowledge work, а не обучения в вузе или школе.

Метод: как была устроена работа

Авторы операционализировали критическое мышление через таксономию Блума: knowledge, comprehension, application, analysis, synthesis и evaluation. Это важный методический выбор: вместо абстрактного вопроса «думаете ли вы критически?» исследование смотрит на конкретные когнитивные действия — вспоминание фактов, структурирование идей, решение задач, разбор проблемы на части, синтез и оценку качества.

Набор участников шёл через Prolific. В исследование брали людей, которые сами сообщали, что используют GenAI на работе минимум раз в неделю. Авторы получили 333 ответа, исключили 14 низкокачественных, а затем попросили участников описать по три реальных рабочих примера использования GenAI. После очистки из 957 примеров осталось 936.

Дальше работа разделяется на два слоя. Во-первых, качественный: исследователи кодировали свободные ответы о том, зачем люди думают критически, где не думают и почему усилие становится больше или меньше. Во-вторых, количественный: они построили одну mixed-effects логистическую модель для вопроса «было ли критическое мышление» и шесть mixed-effects линейных моделей для шести когнитивных активностей. Для поправки на множественные сравнения использовалась процедура Benjamini–Hochberg.

Ключевое ограничение заложено уже здесь: исследование измеряет самосообщаемое критическое мышление и самосообщаемое усилие. Оно не проверяет объективно, стал ли человек хуже решать задачи без ИИ.

Результаты: что показала работа

Ниже — главные числа из одной конкретной опросной работы Lee et al., а не рыночные оценки для всех офисных работников. Именно так их и стоит читать.

Метрика Что сообщили авторы Как это интерпретировать
Выборка 319 участников и 936 очищенных кейсов использования GenAI Материал достаточно большой для HCI-опроса, но это не репрезентативная панель всей экономики
Наличие критического мышления 555 из 936 кейсов, то есть около 59,29%, были помечены участниками как случаи, где они думали критически Это самооценка участников, а не внешний аудит качества мышления
Где усилие чаще становилось ниже В этой выборке доля ответов «меньше усилия» или «намного меньше усилия» составила 72% для knowledge, 79% для comprehension, 69% для application, 72% для analysis, 76% для synthesis и 55% для evaluation GenAI чаще всего снижал воспринимаемую трудоёмкость, но не одинаково по всем когнитивным стадиям
Связь с уверенностью Более высокая уверенность в том, что ИИ справится с задачей, была связана с меньшим количеством самосообщаемого критического мышления; авторы также наблюдали более слабые положительные связи для уверенности пользователя в себе и в своей способности оценивать ответ ИИ Самый устойчивый сигнал в работе — риск чрезмерного доверия к инструменту

Самое интересное в статье — не сама доля «60%», а карта перераспределения усилия. По качественному анализу исследователи увидели три сдвига.

  • От сбора информации к её проверке. GenAI облегчает поиск, сводку и первичную упаковку материала, но заставляет тратить усилие на верификацию фактов и пригодности ответа.
  • От решения задачи к интеграции ответа ИИ. Пользователь реже строит решение с нуля, но чаще подгоняет, комбинирует и локально исправляет ответ модели под контекст.
  • От выполнения к надзору. Вместо прямого производства артефакта работа смещается к управлению процессом: следить, направлять, сравнивать, отклонять, переписывать критерии.

Отдельно важно, что авторы не нашли простого объяснения вида «вот эти типы задач всегда убивают критическое мышление». Сигнал сильнее шёл не от категории задачи самой по себе, а от калибровки доверия: насколько пользователь уверен в инструменте и насколько уверен в собственных силах.

Интерпретация: что это значит для практиков

Наш комментарий

На наш взгляд, сильная сторона работы в том, что она смещает разговор с морализаторского тезиса «ИИ ленит людей» к более проверяемому механизму. Риск возникает не просто потому, что модель пишет за вас черновик, а потому что вместе с черновиком исчезают повторяющиеся микропрактики, на которых обычно и тренируется профессиональное суждение.

Это хорошо согласуется с более ранними работами о метакогнитивных требованиях GenAI и с классикой по автоматизации. Если система берёт на себя лёгкие и средние кейсы, человек оставляет себе надзор, проверку исключений и высокоставочные решения. Но именно для этого надзора нужны навыки, которые раньше поддерживались на рутине.

Для команды, внедряющей Copilot-подобные интерфейсы, практический вывод такой: качество модели само по себе не решает проблему. Если интерфейс выдаёт готовый ответ без требований к критериям, без видимого источника, без альтернатив и без явного шага проверки, организация почти наверняка оптимизирует скорость ценой ослабления навыка суждения.

Отсюда следуют вполне прикладные меры.

  • Фиксировать критерии качества до запроса к модели, а не после генерации.
  • Требовать краткое объяснение, почему ответ ИИ принят или отклонён.
  • Для высокорисковых сценариев разделять этапы: генерация, проверка источников, финальное утверждение человеком.
  • Сохранять часть задач в ручном режиме как тренировку базовых навыков, особенно для junior-специалистов.
  • Проектировать интерфейс так, чтобы он помогал сравнивать варианты, а не только принимал первый удобный ответ.

Ограничения и критика

У самой работы ограничения существенные, и авторы честно их перечисляют. Во-первых, люди могли путать «с GenAI стало легче работать» и «с GenAI стало нужно меньше критического мышления». Это не одно и то же.

Во-вторых, уверенность пользователя в себе не равна объективной компетентности. Человек может быть уверенным и ошибаться, а может быть неуверенным, но проверять ответ модели лучше других. Следовательно, связи между уверенностью и критическим мышлением нельзя автоматически переводить в связи между экспертизой и качеством результата.

В-третьих, выборка смещена в сторону более молодых, более технологически привычных пользователей, которые уже применяют GenAI минимум раз в неделю. Это важный срез ранних и регулярных пользователей, но не всей занятости в экономике.

В-четвёртых, исследование проходило только на английском языке и не покрывает мультиязычные и кросс-культурные контексты. В-пятых, оно не является longitudinal: по нему нельзя установить, приводит ли такая практика к долгосрочной деградации навыков или, наоборот, у части людей со временем формируется более сильный режим проверки.

Наконец, это исследование состояния инструментов до CHI 2025. Агентные продукты 2026 года добавили новые типы интерфейсов, новые режимы делегирования и новые точки контроля, поэтому буквальная экстраполяция на весь текущий рынок была бы слишком смелой.

Вывод

Работа Microsoft Research и Carnegie Mellon важна не тем, что ставит окончательный диагноз, а тем, что уточняет механизм риска. GenAI в knowledge work часто не убирает мышление целиком, а переносит усилие из выполнения в проверку, интеграцию и надзор — и делает этот перенос особенно опасным там, где доверие к системе высоко, а рутина больше не тренирует человеческое суждение.

Если вы внедряете ИИ в рабочие процессы, главный вопрос звучит не «экономит ли он время?», а «какие когнитивные шаги он убирает, и чем мы заменяем их как практику качества». Именно на этом уровне и стоит обсуждать риск когнитивной разгрузки.

Источники

FAQ

Доказывает ли работа, что ИИ «ухудшает интеллект»?

Нет. Она показывает самосообщаемое снижение или смещение усилия в одной выборке работников знаний. Объективного теста навыков до и после использования ИИ здесь нет.

Что в этой статье имеется в виду под когнитивной разгрузкой?

Речь о передаче части умственной работы внешнему инструменту: поиска, вспоминания, чернового синтеза, частично — оценки и формулирования решения. Проблема возникает, когда вместе с разгрузкой исчезает привычка проверки.

Почему для авторов так важна уверенность в ИИ?

Потому что именно высокая уверенность в способности GenAI выполнить задачу сильнее всего связана с меньшим количеством самосообщаемого критического мышления. Иначе говоря, риск начинается там, где пользователь считает ответ почти «по умолчанию» достаточным.

Что делать командам, которые уже используют GenAI каждый день?

Не ограничиваться политикой «человек в цикле». Нужны конкретные механизмы: критерии качества до генерации, видимые источники, журнал проверки, сравнение альтернатив и регулярная ручная практика в высокорисковых задачах.

Читайте также