Запись архива

Поддержка клиентов +14%? Что на самом деле показала Generative AI at Work

Известная история про «+14% в поддержке клиентов» оказалась чуть сложнее: в ранней рабочей версии — около 14%, в публикации QJE 2025 — около 15%. Разбираем дизайн, результаты и ограничения исследования.

Схема поэтапного внедрения GPT-3-помощника в чат-поддержке и сравнения результатов агентов до и после доступа к ИИ

Работа Erik Brynjolfsson, Danielle Li и Lindsey Raymond сначала появилась как working paper весной 2023 года, а 4 февраля 2025 года вышла в The Quarterly Journal of Economics и вошла в майский выпуск журнала. Авторы изучали поэтапное внедрение генеративного помощника для чат-поддержки в Fortune 500 компании, продающей бизнес-ПО для малого и среднего бизнеса в США. Именно из ранней версии пошёл широко цитируемый тезис про «+14% производительности». В финальной peer-reviewed версии формулировка уже немного другая: эффект ближе к 15%, а главный вывод связан не только со средним ростом, но и с тем, кому именно ИИ помогал сильнее.

Коротко

  • Историческое «+14%» относится к раннему публичному ходу работы: его повторяют рабочие и обзорные материалы 2023–2025 годов. В финальной статье QJE авторы пишут уже о 15% среднем росте производительности по метрике решённых обращений в час.
  • В рецензированной версии выборка — 5,172 агента и около 3 млн чатов; в ранних пересказах часто встречается 5,179.
  • Сильнее всего выиграли новички и менее результативные сотрудники: в статье указано до 30% роста по главной метрике у слабейших групп.
  • Это не сплошной RCT на всей выборке. Основной результат строится на staggered rollout и difference-in-differences после небольшого раннего RCT.
  • Работа не отвечает на вопросы о зарплатах, занятости и долгосрочном вытеснении труда; она показывает среднесрочный эффект одного GPT-3-ориентированного инструмента в одной компании.

Контекст

Почему эта статья стала заметной? До неё у генеративного ИИ было много лабораторных и онлайн-экспериментов, но мало наблюдений за реальной работой тысяч сотрудников внутри одной компании. Служба поддержки для такого анализа подходит хорошо: чаты сохраняются, качество и скорость можно измерять, а траектории обучения сотрудников видны по месяцам.

Авторы смотрят на техническую чат-поддержку крупного вендора бизнес-софта. Работа агентов достаточно однородна: они отвечают американским клиентам малого бизнеса на типовые и нетиповые вопросы по продукту. При этом различия между сотрудниками велики: кто-то быстрее диагностирует проблему, кто-то лучше держит тон разговора, кто-то эффективнее снимает напряжение клиента. Именно такую «неформализуемую» разницу в поведении и пытается частично захватить ML-система.

Для практиков здесь важен не только сам эффект, но и его форма. Статья не показывает «ИИ заменил поддержку». Она показывает другой сценарий: ИИ выступает как механизм передачи лучших практик от сильных агентов к слабым и новым.

Метод

Что именно внедрили

В опубликованной версии QJE инструмент описан как система на базе GPT-3 с дополнительной настройкой под customer support. Модель следила за диалогом в чате и в реальном времени предлагала формулировки ответов. Важно, что агент оставался «в контуре»: он мог принять подсказку, отредактировать её или полностью проигнорировать.

Система дообучалась на большом массиве предыдущих диалогов, размеченных по исходам: был ли вопрос решён, сколько длился разговор, относился ли агент к сильным исполнителям и так далее. Отсюда центральная гипотеза статьи: генеративный помощник может не просто ускорять набор текста, а распространять скрытые паттерны поведения лучших сотрудников.

Как оценивали эффект

В статье есть важное уточнение к формулировке «полевой эксперимент». Перед широким запуском был небольшой ранний RCT, но основные выводы работы построены не на нём, а на последующем поэтапном внедрении инструмента осенью 2020 и зимой 2021 года. Доступ зависел от ограничений на обучение и бюджета, а не от чистой случайной раздачи всем сразу.

Каждый агент получал доступ после трёхчасовой онлайн-сессии. Основная эмпирическая стратегия — difference-in-differences со fixed effects по агенту, месяцу и стажу, плюс event study и дополнительные проверки устойчивости.

y_it = δ_t + α_i + β * AI_it + γ * X_it + ε_it

Если упростить: авторы сравнивают, как меняются показатели у одних и тех же сотрудников до и после получения доступа к ИИ, и сопоставляют это с динамикой тех, кто ещё не получил инструмент или не получил его вовсе.

Результаты

Сначала — главное про версионность. Если вы помните только заголовок «поддержка клиентов +14%», это не совсем ошибка, но и не вся история. Ниже — различие между ранним публичным изложением и финальной рецензированной версией.

Версия Как формулировался эффект Размер выборки Что важно
Working paper / ранние пересказы 2023–2025 Около 14% или 14.2% роста производительности 5,179 агентов Именно отсюда пришёл популярный тезис «+14%»
QJE 2025 / финальная peer-reviewed версия 15% среднего роста по метрике resolved issues per hour 5,172 агента Это версия, на которую корректно ссылаться сегодня

Внутри финальной версии картина выглядит так.

Метрика Изменение после доступа к ИИ Как читать результат
Решённые обращения в час +15% в среднем Главный итог статьи; речь не о субъективной «полезности», а о производительности по операционной метрике
Среднее время чата -3.7 минуты, или -8.5% от базового уровня Агенты быстрее закрывали разговоры
Чаты в час +0.37, то есть примерно +15% Помощник ускорял не только отдельный ответ, но и многозадачность
Customer sentiment +0.18 пункта, около 0.5 SD Клиенты в среднем общались заметно спокойнее
Текучесть у агентов со стажем меньше 6 месяцев Около -10 п.п., то есть примерно -40% от базового уровня 25% Интерпретировать осторожно: сами авторы помечают этот результат как менее надёжный, чем основной

Но средний эффект — только половина истории. Самый содержательный результат статьи в том, что ИИ не одинаково помогает всем. Менее опытные и менее сильные сотрудники улучшали результаты сильнее; в статье для таких групп фигурирует рост до 30% по основной метрике. Более того, агенты с двумя месяцами стажа после доступа к системе работали примерно на уровне тех, у кого без ИИ было больше шести месяцев стажа.

Для сильных и опытных сотрудников картина смешанная. Скорость у них почти не меняется или растёт слабо, а по части качественных показателей авторы находят небольшие ухудшения. Это важный антихайповый момент: система не просто «делает всех лучше». Она сжимает разброс производительности и сильнее подтягивает низ хвоста.

Ещё один интересный результат касается механизма. Авторы пишут, что максимальные выгоды наблюдаются не на самых частых кейсах, а на умеренно редких проблемах: там у людей ещё мало собственного опыта, но у системы уже хватает примеров из обучающих данных. Если данных недостаточно, инструмент вообще может не давать подсказки.

Интерпретация

Наш комментарий

На наш взгляд, это одна из самых полезных для практиков статей об ИИ на работе именно потому, что она описывает не магию, а конкретный организационный механизм. ИИ здесь работает как слой операционного наставничества: он не обязательно подменяет эксперта, но способен быстро раздавать его поведенческие паттерны всей команде.

Из этого следует довольно прикладной вывод. Если вы внедряете LLM-инструмент в поддержку, продажи или бэк-офис, то максимальная отдача может прийти не там, где у вас уже сильнейшие сотрудники, а там, где дорого обучение, высок разброс качества и много неявного знания. Иначе говоря, ИИ в этой статье — это скорее ускоритель онбординга и выравнивания качества, чем «сверхсотрудник» для лучших исполнителей.

Есть и второй вывод. Показатели customer sentiment и снижения эскалаций намекают, что экономический эффект может идти не только через скорость, но и через эмоциональную сторону сервиса: меньше конфликтов, меньше ощущения беспомощности у нового агента, меньше поводов звать менеджера. Для бизнеса это часто не менее важно, чем сухой KPI на час.

Ограничения

Первое. Это одна компания, одна профессия и один тип взаимодействия — текстовая техническая поддержка. Переносить результат на юристов, аналитиков, медиков или enterprise-продажи напрямую нельзя.

Второе. Изучался GPT-3-ориентированный инструмент эпохи 2020–2021 годов, а не современные мультимодальные или reasoning-модели 2026 года. Поэтому статья важна скорее как исследование механизма внедрения, чем как точная оценка возможностей текущего поколения моделей.

Третье. Основной дизайн — не полный RCT, а поэтапное внедрение с квази-экспериментальной идентификацией. Авторы делают event study, альтернативные staggered-DiD-оценки и инструментальную проверку через дату первого внедрения в команде, но риск скрытого отбора полностью не исчезает.

Четвёртое. Работа почти ничего не говорит о зарплатах, найме, долгосрочной структуре команды и общем спросе на труд. Авторы прямо пишут, что не измеряют wages, overall labor demand и skill composition hires.

Пятое. Не все «хорошие новости» одинаково надёжны. Для текучести авторы отдельно просят осторожности: увольнение происходит один раз на сотрудника, поэтому модель там слабее, чем в основном анализе производительности.

Вывод

Generative AI at Work — это не просто статья про «+14% в поддержке клиентов». Корректнее говорить так: ранняя публичная версия закрепила число около 14%, а финальная публикация QJE 2025 сообщает о среднем эффекте около 15% и показывает, что основной выигрыш достаётся новичкам и менее сильным агентам. Для практиков это хороший ориентир: генеративный ИИ особенно полезен там, где нужно быстро передавать скрытые лучшие практики, а не только автоматизировать набор текста.

Источники

FAQ

Почему в одних пересказах говорится о +14%, а в других о +15%?

Потому что это разные версии одной и той же исследовательской линии. Ранние working paper и обзорные материалы пересказывали эффект как примерно 14–14.2% и часто использовали выборку 5,179 агентов. В финальной статье QJE 2025 авторы говорят о 15% и используют выборку 5,172 агентов.

Это был настоящий рандомизированный полевой эксперимент?

Не на всей основной выборке. Перед масштабным запуском был небольшой RCT, но центральные результаты статьи строятся на поэтапном rollout и квази-экспериментальном сравнении до и после внедрения.

Значит ли работа, что ИИ лучше всего подходит для замены новичков?

Нет. Работа показывает скорее обратное: инструмент повышал результативность новичков и ускорял их обучение. Это аргумент в пользу модели «усиления сотрудника», а не прямой замены.

Можно ли переносить этот результат на современные LLM-системы в 2026 году?

Только с оговорками. Механизм передачи лучших практик, вероятно, сохраняется, но абсолютные цифры из GPT-3-эпохи нельзя автоматически переносить на новые модели, другие каналы поддержки и другие организационные процессы.

Читайте также