Препринт Rylan Schaeffer, Brando Miranda и Sanmi Koyejo Are Emergent Abilities of Large Language Models a Mirage? появился на arXiv 28 апреля 2023 года, а конференционная версия вышла в материалах NeurIPS 2023. Работа спорит не с тем, что большие языковые модели становятся сильнее при масштабировании, а с более узким тезисом: что резкие, будто бы внезапные скачки способностей на графиках обязательно отражают качественный перелом внутри самой модели.
Для практиков это не академическая тонкость. От трактовки «эмерджентности» зависит, как вы проектируете evals, чем меряете риск, можно ли экстраполировать поведение следующего масштаба и что именно считать новым свойством модели, а не побочным эффектом способа измерения. Исторически статья Schaeffer et al. отвечает прежде всего на волну работ 2022 года о «внезапных способностях», поэтому ниже — разбор именно этого тезиса и его последствий.
Коротко
- Schaeffer et al. не опровергают само масштабирование LLM; они оспаривают интерпретацию резких скачков на графиках как обязательного признака «новой способности».
- Ключевой механизм статьи: плавное улучшение на уровне токенов может превратиться в «обрыв» на графике, если использовать пороговую или нелинейную метрику вроде Exact String Match или Multiple Choice Grade.
- Авторы проверяют это на GPT-3/InstructGPT, в мета-анализе BIG-Bench и даже воспроизводят похожую «эмерджентность» в задачах зрения, просто меняя правило оценки.
- Работа не доказывает, что реальных порогов не бывает вообще. Позднейшие статьи 2024 года предлагают другие объяснения: роль разрешения оценки, in-context learning и порогов по pre-training loss.
- Практический вывод: вопрос не в том, «существует ли эмерджентность» в общем виде, а в том, какая метрика соответствует вашей продуктовой задаче и что именно вы хотите предсказывать — плавный рост качества или момент, когда система становится операционно пригодной.
Контекст: от «внезапных способностей» к спору о метриках
Термин emergent abilities в текущем LLM-контексте закрепился после работы Jason Wei и соавторов, впервые выложенной 15 июня 2022 года и затем опубликованной в Transactions on Machine Learning Research в 2022 году. Там способность называли эмерджентной, если она не наблюдается у меньших моделей, но появляется у больших, и потому не предсказывается простым продолжением кривой меньших масштабов.
Почти одновременно несколько текстов 2022 года задали общий фон спора. Beyond the Imitation Game по BIG-Bench показал, что часть задач масштабируется плавно, а часть выглядит как «breakthrough behavior». В Predictability and Surprise in Large Generative Models Anthropic сформулировала еще более общий тезис: loss на широкой тренировочной дистрибуции ведет себя предсказуемо, но отдельные способности и режимы отказа могут казаться неожиданными.
Это было важно не только для бенчмарков. Если у моделей действительно бывают качественные скачки на определенном масштабе, то простая экстраполяция по малым моделям становится ненадежной. А если скачок частично создается самим способом оценки, то проблема меняется: надо прежде всего улучшать измерение, а не искать мистическую «точку пробуждения» модели.
Метод: что именно проверяли Schaeffer et al.
Главная гипотеза Schaeffer et al. звучит узко и проверяемо: для фиксированной семейства моделей и фиксированных выходов кажущаяся эмерджентность может возникать из-за выбора метрики, а не из-за фундаментально разрывного изменения поведения модели с ростом масштаба.
Авторы строят аргумент в четыре шага.
- Простая математическая модель. Если базовое качество модели улучшается гладко — например, как плавно меняется вероятность правильного токена или cross-entropy, — то последующая нелинейная трансформация может превратить этот гладкий рост в резкий излом на графике итоговой метрики.
- Повторный анализ арифметики на GPT-3/InstructGPT. Те же семейства моделей, которые под Accuracy выглядят как получившие «внезапную» способность, под Token Edit Distance показывают более плавное улучшение.
- Мета-анализ BIG-Bench. Авторы смотрят не только на задачи, но и на то, какими именно метриками они оцениваются. Их тезис: «эмерджентность» концентрируется не в отдельных task-model pairs как таковых, а в конкретных типах метрик — прежде всего дискретных и нелинейных.
- Индукция псевдо-эмерджентности вне LLM. В задачах компьютерного зрения авторы задают специальные правила оценки и получают кривые, визуально похожие на «внезапное возникновение способности», хотя базовая динамика модели остается плавной.
Это сильный дизайн именно потому, что он не ограничивается полемикой на словах. Авторы сначала формулируют альтернативное объяснение, а затем выводят из него предсказания: если дело в метрике, то смена метрики должна менять вид кривой; если дело в разрешении оценки, то больше тестовых данных должно раскрывать слабый, но уже существующий прогресс малых моделей.
Результаты: что показала работа
Самый важный результат можно сформулировать коротко: одни и те же выходы модели могут выглядеть как «скачок способности» или как плавный рост в зависимости от того, чем вы их меряете. Для арифметических задач это хорошо видно на паре Accuracy против Token Edit Distance; для BIG-Bench — на паре Multiple Choice Grade против Brier Score.
Второй важный результат касается статистического разрешения. Когда тест слишком грубый, слабые модели могут казаться «нулевыми», хотя на более чувствительной оценке видно, что они уже постепенно улучшаются. Иначе говоря, плоский участок кривой не всегда означает отсутствие способности; иногда он означает, что инструмент измерения слишком груб, чтобы заметить слабый сигнал.
Третий результат — перенос аргумента за пределы LLM. Демонстрация похожего эффекта в vision-задачах важна не сама по себе, а как методологический удар по сильной версии тезиса об уникальной «магии больших языковых моделей». Если вид графика можно синтетически воспроизвести в других архитектурах и задачах, то по одному только графику нельзя делать сильный вывод о природе явления.
Ниже — сжатая таблица того, как спор эволюционировал после исходной волны 2022 года.
| Работа | Что считается источником «внезапности» | Что именно показано | Практический смысл |
|---|---|---|---|
| Wei et al., Emergent Abilities of Large Language Models (2022) | Рост масштаба модели | Часть способностей выглядит отсутствующей у малых моделей и заметной у больших | Возникает гипотеза о непредсказуемых новых возможностях при масштабировании |
| Schaeffer et al., Are Emergent Abilities of Large Language Models a Mirage? (2023) | Метрика и разрешение оценки | Резкость кривой часто меняется при смене метрики; похожий эффект можно искусственно воспроизвести | Нужно отделять свойства модели от свойств eval-пайплайна |
| Hu et al., Predicting Emergent Abilities with Infinite Resolution Evaluation (2024) | Недостаточное разрешение стандартных evals | Более чувствительная схема оценки выявляет слабый прогресс раньше, чем это видно по грубым метрикам | Для прогнозирования следующего масштаба полезны метрики с высокой разрешающей способностью |
| Lu et al., Are Emergent Abilities in Large Language Models just In-Context Learning? (2024) | Смешение собственно способности с in-context learning | Часть «эмерджентных» результатов объясняется не новой общей способностью, а режимом подсказки и знаниями модели | Нельзя интерпретировать любой резкий выигрыш как доказательство нового механизма рассуждения |
| Du et al., Understanding Emergent Abilities of Language Models from the Loss Perspective (2024) | Pre-training loss, а не просто число параметров | Порогоподобное поведение может оставаться, если смотреть на обучение через loss | Спор смещается от вопроса «есть ли скачок» к вопросу «по какой оси его правильно наблюдать» |
Интерпретация: что это значит для инженеров и исследователей
Сильнейшая часть статьи Schaeffer et al. в том, что она переводит разговор об «эмерджентности» из почти философского регистра в инженерный. После этой работы уже трудно смотреть на любой резкий график и автоматически считать его свидетельством нового внутреннего качества модели. Сначала надо спросить: какая метрика выбрана, насколько она дискретна, какая у нее динамика у слабых моделей и насколько плотна сама сетка измерений.
Наш комментарий
На наш взгляд, после 2023 года спор стал заметно точнее. В 2022-м поле в основном обсуждало, бывают ли у LLM неожиданные способности вообще. После Schaeffer et al. формулировка стала строже: что именно неожиданно — внутренняя способность модели, пользовательский порог полезности, метрика, схема подсказки или разрешение оценки?
Позднейшие работы 2024 года не столько «опровергли» Schaeffer, сколько разложили проблему на несколько осей. Hu et al. показали, что грубая оценка может скрывать слабый ранний прогресс. Lu et al. добавили, что часть эффектов путает общую способность с in-context learning. Du et al. в свою очередь указали, что порогоподобное поведение может не исчезать совсем, если переопределить ось масштаба и смотреть на pre-training loss, а не только на число параметров или FLOPs.
Практически это означает следующее: слово «эмерджентность» само по себе мало что объясняет. Нужно всегда уточнять, по какой оси вы измеряете масштаб, какой сигнал считаете истинным качеством и какая метрика соответствует вашей реальной задаче — исследовательскому прогнозу или производственному допуску.
Ограничения и критика
Сама статья Schaeffer et al. честно оговаривает свои пределы, и это важно не потерять.
- Она не доказывает, что настоящих эмерджентных способностей не бывает. В разделе ограничений авторы прямо пишут более узкий тезис: часть ранее заявленных случаев может быть миражом, индуцированным анализом.
- Доступ к данным ограничен. Для нескольких семейств с громкими claims об эмерджентности авторы не имели прямого доступа к выходам моделей и были вынуждены анализировать уже опубликованные результаты. Это делает аргумент сильным методологически, но не универсальным эмпирически.
- Непрерывная метрика не всегда лучше для продукта. Если вы строите калькулятор, систему проверки кода или агент с формальным критерием успеха, то мягкие метрики могут быть полезны для прогнозирования, но не заменяют бинарный operational check. Модель, которая «почти» решает задачу, все еще может быть непригодна для реального сценария.
- Человеческая полезность может быть сама по себе пороговой. Даже если внутренняя динамика модели гладкая, пользовательское восприятие и бизнес-критерии часто нелинейны: до определенного уровня система бесполезна, после него — полезна.
- Более поздняя литература предлагает множественные механизмы. После 2023 года стало ясно, что единое объяснение «всё — артефакт метрики» слишком сильное. В одних случаях решает метрика, в других — способ подсказки, в третьих — ось измерения вроде loss.
Именно поэтому полезно читать слово mirage буквально и узко. Не «все способности выдуманы», а «вид графика может обманывать, если не различать модель, метрику и разрешение эксперимента».
Вывод
Are Emergent Abilities of Large Language Models a Mirage? — важная работа не потому, что она «закрыла» тему эмерджентности, а потому, что она заставила поле тщательнее определять предмет спора. После нее нельзя уверенно говорить о «внезапной способности», не указав, какой именно метрикой и при каком разрешении эта внезапность наблюдается.
Для практиков минимальный вывод очень приземленный: храните сырые ответы модели, считайте несколько метрик одновременно, отделяйте метрики прогноза от метрик допуска в прод и не делайте сильных онтологических выводов из одного графика exact match. В споре об эмерджентности главный урок пока не в том, что скачков не бывает, а в том, что измерение — часть самого явления.
Источники
- Rylan Schaeffer, Brando Miranda, Sanmi Koyejo. Are Emergent Abilities of Large Language Models a Mirage?
- Rylan Schaeffer, Brando Miranda, Sanmi Koyejo. Are Emergent Abilities of Large Language Models a Mirage? NeurIPS 2023 Proceedings
- Jason Wei et al. Emergent Abilities of Large Language Models. Transactions on Machine Learning Research
- Jason Wei et al. Emergent Abilities of Large Language Models. arXiv
- Chitta Baral et al. Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models
- Deep Ganguli et al. Predictability and Surprise in Large Generative Models
- Shengding Hu et al. Predicting Emergent Abilities with Infinite Resolution Evaluation
- Shengding Hu et al. Predicting Emergent Abilities with Infinite Resolution Evaluation. OpenReview / ICLR 2024
- Sheng Lu et al. Are Emergent Abilities in Large Language Models just In-Context Learning?
- Sheng Lu et al. Are Emergent Abilities in Large Language Models just In-Context Learning? arXiv
- Zhengxiao Du et al. Understanding Emergent Abilities of Language Models from the Loss Perspective
- Zhengxiao Du et al. Understanding Emergent Abilities of Language Models from the Loss Perspective. NeurIPS 2024
FAQ
Значит ли это, что «внезапных способностей» у LLM не существует?
Нет. Работа Schaeffer et al. утверждает более узкую вещь: часть резких скачков на графиках можно объяснить метрикой и статистическим разрешением. Она не доказывает, что порогоподобного поведения не бывает вообще.
Почему тогда не отказаться от exact match и бинарных метрик?
Потому что для части задач именно они и определяют практическую пригодность. Для прогноза масштаба полезны мягкие и непрерывные метрики, но для продакшн-решения вам часто все равно нужен жесткий критерий успеха.
Что делать, если я строю собственный eval для модели?
Считать минимум две метрики: одну чувствительную к слабому раннему прогрессу и одну operational, отражающую реальный порог полезности. Полезно также сохранять сырые ответы, логиты или вероятности, чтобы не быть заложником одной агрегированной цифры.
Какой главный урок из спора 2023–2024 годов?
Не смешивать три разных вопроса: что умеет модель, как это измерено и при каком уровне качества это становится полезным для пользователя. Эти три оси могут давать очень разные «кривые эмерджентности».
