Работа Ziwei Xu, Sanjay Jain и Mohan Kankanhalli была впервые подана на arXiv 22 января 2024 года; в разборе мы опираемся на доступную версию v2 от 13 февраля 2025 года, но обсуждаем именно тезис исходной статьи 2024 года. Авторы пытаются ответить не на практический вопрос «как уменьшить галлюцинации», а на более жёсткий: можно ли устранить их полностью в принципе.
Их ответ отрицательный, но важна оговорка: это не универсальный приговор всем ошибкам чат-ботов в реальном мире. Это формальный результат внутри специально заданной модели, где LLM рассматривается как вычислимая функция, а «истина» задаётся другой вычислимой функцией.
Коротко
- Xu et al. формализуют галлюцинацию как несовпадение вывода LLM с некоторой вычислимой функцией истины.
- Ключевой инструмент доказательства — диагонализация: для любого класса вычислимых моделей можно построить задачу, на которой каждая из них где-то ошибётся.
- Авторы делают сильный вывод: полностью безгаллюцинаторная универсальная LLM недостижима, если требовать корректности на всех вычислимых задачах.
- При этом статья не утверждает, что модели бесполезны или что они ошибаются одинаково часто на всех типах запросов.
- Главная практическая мысль для инженера — смещать цель с «убрать ошибки навсегда» на «уменьшать ошибки, заземлять ответ и уметь отказываться от ответа».
Контекст и постановка проблемы
Большая часть литературы о галлюцинациях занимается измерением и снижением ошибок: строит метрики, датасеты, retrieval-пайплайны, схемы самопроверки и специальные decoding-стратегии. Это хорошо описано в обзоре Survey of Hallucination in Natural Language Generation. Но такие работы в основном эмпирические: они показывают, что ошибка стала реже на конкретных задачах, а не отвечают на вопрос о принципиальной достижимости нуля.
Xu et al. меняют постановку. Их интересует не «можно ли снизить factual error на бенчмарке», а «существует ли вообще процедура обучения, после которой LLM станет полностью истинной для любой целевой функции». Это уже вопрос из теории вычислимости и алгоритмического обучения, а не из стандартной оценки моделей.
Есть и ещё одна причина, почему авторам пришлось уйти в абстракцию. Как отмечают и сами Xu et al., и Kees van Deemter в статье The Pitfalls of Defining Hallucination, формально определить «истинность» в реальном языке очень трудно: в ответах бывают неоднозначность, недосказанность, несколько допустимых формулировок и прагматические эффекты. Поэтому Xu et al. сознательно заменяют реальный мир более узким формальным миром, где у каждого входа есть единственный корректный выход.
Метод: почему в статье звучит тезис «галлюцинации неизбежны»
Формальная конструкция статьи опирается на три шага.
Шаг 1. Что такое LLM в этой модели
Авторы абстрагируются от трансформеров, attention, токенизаторов и параметров. После обучения LLM рассматривается просто как тотальная вычислимая функция из строк в строки. У модели есть состояния обучения: условно, после разных объёмов увиденных примеров получается состояние h[i].
Шаг 2. Что такое «мир» и «галлюцинация»
Затем вводится вычислимая функция истины f. Она задаёт единственно правильный ответ для любого входа s. Формальный мир — это множество пар (s, f(s)). Галлюцинация определяется жёстко: модель галлюцинирует относительно f, если для любого состояния обучения найдётся хотя бы один вход, на котором ответ модели не совпадёт с f.
Hallucination(h, f) := для любого состояния h[i] существует вход s,
такой что h[i](s) ≠ f(s)
Это более сильное и более узкое определение, чем бытовое «модель иногда уверенно выдумывает факты». Здесь ошибка — любое несовпадение с заранее заданной функцией истины.
Шаг 3. Диагонализация
Дальше появляется главный ход статьи: диагонализация, знакомая по классической теории вычислимости. Представьте таблицу, где по строкам перечислены все состояния всех моделей из некоторого класса, а по столбцам — все возможные входные строки. В каждой клетке стоит ответ модели на соответствующий вход.
Теперь можно построить новую функцию истины так, чтобы на диагонали таблицы она специально отличалась от каждого ответа модели. Если в клетке на диагонали модель выдала одно значение, новая функция возвращает другое. Значит, для каждой строки таблицы находится вход, на котором соответствующая модель ошибается. Именно это и даёт невозможность полной безошибочности.
Интуитивно это не аргумент о «плохих данных» или «слабой архитектуре». Это аргумент о том, что как только вы фиксируете вычислимый класс решателей, можно построить задачу, выходящую за пределы его полного покрытия.
Результаты
Ниже — компактная карта того, что именно утверждает работа.
| Результат | Формулировка без лишней математики | Практический смысл |
|---|---|---|
| Теорема 1 | Для любого перечислимого семейства LLM можно построить вычислимую целевую функцию, на которой каждая модель из семейства где-то ошибётся. | Если класс моделей фиксирован, всегда можно найти задачу вне зоны полной надёжности. |
| Теорема 2 | Можно построить такую функцию, где ошибка будет возникать не в одном исключительном месте, а на бесконечном множестве входов. | Аргумент не сводится к единичному контрпримеру. |
| Теорема 3 | Вывод распространяется на любую вычислимую LLM, а не только на заранее перечисленный набор архитектур. | Полностью истинная универсальная LLM как общий решатель вычислимых задач недостижима. |
| Таблица 3 и приложения | Авторы связывают риск ошибок с задачами перечисления, комбинаторики и логического вывода при ограничениях на вычисления; эмпирические приложения служат иллюстрацией. | Особенно осторожно стоит относиться к ответам на формальные задачи, где верность ответа легко проверить, но трудно вывести. |
| Приложения E2 и E3 | Статья также показывает верхнюю границу: существуют семейства функций, для которых некоторые LLM в принципе могут быть безгаллюцинаторными. | Тезис статьи не равен формуле «модель обречена ошибаться везде и всегда». |
Это последний пункт часто теряется в пересказах. В приложении E2 авторы дают верхнюю границу множества функций, на которых конкретная вычислимая LLM может быть полностью корректной после обучения. А в E3 показывают и обратную сторону: для некоторых перечислимых семейств вычислимых функций можно сконструировать LLM, которая будет безошибочной. Иными словами, статья доказывает не повсеместный провал, а невозможность универсального покрытия.
Эмпирическая часть в приложениях важна, но её роль скромнее, чем у теорем. Она иллюстрирует идею на игрушечных задачах вроде полного перечисления строк, отношений порядка и индексирования символов. Это не «доказательство данными», а демонстрация того, как формальная мысль может проявляться в поведении моделей.
Интерпретация
Наш комментарий
На наш взгляд, сильная сторона статьи в том, что она меняет инженерную цель. Если принять её рамку, задача уже не в том, чтобы мечтать о модели, которая «никогда не галлюцинирует», а в том, чтобы управлять неизбежной областью неопределённости: заземлять ответы, добавлять внешние источники, строить проверки и давать модели право на отказ от ответа.
Это хорошо согласуется с другими линиями исследований, хотя и не тождественно им. В Calibrated Language Models Must Hallucinate Kalai и Vempala показывают более узкий, статистический результат: для калиброванных языковых моделей галлюцинации неизбежны на определённом классе редких фактов. А работы вроде Chain-of-Verification Reduces Hallucination in Large Language Models и Don’t Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM Collaboration показывают практический путь: не обещать полную ликвидацию ошибки, а снижать её и лучше распознавать границы знания.
Из этого следует трезвый вывод для продакшна. Если ваш сценарий допускает автоматический ответ без источников и без механизма отказа, вы спорите не только с текущим уровнем моделей, но и, возможно, с более общей теоретической границей. Если же система умеет извлекать факты из внешней базы, ссылаться на документы и говорить «не знаю», вы уже оптимизируете не невозможную цель, а реалистичную.
Ограничения и критика
- Формальное определение уже содержит сильные допущения. В статье у каждого входа есть единственный правильный выход. В реальном языке это часто не так: возможны несколько корректных ответов, допустимая неопределённость и разные уровни детализации.
- Переход от формального мира к реальному — это интерпретация, а не прямое измерение. Xu et al. утверждают, что формальный мир является частью реального, поэтому невозможность переносится и на практические LLM. Это правдоподобный, но не полностью бесспорный шаг.
- Результат экзистенциальный. Для любой вычислимой LLM существует функция, на которой она ошибётся. Но из этого не следует, что типичные пользовательские вопросы лежат именно в этой трудной области.
- Статья не объясняет все виды галлюцинаций единым механизмом. Обзоры по теме отдельно выделяют проблемы данных, декодирования, архитектуры, outdated knowledge и слабой привязки к контексту. Теорема Xu et al. не отменяет эти причины, а добавляет к ним фундаментальный слой.
- Эмпирические приложения ограничены. Они полезны как иллюстрации, но не заменяют широкую оценку на реальных рабочих нагрузках вроде поиска по документам, customer support или code review.
- Отказ от ответа вынесен за рамку базового определения. На практике «не знаю» часто лучше ложного утверждения. Именно поэтому линия работ про abstention так важна: она не опровергает Xu et al., а меняет критерий качества системы.
Вывод
Xu et al. не доказывают, что каждая реальная ошибка LLM предопределена одним и тем же законом. Они доказывают более узкое, но важное утверждение: если мыслить о модели как об универсальном вычислимом решателе, полностью убрать галлюцинации нельзя.
Для практики это не повод отказаться от LLM, а повод точнее ставить задачу. Надёжные системы строятся не вокруг мечты о безошибочной генерации, а вокруг источников, верификации, ограничений домена и права модели не отвечать там, где она не знает.
Источники
- Hallucination is Inevitable: An Innate Limitation of Large Language Models — Ziwei Xu, Sanjay Jain, Mohan Kankanhalli.
- Hallucination is Inevitable: An Innate Limitation of Large Language Models (PDF) — Ziwei Xu, Sanjay Jain, Mohan Kankanhalli.
- Calibrated Language Models Must Hallucinate — Adam Tauman Kalai, Santosh S. Vempala.
- Survey of Hallucination in Natural Language Generation — Ziwei Ji и соавторы.
- The Pitfalls of Defining Hallucination — Kees van Deemter.
- Chain-of-Verification Reduces Hallucination in Large Language Models — Shehzaad Dhuliawala и соавторы.
- Don’t Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM Collaboration — Shangbin Feng и соавторы.
- Learning families of algebraic structures from informant — Nikolay Bazhenov, Ekaterina Fokina, Luca San Mauro.
FAQ
Доказывает ли статья, что любая ошибка ChatGPT или Claude теоретически неизбежна?
Нет. Работа доказывает невозможность универсальной безошибочности в своей формальной модели. Она не классифицирует каждую практическую ошибку и не измеряет частоту ошибок на реальных продуктах.
Значит ли это, что RAG, CoVe и другие mitigations бессмысленны?
Нет. Такие методы могут заметно снижать число ошибок или лучше выявлять незнание модели. Тезис Xu et al. только в том, что общего и окончательного устранения галлюцинаций они не гарантируют.
Можно ли обойти вывод, если разрешить модели отвечать «не знаю»?
Частично на практике — да, и именно поэтому abstention важен. Но это уже другой критерий качества системы: не полная истинность на всех входах, а надёжное распознавание границы знания.
