Запись архива

Эксперимент: ChatGPT, Claude и Gemini уличили друг друга в галлюцинациях в общем чате

Пользователь Reddit запустил три LLM в одном чате для решения сложной задачи. Модели начали исправлять ошибки друг друга, выявив взаимные галлюцинации. Результат — идеальный ответ, но вопросы к методологии эксперимента остаются.

Редакционная обложка COMRAD404: Эксперимент: ChatGPT, Claude и Gemini уличили друг друга в галлюцинациях в общем чате
Редакционная обложка COMRAD404: Эксперимент: ChatGPT, Claude и Gemini уличили друг друга в галлюцинациях в общем чате
Редакционная тематическая обложка COMRAD404

Эксперимент пользователя Reddit

На Reddit в сообществе r/artificial пользователь под ником capibara13 опубликовал отчет о необычном эксперименте. Он запустил три популярные языковые модели — ChatGPT (OpenAI), Claude (Anthropic) и Gemini (Google) — в одном групповом чате, чтобы они совместно решали сложную задачу. Целью было проверить, смогут ли модели выявить ошибки друг друга в реальном времени, а не просто при сравнении ответов в разных вкладках.

Что произошло в чате

ChatGPT первым выдал развернутый, структурированный, но полностью неверный ответ. Он сгенерировал налоговое правило, которое не применялось к задаче — классическая галлюцинация. Claude, получив ответ ChatGPT, сразу указал на ошибку, но при попытке исправить её сам допустил неточность в финальных математических расчетах. Gemini выступил в роли арбитра: он взял структуру от ChatGPT, логические правки от Claude, исправил математику и выдал безупречный итоговый результат.

Почему это вызвало дискуссию

Ключевое наблюдение автора: когда модель проверяет саму себя, она лишь повторяет те же допущения. Но принудительное перекрестное рецензирование разных моделей (OpenAI, Anthropic, Google) выявляет взаимные слепые зоны и галлюцинации. Пользователь настолько увлекся идеей, что создал сайт для организации подобных дебатов между моделями без ручного копирования между вкладками.

Что остается неясным

Эксперимент носит частный характер, его результаты не подтверждены независимой проверкой. Неизвестны точные формулировки промптов, версии моделей и настройки температуры генерации. Также неясно, насколько воспроизводим такой результат на других задачах — возможно, успех зависит от конкретной темы и сложности вопроса.

Ключевые моменты эксперимента

Punkt Detail
Автор Пользователь Reddit capibara13
Участники ChatGPT, Claude, Gemini
Результат Gemini исправил ошибки ChatGPT и Claude, выдал верный ответ
Вывод автора Перекрестная проверка моделей эффективнее самопроверки
Статус Частный эксперимент, не подтвержден независимо

Что дальше

Сообщество обсуждает возможность интеграции подобных «AI-дебатов» в рабочие процессы разработчиков и аналитиков. Однако для практического применения необходимы систематические тесты на разных типах задач и с разными комбинациями моделей. Пока что эксперимент — интересный, но единичный случай, который стоит проверить самостоятельно.

Источники: оригинальный пост на Reddit (https://www.reddit.com/r/artificial/comments/1vx1jrm/i_brought_chatgpt_claude_and_gemini_into_a_group/), информация о моделях OpenAI (https://openai.com/news/).