
Эксперимент пользователя Reddit
На Reddit в сообществе r/artificial пользователь под ником capibara13 опубликовал отчет о необычном эксперименте. Он запустил три популярные языковые модели — ChatGPT (OpenAI), Claude (Anthropic) и Gemini (Google) — в одном групповом чате, чтобы они совместно решали сложную задачу. Целью было проверить, смогут ли модели выявить ошибки друг друга в реальном времени, а не просто при сравнении ответов в разных вкладках.
Что произошло в чате
ChatGPT первым выдал развернутый, структурированный, но полностью неверный ответ. Он сгенерировал налоговое правило, которое не применялось к задаче — классическая галлюцинация. Claude, получив ответ ChatGPT, сразу указал на ошибку, но при попытке исправить её сам допустил неточность в финальных математических расчетах. Gemini выступил в роли арбитра: он взял структуру от ChatGPT, логические правки от Claude, исправил математику и выдал безупречный итоговый результат.
Почему это вызвало дискуссию
Ключевое наблюдение автора: когда модель проверяет саму себя, она лишь повторяет те же допущения. Но принудительное перекрестное рецензирование разных моделей (OpenAI, Anthropic, Google) выявляет взаимные слепые зоны и галлюцинации. Пользователь настолько увлекся идеей, что создал сайт для организации подобных дебатов между моделями без ручного копирования между вкладками.
Что остается неясным
Эксперимент носит частный характер, его результаты не подтверждены независимой проверкой. Неизвестны точные формулировки промптов, версии моделей и настройки температуры генерации. Также неясно, насколько воспроизводим такой результат на других задачах — возможно, успех зависит от конкретной темы и сложности вопроса.
Ключевые моменты эксперимента
| Punkt | Detail |
|---|---|
| Автор | Пользователь Reddit capibara13 |
| Участники | ChatGPT, Claude, Gemini |
| Результат | Gemini исправил ошибки ChatGPT и Claude, выдал верный ответ |
| Вывод автора | Перекрестная проверка моделей эффективнее самопроверки |
| Статус | Частный эксперимент, не подтвержден независимо |
Что дальше
Сообщество обсуждает возможность интеграции подобных «AI-дебатов» в рабочие процессы разработчиков и аналитиков. Однако для практического применения необходимы систематические тесты на разных типах задач и с разными комбинациями моделей. Пока что эксперимент — интересный, но единичный случай, который стоит проверить самостоятельно.
Источники: оригинальный пост на Reddit (https://www.reddit.com/r/artificial/comments/1vx1jrm/i_brought_chatgpt_claude_and_gemini_into_a_group/), информация о моделях OpenAI (https://openai.com/news/).
