Запись архива

Council 1.2: слепое рецензирование ответов ИИ — анонс на Reddit

Пользователь Reddit анонсировал версию 1.2 инструмента Council с открытым исходным кодом, который отправляет один вопрос нескольким моделям ИИ и проводит анонимную взаимную рецензию ответов. Ключевое нововведение — гостевой режим, позволяющий вставить ответ из любого источника для равноправной оценки.

Интерфейс инструмента Council 1.2 для слепого рецензирования ответов разных моделей ИИ
Интерфейс инструмента Council 1.2 для слепого рецензирования ответов разных моделей ИИ
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Council 1.2: слепое рецензирование ответов ИИ

Что произошло

На Reddit в разделе r/artificial опубликован анонс версии 1.2 утилиты Council с открытым исходным кодом (лицензия MIT). Инструмент отправляет один вопрос нескольким моделям ИИ одновременно, после чего каждая анонимно рецензирует ответы остальных — названия моделей удаляются, чтобы репутация бренда не влияла на оценку. Итог: шкала согласованности 0–100 и указание ответов, выбивающихся из общего поля. Ключевое нововведение — гостевой режим: пользователь может вставить ответ из любого источника (ChatGPT, Gemini, коллега), и он участвует в раунде как анонимный советник, не раскрывая происхождение.

Почему это обсуждают

Council решает прикладную задачу объективной оценки ответов моделей без опоры на бренд. В ситуации, когда каждый новый релиз заявляет о превосходстве, слепая рецензия даёт независимый срез: модели оценивают друг друга вслепую, а не по имени. Гостевой режим позволяет проверить конкретный сторонний ответ на фоне пула моделей — это востребовано в командах, где решения принимаются на основе консультаций с ИИ. Утилита работает как в облаке, так и полностью локально, что важно для задач с ограничениями по передаче данных.

Что подтверждено и что остаётся неясным

Подтверждено: код опубликован, работает с Claude, GPT, Gemini, DeepSeek, Grok, Mistral, Perplexity, OpenRouter, Ollama, Apple on-device и любым OpenAI-совместимым сервером (llama.cpp, LM Studio, vLLM). Доступен CLI с параметрами –seats, –guest, –json, –fail-above. Нет телеметрии, не требует регистрации. Неясно: как методология справляется с систематическими ошибками самих моделей (например, склонность одобрять стилистически похожие ответы), насколько воспроизводимы результаты при повторных запусках, как ведут себя слабые модели при рецензировании сильных.

Что проверять

Запустить Council локально через Ollama с 2–3 моделями, вставить guest-ответ от закрытой модели или коллеги и оценить разброс. Проверить работу флага –fail-above в CI-скриптах. Сравнить результаты при исключении одной модели из пула для оценки стабильности итогового score.

Punkt Detail
Версия 2
Лицензия MIT
Режимы Прямой опрос + гостевой (guest)
Поддерживаемые модели Claude, GPT, Gemini, DeepSeek, Grok, Mistral, Perplexity, OpenRouter, Ollama, Apple on-device, OpenAI-совместимые серверы
CLI council “вопрос” –seats m1,m2 –guest file.txt –json –fail-above N
Телеметрия Отсутствует
Регистрация Не требуется

Источники:

Оригинальный пост на Reddit: https://www.reddit.com/r/artificial/comments/1v8c34s/council_12_drop_any_ais_answer_into_a_blind/

Верификация: https://openai.com/news/