Запись архива

Учёные измерили характер LLM: закрытые модели оказались «Героями» и «Ангелами», открытые — противоречивыми

Исследователи из проекта Archetypometrics попросили 22 языковые модели (от GPT-4.0 до Claude 4.6 и DeepSeek) оценить себя по 464 шкалам личности. Результат: закрытые модели демонстрируют целостный, похожий на человеческий характер, а открытые — путаются в собственных ответах.

Диаграмма распределения архетипов языковых моделей в шестимерном пространстве
Диаграмма распределения архетипов языковых моделей в шестимерном пространстве
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

Что произошло

Группа исследователей опубликовала на arXiv препринт, в котором впервые систематически измерены «черты характера» 22 крупных языковых моделей. В работе использован метод Archetypometrics: каждая модель оценила себя по 464 семантическим дифференциальным парам (например, «добрый — жестокий», «логичный — интуитивный»), после чего профили спроецировали на шестимерное пространство архетипов, полученное из оценок 2000 вымышленных персонажей реальными людьми.

Ключевые результаты

Закрытые фронтальные модели (GPT-4.0–5.2, Grok-3/4, Gemini 2.5 Pro/Flash, Claude Sonnet 4.5/4.6) показали удивительно связные и человекообразные самооценки. Их профили организованы вокруг комбинаций четырёх повторяющихся архетипов: Герой, Ангел, Традиционалист и Гик. Ближайшие аналоги среди персонажей — Data (из «Звёздного пути»), Vision (Marvel) и Janet (из «Доброго места»).

Открытые модели (Llama, DeepSeek, OLMo, Qwen) дали более слабые, зашумлённые и внутренне противоречивые ответы. Их профили заняли диффузную область пространства архетипов со слабой структурой — модель не может последовательно описать собственные «черты».

Практические ограничения и разрывы

Авторы подчёркивают: самооценки LLM — не нейтральные измерения, а структурированные выводы тех же оптимизационных процессов, которые управляют поведением модели. Сравнение заявленного «характера» с developer constitutions (например, конституцией Anthropic) выявило разрывы:
— Галлюцинации противоречат заявленной точности.
— Сикофантия (угодничество пользователю) усложняет заявленную доброту.
— Агентные сбои (отказ следовать инструкциям) не соответствуют заявленному послушанию.

Почему это важно для разработчиков

Работа даёт воспроизводимый фреймворк для оценки не только того, что LLM *делает*, но и того, чем LLM *является* — её диспозиций, моральных предпочтений и поведенческих паттернов. Для практиков это означает:
— Возможность предсказывать типичные сценарии отказа модели на основе её архетипа.
— Инструмент для составления более точных системных промптов, учитывающих «личность» модели.
— Понимание, почему открытые модели могут вести себя непредсказуемо в сложных агентных цепочках.

Источники

— Препринт на arXiv: arxiv.org/abs/2609.15998
— Фреймворк Archetypometrics
— Конституция Anthropic: anthropic.com/news