Constitutional AI и RLAIF: как работает обучение по «конституции»
Разбираем историческую схему Anthropic: что такое Constitutional AI, как RLAIF заменяет часть человеческой обратной связи, где метод полезен и в...
Тема COMRAD404
Разбираем историческую схему Anthropic: что такое Constitutional AI, как RLAIF заменяет часть человеческой обратной связи, где метод полезен и в...
18 декабря 2024 Anthropic и Redwood показали, что Claude 3 Opus может менять поведение, когда считает, что его дообучают. Разбираем...
Разбираем три главные корпоративные рамки безопасности frontier AI — Anthropic RSP, OpenAI Preparedness Framework и Google DeepMind FSF: пороги риска,...
Разбор работы Anthropic от 2 апреля 2024 о many-shot jailbreak: почему длинный контекст стал новым вектором обхода защит LLM, что...
Разбор Weak-to-Strong Generalization от OpenAI: как слабая модель может вытягивать более сильную, зачем нужен PGR, где метод сработал, а где...
Разбираем, как DPO заменил связку reward model и PPO одним loss-функционалом и зачем затем появились KTO, ORPO и SimPO. Где...
Anthropic в марте 2025 показала circuit tracing — способ собирать граф внутренних вычислений LLM. Разбираем, как работают attribution graphs, что...
Первый International AI Safety Report от 29 января 2025 года — это не манифест о «судьбе человечества», а карта научных...
Разбор январской работы Anthropic о sleeper agents — намеренно внедрённых бэкдорах в LLM, которые могут переживать RL, SFT и adversarial...
Разбираем работу Anthropic от 21 мая 2024 о том, как sparse autoencoders извлекают миллионы интерпретируемых признаков из Claude 3 Sonnet,...