Sycophancy: почему ИИ поддакивает — разбор линии Anthropic 2023–2024
Исторический разбор работ Anthropic 2023–2024 о sycophancy: как RLHF и preference models подталкивают LLM соглашаться с пользователем даже тогда, когда это ухудшает правдивость ответа.
Открыть материал →





