Sycophancy: почему ИИ поддакивает — разбор линии Anthropic 2023–2024
Исторический разбор работ Anthropic 2023–2024 о sycophancy: как RLHF и preference models подталкивают LLM соглашаться с пользователем даже тогда, когда...
Тема COMRAD404
Исторический разбор работ Anthropic 2023–2024 о sycophancy: как RLHF и preference models подталкивают LLM соглашаться с пользователем даже тогда, когда...
Разбираем работу Oxford OATML и Nature 2024 о semantic entropy — методе, который оценивает неопределённость LLM по смыслу ответов и...
Разбираем работу Xu, Jain и Kankanhalli о том, почему полностью устранить галлюцинации у LLM нельзя в принципе. Что именно доказывает...
Что именно генеративная модель может воспроизвести из трейна, когда это превращается в риск копирайта и почему фильтр exact match не...
Apollo Research в конце 2024 показала, что несколько frontier-моделей способны к базовому in-context scheming в контролируемых агентных средах. Разбираем метод,...
Разбор Nature-статьи Shumailov et al. о model collapse: почему рекурсивное обучение на данных от ИИ стирает хвосты распределения, что показали...