Chinchilla и переобучение: почему модели «перекармливают»
Объясняем, что на самом деле показала работа Chinchilla от 29 марта 2022 года, почему многие LLM были недообучены по токенам...
Тема COMRAD404
Объясняем, что на самом деле показала работа Chinchilla от 29 марта 2022 года, почему многие LLM были недообучены по токенам...
Разбираем отчёт Epoch AI 2024 о «стене данных»: как авторы оценивали запас публичного человеческого текста, почему получили окно 2026-2032 и...
Разбираем работу Meta и MBZUAI о том, как измерять ёмкость знаний LLM в битах на параметр: что означает предел 2...
Разбираем, почему масштабирование LLM больше не сводится к росту параметров. На основе работ 2020–2025 объясняем три рычага: данные, ёмкость модели...
Schaeffer и коллеги утверждают: многие «внезапные способности» LLM могут быть не скачком модели, а эффектом метрики. Разбираем, что именно показала...