Mamba: линейная альтернатива трансформеру — разбор исходной работы Gu и Dao
Разбираем исходную Mamba: как selective state spaces сделали рекуррентную модель контекстно-зависимой, почему scan заменил attention и где результаты статьи действительно...
Тема COMRAD404
Разбираем исходную Mamba: как selective state spaces сделали рекуррентную модель контекстно-зависимой, почему scan заменил attention и где результаты статьи действительно...
Разбираем Mixture of Experts без хайпа: что делает роутер, почему активируется лишь часть параметров, откуда берутся overflow и token dropping...
Разбираем paper Jamba от AI21 от 28 марта 2024 года: зачем смешивать Mamba, attention и MoE, что показали бенчмарки, где...
Обзор трёх линий ускорения вывода LLM из окна 2023–2024: классического speculative decoding, Medusa и EAGLE. Разбираем механику, цифры, гарантии точности...
Разбираем статью FlashAttention-3 от 11 июля 2024 года: как авторы переписали exact attention под NVIDIA Hopper, зачем нужны TMA, WGMMA...
Разбираем три ключевых подхода к низкобитной работе с LLM — GPTQ, AWQ и QLoRA: что именно они квантуют, для чего...
Разбираем исходную работу Microsoft от 27 февраля 2024 года о BitNet b1.58: как устроена тернарная LLM, где именно появляется выигрыш...
Разбираем первый релиз DeepSeek-R1 от 20 января 2025 года: что именно дистиллировали в Qwen и Llama, какие результаты показали модели...
Разбираем, из каких частей собирают длинный контекст в LLM: что делает RoPE, зачем нужны YaRN и LongRoPE, и почему без...