Anthropic Economic Index: какие профессии реально используют ИИ
Разбираем Anthropic Economic Index 2025: как Claude сопоставляли с профессиями через O*NET, почему лидируют кодинг и письмо, что показали API-данные и где у метода...
Открыть материал →Редактор направления «Модели и evals»
В редакции COMRAD404 Ирина Волкова ведёт направление моделей и evals: следит за релизами, изменениями модельных линеек и тем, как новые возможности проявляются в реальных задачах.
В материалах сопоставляет model cards, технические отчёты, независимые тесты и ограничения методик. Основной принцип — отделять измеряемый прогресс от маркетинговых формулировок.

Разбираем Anthropic Economic Index 2025: как Claude сопоставляли с профессиями через O*NET, почему лидируют кодинг и письмо, что показали API-данные и где у метода...
Открыть материал →
Разбираем Operator в исторической версии запуска 23 января 2025 года: как модель CUA видит веб через скриншоты, где выигрывает, где ошибается и какие ограничения...
Открыть материал →
Разбираем работу Meta и MBZUAI о том, как измерять ёмкость знаний LLM в битах на параметр: что означает предел 2 бита, как его получили...
Открыть материал →
Разбираем первый релиз DeepSeek-R1 от 20 января 2025 года: что именно дистиллировали в Qwen и Llama, какие результаты показали модели 1.5B–70B и где у...
Открыть материал →
Разбираем, из каких частей собирают длинный контекст в LLM: что делает RoPE, зачем нужны YaRN и LongRoPE, и почему без blockwise/ring-attention миллион токенов не...
Открыть материал →
Разбор работы Anthropic от 2 апреля 2024 о many-shot jailbreak: почему длинный контекст стал новым вектором обхода защит LLM, что именно измеряли авторы и...
Открыть материал →
Разбор Weak-to-Strong Generalization от OpenAI: как слабая модель может вытягивать более сильную, зачем нужен PGR, где метод сработал, а где провалился, и что это...
Открыть материал →
Разбираем, что именно показала работа Lost in the Middle, почему длинное окно не гарантирует использование всех фрагментов и как это меняет дизайн RAG-систем.
Открыть материал →
Разбираем две ключевые работы 2023–2024 годов о самопроверке RAG: Self-RAG учит модель решать, когда искать и как критиковать ответ, а CRAG исправляет неудачный retrieval...
Открыть материал →
Anthropic в марте 2025 показала circuit tracing — способ собирать граф внутренних вычислений LLM. Разбираем, как работают attribution graphs, что они реально доказывают и...
Открыть материал →
Разбираем FrontierMath от Epoch AI в исторической версии 2024 года: как собрали задачи, почему ни одна модель не превышала 2% и какие ограничения бенчмарка...
Открыть материал →
Сравниваем длинный контекст и RAG по первоисточникам 2024 года: где full-context действительно сильнее, где retrieval не сдал позиции, и почему в продакшене чаще выигрывает...
Открыть материал →