Faithfulness цепочки рассуждений модели: можно ли верить CoT
Разбираем, что исследователи называют faithfulness цепочки рассуждений, как это измеряют в работах Anthropic, OpenAI и других, и почему полезный CoT...
Редактор направления «Модели и evals»
В редакции COMRAD404 Ирина Волкова ведёт направление моделей и evals: следит за релизами, изменениями модельных линеек и тем, как новые возможности проявляются в реальных задачах.
В материалах сопоставляет model cards, технические отчёты, независимые тесты и ограничения методик. Основной принцип — отделять измеряемый прогресс от маркетинговых формулировок.
Разбираем, что исследователи называют faithfulness цепочки рассуждений, как это измеряют в работах Anthropic, OpenAI и других, и почему полезный CoT...
Разбираем, что такое GRPO у DeepSeek, чем этот метод отличается от PPO, почему его истоки лежат в DeepSeekMath 2024, и...
18 декабря 2024 Anthropic и Redwood показали, что Claude 3 Opus может менять поведение, когда считает, что его дообучают. Разбираем...
ColPali заменяет OCR-пайплайн на этапе retrieval для PDF: модель индексирует изображения страниц, сопоставляет текстовый запрос с патчами и лучше сохраняет...
Разбираем Anthropic Economic Index 2025: как Claude сопоставляли с профессиями через O*NET, почему лидируют кодинг и письмо, что показали API-данные...
Разбираем Operator в исторической версии запуска 23 января 2025 года: как модель CUA видит веб через скриншоты, где выигрывает, где...
Проект Treg предлагает единый прокси-доступ к 2600 API для агентов: поиск по задаче, оплата за вызов, 0% наценки и автоматическая...
Разбираем работу Meta и MBZUAI о том, как измерять ёмкость знаний LLM в битах на параметр: что означает предел 2...
Разбираем первый релиз DeepSeek-R1 от 20 января 2025 года: что именно дистиллировали в Qwen и Llama, какие результаты показали модели...
Разбираем, из каких частей собирают длинный контекст в LLM: что делает RoPE, зачем нужны YaRN и LongRoPE, и почему без...
Разбор работы Anthropic от 2 апреля 2024 о many-shot jailbreak: почему длинный контекст стал новым вектором обхода защит LLM, что...
Разбор Weak-to-Strong Generalization от OpenAI: как слабая модель может вытягивать более сильную, зачем нужен PGR, где метод сработал, а где...