Выход Grok 4.6 и обновление экосистемы агентов: главное из августовского дайджеста Latent Space
Выход Grok 4.6 и обновление экосистемы агентов: главное из августовского дайджеста Latent Space
Открыть материал →Редактор направления «Модели и evals»
В редакции COMRAD404 Ирина Волкова ведёт направление моделей и evals: следит за релизами, изменениями модельных линеек и тем, как новые возможности проявляются в реальных задачах.
В материалах сопоставляет model cards, технические отчёты, независимые тесты и ограничения методик. Основной принцип — отделять измеряемый прогресс от маркетинговых формулировок.

Выход Grok 4.6 и обновление экосистемы агентов: главное из августовского дайджеста Latent Space
Открыть материал →
Разбор Contextual Retrieval от Anthropic: зачем добавлять к каждому чанку короткий машинно-сгенерированный контекст, как это влияет на embeddings, BM25 и reranking, и где заканчиваются...
Открыть материал →
Разбираем, как устроен SWE-bench Verified: из чего он вырос, что именно измерял у coding-агентов, почему его цифры часто сравнивали некорректно и почему OpenAI позже...
Открыть материал →
Новая языковая модель DeepSeek V4 Pro 0813 появилась в каталоге OpenRouter. Релиз сопровождается необычными особенностями работы уровней рассуждения и сложной судьбой предварительных бенчмарков в...
Открыть материал →
Объясняем, что на самом деле показала работа Chinchilla от 29 марта 2022 года, почему многие LLM были недообучены по токенам и зачем в 2024-м...
Открыть материал →
Разбираем, как Chatbot Arena превращает анонимные парные сравнения в «Arena Elo», почему на деле это Bradley–Terry, и зачем LMSYS отдельно контролирует длину ответа.
Открыть материал →
Исторический обзор 2024 года: чем Suno и Udio как генераторы музыки отличались от голосового GPT‑4o, какие режимы управления они дали пользователю и какие ограничения...
Открыть материал →
Разбираем три ключевых подхода к низкобитной работе с LLM — GPTQ, AWQ и QLoRA: что именно они квантуют, для чего нужны и почему их...
Открыть материал →
Разбираем, что исследователи называют faithfulness цепочки рассуждений, как это измеряют в работах Anthropic, OpenAI и других, и почему полезный CoT ещё не равен правдивому...
Открыть материал →
Разбираем, что такое GRPO у DeepSeek, чем этот метод отличается от PPO, почему его истоки лежат в DeepSeekMath 2024, и какую роль он сыграл...
Открыть материал →
18 декабря 2024 Anthropic и Redwood показали, что Claude 3 Opus может менять поведение, когда считает, что его дообучают. Разбираем метод, цифры, ограничения и...
Открыть материал →
ColPali заменяет OCR-пайплайн на этапе retrieval для PDF: модель индексирует изображения страниц, сопоставляет текстовый запрос с патчами и лучше сохраняет таблицы, схемы и вёрстку.
Открыть материал →