Claude 3: как Anthropic догнала GPT-4 в марте 2024 года
Разбираем, что на самом деле показал релиз Claude 3 от 4 марта 2024 года: где Opus вышел на уровень GPT-4, почему Sonnet был не...
Открыть материал →Глубокие исследования искусственного интеллекта: разборы papers, моделей, бенчмарков, безопасности, регулирования и механизмов работы.

Разбираем, что на самом деле показал релиз Claude 3 от 4 марта 2024 года: где Opus вышел на уровень GPT-4, почему Sonnet был не...
Открыть материал →
23 июля 2024 года Meta выпустила Llama 3.1 405B и заявила, что открытая модель уровня frontier наконец сравнялась с закрытыми системами. Разбираем paper, model...
Открыть материал →
Разбираем работу Oxford OATML и Nature 2024 о semantic entropy — методе, который оценивает неопределённость LLM по смыслу ответов и помогает ловить часть галлюцинаций...
Открыть материал →
Разбор Contextual Retrieval от Anthropic: зачем добавлять к каждому чанку короткий машинно-сгенерированный контекст, как это влияет на embeddings, BM25 и reranking, и где заканчиваются...
Открыть материал →
Разбираем, что именно стандартизует Model Context Protocol, как в нём устроены tools, resources и prompts, и чем запуск Anthropic в 2024 году отличается от...
Открыть материал →
22 октября 2024 Anthropic показала Computer Use — режим, в котором Claude 3.5 Sonnet работает с GUI по скриншотам. Разбираем метод, OSWorld-результаты, риски и...
Открыть материал →
Разбираем, как устроен SWE-bench Verified: из чего он вырос, что именно измерял у coding-агентов, почему его цифры часто сравнивали некорректно и почему OpenAI позже...
Открыть материал →
Исторический обзор волны января–марта 2025: чем Open-R1, s1 и TinyZero на самом деле «повторяли» DeepSeek-R1, где сработали дистилляция и test-time scaling, а где —...
Открыть материал →
Разбираем работу Xu, Jain и Kankanhalli о том, почему полностью устранить галлюцинации у LLM нельзя в принципе. Что именно доказывает их формальная модель, где...
Открыть материал →
Разбираем две ключевые погодные работы DeepMind — GraphCast и GenCast. Где ML действительно обошёл ECMWF, почему сравнение с HRES и ENS — не одно...
Открыть материал →