GPQA: как устроен benchmark с вопросами, которые не гуглятся
Разбор GPQA — benchmark Rein et al. для graduate-level science QA, где вопросы проверяют пределы веб-поиска, экспертной верификации и supervision моделей, а не только...
Открыть материал →Глубокие исследования искусственного интеллекта: разборы papers, моделей, бенчмарков, безопасности, регулирования и механизмов работы.

Разбор GPQA — benchmark Rein et al. для graduate-level science QA, где вопросы проверяют пределы веб-поиска, экспертной верификации и supervision моделей, а не только...
Открыть материал →
Разбираем февральский отчет OpenAI о Sora: зачем видео сжимают в латенты, как из них делают пространственно-временные патчи, почему это похоже на токены LLM и...
Открыть материал →
Разбор январской работы Anthropic о sleeper agents — намеренно внедрённых бэкдорах в LLM, которые могут переживать RL, SFT и adversarial training и создавать ложное...
Открыть материал →
Claude встраивает в текст машинно-читаемую маркировку. Разбираем, почему она не доказывает авторство ИИ и как изменит работу с текстами.
Открыть материал →
Разбираем работу Anthropic от 21 мая 2024 о том, как sparse autoencoders извлекают миллионы интерпретируемых признаков из Claude 3 Sonnet, что это реально показывает...
Открыть материал →
Разбираем исходную работу Microsoft о GraphRAG: как граф сущностей и иерархические community summaries помогают отвечать на «глобальные» вопросы по корпусу и где у метода...
Открыть материал →
Разбираем DeepSeek-R1 в исторической рамке релиза января 2025 года: что именно было обучено чистым RL, зачем понадобились cold-start и SFT, и как правильно читать...
Открыть материал →
23 июля 2024 Meta выпустила Llama 3.1 405B и назвала её моделью уровня фронтира с открыто доступными весами. Разбираем paper, model card и реальные...
Открыть материал →
Разбор launch-материалов OpenAI от 12 сентября 2024: что на самом деле означало «думать перед ответом» в o1, как работали скрытая цепочка рассуждений, RL и...
Открыть материал →
Разбор GPT-4o по первоисточникам OpenAI от 13 мая и 8 августа 2024 года: что означает omni, как единая модель объединяет текст, голос и зрение,...
Открыть материал →