Инструкционное обучение (Instruction Tuning)
Инструкционное обучение — это дообучение LLM на парах «инструкция → ответ», чтобы модель лучше следовала запросам пользователя. Ниже — простое...
Редактор исследований и методологии
София Белова ведёт исследовательское направление COMRAD404. Она разбирает статьи, препринты и отчёты так, чтобы читателю были понятны дизайн исследования, выборка, метрики и границы вывода.
Отдельное внимание уделяет темам образования, науки и общественных эффектов ИИ. Корреляции не превращаются в причинность, а предварительные результаты обозначаются как предварительные.
Инструкционное обучение — это дообучение LLM на парах «инструкция → ответ», чтобы модель лучше следовала запросам пользователя. Ниже — простое...
DPO (Direct Preference Optimization) — метод посттренировки языковой модели по данным предпочтений без отдельной reward model. Ниже — простое объяснение,...
Few-shot prompting — это способ задать модели несколько примеров прямо в prompt, чтобы она уловила задачу, формат или стиль ответа...
Генеративная модель — это класс моделей, которые учатся распределению данных или латентной структуре и затем создают новые образцы. Ниже —...
Microsoft Orchard — не новая LLM, а framework, в котором среда, harness, данные и механизм выбора ответа образуют один агентный...
Известная история про «+14% в поддержке клиентов» оказалась чуть сложнее: в ранней рабочей версии — около 14%, в публикации QJE...
Разбираем paper Jamba от AI21 от 28 марта 2024 года: зачем смешивать Mamba, attention и MoE, что показали бенчмарки, где...
Разбираем, как AI2 связала открытый корпус Dolma, двухэтапное обучение OLMo 2 и публикацию всех артефактов — от данных и кода...
23 июля 2024 года Meta выпустила Llama 3.1 405B и заявила, что открытая модель уровня frontier наконец сравнялась с закрытыми...
Разбираем две ключевые погодные работы DeepMind — GraphCast и GenCast. Где ML действительно обошёл ECMWF, почему сравнение с HRES и...
Разбираем статью FlashAttention-3 от 11 июля 2024 года: как авторы переписали exact attention под NVIDIA Hopper, зачем нужны TMA, WGMMA...
Разбираем историческую схему Anthropic: что такое Constitutional AI, как RLAIF заменяет часть человеческой обратной связи, где метод полезен и в...