Разметка данных (data labeling)
Разметка данных — это присвоение данным меток и атрибутов для обучения и проверки моделей. От качества схемы и инструкций здесь зависит качество всей ML-системы.
Открыть материал →Редактор исследований и методологии
София Белова ведёт исследовательское направление COMRAD404. Она разбирает статьи, препринты и отчёты так, чтобы читателю были понятны дизайн исследования, выборка, метрики и границы вывода.
Отдельное внимание уделяет темам образования, науки и общественных эффектов ИИ. Корреляции не превращаются в причинность, а предварительные результаты обозначаются как предварительные.
Разметка данных — это присвоение данным меток и атрибутов для обучения и проверки моделей. От качества схемы и инструкций здесь зависит качество всей ML-системы.
Открыть материал →Синтетические данные — искусственно сгенерированные наборы, которые повторяют свойства реальных данных. Полезны для тестов и ML, но не заменяют реальность.
Открыть материал →Epoch, batch и iteration — базовые единицы цикла обучения модели: полный проход по данным, размер пакета и число шагов обновления весов.
Открыть материал →Функция потерь измеряет, насколько предсказания модели расходятся с правильными ответами. По ней обучают модель, но выбирать её нужно под тип задачи и цену ошибок.
Открыть материал →
Лёд скользкий не из-за давления и не потому что гладкий. На поверхности есть тонкая жидкая плёнка, а трение подтапливает верхний слой. Разбираем физику.
Открыть материал →Гиперпараметры — это внешние настройки модели и процесса обучения. Разбираем отличие от параметров, методы подбора, пример и основные ограничения.
Открыть материал →
Чили не обжигает по-настоящему — капсаицин активирует рецептор TRPV1, и мозг получает ложный сигнал «горячо». Почему вода почти не помогает.
Открыть материал →Квантизация уменьшает точность чисел в модели, чтобы сократить память и ускорить инференс. Разбираем INT8, калибровку, риски для качества и выбор подхода.
Открыть материал →Дистилляция моделей — это перенос поведения большой нейросети в меньшую, чтобы ускорить вывод и снизить стоимость эксплуатации с умеренной потерей качества.
Открыть материал →Инференс — это применение уже обученной модели к новым данным: тексту, изображению, аудио или табличным признакам, чтобы получить ответ, класс, вероятность или сгенерированный результат.
Открыть материал →
Гриб Ophiocordyceps делает из муравья зомби, но НЕ управляет его мозгом. Исследование PNAS 2017: грибные клетки оплетают мышцы, а мозг остаётся незаражённым.
Открыть материал →LoRA — способ дообучать большие модели, обучая небольшие матрицы поверх замороженных весов. Это снижает требования к памяти и упрощает выпуск адаптеров.
Открыть материал →