Исследования ИИ: технологии, модели и бенчмарки

133 материалов

Глубокие исследования искусственного интеллекта: разборы papers, моделей, бенчмарков, безопасности, регулирования и механизмов работы.

Схема аудита memorization: данные, атаки на модель, поиск совпадений и меры снижения риска копирайта

Запоминание и копирайт: что модель действительно «выучила наизусть»

Что именно генеративная модель может воспроизвести из трейна, когда это превращается в риск копирайта и почему фильтр exact match не решает проблему. Обзор ключевых...

Открыть материал →
Схема пайплайна LiveBench: свежие источники вопросов, генерация проверяемых задач, запуск моделей и автоматическая проверка по ground truth

LiveBench: что реально измеряет бенчмарк, который «нельзя выучить»

LiveBench обещал стать бенчмарком, который трудно «выучить» через тренировочные данные. Разбираем стартовую версию 2024 года, её метод, результаты и ограничения по paper, datasheet и...

Открыть материал →