
Hugging Face объявила конкурс E2LM для NeurIPS 2025. Участникам предлагают разработать бенчмарки, которые смогут различать языковые модели на ранних этапах обучения. Основной фокус — задания по научным знаниям.
Объявление опубликовано 4 июля 2025 года в блоге Hugging Face. Конкурс рассчитан на исследователей и разработчиков инструментов оценки LLM. Решения будут запускаться через Hugging Face Space, а их результаты — собираться в общей таблице лидеров.
Почему стандартных тестов может быть недостаточно
При обучении большой языковой модели исследователи обычно сравнивают несколько вариантов архитектуры, состава данных и гиперпараметров. Для этого они смотрят на кривую обучающей потери и результаты тестов на контрольных наборах.
Проблема возникает на ранних контрольных точках. Модель уже обработала значительный объём данных, но ещё далека от завершения обучения. В этот момент привычный бенчмарк может давать почти одинаковые результаты для разных вариантов эксперимента. Исследователю становится трудно понять, какое изменение действительно улучшает будущую модель.
В описании E2LM организаторы говорят о сценариях, где модели обучаются примерно на первых 200 млрд токенов. Это не универсальная граница для всех экспериментов, а ориентир, используемый в конкурсной методике. Задача соревнования — найти тесты, которые раньше и надёжнее показывают содержательные различия между моделями.
Конкурс не пытается определить лучший способ обучения LLM напрямую. Он посвящён качеству самих методов оценки: насколько хорошо набор заданий отражает прогресс модели и помогает сравнивать ранние контрольные точки.
Что именно будут оценивать
Каждое решение получит три основных показателя:
- SQ — качество сигнала;
- RC — согласованность ранжирования;
- CS — соответствие научным знаниям.
Итоговый результат рассчитывается как взвешенная сумма этих компонентов. В объявлении указаны коэффициенты 0,5 для SQ, 0,1 для RC и 0,4 для CS.
Такая схема отдаёт приоритет способности теста давать различимый сигнал и проверять корректные научные знания. Устойчивого ранжирования моделей недостаточно: задания должны быть содержательными и относиться к заявленной предметной области.
Организаторы также планируют две дополнительные проверки. Первая должна установить, соответствуют ли задания признанным научным направлениям. Вторая направлена на выявление утечки ответа, когда правильный вариант можно восстановить непосредственно из формулировки вопроса.
Эти процедуры описаны как часть конкурсной методики. В опубликованном материале нет результатов завершённого соревнования или независимой оценки того, насколько хорошо такая система работает на других типах моделей и задач. Поэтому итоговое место в таблице будет показывать результат внутри E2LM, но само по себе не станет доказательством универсальности предложенного бенчмарка.
Какие модели и данные получат участники
Для локального расчёта SQ организаторы обещают предоставить контрольные точки трёх небольших моделей — на 0,5, 1 и 3 млрд параметров. Для них заявлен диапазон обучения до 200 млрд токенов. Вместе с моделями участники получат алгоритм оценки и стартовые ноутбуки.
Два других компонента полностью воспроизвести локально нельзя. Контрольные точки, используемые для RC и CS, будут скрыты. В описании упоминаются модели, обученные на объёмах от 200 млрд до 1 трлн токенов, а также модель на 0,5 млрд параметров, обученная только на веб-данных.
Скрытая часть оценки должна снизить риск подгонки решения под опубликованные модели. Одновременно это ограничивает независимую проверку: участник сможет заранее вычислить SQ, но итоговый балл будет зависеть от серверной оценки на закрытых контрольных точках.
Предоставляемые модели, по словам организаторов, должны запускаться даже на бесплатных GPU Google Colab. Это характеристика стартового набора, а не гарантия для любой пользовательской реализации. Объём памяти, время расчёта и стабильность запуска будут зависеть от конкретного ноутбука и выбранного решения.
Как подать решение
Регистрация проходит через форму конкурса. Для отправки решений потребуется использовать библиотеку lm-evaluation-harness и загрузить результат через Hugging Face Space. Официальная информация о конкурсе опубликована на странице проекта E2LM.
Организаторы также подготовили стартовый набор с ноутбуками. Перед разработкой собственного бенчмарка имеет смысл сначала проверить базовый сценарий:
запустить предоставленный ноутбук на одной из открытых контрольных точек;
измерить время расчёта SQ;
3. проверить потребление памяти;
4. убедиться, что локальный результат совпадает с форматом, который принимает конкурсная площадка;
5. отдельно зафиксировать, какие показатели остаются доступными только после серверной проверки.
Такой тест позволит понять реальные требования к вычислительным ресурсам до подготовки полноценного решения. Он также покажет, насколько конкурс подходит командам, у которых нет постоянного доступа к собственным GPU.
Что пока нельзя считать подтверждённым
В обсуждении публикации упоминается возможная презентация трёх лучших работ на семинаре NeurIPS 2025 6 или 7 декабря. Этот пункт приведён в комментариях к публикации, а не в основном описании условий. Поэтому участие победителей в мероприятии не стоит воспринимать как гарантированную награду без подтверждения в официальных правилах.
Подробные требования к формату заданий, ограничениям отправки и календарю следует сверять с актуальными материалами конкурса. Исходное объявление объясняет общую систему оценки, но не заменяет полный регламент.
Для разработчиков бенчмарков E2LM представляет практический интерес: конкурс предлагает сравнивать не только сами модели, но и способность тестов давать полезный сигнал до завершения обучения. При этом результаты нужно интерпретировать осторожно — высокий балл будет относиться к заявленным научным задачам, открытым и скрытым контрольным точкам конкурса, а не автоматически ко всем LLM и предметным областям.
Подробное описание методики опубликовано в исходном объявлении Hugging Face.










