
OpenAI 5 августа 2025 года опубликовала model card для gpt-oss-120b и gpt-oss-20b — двух моделей с открытыми весами, доступных под лицензией Apache 2.0 и собственной политикой использования gpt-oss. Это первый с 2019 года (со времён GPT-2) публичный релиз весов от OpenAI, и он принципиально меняет расклад на рынке доступных LLM.
Обе модели построены на архитектуре mixture-of-experts. gpt-oss-120b содержит 117 млрд параметров суммарно, но активирует лишь около 5,1 млрд на токен за счёт 128 экспертов на MoE-слой, из которых работают только 4. Младшая модель, gpt-oss-20b, имеет 21 млрд параметров и 32 эксперта на слой (4 активных), что даёт около 3,6 млрд активных параметров на токен. Количество слоёв — 36 и 24 соответственно.
Ключевое практическое следствие: старшая модель помещается на один H100, младшая работает в пределах 16 ГБ памяти и пригодна для потребительских видеокарт и устройств на границе сети.
Бенчмарки и независимая проверка
Независимое исследование, опубликованное на arXiv (ID 2508.12461v3), сравнило обе модели с шестью современными open-source LLM размером от 14,7B до 235B параметров — как плотными, так и разреженными. Тестирование проводилось на десяти бенчмарках, охватывающих общие знания, математические рассуждения, генерацию кода, мультиязычное понимание и диалоговые способности. Все модели запускались без квантизации, при стандартизированных условиях инференса, со статистической валидацией через тест МакНемара и анализ величины эффекта.
Результаты показали, что gpt-oss-20B на нескольких бенчмарках (HumanEval, MMLU) опережает gpt-oss-120B, несмотря на значительно меньший расход памяти и энергии на ответ. Обе модели демонстрируют результаты среднего уровня в текущем ландшафте open-source моделей, с относительной силой в генерации кода и заметными слабостями в мультиязычных задачах. Исследователи подчёркивают, что масштабирование разреженных архитектур не даёт пропорционального прироста производительности, и это требует дальнейшего изучения стратегий оптимизации.
Архитектура и развёртывание
Модели используют 4-битную квантизацию MXFP4, что дополнительно снижает требования к памяти. OpenAI предоставляет доступ через сервис Hugging Face Inference Providers, совместимый с OpenAI Responses API. Пример кода на Python:
python
import os
from openai import OpenAI
client = OpenAI(
base_url=»https://router.huggingface.co/v1″,
api_key=os.environ[«HF_TOKEN»],
)
completion = client.chat.completions.create(
model=»openai/gpt-oss-120b:cerebras»,
messages=[{«role»: «user», «content»: «How many rs are in the word ‘strawberry’?»}],
)
print(completion.choices[0].message)
Также доступна официальная демонстрация на gpt-oss.com.
Лицензирование и ограничения
Apache 2.0 с дополнительной политикой использования gpt-oss — один из самых либеральных режимов среди крупных моделей. Пользователь обязуется соблюдать применимое законодательство; никаких дополнительных ограничений на коммерческое использование, тонкую настройку или развёртывание за файрволом не накладывается. Это принципиально отличается от лицензионных моделей Meta (Llama Community License) или Microsoft (особые условия для Phi).
Сообщество и экосистема
По состоянию на октябрь 2025 года совокупное количество загрузок моделей на Hugging Face превысило 9 миллионов. Появились специализированные сборки, в том числе дерстриктированные версии (ArliAI/gpt-oss-20b-Derestricted), а также инструменты для аблитерации — удаления поведенческих ограничений. Сформирован курируемый список ресурсов awesome-gpt-oss на GitHub.
В октябре 2025 года OpenAI выпустила gpt-oss-safeguard — пару открытых моделей безопасности (120B и 20B), предназначенных для классификации контента на основе заданных политик.
Практические выводы для разработчиков и пользователей
gpt-oss-120b можно запустить на одном H100 (80 ГБ) с MXFP4 без потери качества на большинстве задач. Для инференса gpt-oss-20b достаточно видеокарты с 16 ГБ памяти — например, RTX 4090 или M2 Ultra. Обе модели поддерживают полный chain-of-thought, нативное использование инструментов и тонкую настройку.
Ограничения, которые стоит учитывать: мультиязычные задачи — слабое место обеих моделей; gpt-oss-20b на отдельных бенчмарках превосходит старшую версию, что делает выбор неочевидным; модели не поддерживают мультимодальность (только текст).
Перед развёртыванием рекомендуется провести собственные тесты на целевых задачах, особенно если требуется работа с несколькими языками или высокая точность в узких доменах.
