Hugging Face представил NeoMME — мультимодальный энкодер без раздельного vision tower и каузальной языковой модели

NeoMME от Hugging Face — семейство мультимодальных энкодеров (260M и 800M параметров) без раздельного vision tower и каузальной языковой модели. Единый Transformer обрабатывает и текст, и сырые патчи изображений. Модель обучена с нуля на...

Открыть материал →