Hugging Face представил NeoMME — мультимодальный энкодер без раздельного vision tower и каузальной языковой модели
NeoMME от Hugging Face — семейство мультимодальных энкодеров (260M и 800M параметров) без раздельного vision tower и каузальной языковой модели. Единый Transformer обрабатывает и...
Открыть материал →









