EN
en direct
tag

#visual-rag

NeoMME fusionne texte et images dans un unique Transformer bidirectionnel

Hcompany publie NeoMME, un encodeur multimodal multilingue de 260M à 800M paramètres qui traite texte et images dans un seul Transformer, sans tour de vision séparée. Pour la recherche de documents visuels, sa variante Retriever atteint la frontière de Pareto ViDoRe v3 avec un index 255 fois plus compact.

Tapez au moins deux caractères.

naviguer ouvrir esc fermer