Aigest.
Newsy

H Company prezentuje NeoMME: Nowe multimodalne kodery bez wieży wizyjnej

Firma H Company wprowadza na rynek NeoMME, rodzinę multimodalnych koderów, które przetwarzają tekst i obrazy w jednym transformatorze, eliminując potrzebę oddzielnej wieży wizyjnej i dekodera przyczynowego.

RA

Udostępnij
H Company prezentuje NeoMME: Nowe multimodalne kodery bez wieży wizyjnej
Fot. MarkTechPost

Firma H Company wprowadziła na rynek NeoMME, nową rodzinę dwukierunkowych koderów multimodalnych, dostępnych w wersjach z 260 milionami i 800 milionami parametrów. Wyróżniają się one zdolnością do przetwarzania wielojęzycznych tokenów tekstowych i surowych fragmentów obrazów (32x32 piksele) w ramach jednego transformatora. Kluczową innowacją jest rezygnacja z wstępnie wytrenowanej wieży wizyjnej oraz dekodera przyczynowego, co odróżnia je od tradycyjnych systemów, takich jak te w stylu ColPali.

Innowacyjna architektura i pretrening

Modele NeoMME integrują przetwarzanie tekstu i obrazu w jednej architekturze, co stanowi znaczące odejście od dotychczasowych rozwiązań. Zamiast polegać na oddzielnych komponentach do analizy wizualnej, NeoMME wykorzystuje pojedynczy transformator do obsługi obu typów danych. Architektura ta opiera się na dwukierunkowych koderach, co pozwala na bardziej kompleksowe rozumienie kontekstu zarówno w tekście, jak i w obrazach. Proces pretreningu wykorzystuje innowacyjną metodę maskowanej dyskretnej dyfuzji, co przyczynia się do efektywności i wydajności modeli.

Wydajność i zastosowania

NeoMME wyposażono w podwójne głowice wyszukiwania: gęste (dense) i z późną interakcją (late-interaction), co optymalizuje proces wyszukiwania informacji. W testach ViDoRe v3 model 260M osiągnął wynik 0.523 nDCG@10, co świadczy o jego skuteczności w zadaniach wyszukiwania. Dodatkowo, modele te oferują imponującą kompresję indeksu na poziomie 255x oraz przepustowość indeksowania wynoszącą 51.3 strony na sekundę na jednym procesorze L40S. Autorzy projektu otwarcie przyznają jednak, że istnieją jeszcze pewne luki w zakresie wyszukiwania tekstowego, nad którymi prawdopodobnie będą pracować w przyszłości.

Znaczenie dla rozwoju AI multimodalnej

Prezentacja NeoMME przez H Company stanowi istotny krok w rozwoju multimodalnych systemów AI. Eliminacja oddzielnych wież wizyjnych i dekoderów przyczynowych może uprościć architekturę modeli, zmniejszyć ich złożoność obliczeniową oraz potencjalnie obniżyć zapotrzebowanie na zasoby. Takie podejście otwiera nowe możliwości w tworzeniu bardziej zintegrowanych i efektywnych rozwiązań, które potrafią jednocześnie przetwarzać i rozumieć zarówno tekst, jak i obrazy, co jest kluczowe dla wielu zaawansowanych zastosowań sztucznej inteligencji, od wyszukiwania informacji po generowanie treści. Warto obserwować, jak ta innowacja wpłynie na dalsze kierunki badań i rozwoju w dziedzinie AI multimodalnej.

Źródło: marktechpost.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Chatbot, który radzi, to chatbot, który bierze odpowiedzialność
IFM prezentuje K2 Horizon: sześć modeli Apache 2.0 od 0.9B do 375B
Czy „psychoza AI” to nowa diagnoza? Badacze analizują wpływ chatbotów na zdrowie psychiczne
Nadzór nad AI jest pilniejszy niż kiedykolwiek, bo agenci zyskują autonomię
CUA-Lite: UC Berkeley Upraszcza Rozwój Agentów AI do Obsługi Komputerów
Perplexity ujawnia architekturę GPU dla modelu osadzania pplx-embed

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.