H Company prezentuje NeoMME: Nowe multimodalne kodery bez wieży wizyjnej
Firma H Company wprowadza na rynek NeoMME, rodzinę multimodalnych koderów, które przetwarzają tekst i obrazy w jednym transformatorze, eliminując potrzebę oddzielnej wieży wizyjnej i dekodera przyczynowego.

Firma H Company wprowadziła na rynek NeoMME, nową rodzinę dwukierunkowych koderów multimodalnych, dostępnych w wersjach z 260 milionami i 800 milionami parametrów. Wyróżniają się one zdolnością do przetwarzania wielojęzycznych tokenów tekstowych i surowych fragmentów obrazów (32x32 piksele) w ramach jednego transformatora. Kluczową innowacją jest rezygnacja z wstępnie wytrenowanej wieży wizyjnej oraz dekodera przyczynowego, co odróżnia je od tradycyjnych systemów, takich jak te w stylu ColPali.
Innowacyjna architektura i pretrening
Modele NeoMME integrują przetwarzanie tekstu i obrazu w jednej architekturze, co stanowi znaczące odejście od dotychczasowych rozwiązań. Zamiast polegać na oddzielnych komponentach do analizy wizualnej, NeoMME wykorzystuje pojedynczy transformator do obsługi obu typów danych. Architektura ta opiera się na dwukierunkowych koderach, co pozwala na bardziej kompleksowe rozumienie kontekstu zarówno w tekście, jak i w obrazach. Proces pretreningu wykorzystuje innowacyjną metodę maskowanej dyskretnej dyfuzji, co przyczynia się do efektywności i wydajności modeli.
Wydajność i zastosowania
NeoMME wyposażono w podwójne głowice wyszukiwania: gęste (dense) i z późną interakcją (late-interaction), co optymalizuje proces wyszukiwania informacji. W testach ViDoRe v3 model 260M osiągnął wynik 0.523 nDCG@10, co świadczy o jego skuteczności w zadaniach wyszukiwania. Dodatkowo, modele te oferują imponującą kompresję indeksu na poziomie 255x oraz przepustowość indeksowania wynoszącą 51.3 strony na sekundę na jednym procesorze L40S. Autorzy projektu otwarcie przyznają jednak, że istnieją jeszcze pewne luki w zakresie wyszukiwania tekstowego, nad którymi prawdopodobnie będą pracować w przyszłości.
Znaczenie dla rozwoju AI multimodalnej
Prezentacja NeoMME przez H Company stanowi istotny krok w rozwoju multimodalnych systemów AI. Eliminacja oddzielnych wież wizyjnych i dekoderów przyczynowych może uprościć architekturę modeli, zmniejszyć ich złożoność obliczeniową oraz potencjalnie obniżyć zapotrzebowanie na zasoby. Takie podejście otwiera nowe możliwości w tworzeniu bardziej zintegrowanych i efektywnych rozwiązań, które potrafią jednocześnie przetwarzać i rozumieć zarówno tekst, jak i obrazy, co jest kluczowe dla wielu zaawansowanych zastosowań sztucznej inteligencji, od wyszukiwania informacji po generowanie treści. Warto obserwować, jak ta innowacja wpłynie na dalsze kierunki badań i rozwoju w dziedzinie AI multimodalnej.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Chatbot, który radzi, to chatbot, który bierze odpowiedzialność
Incydent z Google Gemini i Mount Shasta to nie tylko anegdota, ale poważne ostrzeżenie, że AI przestaje być tylko narzędziem, a staje się aktywnym doradcą, co rodzi nowe wyzwania etyczne i prawne.
Michał Chmielarz4 godz. temu
IFM prezentuje K2 Horizon: sześć modeli Apache 2.0 od 0.9B do 375B
Instytut Modeli Fundacyjnych (IFM) wprowadził na rynek K2 Horizon – zestaw sześciu modeli sztucznej inteligencji o zróżnicowanej skali, dostępnych na licencji Apache 2.0.
Redakcja Aigest7 godz. temu

Czy „psychoza AI” to nowa diagnoza? Badacze analizują wpływ chatbotów na zdrowie psychiczne
Zespół badaczy z Wielkiej Brytanii analizuje zjawisko „psychozy związanej z AI”, w której chatboty mogą wzmacniać urojenia, tworząc „komorę echa jednego użytkownika”. Zastanawiają się, czy powinno to być uznane za odrębn
Redakcja Aigestwczoraj

Nadzór nad AI jest pilniejszy niż kiedykolwiek, bo agenci zyskują autonomię
Incydenty z agentami AI OpenAI, którzy wymykają się spod kontroli i planują ucieczki, to nie science fiction, a realny problem, który wymaga natychmiastowej uwagi i niezależnego nadzoru.
Michał Chmielarzwczoraj
CUA-Lite: UC Berkeley Upraszcza Rozwój Agentów AI do Obsługi Komputerów
Naukowcy z UC Berkeley wprowadzili CUA-Lite, otwartą platformę integrującą kluczowe elementy do tworzenia i testowania agentów AI, znacząco redukując rozmiar środowiska.
Redakcja Aigestwczoraj

Perplexity ujawnia architekturę GPU dla modelu osadzania pplx-embed
Zespół inżynierów Perplexity opublikował szczegóły dotyczące infrastruktury obsługującej model osadzania pplx-embed, kluczowy dla jakości wyszukiwania AI.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.