Aigest.
Newsy

Modele hybrydowe przewidują znaczące tokeny lepiej niż transformery

Nowe badania AllenAI, opublikowane przez Kyle'a Wiggersa, analizują, które typy tokenów są lepiej przewidywane przez modele hybrydowe w porównaniu do architektur transformerowych. Wyniki wskazują na przewagę hybryd w prz

RA

Udostępnij
Modele hybrydowe przewidują znaczące tokeny lepiej niż transformery
Fot. Hugging Face

Nowe badania przeprowadzone przez AllenAI, opublikowane przez Kyle'a Wiggersa na platformie Hugging Face, rzucają światło na specyficzne zdolności predykcyjne modeli hybrydowych w porównaniu do tradycyjnych architektur transformerowych. Analiza skupiła się na tym, które typy tokenów są lepiej przewidywane przez poszczególne modele, dostarczając cennych informacji na temat ich mocnych i słabych stron.

Hybrydy kontra transformery: Bitwa o tokeny

Modele hybrydowe, które łączą elementy architektur transformerowych i rekurencyjnych, zaczynają stanowić wyzwanie dla dominujących transformerów w zadaniach przetwarzania języka naturalnego. Chociaż modele hybrydowe, takie jak Olmo Hybrid, mogą dorównywać lub przewyższać transformery na standardowych benchmarkach, ogólne wyniki nie zawsze ujawniają szczegółowe przewagi. Aby zgłębić te różnice, AllenAI przeprowadziło eksperymenty porównujące swój 7B transformer, Olmo 3, z modelem hybrydowym Olmo Hybrid.

Modele te zostały zaprojektowane tak, aby były jak najbardziej podobne pod względem danych treningowych, tokenizera i receptury treningowej, co oznacza, że wszelkie różnice w ich przewidywaniach odzwierciedlają głównie samą architekturę. Analiza na poziomie tokenów pozwoliła na zrozumienie specyficznych atutów modeli hybrydowych.

Gdzie hybrydy błyszczą, a gdzie transformery dominują

Wyniki badań pokazują, że modele hybrydowe mają realną przewagę w przewidywaniu wielu tokenów, ale nie wszystkich. Olmo Hybrid najlepiej radzi sobie z tokenami niosącymi znaczenie, takimi jak rzeczowniki, czasowniki i przymiotniki, a także z tokenami, których przewidywanie wymaga śledzenia kontekstu, na przykład odniesień zaimkowych. Przewaga hybryd jest szczególnie widoczna w przypadku słów treściowych (rzeczowników, czasowników, przymiotników), gdzie różnica w stracie (loss gap) wynosi około 0.04, podczas gdy dla słów funkcyjnych (np. „the”, „of”, „is”) jest bliższa 0.02.

Z drugiej strony, przewaga hybryd niemal zanika w przypadku tokenów, które po prostu powtarzają coś, co już pojawiło się w tekście – słowo lub fraza odtworzona dosłownie z wcześniejszej części danych wejściowych. W takich sytuacjach, gdzie odpowiedź jest łatwo dostępna, siła transformerów jest niezaprzeczalna. Transformery, dzięki mechanizmowi uwagi, mogą bezpośrednio odwoływać się do każdego wcześniejszego tokena, co jest efektywne w przypominaniu dokładnych, odległych tokenów. Koszt uwagi rośnie jednak wraz z długością danych wejściowych, a mechanizm ten ma trudności z reprezentowaniem informacji ewoluujących sekwencyjnie.

Mechanizmy uwagi i rekurencji

Model językowy składa się z warstw, z których każda udoskonala reprezentację tokenów na podstawie otaczającego kontekstu. Transformer wykorzystuje uwagę w każdej warstwie, co pozwala mu na jednoczesne odwoływanie się do wszystkich wcześniejszych tokenów i ocenę ich istotności dla bieżącego przewidywania. Jest to skuteczne w przypominaniu konkretnych tokenów, nawet tych odległych, ale wiąże się z rosnącymi kosztami obliczeniowymi wraz z długością danych wejściowych.

Model hybrydowy zachowuje kilka warstw uwagi, ale większość z nich zastępuje warstwami rekurencyjnymi. Warstwa rekurencyjna przetwarza tokeny od lewej do prawej, utrzymując pamięć o stałym rozmiarze, co sprawia, że koszt przetwarzania każdego tokena pozostaje stały, niezależnie od długości danych wejściowych. Pamięć ta jest jednak skompresowana i stratna, co oznacza, że warstwa rekurencyjna nie może sięgać po dokładny wcześniejszy token tak, jak uwaga. Jest za to dobrze przystosowana do śledzenia informacji, które ewoluują sekwencyjnie, uzupełniając w ten sposób możliwości uwagi.

Metodologia badań i dalsze kroki

Aby wyizolować obszary siły i słabości obu architektur, badacze podawali Olmo 3 i Olmo Hybrid fragmenty tekstu z różnych źródeł, takich jak artykuły, wpisy z Wikipedii, książki oraz teksty strukturalne (Python, HTML, LaTeX). Modele były oceniane pod kątem skuteczności przewidywania każdego tokena na podstawie poprzedzających go tokenów. Mierzono różnicę w stracie (loss gap) między modelami, gdzie dodatnia wartość oznaczała lepsze przewidywanie przez hybrydę, a ujemna – przez transformera.

Badacze odkryli, że hybryda i czysty model rekurencyjny przewyższają transformera w przewidywaniu znaczących tokenów, które nie są powtórzeniami, przy czym hybryda osiąga najlepsze wyniki. W przypadku tokenów powtarzanych, czysty model rekurencyjny – pozbawiony uwagi – wypada gorzej niż hybryda i transformer. Te szczegółowe analizy strat tokenów ujawniają subtelne różnice między architekturami, w tym ich zdolności kopiowania i radzenia sobie ze słowami treściowymi, co nie byłoby widoczne przy użyciu ogólnych metryk.

Wyniki te sugerują, że najlepsze architektury hybrydowe powstaną dzięki dogłębnemu zrozumieniu, token po tokenie, w czym każda komponenta modelu jest najlepsza. Badania takie jak to są kluczowe dla rozwoju całej społeczności AI, dostarczając narzędzi do precyzyjniejszej oceny i projektowania przyszłych modeli językowych.

Źródło: huggingface.co

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Agenty AI zrewolucjonizują naukę, wykraczając poza podejście oparte na danych
Startupy rewolucjonizują LLM-y: Nadchodzi nowa generacja modeli językowych
Newsy

Startupy rewolucjonizują LLM-y: Nadchodzi nowa generacja modeli językowych

W obliczu rosnących kosztów i ograniczeń obecnych modeli językowych, nowe startupy opracowują innowacyjne rozwiązania, które mają zastąpić lub znacząco ulepszyć technologię transformatorów.

Redakcja Aigest3 godz. temu

Agenty AI to nowa granica, która wymaga równie nowej strategii bezpieczeństwa
Situational Awareness inwestuje 400 mln dolarów w startup Source Foundry, mimo wcześniejszych strat
Newsy

Situational Awareness inwestuje 400 mln dolarów w startup Source Foundry, mimo wcześniejszych strat

Fundusz hedgingowy Situational Awareness, pomimo niedawnej sprzedaży większości swojego portfela publicznego, zainwestował kolejne 400 milionów dolarów w startup Source Foundry, zajmujący się produkcją chipów.

Redakcja Aigest16 godz. temu

Anthropic domyślnie włącza tryb automatyczny w Claude Code
Testy bezpieczeństwa AI stają się zagrożeniem: Modele uciekają z piaskownic i hakują systemy

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.