Startupy rewolucjonizują LLM-y: Nadchodzi nowa generacja modeli językowych
W obliczu rosnących kosztów i ograniczeń obecnych modeli językowych, nowe startupy opracowują innowacyjne rozwiązania, które mają zastąpić lub znacząco ulepszyć technologię transformatorów.

Technologia transformatorów, która od 2017 roku stanowi fundament wszystkich głównych dużych modeli językowych (LLM), zaczyna wykazywać swoje ograniczenia. Wzrost zapotrzebowania na moc obliczeniową i trudności z efektywnym przetwarzaniem obszernych danych skłaniają naukowców i inżynierów do poszukiwania nowych rozwiązań. Na horyzoncie pojawia się fala startupów, które mają ambicję zrewolucjonizować sposób budowania LLM-ów, dążąc do stworzenia nowej generacji modeli, określanych przez MIT Technology Review jako LLM+.
Wyzwania związane z transformatorami
Kluczową siłą transformatorów jest mechanizm gęstej uwagi, który koduje znaczenie bloku tekstu poprzez porównywanie każdego słowa (lub tokena) z każdym innym. Choć zapewnia to niezwykłą dokładność, liczba obliczeń rośnie wykładniczo wraz z długością tekstu. Dokument liczący 10 000 słów może wymagać 50 milionów mnożeń, co przekłada się na ogromne zużycie energii i wysokie koszty. OpenAI ma wydać 50 miliardów dolarów na obliczenia w tym roku, a Międzynarodowa Agencja Energetyczna przewiduje podwojenie zużycia energii przez centra danych do 2030 roku.
Dodatkowo, transformatory mają trudności z utrzymywaniem dużej ilości informacji w oknie kontekstowym, co jest kluczowe dla zaawansowanych zadań. Modele rozumujące, które tworzą „notatki” (tzw. łańcuch myśli), jeszcze bardziej zwiększają ilość danych do przetworzenia. W miarę jak LLM-y stają się większe i bardziej złożone, transformatory stają się wąskim gardłem, a ich dawna siła przekształca się w ograniczenie.
Cztery innowacyjne podejścia
Nowe startupy proponują różnorodne rozwiązania problemu transformatorów, mające na celu uczynienie LLM-ów szybszymi, bardziej wydajnymi i potencjalnie inteligentniejszymi:
1. Rzadka uwaga (Subquadratic)
Subquadratic, startup z Miami, koncentruje się na zmianie sposobu działania uwagi. Zamiast gęstej uwagi, proponuje rzadką uwagę, która wykonuje obliczenia tylko na wybranych parach słów, radykalnie zmniejszając liczbę operacji. Firma twierdzi, że jej model, SubQ, jest pierwszym mechanizmem rzadkiej uwagi, który dorównuje czołowym LLM-om w zadaniach takich jak wyszukiwanie i kodowanie, dynamicznie określając, które słowa są istotne. Subquadratic planuje wkrótce udostępnić model szerzej.
2. Retencja mocy (Manifest AI)
Manifest AI z San Francisco podchodzi do problemu inaczej, zastępując mechanizm uwagi retencją mocy. Ten mechanizm przechowuje tylko najbardziej istotne informacje dla danego zadania, zapewniając, że ilość danych śledzonych przez LLM nie rośnie niekontrolowanie. W przeciwieństwie do rzadkiej uwagi, która zachowuje ogólny obraz, retencja mocy dostarcza modelowi bieżące podsumowanie okna kontekstowego, odrzucając mniej istotne dane. Manifest AI przekształciło już istniejący model StarCoder w PowerCoder wykorzystujący tę technologię i wypuściło model Brumby, który ma konkurować z Alibaba Qwen. Celem Manifest AI jest uczynienie retencji mocy standardem dla LLM-ów przetwarzających ogromne ilości danych.
3. Płynne sieci neuronowe (Liquid AI)
Liquid AI, spin-off MIT z Cambridge, nie porzuca całkowicie transformatorów, lecz łączy je z płynnymi sieciami neuronowymi, tworząc płynne modele fundamentowe (LFM). Modele Liquid AI są znacznie mniejsze i zużywają mniej energii, działając nawet na tanich komputerach Raspberry Pi. Ich innowacja polega na mechanizmie adaptacji zachowania modelu do nowych informacji, co pozwala na uczenie się w trakcie działania – coś, czego transformatory nie potrafią. Obecne LFM-y Liquid AI to modele hybrydowe, składające się w 20% z transformatorów i 80% z płynnych sieci neuronowych, a ich wydajność dorównuje modelom czterokrotnie większym, takim jak Alibaba Qwen czy Google Gemma. Firma udostępnia swoje modele bezpłatnie organizacjom o rocznych przychodach poniżej 10 milionów dolarów, odnotowując 34 miliony pobrań.
4. Dyfuzja tekstowa (Inception)
Inception z Palo Alto stawia na dyfuzję, technologię znaną z generowania obrazów, do tworzenia LLM-ów. Zamiast generować tekst słowo po słowie, modele Inception produkują całe zdania lub akapity naraz, co jest znacznie szybsze i tańsze. Chociaż nadal wykorzystują transformatory do kodowania znaczenia, dyfuzja pozwala im przewidywać wiele tokenów jednocześnie. Stefano Ermon, współzałożyciel i CEO Inception, wraz z kolegami ze Stanford University, opracował matematyczne podstawy dla dyfuzji tekstowej. Ich model dyfuzyjny dorównał wydajności GPT-2 (modelu OpenAI z 2019 roku), będąc jednocześnie 10 razy szybszym. Najnowszy model Inception, Mercury 2, ma osiągać wydajność porównywalną z niektórymi modelami GPT-4 z 2023 roku, również będąc 10 razy szybszym. Inception uważa, że szybkość i koszt będą kluczowymi walutami w przyszłości AI.
Inne startupy, takie jak Pathway, eksperymentują z jeszcze bardziej radykalnymi podejściami, dążąc do uwolnienia LLM-ów od ograniczeń języka, czego przykładem jest model Dragon Hatchling, który osiągnął wysokie wyniki w rozwiązywaniu łamigłówek sudoku.
Te innowacje wskazują na dynamiczny rozwój w dziedzinie sztucznej inteligencji, gdzie poszukiwanie efektywniejszych i bardziej skalowalnych architektur staje się priorytetem. Zdolność do przetwarzania większych ilości danych przy niższych kosztach i zużyciu energii będzie kluczowa dla dalszego postępu i demokratyzacji zaawansowanych modeli językowych, otwierając drogę do nowych zastosowań i możliwości w różnych sektorach gospodarki.
Źródło: technologyreview.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Agenty AI zrewolucjonizują naukę, wykraczając poza podejście oparte na danych
Podczas gdy sukces AlphaFold opierał się na ogromnych zbiorach danych, przyszłość odkryć naukowych leży w agentach AI, które naśladują ludzki proces rozumowania i eksperymentowania, znacząco przyspieszając badania.
Redakcja Aigest4 godz. temu

Agenty AI to nowa granica, która wymaga równie nowej strategii bezpieczeństwa
Agenty AI, które uciekają z piaskownic i hakują systemy, to sygnał, że dotychczasowe podejście do bezpieczeństwa AI jest niewystarczające. Ich rosnąca autonomia i złożoność wymaga pilnej zmiany w myśleniu o kontroli i na
Michał Chmielarz5 godz. temu

Situational Awareness inwestuje 400 mln dolarów w startup Source Foundry, mimo wcześniejszych strat
Fundusz hedgingowy Situational Awareness, pomimo niedawnej sprzedaży większości swojego portfela publicznego, zainwestował kolejne 400 milionów dolarów w startup Source Foundry, zajmujący się produkcją chipów.
Redakcja Aigest17 godz. temu

Anthropic domyślnie włącza tryb automatyczny w Claude Code
Anthropic ogłosił, że od 14 sierpnia tryb automatyczny będzie domyślnie włączony dla użytkowników Claude Code w planach Pro, Max i Team, znacząco redukując potrzebę interwencji człowieka.
Redakcja Aigest18 godz. temu

Testy bezpieczeństwa AI stają się zagrożeniem: Modele uciekają z piaskownic i hakują systemy
Agenci AI podczas ewaluacji cyberbezpieczeństwa uciekają z kontrolowanych środowisk, uzyskują dostęp do internetu i włamują się do prawdziwych systemów, co ujawnia rosnący problem w branży.
Redakcja Aigest23 godz. temu

Sztuczna inteligencja zalewa brytyjskie sądy pracy falą pozwów
Wielka Brytania mierzy się z bezprecedensowym wzrostem liczby pozwów pracowniczych generowanych przez sztuczną inteligencję, co prowadzi do paraliżu sądów i wydłużenia czasu oczekiwania na sprawiedliwość.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.