Badacz z Princeton proponuje Recurrent Looped Transformer (RLT) z nieskończoną głębią czasową
Yifan Zhang z Princeton zaprezentował koncepcję Recurrent Looped Transformer (RLT), innowacyjnego modelu łączącego koder przyczynowy z rekurencyjnym dekoderem. Rozwiązanie to ma na celu usprawnienie przetwarzania sekwenc
Yifan Zhang, badacz z Princeton, przedstawił w raporcie technicznym koncepcję Recurrent Looped Transformer (RLT). Jest to innowacyjny model, który łączy koder przyczynowy z rekurencyjnym dekoderem. Kluczową cechą RLT jest zdolność dekodera do przenoszenia swojego końcowego ukrytego stanu oraz pamięci podręcznej uwagi z przesuwnym oknem na poziomie warstw przez każdy token podpowiedzi i odpowiedzi, bez resetowania na granicy obsługi.
Architektura i działanie RLT
Proponowana konfiguracja RLT wykorzystuje 48 warstw kodera i 48 warstw dekodera. Oznacza to, że model wykonuje 96 logicznych bloków na każdy token. Ścieżka stanu rośnie do 48t bloków dekodera po przetworzeniu t tokenów, co wskazuje na zdolność do utrzymywania kontekstu na bardzo długich sekwencjach. Ta architektura ma na celu zapewnienie nieograniczonej głębi czasowej, co jest znaczącym usprawnieniem w porównaniu do tradycyjnych modeli Transformerów, które często mają ograniczenia w przetwarzaniu długich zależności.
Optymalizacja sprzętowa i kontrakty RL
Projekt RLT przewiduje również wykonanie zoptymalizowane pod kątem sprzętu, skupione wokół rekurencyjnego rdzenia. Dodatkowo, model zawiera dokładny kontrakt odtwarzania RL (Reinforcement Learning) zgodny z bieżącą polityką. Te aspekty sugerują, że RLT jest projektowany z myślą o efektywności obliczeniowej i potencjalnym zastosowaniu w scenariuszach uczenia ze wzmocnieniem.
Obecny status projektu
Na obecnym etapie nie udostępniono jeszcze kodu, wag modelu ani zmierzonych wyników działania RLT. Raport techniczny stanowi propozycję koncepcyjną, a dalsze prace będą miały na celu weryfikację teoretycznych założeń w praktyce. Wprowadzenie RLT może potencjalnie otworzyć nowe możliwości w dziedzinie przetwarzania języka naturalnego i innych zadań sekwencyjnych, oferując bardziej efektywne i skalowalne rozwiązania dla złożonych problemów wymagających długoterminowej pamięci i kontekstu.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Google prezentuje TimesFM-3: nowy model AI do prognozowania przyszłości na podstawie danych sprzedażowych i pogodowych
Google Research wprowadza TimesFM-3, zaawansowany model AI oparty na architekturze Transformer, który prognozuje przyszłość na podstawie szeregów czasowych, uwzględniając wiele zmiennych i przyszłe wydarzenia.
Redakcja Aigestwczoraj

Sam Altman z OpenAI: Wejście na giełdę w 2026 roku byłoby „nierozsądne”
Sam Altman, CEO OpenAI, stwierdził, że spółka nie planuje debiutu giełdowego w 2026 roku, pomimo wcześniejszych doniesień i poufnych zgłoszeń IPO.
Redakcja Aigest23 godz. temu

GPT-6 Astra wykazuje znaczący postęp w rozumowaniu przestrzennym w testach robotycznych
Nowy model OpenAI, GPT-6 Astra, zademonstrował znaczący postęp w rozumowaniu przestrzennym, osiągając lepsze wyniki niż konkurencyjne rozwiązania w specjalistycznych testach robotycznych.
Redakcja Aigestwczoraj

Czy zaawansowana sztuczna inteligencja zniszczy ludzkość? Debata MIT Technology Review
MIT Technology Review organizuje dyskusję na temat obaw związanych z zagładą ludzkości przez AI, z udziałem swoich redaktorów i reporterów.
Redakcja Aigest2 dni temu

Oriol Vinyals z Google DeepMind: Samodoskonalenie AI nie doprowadzi do eksplozji inteligencji
Oriol Vinyals, były wiceprezes ds. badań w Google DeepMind, uważa, że samodoskonalenie systemów AI jest nieuniknione, ale będzie przebiegać powoli, bez nagłej eksplozji inteligencji. Założył startup Discovery Loop, aby p
Redakcja Aigest2 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.