Aigest.
Newsy

DiffusionGemma: Google DeepMind przekształca istniejący model w dyfuzyjny, oszczędzając zasoby

Google DeepMind zaprezentowało DiffusionGemma, model dyfuzyjny stworzony poprzez adaptację istniejącego Gemma 4, co dowodzi możliwości budowania zaawansowanych systemów AI bez konieczności trenowania od podstaw.

RA

Udostępnij
DiffusionGemma: Google DeepMind przekształca istniejący model w dyfuzyjny, oszczędzając zasoby
Fot. The Decoder

Google DeepMind zaprezentowało DiffusionGemma, model dyfuzyjny do generowania tekstu, który powstał w wyniku adaptacji istniejącego modelu językowego Gemma 4. To innowacyjne podejście, szczegółowo opisane w raporcie technicznym, pokazuje, że nie zawsze jest konieczne trenowanie nowych modeli od podstaw, co może znacząco obniżyć koszty i czas rozwoju.

Zamiast tworzyć zupełnie nowy model, zespół Google DeepMind przekształcił Gemma-4-26B-A4B w model dyfuzyjny, wykorzystując do tego mniej niż dziesięć procent oryginalnego budżetu tokenów treningowych. DiffusionGemma, w przeciwieństwie do standardowych modeli językowych, które generują tekst token po tokenie, udoskonala bloki po 256 tokenów równolegle, naśladując proces, w którym sztuczna inteligencja obrazu wydobywa obraz z szumu. Na akceleratorze Nvidia H100 model osiąga prędkość około 1500 tokenów na sekundę.

Innowacyjne podejście SD·RL i jego efekty

Proces adaptacji obejmował dwa główne etapy. W pierwszym model uczy się rekonstruować zaszumione bloki tekstu na podstawie danych przykładowych. Następnie zastosowano połączoną fazę uczenia ze wzmocnieniem i destylacji samplera, którą Google nazywa SD·RL. Uczenie ze wzmocnieniem zazwyczaj poprawia jakość odpowiedzi, natomiast destylacja samplera pozwala modelowi działać przy mniejszej liczbie kroków obliczeniowych. Połączenie tych dwóch metod w jeden proces, według raportu, zwiększa jakość na benchmarkach rozumowania średnio o dziesięć punktów, jednocześnie niemal czterokrotnie zwiększając liczbę tokenów na krok obliczeniowy. Dodatkowym efektem jest skrócenie odpowiedzi DiffusionGemma o około 50 procent, co dodatkowo przyspiesza działanie.

Model dyfuzyjny wykazuje również przewagę w zadaniach wymagających złożonego rozumowania. W przeciwieństwie do standardowych modeli językowych, które muszą podjąć decyzję o pierwszej cyfrze odpowiedzi, zanim zakończą proces rozumowania, DiffusionGemma rozwija odpowiedź i rozumowanie równolegle. Dzięki temu może korygować błędy, zanim ostateczna odpowiedź zostanie sfinalizowana. Przykładem jest problem matematyczny, gdzie bazowy model Gemma 4 początkowo podaje błędną odpowiedź, a następnie ją koryguje. DiffusionGemma, po minimalnym dostrojeniu, poprawnie rozwiązuje blisko 85 procent łamigłówek Sudoku, podczas gdy model bazowy całkowicie sobie z nimi nie radzi. Strukturalne dane wyjściowe, takie jak JSON czy naprawy kodu, są finalizowane już po dwóch do trzech krokach udoskonalania, ponieważ dane wejściowe w dużej mierze determinują większość tokenów.

DiffusionGemma zachowuje również swoją oryginalną zdolność do generowania tekstu słowo po słowie, umożliwiając użytkownikom przełączanie się między trybami w zależności od zadania.

Ograniczenia i przyszłość eksperymentalnego modelu

Pomimo znaczących zalet, absolutna wydajność DiffusionGemma jest niższa niż autoregresyjnego modelu bazowego. Google wskazuje na kilka przyczyn tego stanu rzeczy:

  • Model nie był trenowany jako model dyfuzyjny od początku, lecz został zaadaptowany.
  • Faza treningu po adaptacji była stosunkowo krótka.
  • Drugi etap, SD·RL, priorytetowo traktował szybkość nad szczytową jakością.
  • Architektura, dane treningowe i inne ustawienia zostały przeniesione z oryginalnego modelu Gemma 4, które niekoniecznie są idealne dla dyfuzji.

Model sporadycznie wpada w pętle powtórzeń, generując pojedyncze słowa wielokrotnie z rzędu, co jest efektem agresywnie zredukowanych kroków obliczeniowych. W zadaniach multimodalnych DiffusionGemma czasami zapomina o prawidłowym zamknięciu sekcji rozumowania, co sztucznie obniża wyniki benchmarków. Przewaga prędkości utrzymuje się głównie w scenariuszach dla jednego użytkownika; przy około 32 jednoczesnych żądaniach standardowe modele językowe dorównują mu pod względem przepustowości.

Google wyraźnie określa DiffusionGemma jako model eksperymentalny, a jego udostępnienie ma na celu przyspieszenie badań nad dyfuzją tekstu oraz dostarczenie społeczności podstawy do tworzenia wyspecjalizowanych, zasobooszczędnych adaptacji. Model jest już wykorzystywany przez startup Interfaze do wielojęzycznego rozpoznawania mowy oraz w projekcie badawczym dotyczącym interaktywnego generowania raportów radiologicznych. Wcześniej Google udostępniło model na licencji Apache 2.0 na platformie Hugging Face. Jego poprzednikiem jest Gemini Diffusion, zaprezentowany przez Google w maju 2025 roku.

Rozwój DiffusionGemma podkreśla rosnący trend w dziedzinie sztucznej inteligencji, gdzie optymalizacja i adaptacja istniejących zasobów stają się kluczowe dla efektywnego postępu. Pokazuje to, że innowacje nie zawsze wymagają gigantycznych inwestycji w trening od zera, otwierając drogę do bardziej dostępnych i zrównoważonych rozwiązań AI, które mogą znaleźć zastosowanie w wielu specjalistycznych dziedzinach.

Źródło: the-decoder.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Sztuczna inteligencja zalewa brytyjskie sądy pracy falą pozwów
Samodzielne agenty AI to kolejny etap rozwoju, ale musimy świadomie zarządzać ich kosztami i ryzykiem
Pokee AI prezentuje Pokee-Isaac 28B: model agentowy z oknem kontekstowym 10M tokenów do wdrożeń lokalnych
Anthropic wprowadza tryb automatyczny w Claude Code jako domyślny, zwiększając bezpieczeństwo i efektywność
Newsy

Anthropic wprowadza tryb automatyczny w Claude Code jako domyślny, zwiększając bezpieczeństwo i efektywność

Anthropic ogłosił, że tryb automatyczny (Auto Mode) w narzędziu Claude Code stanie się domyślny dla większości użytkowników. Zmiana ma na celu zwiększenie bezpieczeństwa i przyspieszenie procesów deweloperskich.

Redakcja Aigest21 godz. temu

Czytelnicy wyżej oceniają opowiadania AI, dopóki nie wiedzą, kto jest autorem
Przełom DeepMind w prognozowaniu huraganów zaskakuje naukowców

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.