DiffusionGemma: Google DeepMind przekształca istniejący model w dyfuzyjny, oszczędzając zasoby
Google DeepMind zaprezentowało DiffusionGemma, model dyfuzyjny stworzony poprzez adaptację istniejącego Gemma 4, co dowodzi możliwości budowania zaawansowanych systemów AI bez konieczności trenowania od podstaw.

Google DeepMind zaprezentowało DiffusionGemma, model dyfuzyjny do generowania tekstu, który powstał w wyniku adaptacji istniejącego modelu językowego Gemma 4. To innowacyjne podejście, szczegółowo opisane w raporcie technicznym, pokazuje, że nie zawsze jest konieczne trenowanie nowych modeli od podstaw, co może znacząco obniżyć koszty i czas rozwoju.
Zamiast tworzyć zupełnie nowy model, zespół Google DeepMind przekształcił Gemma-4-26B-A4B w model dyfuzyjny, wykorzystując do tego mniej niż dziesięć procent oryginalnego budżetu tokenów treningowych. DiffusionGemma, w przeciwieństwie do standardowych modeli językowych, które generują tekst token po tokenie, udoskonala bloki po 256 tokenów równolegle, naśladując proces, w którym sztuczna inteligencja obrazu wydobywa obraz z szumu. Na akceleratorze Nvidia H100 model osiąga prędkość około 1500 tokenów na sekundę.
Innowacyjne podejście SD·RL i jego efekty
Proces adaptacji obejmował dwa główne etapy. W pierwszym model uczy się rekonstruować zaszumione bloki tekstu na podstawie danych przykładowych. Następnie zastosowano połączoną fazę uczenia ze wzmocnieniem i destylacji samplera, którą Google nazywa SD·RL. Uczenie ze wzmocnieniem zazwyczaj poprawia jakość odpowiedzi, natomiast destylacja samplera pozwala modelowi działać przy mniejszej liczbie kroków obliczeniowych. Połączenie tych dwóch metod w jeden proces, według raportu, zwiększa jakość na benchmarkach rozumowania średnio o dziesięć punktów, jednocześnie niemal czterokrotnie zwiększając liczbę tokenów na krok obliczeniowy. Dodatkowym efektem jest skrócenie odpowiedzi DiffusionGemma o około 50 procent, co dodatkowo przyspiesza działanie.
Model dyfuzyjny wykazuje również przewagę w zadaniach wymagających złożonego rozumowania. W przeciwieństwie do standardowych modeli językowych, które muszą podjąć decyzję o pierwszej cyfrze odpowiedzi, zanim zakończą proces rozumowania, DiffusionGemma rozwija odpowiedź i rozumowanie równolegle. Dzięki temu może korygować błędy, zanim ostateczna odpowiedź zostanie sfinalizowana. Przykładem jest problem matematyczny, gdzie bazowy model Gemma 4 początkowo podaje błędną odpowiedź, a następnie ją koryguje. DiffusionGemma, po minimalnym dostrojeniu, poprawnie rozwiązuje blisko 85 procent łamigłówek Sudoku, podczas gdy model bazowy całkowicie sobie z nimi nie radzi. Strukturalne dane wyjściowe, takie jak JSON czy naprawy kodu, są finalizowane już po dwóch do trzech krokach udoskonalania, ponieważ dane wejściowe w dużej mierze determinują większość tokenów.
DiffusionGemma zachowuje również swoją oryginalną zdolność do generowania tekstu słowo po słowie, umożliwiając użytkownikom przełączanie się między trybami w zależności od zadania.
Ograniczenia i przyszłość eksperymentalnego modelu
Pomimo znaczących zalet, absolutna wydajność DiffusionGemma jest niższa niż autoregresyjnego modelu bazowego. Google wskazuje na kilka przyczyn tego stanu rzeczy:
- Model nie był trenowany jako model dyfuzyjny od początku, lecz został zaadaptowany.
- Faza treningu po adaptacji była stosunkowo krótka.
- Drugi etap, SD·RL, priorytetowo traktował szybkość nad szczytową jakością.
- Architektura, dane treningowe i inne ustawienia zostały przeniesione z oryginalnego modelu Gemma 4, które niekoniecznie są idealne dla dyfuzji.
Model sporadycznie wpada w pętle powtórzeń, generując pojedyncze słowa wielokrotnie z rzędu, co jest efektem agresywnie zredukowanych kroków obliczeniowych. W zadaniach multimodalnych DiffusionGemma czasami zapomina o prawidłowym zamknięciu sekcji rozumowania, co sztucznie obniża wyniki benchmarków. Przewaga prędkości utrzymuje się głównie w scenariuszach dla jednego użytkownika; przy około 32 jednoczesnych żądaniach standardowe modele językowe dorównują mu pod względem przepustowości.
Google wyraźnie określa DiffusionGemma jako model eksperymentalny, a jego udostępnienie ma na celu przyspieszenie badań nad dyfuzją tekstu oraz dostarczenie społeczności podstawy do tworzenia wyspecjalizowanych, zasobooszczędnych adaptacji. Model jest już wykorzystywany przez startup Interfaze do wielojęzycznego rozpoznawania mowy oraz w projekcie badawczym dotyczącym interaktywnego generowania raportów radiologicznych. Wcześniej Google udostępniło model na licencji Apache 2.0 na platformie Hugging Face. Jego poprzednikiem jest Gemini Diffusion, zaprezentowany przez Google w maju 2025 roku.
Rozwój DiffusionGemma podkreśla rosnący trend w dziedzinie sztucznej inteligencji, gdzie optymalizacja i adaptacja istniejących zasobów stają się kluczowe dla efektywnego postępu. Pokazuje to, że innowacje nie zawsze wymagają gigantycznych inwestycji w trening od zera, otwierając drogę do bardziej dostępnych i zrównoważonych rozwiązań AI, które mogą znaleźć zastosowanie w wielu specjalistycznych dziedzinach.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Koszty AI spadają, co otwiera nowe możliwości dla lokalnych wdrożeń
Obniżanie kosztów modeli AI, takich jak Claude Opus 5.5 czy rozwiązania NVIDIA SoL-Pi, zmienia reguły gry, przyspieszając demokratyzację sztucznej inteligencji i jej dostępność poza gigantami technologicznymi.
Michał Chmielarz5 godz. temu

Microsoft rozbił platformę EvilTokens, która z pomocą AI przejęła 12 000 kont
Microsoft ogłosił rozbicie platformy EvilTokens, która wykorzystywała sztuczną inteligencję do masowego przejmowania kont Microsoft, kompromitując 12 000 kont należących do 10 000 organizacji.
Redakcja Aigest17 godz. temu

Anthropic wprowadza Claude Opus 5.5: niższy koszt, lepsza wydajność i bardziej naturalny język
Anthropic zaprezentował Claude Opus 5.5, nowy model AI, który dorównuje wydajnością Fable 5.1, oferując jednocześnie znacznie niższe koszty operacyjne i bardziej naturalny styl komunikacji.
Redakcja Aigest20 godz. temu

OpenAI wzywa do międzynarodowych standardów dla samodoskonalącej się sztucznej inteligencji
OpenAI apeluje o globalne regulacje dotyczące zaawansowanych systemów AI, zwłaszcza tych zdolnych do samodoskonalenia. Firma podkreśla potrzebę bezpieczeństwa, zanim takie technologie staną się powszechne.
Redakcja Aigest22 godz. temu

Raport ONZ o kontroli nad AI to dzwonek alarmowy dla każdego z nas
Pierwszy raport panelu naukowego ONZ ds. AI sygnalizuje poważne ryzyko utraty kontroli nad autonomicznymi agentami AI. To nie science fiction, a realne wyzwanie, które musimy potraktować poważnie.
Michał Chmielarzwczoraj
NVIDIA prezentuje SoL-Pi: pętle auto-badawcze redukujące ruch tokenów agenta kodującego nawet o 49%
Badacze z NVIDII wprowadzili SoL-Pi, zestaw mechanizmów dla agenta kodującego Pi, które znacząco obniżają zużycie tokenów i koszty API, zachowując wysoką wydajność.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.