DiffusionGemma: Google DeepMind przekształca istniejący model w dyfuzyjny, oszczędzając zasoby
Google DeepMind zaprezentowało DiffusionGemma, model dyfuzyjny stworzony poprzez adaptację istniejącego Gemma 4, co dowodzi możliwości budowania zaawansowanych systemów AI bez konieczności trenowania od podstaw.

Google DeepMind zaprezentowało DiffusionGemma, model dyfuzyjny do generowania tekstu, który powstał w wyniku adaptacji istniejącego modelu językowego Gemma 4. To innowacyjne podejście, szczegółowo opisane w raporcie technicznym, pokazuje, że nie zawsze jest konieczne trenowanie nowych modeli od podstaw, co może znacząco obniżyć koszty i czas rozwoju.
Zamiast tworzyć zupełnie nowy model, zespół Google DeepMind przekształcił Gemma-4-26B-A4B w model dyfuzyjny, wykorzystując do tego mniej niż dziesięć procent oryginalnego budżetu tokenów treningowych. DiffusionGemma, w przeciwieństwie do standardowych modeli językowych, które generują tekst token po tokenie, udoskonala bloki po 256 tokenów równolegle, naśladując proces, w którym sztuczna inteligencja obrazu wydobywa obraz z szumu. Na akceleratorze Nvidia H100 model osiąga prędkość około 1500 tokenów na sekundę.
Innowacyjne podejście SD·RL i jego efekty
Proces adaptacji obejmował dwa główne etapy. W pierwszym model uczy się rekonstruować zaszumione bloki tekstu na podstawie danych przykładowych. Następnie zastosowano połączoną fazę uczenia ze wzmocnieniem i destylacji samplera, którą Google nazywa SD·RL. Uczenie ze wzmocnieniem zazwyczaj poprawia jakość odpowiedzi, natomiast destylacja samplera pozwala modelowi działać przy mniejszej liczbie kroków obliczeniowych. Połączenie tych dwóch metod w jeden proces, według raportu, zwiększa jakość na benchmarkach rozumowania średnio o dziesięć punktów, jednocześnie niemal czterokrotnie zwiększając liczbę tokenów na krok obliczeniowy. Dodatkowym efektem jest skrócenie odpowiedzi DiffusionGemma o około 50 procent, co dodatkowo przyspiesza działanie.
Model dyfuzyjny wykazuje również przewagę w zadaniach wymagających złożonego rozumowania. W przeciwieństwie do standardowych modeli językowych, które muszą podjąć decyzję o pierwszej cyfrze odpowiedzi, zanim zakończą proces rozumowania, DiffusionGemma rozwija odpowiedź i rozumowanie równolegle. Dzięki temu może korygować błędy, zanim ostateczna odpowiedź zostanie sfinalizowana. Przykładem jest problem matematyczny, gdzie bazowy model Gemma 4 początkowo podaje błędną odpowiedź, a następnie ją koryguje. DiffusionGemma, po minimalnym dostrojeniu, poprawnie rozwiązuje blisko 85 procent łamigłówek Sudoku, podczas gdy model bazowy całkowicie sobie z nimi nie radzi. Strukturalne dane wyjściowe, takie jak JSON czy naprawy kodu, są finalizowane już po dwóch do trzech krokach udoskonalania, ponieważ dane wejściowe w dużej mierze determinują większość tokenów.
DiffusionGemma zachowuje również swoją oryginalną zdolność do generowania tekstu słowo po słowie, umożliwiając użytkownikom przełączanie się między trybami w zależności od zadania.
Ograniczenia i przyszłość eksperymentalnego modelu
Pomimo znaczących zalet, absolutna wydajność DiffusionGemma jest niższa niż autoregresyjnego modelu bazowego. Google wskazuje na kilka przyczyn tego stanu rzeczy:
- Model nie był trenowany jako model dyfuzyjny od początku, lecz został zaadaptowany.
- Faza treningu po adaptacji była stosunkowo krótka.
- Drugi etap, SD·RL, priorytetowo traktował szybkość nad szczytową jakością.
- Architektura, dane treningowe i inne ustawienia zostały przeniesione z oryginalnego modelu Gemma 4, które niekoniecznie są idealne dla dyfuzji.
Model sporadycznie wpada w pętle powtórzeń, generując pojedyncze słowa wielokrotnie z rzędu, co jest efektem agresywnie zredukowanych kroków obliczeniowych. W zadaniach multimodalnych DiffusionGemma czasami zapomina o prawidłowym zamknięciu sekcji rozumowania, co sztucznie obniża wyniki benchmarków. Przewaga prędkości utrzymuje się głównie w scenariuszach dla jednego użytkownika; przy około 32 jednoczesnych żądaniach standardowe modele językowe dorównują mu pod względem przepustowości.
Google wyraźnie określa DiffusionGemma jako model eksperymentalny, a jego udostępnienie ma na celu przyspieszenie badań nad dyfuzją tekstu oraz dostarczenie społeczności podstawy do tworzenia wyspecjalizowanych, zasobooszczędnych adaptacji. Model jest już wykorzystywany przez startup Interfaze do wielojęzycznego rozpoznawania mowy oraz w projekcie badawczym dotyczącym interaktywnego generowania raportów radiologicznych. Wcześniej Google udostępniło model na licencji Apache 2.0 na platformie Hugging Face. Jego poprzednikiem jest Gemini Diffusion, zaprezentowany przez Google w maju 2025 roku.
Rozwój DiffusionGemma podkreśla rosnący trend w dziedzinie sztucznej inteligencji, gdzie optymalizacja i adaptacja istniejących zasobów stają się kluczowe dla efektywnego postępu. Pokazuje to, że innowacje nie zawsze wymagają gigantycznych inwestycji w trening od zera, otwierając drogę do bardziej dostępnych i zrównoważonych rozwiązań AI, które mogą znaleźć zastosowanie w wielu specjalistycznych dziedzinach.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Sztuczna inteligencja zalewa brytyjskie sądy pracy falą pozwów
Wielka Brytania mierzy się z bezprecedensowym wzrostem liczby pozwów pracowniczych generowanych przez sztuczną inteligencję, co prowadzi do paraliżu sądów i wydłużenia czasu oczekiwania na sprawiedliwość.
Redakcja Aigest2 godz. temu

Samodzielne agenty AI to kolejny etap rozwoju, ale musimy świadomie zarządzać ich kosztami i ryzykiem
Wzrost złożoności agentów AI, od ich możliwości po wpływ na środowisko, stanowi wyzwanie, które wymaga przemyślanej strategii zarządzania zasobami i bezpieczeństwem. To nie tylko kwestia technologii, ale i odpowiedzialno
Michał Chmielarz4 godz. temu

Pokee AI prezentuje Pokee-Isaac 28B: model agentowy z oknem kontekstowym 10M tokenów do wdrożeń lokalnych
Pokee AI wprowadza Pokee-Isaac 28B, model językowy z imponującym oknem kontekstowym 10 milionów tokenów, zaprojektowany do działania w środowiskach lokalnych i regulowanych. Umożliwia to przetwarzanie danych bez opuszcza
Redakcja Aigest19 godz. temu

Anthropic wprowadza tryb automatyczny w Claude Code jako domyślny, zwiększając bezpieczeństwo i efektywność
Anthropic ogłosił, że tryb automatyczny (Auto Mode) w narzędziu Claude Code stanie się domyślny dla większości użytkowników. Zmiana ma na celu zwiększenie bezpieczeństwa i przyspieszenie procesów deweloperskich.
Redakcja Aigest21 godz. temu

Czytelnicy wyżej oceniają opowiadania AI, dopóki nie wiedzą, kto jest autorem
Nowe badanie wykazało, że opowiadania generowane przez ChatGPT są oceniane wyżej niż te pisane przez ludzi, pod warunkiem, że czytelnicy nie są świadomi maszynowego autorstwa. Uczestnicy eksperymentu mieli trudności z od
Redakcja Aigest22 godz. temu

Przełom DeepMind w prognozowaniu huraganów zaskakuje naukowców
Model AI WeatherNext, opracowany przez DeepMind, znacząco poprawia dokładność prognoz huraganów, oferując dodatkowy dzień ostrzeżenia.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.