Google przedstawia Gemini 3.8 Flash i 3.8 Flash Cyber: Nowa generacja AI dla agentów i cyberbezpieczeństwa
Google zaprezentowało Gemini 3.8 Flash i Gemini 3.8 Flash Cyber, najnowsze modele AI, które oferują znaczące ulepszenia w rozumowaniu i kodowaniu, przy zachowaniu niskich kosztów i wysokiej szybkości.

Google kontynuuje dynamiczny rozwój swoich modeli Gemini, prezentując Gemini 3.8 Flash oraz Gemini 3.8 Flash Cyber. To już trzecia odsłona Flash w ciągu zaledwie sześciu tygodni, która wprowadza znaczące usprawnienia w zakresie rozumowania i kodowania, zachowując przy tym szybkość i niskie koszty poprzedniej wersji 3.7.
Obie nowe warianty, choć dostosowane do różnych środowisk wdrożeniowych, bazują na tej samej inteligencji fundamentalnej. Ich wydajność została dodatkowo zwiększona dzięki zastosowaniu długotrwałych pętli agentowych, które rekurencyjnie oceniają i udoskonalają bazowe modele. Kluczowe postępy w kodowaniu i rozumowaniu wynikają z innowacji, w tym intensywnego treningu w wymagającej dziedzinie cyberbezpieczeństwa.
Gemini 3.8 Flash: Wydajność na poziomie modeli granicznych
Gemini 3.8 Flash oferuje znaczące usprawnienia w porównaniu do wersji 3.7 Flash, często zbliżając się do wydajności droższych modeli granicznych. W teście DeepSWE v1.1 (Long-Horizon Software Engineering) model ten przewyższa większość większych modeli granicznych w autonomicznym rozwiązywaniu złożonych problemów inżynieryjnych od początku do końca, przy ułamku kosztów.
Model 3.8 Flash wykazuje również niezawodność niezbędną dla krytycznej autonomii przedsiębiorstw w specjalistycznych dziedzinach wiedzy. W obszarach ilościowych i profesjonalnych, wymagających zaawansowanej analizy i raportowania, 3.8 Flash przewyższa 3.7 Flash oraz inne modele graniczne w benchmarkach takich jak Vals Finance Agent V2 i Harvey's Legal Agent Benchmark. Dodatkowo, model osiąga wynik 54,9% w HLE-Verified, co świadczy o jego zdolności do wieloetapowego rozumowania w dziedzinach STEM, humanistycznych i zawodowych.
Te wzrosty wydajności wynikają z kluczowej decyzji projektowej: 3.8 Flash „pracuje ciężej”. W złożonych zadaniach wykazuje większą staranność, wykonując dodatkowe kroki rozumowania i iteracyjnie wywołując narzędzia. Czasami model może zużywać więcej tokenów, aby zmaksymalizować wydajność, szczególnie przy wyższych poziomach wysiłku. Dla aplikacji, gdzie głównym ograniczeniem jest efektywność obliczeniowa, deweloperzy mogą korzystać z niższych poziomów wysiłku, aby zminimalizować zużycie tokenów, lub nadal polegać na Gemini 3.7 Flash, który pozostaje w pełni wspierany dla zadań priorytetowo traktujących efektywność.
Możliwości Gemini 3.8 Flash zostały zademonstrowane w kilku projektach:
- Stworzenie gry 3D z zagadkami i narracją środowiskową w Google Antigravity za pomocą prostego promptu.
- Zbudowanie w pełni funkcjonalnej wersji Google Maps dla DOS w jednym prompcie, z lokalizacjami, wskazówkami i widokiem ulicy.
- Wygenerowanie interaktywnej mapy topograficznej znanych miejsc geograficznych z przekrojami i wyjaśnieniami naukowymi, wykorzystując dane z U.S. Geological Survey.
- Stworzenie Hardware Anatomy, interaktywnego wizualizatora 3D w Google AI Studio, generującego realistyczne rendery rozłożonych urządzeń sprzętowych.
Gemini 3.8 Flash Cyber: Przewaga w cyberbezpieczeństwie
Gemini 3.8 Flash Cyber, dostępny dla zaufanych obrońców w ramach programu Fairwind, zapewnia decydującą przewagę w złożonym krajobrazie cyberbezpieczeństwa, oferując szybkość i niskie koszty, co umożliwia szybkie iteracje. W standardowym branżowym benchmarku do znajdowania luk, CyberGym, Gemini 3.8 Flash Cyber demonstruje wydajność na poziomie modeli granicznych w autonomicznym wykrywaniu luk. Przewyższa zarówno 3.5 Flash Cyber, jak i znacznie większe modele graniczne.
Aby lepiej odzwierciedlić rzeczywiste potrzeby obronne, które nie ograniczają się do baz kodu C/C++, Google oceniło Gemini 3.8 Flash Cyber w kompleksowym wewnętrznym benchmarku. Model musiał wykryć szeroki zakres luk w złożonych bazach kodu obejmujących 20 języków programowania. W tym teście model osiągnął imponujący skok w stosunku do poprzednich wersji, uzyskując wskaźnik sukcesu przekraczający 70%.
Google skupiło się na wyposażeniu obrońców w eksperckie możliwości, dające im przewagę nad atakującymi, dlatego inwestowano w naprawianie luk od samego początku, priorytetowo traktując je nad możliwościami ofensywnymi, takimi jak eksploitacja. W CWE-Bench, wymagającym zewnętrznym benchmarku dla możliwości łatania, Gemini 3.8 Flash Cyber znajduje się na granicy Pareto, z wynikiem pass@1 wynoszącym 47,2% w porównaniu do wiodącego modelu granicznego z wynikiem 47,8%, oferując jednocześnie znacznie niższe koszty. Google już wykorzystuje Gemini 3.8 Flash Cyber do zabezpieczania kodu w całej firmie.
Modele 3.8 Flash są wyposażone w zabezpieczenia przed niewłaściwym użyciem w dziedzinach chemicznych, biologicznych, radiologicznych i nuklearnych (CBRN) oraz cyberofensywy, jednocześnie umożliwiając korzystne zastosowania, zgodnie z Frontier Safety Framework. 3.8 Flash Cyber posiada bardziej liberalny zestaw środków zaradczych dla cyberbezpieczeństwa i dlatego jest dostępny tylko dla zaufanych obrońców, którzy wymagają bardziej kompleksowego zestawu możliwości cybernetycznych.
Modele Gemini 3.8 dokonały również znaczącego skoku w odporności na ataki typu prompt injection, mierzonej przez Gray Swan, chroniąc użytkowników modeli Gemini przed złośliwymi atakami związanymi z wstrzykiwaniem promptów.
Wprowadzenie Gemini 3.8 Flash i 3.8 Flash Cyber podkreśla rosnące znaczenie zaawansowanych modeli AI w kluczowych obszarach, takich jak inżynieria oprogramowania i cyberbezpieczeństwo. Zdolność tych modeli do autonomicznego rozwiązywania złożonych problemów i wykrywania luk w zabezpieczeniach, przy jednoczesnym zachowaniu efektywności kosztowej, może znacząco wpłynąć na rozwój technologii i bezpieczeństwo cyfrowe w nadchodzących latach, otwierając nowe możliwości dla deweloperów i obrońców cyfrowych.
Źródło: deepmind.google
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

AI w cyberbezpieczeństwie to miecz obosieczny, który wymaga kontroli
Model Astra od OpenAI, Gemini 3.8 Flash Cyber od Google i program Fairwind to sygnały, że AI w cyberbezpieczeństwie to nie tylko szansa, ale i ogromne ryzyko. Potrzebujemy pilnie mechanizmów kontroli.
Michał Chmielarz1 godz. temu

Amazon wykorzystuje AI do walki z oszustwami, Alexa pomoże rozpoznać scamy
Amazon wprowadza nowe funkcje oparte na sztucznej inteligencji, aby pomóc klientom w identyfikacji fałszywych wiadomości i oszustw. Usługa Alexa for Shopping będzie teraz w stanie potwierdzić autentyczność komunikacji od
Redakcja Aigest18 godz. temu

Google DeepMind stawia na innowacje, ignorując ryzyko rynkowe i etyczne
Deklaracja szefa Google DeepMind o priorytecie innowacji w AI, w obliczu ostrzeżeń Banku Anglii i problemów z AI Overviews, budzi poważne pytania o odpowiedzialność liderów rynku.
Michał Chmielarzwczoraj
Meta Superintelligence Labs wprowadza Muse Voice Transcribe – jeden model dla transkrypcji, diaryzacji i detekcji końca
Meta Superintelligence Labs zaprezentowało Muse Voice Transcribe, innowacyjny model AI, który łączy funkcje transkrypcji mowy, rozdzielania mówców i detekcji końca wypowiedzi w jednym systemie, znacząco redukując opóźnie
Redakcja Aigestwczoraj

BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Artykuł analizuje skuteczność tradycyjnych benchmarków w ocenie dużych modeli językowych (LLM), wprowadzając koncepcję BenchMIRT, która ma lepiej oddawać ich rzeczywiste możliwości.
Redakcja Aigestwczoraj
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.