Aigest.
Newsy

Google przedstawia Gemini 3.8 Flash i 3.8 Flash Cyber: Nowa generacja AI dla agentów i cyberbezpieczeństwa

Google zaprezentowało Gemini 3.8 Flash i Gemini 3.8 Flash Cyber, najnowsze modele AI, które oferują znaczące ulepszenia w rozumowaniu i kodowaniu, przy zachowaniu niskich kosztów i wysokiej szybkości.

RA

Udostępnij
Google przedstawia Gemini 3.8 Flash i 3.8 Flash Cyber: Nowa generacja AI dla agentów i cyberbezpieczeństwa
Fot. Google DeepMind

Google kontynuuje dynamiczny rozwój swoich modeli Gemini, prezentując Gemini 3.8 Flash oraz Gemini 3.8 Flash Cyber. To już trzecia odsłona Flash w ciągu zaledwie sześciu tygodni, która wprowadza znaczące usprawnienia w zakresie rozumowania i kodowania, zachowując przy tym szybkość i niskie koszty poprzedniej wersji 3.7.

Obie nowe warianty, choć dostosowane do różnych środowisk wdrożeniowych, bazują na tej samej inteligencji fundamentalnej. Ich wydajność została dodatkowo zwiększona dzięki zastosowaniu długotrwałych pętli agentowych, które rekurencyjnie oceniają i udoskonalają bazowe modele. Kluczowe postępy w kodowaniu i rozumowaniu wynikają z innowacji, w tym intensywnego treningu w wymagającej dziedzinie cyberbezpieczeństwa.

Gemini 3.8 Flash: Wydajność na poziomie modeli granicznych

Gemini 3.8 Flash oferuje znaczące usprawnienia w porównaniu do wersji 3.7 Flash, często zbliżając się do wydajności droższych modeli granicznych. W teście DeepSWE v1.1 (Long-Horizon Software Engineering) model ten przewyższa większość większych modeli granicznych w autonomicznym rozwiązywaniu złożonych problemów inżynieryjnych od początku do końca, przy ułamku kosztów.

Model 3.8 Flash wykazuje również niezawodność niezbędną dla krytycznej autonomii przedsiębiorstw w specjalistycznych dziedzinach wiedzy. W obszarach ilościowych i profesjonalnych, wymagających zaawansowanej analizy i raportowania, 3.8 Flash przewyższa 3.7 Flash oraz inne modele graniczne w benchmarkach takich jak Vals Finance Agent V2 i Harvey's Legal Agent Benchmark. Dodatkowo, model osiąga wynik 54,9% w HLE-Verified, co świadczy o jego zdolności do wieloetapowego rozumowania w dziedzinach STEM, humanistycznych i zawodowych.

Te wzrosty wydajności wynikają z kluczowej decyzji projektowej: 3.8 Flash „pracuje ciężej”. W złożonych zadaniach wykazuje większą staranność, wykonując dodatkowe kroki rozumowania i iteracyjnie wywołując narzędzia. Czasami model może zużywać więcej tokenów, aby zmaksymalizować wydajność, szczególnie przy wyższych poziomach wysiłku. Dla aplikacji, gdzie głównym ograniczeniem jest efektywność obliczeniowa, deweloperzy mogą korzystać z niższych poziomów wysiłku, aby zminimalizować zużycie tokenów, lub nadal polegać na Gemini 3.7 Flash, który pozostaje w pełni wspierany dla zadań priorytetowo traktujących efektywność.

Możliwości Gemini 3.8 Flash zostały zademonstrowane w kilku projektach:

  • Stworzenie gry 3D z zagadkami i narracją środowiskową w Google Antigravity za pomocą prostego promptu.
  • Zbudowanie w pełni funkcjonalnej wersji Google Maps dla DOS w jednym prompcie, z lokalizacjami, wskazówkami i widokiem ulicy.
  • Wygenerowanie interaktywnej mapy topograficznej znanych miejsc geograficznych z przekrojami i wyjaśnieniami naukowymi, wykorzystując dane z U.S. Geological Survey.
  • Stworzenie Hardware Anatomy, interaktywnego wizualizatora 3D w Google AI Studio, generującego realistyczne rendery rozłożonych urządzeń sprzętowych.

Gemini 3.8 Flash Cyber: Przewaga w cyberbezpieczeństwie

Gemini 3.8 Flash Cyber, dostępny dla zaufanych obrońców w ramach programu Fairwind, zapewnia decydującą przewagę w złożonym krajobrazie cyberbezpieczeństwa, oferując szybkość i niskie koszty, co umożliwia szybkie iteracje. W standardowym branżowym benchmarku do znajdowania luk, CyberGym, Gemini 3.8 Flash Cyber demonstruje wydajność na poziomie modeli granicznych w autonomicznym wykrywaniu luk. Przewyższa zarówno 3.5 Flash Cyber, jak i znacznie większe modele graniczne.

Aby lepiej odzwierciedlić rzeczywiste potrzeby obronne, które nie ograniczają się do baz kodu C/C++, Google oceniło Gemini 3.8 Flash Cyber w kompleksowym wewnętrznym benchmarku. Model musiał wykryć szeroki zakres luk w złożonych bazach kodu obejmujących 20 języków programowania. W tym teście model osiągnął imponujący skok w stosunku do poprzednich wersji, uzyskując wskaźnik sukcesu przekraczający 70%.

Google skupiło się na wyposażeniu obrońców w eksperckie możliwości, dające im przewagę nad atakującymi, dlatego inwestowano w naprawianie luk od samego początku, priorytetowo traktując je nad możliwościami ofensywnymi, takimi jak eksploitacja. W CWE-Bench, wymagającym zewnętrznym benchmarku dla możliwości łatania, Gemini 3.8 Flash Cyber znajduje się na granicy Pareto, z wynikiem pass@1 wynoszącym 47,2% w porównaniu do wiodącego modelu granicznego z wynikiem 47,8%, oferując jednocześnie znacznie niższe koszty. Google już wykorzystuje Gemini 3.8 Flash Cyber do zabezpieczania kodu w całej firmie.

Modele 3.8 Flash są wyposażone w zabezpieczenia przed niewłaściwym użyciem w dziedzinach chemicznych, biologicznych, radiologicznych i nuklearnych (CBRN) oraz cyberofensywy, jednocześnie umożliwiając korzystne zastosowania, zgodnie z Frontier Safety Framework. 3.8 Flash Cyber posiada bardziej liberalny zestaw środków zaradczych dla cyberbezpieczeństwa i dlatego jest dostępny tylko dla zaufanych obrońców, którzy wymagają bardziej kompleksowego zestawu możliwości cybernetycznych.

Modele Gemini 3.8 dokonały również znaczącego skoku w odporności na ataki typu prompt injection, mierzonej przez Gray Swan, chroniąc użytkowników modeli Gemini przed złośliwymi atakami związanymi z wstrzykiwaniem promptów.

Wprowadzenie Gemini 3.8 Flash i 3.8 Flash Cyber podkreśla rosnące znaczenie zaawansowanych modeli AI w kluczowych obszarach, takich jak inżynieria oprogramowania i cyberbezpieczeństwo. Zdolność tych modeli do autonomicznego rozwiązywania złożonych problemów i wykrywania luk w zabezpieczeniach, przy jednoczesnym zachowaniu efektywności kosztowej, może znacząco wpłynąć na rozwój technologii i bezpieczeństwo cyfrowe w nadchodzących latach, otwierając nowe możliwości dla deweloperów i obrońców cyfrowych.

Źródło: deepmind.google

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

AI w cyberbezpieczeństwie to miecz obosieczny, który wymaga kontroli
Amazon wykorzystuje AI do walki z oszustwami, Alexa pomoże rozpoznać scamy
Google DeepMind stawia na innowacje, ignorując ryzyko rynkowe i etyczne
Meta Superintelligence Labs wprowadza Muse Voice Transcribe – jeden model dla transkrypcji, diaryzacji i detekcji końca
BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.