Gemini Robotics ER 2: Nowy mózg dla robotów od Google z rozumieniem wideo i współpracą
Google wprowadza Gemini Robotics ER 2, zaawansowany model AI, który ma działać jako mózg dla robotów, umożliwiając im rozumienie wideo, planowanie zadań i współpracę.

Google zaprezentowało Gemini Robotics ER 2, nowy, zaawansowany model sztucznej inteligencji, który ma pełnić funkcję wysokopoziomowego mózgu dla robotów. Jego celem jest zwiększenie użyteczności maszyn w świecie fizycznym poprzez zaawansowane rozumienie obrazu wideo, orkiestrację zadań oraz możliwość współpracy między wieloma robotami. Model jest już dostępny dla deweloperów za pośrednictwem Gemini API, Google AI Studio oraz w prywatnej wersji zapoznawczej na platformie Gemini Enterprise Agent Platform.
Inteligentne planowanie i samokorekta
Gemini Robotics ER 2 został zaprojektowany, aby umożliwić robotom szybkie myślenie, planowanie wieloetapowych zadań oraz współpracę. Model pozwala maszynom na bieżąco analizować strumienie wideo, co umożliwia im śledzenie własnych postępów i korygowanie błędów w czasie rzeczywistym. Dzięki temu roboty mogą być bezpieczniejsze i bardziej pomocne w codziennych środowiskach. Model pozwala robotom na komunikację z ludźmi, rozumienie świata fizycznego i planowanie złożonych sekwencji działań, przekazując następnie wykonanie ruchów niższym poziomom, takim jak modele VLA (Vision-Language-Action). Co więcej, Gemini Robotics ER 2 może natywnie korzystać z narzędzi, takich jak Google Search, aby wyszukiwać informacje, lub z innych funkcji zdefiniowanych przez użytkownika. Ta architektura pozwala robotowi „myśleć” o kolejnych krokach, jednocześnie wykonując bieżące działania.
Model stanowi znaczące ulepszenie w stosunku do poprzedniej wersji, Gemini Robotics ER 1.6. Dzięki ciągłej analizie obrazu wideo, roboty mogą teraz:
- Śledzić własne postępy.
- Adaptować się, gdy coś pójdzie nie tak.
- Precyzyjnie określać moment przejścia do kolejnego etapu zadania.
Współpraca wielu robotów i precyzyjne wykonanie
Jedną z kluczowych nowości jest wprowadzenie współpracy wielu robotów. Umożliwia to maszynom wspólną pracę w tych samych przestrzeniach i realizację złożonych zadań, których pojedynczy robot nie byłby w stanie wykonać samodzielnie. Przykładem jest demonstracja, w której Gemini Robotics ER 2 koordynuje współpracę robotów Apptronik Apollo 2 i Franka F3 Duo. Model poprawia również przepływ pracy w zakresie orkiestracji narzędzi, a jego wydajność jest oceniana w symulacjach, z kontrolą robotów w świecie rzeczywistym, a nawet w połączeniu z człowiekiem zdalnie sterującym robotem.
Gemini Robotics ER 2 konsekwentnie przewyższa ER 1.6 w orkiestracji narzędzi w trzech trybach sterowania: rzeczywistym VLA, symulowanym VLA i zdalnym sterowaniu przez człowieka. Wysokopoziomowe rozumowanie w robotyce zależy od szybkości wykonania. Gemini Robotics ER 2 integruje się z Gemini Live API, wykorzystując dwukierunkowy punkt końcowy strumieniowania zoptymalizowany pod kątem zadań wrażliwych na opóźnienia. Rezultatem jest płynna orkiestracja, która pozwala robotom na wykonywanie wieloetapowych zadań bez irytujących przerw na „zatrzymanie i zastanowienie się”. Google zademonstrowało to na przykładzie robota Spot firmy Boston Dynamics, gdzie Gemini Robotics ER 2 orkiestruje API Spot, takie jak nawigacja i ruch manipulatora, tworząc interaktywnego robota, który na polecenie w języku naturalnym potrafi przynieść przekąski.
Rozumienie wideo i bezpieczeństwo
Jednym z najtrudniejszych wyzwań w robotyce jest określenie, kiedy zadanie zostało zakończone. Gemini Robotics ER 2 wprowadza przełom w rozumieniu wideo i śledzeniu postępów, aby weryfikować, czy złożone zadania – takie jak dokręcanie żarówki czy zawiązywanie worka na śmieci – są ukończone zgodnie ze specyfikacją, zanim robot przejdzie do kolejnego etapu. W tej aktualizacji Google poczyniło postępy w dwóch podstawowych obszarach rozumienia postępu zadań: klasyfikacji postępu i znajdowaniu momentów krytycznych.
Klasyfikacja postępu odnosi się do zdolności robota do śledzenia postępów w realizacji zadania. W ocenach Google każda klatka wideo jest przypisywana do pięciu poziomów postępu (0-20%, 20-40%, 40-60%, 60-80%, 80-100%). Kwantyfikując postęp zadań, Gemini Robotics ER 2 zapewnia robotom świadomość sytuacyjną w czasie rzeczywistym i pozwala im na bieżąco dostosowywać działania lub ponawiać nieudane kroki bez restartowania całego procesu. Model osiąga 57,4% dokładności w zadaniach klasyfikacji postępu, przewyższając poprzednie generacje modeli.
Znajdowanie momentów krytycznych mierzy zdolność modelu do identyfikacji dokładnej klatki wideo, w której ma miejsce kluczowe zdarzenie (np. kiedy przestać nalewać kawę do filiżanki). Gemini Robotics ER 2 osiąga znaczne zyski w wydajności w tym obszarze, umożliwiając robotom precyzyjne przełączanie się między zadaniami, weryfikację sukcesu i sugerowanie korekt. W zadaniach znajdowania momentów model osiąga 91,3% dokładności i średnią odległość bezwzględną wynoszącą 0,96 sekundy. Konkuruje on z znacznie większymi kategoriami modeli, ale zapewnia tę precyzję przy ułamku kosztów obliczeniowych i czterokrotnie większej szybkości wykonania, co jest kluczowe dla bezpiecznego działania robotyki fizycznej w świecie rzeczywistym.
Gemini Robotics ER 2 jest również najbezpieczniejszym modelem Google, osiągającym znaczące zyski w testach Safety Instruction Following i Human Proximity. Testy te oceniają, jak model przestrzega fizycznych ograniczeń podczas zadań rozumowania i świadomości przestrzennej w wykrywaniu ludzi. Stwierdzono, że Gemini Robotics ER 2 skutecznie zatrzymuje robota humanoidalnego, gdy w pobliżu znajduje się osoba, i autonomicznie wznawia pracę dopiero po usunięciu przeszkody. Aby zwiększyć bezpieczeństwo agentów fizycznych, Google wprowadza również nowy benchmark, który ocenia zdolność modelu do działania jako bezpieczny orkiestrator VLA poprzez testowanie jego zdolności do egzekwowania ograniczeń bezpieczeństwa, monitorowania środowiska, oceny wykonalności fizycznej i poszukiwania wyjaśnień od człowieka.
Rozwój Gemini Robotics ER 2 stanowi istotny krok w kierunku tworzenia bardziej autonomicznych i inteligentnych robotów, które będą w stanie efektywnie współpracować z ludźmi i wykonywać złożone zadania w dynamicznym środowisku. Dostępność modelu dla deweloperów otwiera nowe możliwości dla innowacji w dziedzinie robotyki, przyspieszając rozwój pomocnych maszyn i wspierając całą społeczność robotyczną.
Źródło: deepmind.google
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
Indeks Hype'u AI: Nieseksowna strona sztucznej inteligencji
MIT Technology Review przedstawia subiektywną analizę najnowszych trendów w AI, wskazując na mniej efektowne, lecz istotne aspekty tej technologii.
Redakcja Aigestwczoraj

Fale mózgowe kluczem do rozwoju fizycznej sztucznej inteligencji?
Firma Encord, specjalizująca się w narzędziach do trenowania modeli AI, testuje innowacyjne metody zbierania danych dla robotyki, wykorzystując m.in. pomiary fal mózgowych. Celem jest przełamanie bariery braku danych tre
Redakcja Aigest3 dni temu

Claude Opus 5 firmy Anthropic ustanawia nowy rekord w teście ARC-AGI-3, wyprzedzając konkurencję
Model Claude Opus 5 firmy Anthropic osiągnął rekordowy wynik w teście ARC-AGI-3, mierzącym zdolności rozumowania AI w nowych środowiskach, znacząco przewyższając poprzednie osiągnięcia.
Redakcja Aigest4 dni temu

Google odnotowuje pierwszy w historii kwartał z ujemnymi przepływami pieniężnymi z powodu gigantycznych inwestycji w AI
Google, pomimo rekordowych przychodów w drugim kwartale 2026 roku, po raz pierwszy odnotowało ujemne wolne przepływy pieniężne, co jest bezpośrednim skutkiem masowych inwestycji w infrastrukturę sztucznej inteligencji.
Redakcja Aigest23 lip 2026

Microsoft AI stawia na małe, specjalistyczne modele zamiast na ogólne modele graniczne
Microsoft AI zmienia strategię, koncentrując się na efektywności tokenów i rozwijaniu małych, specjalistycznych modeli. Firma dąży do obniżenia kosztów i zwiększenia wydajności w konkretnych zastosowaniach, zamiast tworz
Redakcja Aigest7 godz. temu

Tencent udostępnia AngelSpec: ujednolicony framework do trenowania modeli MTP i blokowo-równoległego dekodowania spekula
Tencent udostępnił AngelSpec, framework do trenowania modeli draftowych dla dekodowania spekulacyjnego, wspierający zarówno predykcję wielotokenową (MTP), jak i rodzinę DFlash.
Redakcja Aigest10 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.