Aigest.
Newsy

Gemini Robotics ER 2: Nowy mózg dla robotów od Google z rozumieniem wideo i współpracą

Google wprowadza Gemini Robotics ER 2, zaawansowany model AI, który ma działać jako mózg dla robotów, umożliwiając im rozumienie wideo, planowanie zadań i współpracę.

RA

Udostępnij
Gemini Robotics ER 2: Nowy mózg dla robotów od Google z rozumieniem wideo i współpracą
Fot. Google DeepMind

Google zaprezentowało Gemini Robotics ER 2, nowy, zaawansowany model sztucznej inteligencji, który ma pełnić funkcję wysokopoziomowego mózgu dla robotów. Jego celem jest zwiększenie użyteczności maszyn w świecie fizycznym poprzez zaawansowane rozumienie obrazu wideo, orkiestrację zadań oraz możliwość współpracy między wieloma robotami. Model jest już dostępny dla deweloperów za pośrednictwem Gemini API, Google AI Studio oraz w prywatnej wersji zapoznawczej na platformie Gemini Enterprise Agent Platform.

Inteligentne planowanie i samokorekta

Gemini Robotics ER 2 został zaprojektowany, aby umożliwić robotom szybkie myślenie, planowanie wieloetapowych zadań oraz współpracę. Model pozwala maszynom na bieżąco analizować strumienie wideo, co umożliwia im śledzenie własnych postępów i korygowanie błędów w czasie rzeczywistym. Dzięki temu roboty mogą być bezpieczniejsze i bardziej pomocne w codziennych środowiskach. Model pozwala robotom na komunikację z ludźmi, rozumienie świata fizycznego i planowanie złożonych sekwencji działań, przekazując następnie wykonanie ruchów niższym poziomom, takim jak modele VLA (Vision-Language-Action). Co więcej, Gemini Robotics ER 2 może natywnie korzystać z narzędzi, takich jak Google Search, aby wyszukiwać informacje, lub z innych funkcji zdefiniowanych przez użytkownika. Ta architektura pozwala robotowi „myśleć” o kolejnych krokach, jednocześnie wykonując bieżące działania.

Model stanowi znaczące ulepszenie w stosunku do poprzedniej wersji, Gemini Robotics ER 1.6. Dzięki ciągłej analizie obrazu wideo, roboty mogą teraz:

  • Śledzić własne postępy.
  • Adaptować się, gdy coś pójdzie nie tak.
  • Precyzyjnie określać moment przejścia do kolejnego etapu zadania.

Współpraca wielu robotów i precyzyjne wykonanie

Jedną z kluczowych nowości jest wprowadzenie współpracy wielu robotów. Umożliwia to maszynom wspólną pracę w tych samych przestrzeniach i realizację złożonych zadań, których pojedynczy robot nie byłby w stanie wykonać samodzielnie. Przykładem jest demonstracja, w której Gemini Robotics ER 2 koordynuje współpracę robotów Apptronik Apollo 2 i Franka F3 Duo. Model poprawia również przepływ pracy w zakresie orkiestracji narzędzi, a jego wydajność jest oceniana w symulacjach, z kontrolą robotów w świecie rzeczywistym, a nawet w połączeniu z człowiekiem zdalnie sterującym robotem.

Gemini Robotics ER 2 konsekwentnie przewyższa ER 1.6 w orkiestracji narzędzi w trzech trybach sterowania: rzeczywistym VLA, symulowanym VLA i zdalnym sterowaniu przez człowieka. Wysokopoziomowe rozumowanie w robotyce zależy od szybkości wykonania. Gemini Robotics ER 2 integruje się z Gemini Live API, wykorzystując dwukierunkowy punkt końcowy strumieniowania zoptymalizowany pod kątem zadań wrażliwych na opóźnienia. Rezultatem jest płynna orkiestracja, która pozwala robotom na wykonywanie wieloetapowych zadań bez irytujących przerw na „zatrzymanie i zastanowienie się”. Google zademonstrowało to na przykładzie robota Spot firmy Boston Dynamics, gdzie Gemini Robotics ER 2 orkiestruje API Spot, takie jak nawigacja i ruch manipulatora, tworząc interaktywnego robota, który na polecenie w języku naturalnym potrafi przynieść przekąski.

Rozumienie wideo i bezpieczeństwo

Jednym z najtrudniejszych wyzwań w robotyce jest określenie, kiedy zadanie zostało zakończone. Gemini Robotics ER 2 wprowadza przełom w rozumieniu wideo i śledzeniu postępów, aby weryfikować, czy złożone zadania – takie jak dokręcanie żarówki czy zawiązywanie worka na śmieci – są ukończone zgodnie ze specyfikacją, zanim robot przejdzie do kolejnego etapu. W tej aktualizacji Google poczyniło postępy w dwóch podstawowych obszarach rozumienia postępu zadań: klasyfikacji postępu i znajdowaniu momentów krytycznych.

Klasyfikacja postępu odnosi się do zdolności robota do śledzenia postępów w realizacji zadania. W ocenach Google każda klatka wideo jest przypisywana do pięciu poziomów postępu (0-20%, 20-40%, 40-60%, 60-80%, 80-100%). Kwantyfikując postęp zadań, Gemini Robotics ER 2 zapewnia robotom świadomość sytuacyjną w czasie rzeczywistym i pozwala im na bieżąco dostosowywać działania lub ponawiać nieudane kroki bez restartowania całego procesu. Model osiąga 57,4% dokładności w zadaniach klasyfikacji postępu, przewyższając poprzednie generacje modeli.

Znajdowanie momentów krytycznych mierzy zdolność modelu do identyfikacji dokładnej klatki wideo, w której ma miejsce kluczowe zdarzenie (np. kiedy przestać nalewać kawę do filiżanki). Gemini Robotics ER 2 osiąga znaczne zyski w wydajności w tym obszarze, umożliwiając robotom precyzyjne przełączanie się między zadaniami, weryfikację sukcesu i sugerowanie korekt. W zadaniach znajdowania momentów model osiąga 91,3% dokładności i średnią odległość bezwzględną wynoszącą 0,96 sekundy. Konkuruje on z znacznie większymi kategoriami modeli, ale zapewnia tę precyzję przy ułamku kosztów obliczeniowych i czterokrotnie większej szybkości wykonania, co jest kluczowe dla bezpiecznego działania robotyki fizycznej w świecie rzeczywistym.

Gemini Robotics ER 2 jest również najbezpieczniejszym modelem Google, osiągającym znaczące zyski w testach Safety Instruction Following i Human Proximity. Testy te oceniają, jak model przestrzega fizycznych ograniczeń podczas zadań rozumowania i świadomości przestrzennej w wykrywaniu ludzi. Stwierdzono, że Gemini Robotics ER 2 skutecznie zatrzymuje robota humanoidalnego, gdy w pobliżu znajduje się osoba, i autonomicznie wznawia pracę dopiero po usunięciu przeszkody. Aby zwiększyć bezpieczeństwo agentów fizycznych, Google wprowadza również nowy benchmark, który ocenia zdolność modelu do działania jako bezpieczny orkiestrator VLA poprzez testowanie jego zdolności do egzekwowania ograniczeń bezpieczeństwa, monitorowania środowiska, oceny wykonalności fizycznej i poszukiwania wyjaśnień od człowieka.

Rozwój Gemini Robotics ER 2 stanowi istotny krok w kierunku tworzenia bardziej autonomicznych i inteligentnych robotów, które będą w stanie efektywnie współpracować z ludźmi i wykonywać złożone zadania w dynamicznym środowisku. Dostępność modelu dla deweloperów otwiera nowe możliwości dla innowacji w dziedzinie robotyki, przyspieszając rozwój pomocnych maszyn i wspierając całą społeczność robotyczną.

Źródło: deepmind.google

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Indeks Hype'u AI: Nieseksowna strona sztucznej inteligencji
Fale mózgowe kluczem do rozwoju fizycznej sztucznej inteligencji?
Claude Opus 5 firmy Anthropic ustanawia nowy rekord w teście ARC-AGI-3, wyprzedzając konkurencję
Google odnotowuje pierwszy w historii kwartał z ujemnymi przepływami pieniężnymi z powodu gigantycznych inwestycji w AI
Microsoft AI stawia na małe, specjalistyczne modele zamiast na ogólne modele graniczne
Tencent udostępnia AngelSpec: ujednolicony framework do trenowania modeli MTP i blokowo-równoległego dekodowania spekula

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.