Aigest.
Newsy

AllSpark prezentuje Iris-mini i Iris-pro: najsilniejsze otwarte agenty wyszukiwania

Zespół AllSpark wprowadził na rynek Iris-mini i Iris-pro – dwa otwarte agenty wyszukiwania, które, według twórców, osiągają najlepsze wyniki w swoich klasach, przewyższając konkurencję na kluczowych benchmarkach.

RA

Udostępnij
AllSpark prezentuje Iris-mini i Iris-pro: najsilniejsze otwarte agenty wyszukiwania
Fot. The Decoder

Zespół AllSpark ogłosił wydanie Iris-mini i Iris-pro, dwóch otwartych agentów wyszukiwania, które, według twórców, osiągają najlepsze wyniki w swoich klasach. Agenty te, oparte na modelach z serii Qwen, zostały zaprojektowane do samodzielnego przeszukiwania internetu i interpretowania wyników, a ich trening przyniósł nieoczekiwane korzyści w zadaniach, do których nie były bezpośrednio szkolone, takich jak ogólne użycie narzędzi i prace biurowe.

Nowe standardy w agentach wyszukiwania

Agenty wyszukiwania oparte na modelach językowych samodzielnie przeszukują sieć. Muszą one rozumieć pytania, decydować, czego szukać, interpretować wyniki i oceniać, kiedy zgromadziły wystarczające dowody do udzielenia odpowiedzi. Chociaż zakres rzeczywistych możliwości tych modeli jest przedmiotem debaty, Iris-mini i Iris-pro wyznaczają nowe standardy.

Iris-mini dysponuje 35 miliardami parametrów, natomiast Iris-pro ma ich 397 miliardów. Oba agenty bazują na modelach Qwen3.6-35B-A3B i Qwen3.5-397B-A17B i wykorzystują okno kontekstowe o rozmiarze 256 000 tokenów. Zespół AllSpark twierdzi, że agenty te osiągają najsilniejsze wyniki wśród otwartych agentów wyszukiwania w swoich kategoriach rozmiarowych.

Innowacyjny proces treningowy

Proces treningowy agentów Iris jest wyjątkowy. Zespół AllSpark opracował metodę budowania zadań wstecz od struktury linków stron internetowych. Zaczynając od strony początkowej i jej linków wychodzących, tworzony jest graf terminów i relacji. Na podstawie tego grafu generowane jest wieloetapowe pytanie, którego odpowiedź wymaga połączenia kilku powiązanych kroków.

Kluczowe aspekty treningu to:

  • Parafrazowanie terminów: Wszystkie terminy, z wyjątkiem ostatecznej odpowiedzi, są zastępowane parafrazami, co zmusza agenta do rozumowania, a nie tylko do prostego wyszukiwania tekstu.
  • Generowanie ścieżek rozwiązań: Silniejszy model nauczycielski generuje ścieżki rozwiązań składające się z rozumowania, zapytań wyszukiwania i wyników.
  • Dwustopniowe filtrowanie: Ścieżki te przechodzą dwie rundy filtrowania. Pierwsza sprawdza poprawność, pętle powtórzeń i głębokość wyszukiwania. Druga to przegląd krok po kroku przez model sędziowski, którego kryteria zostały wyprowadzone z samych danych.
  • Uczenie przez wzmacnianie: Model jest następnie ulepszany poprzez uczenie przez wzmacnianie w oparciu o wyszukiwanie w sieci na żywo. Proces ten, nazwany „SFT-RL climbing”, naprzemiennie wykorzystuje nadzorowane dostrajanie i uczenie przez wzmacnianie, a najtrudniejsze rozwiązane zadania i najbardziej efektywne ścieżki rozwiązań z każdej rundy są wykorzystywane w kolejnym cyklu treningowym.

Wyniki i zarządzanie kontekstem

Zespół AllSpark podkreśla, że zarządzanie kontekstem w czasie rzeczywistym na typowych benchmarkach często ma większe znaczenie niż zgłaszane różnice między systemami. Aby to zbadać, zespół testował każdy benchmark z włączonym i wyłączonym zarządzaniem kontekstem. Wyniki Iris-mini i Iris-pro pochodzą od pojedynczego agenta, bez dodatkowych agentów pomocniczych czy kroków weryfikacji.

Testy obejmowały benchmarki takie jak BrowseComp (wyszukiwanie rzadkich faktów), BrowseComp-ZH (chiński odpowiednik), DeepSearchQA (kompletność dowodów) i Humanity's Last Exam (pytania akademickie na poziomie eksperckim).

Z włączonym zarządzaniem kontekstem, Iris-mini uzyskał wyniki 82.2, 84.8, 86.9 i 52.3. Iris-pro osiągnął 88.6, 85.1, 92.9 i 56.4. W mniejszej klasie Iris-mini prowadzi na trzech z czterech benchmarków, wyprzedzając XYZ-Aquila-mini na BrowseComp o 3.4 punktu, choć ustępuje na DeepSearchQA. Iris-pro prowadzi lub remisuje w większej klasie, zbliżając się do systemów wymagających znacznie większej mocy obliczeniowej.

Zarządzanie kontekstem ma znacznie większy wpływ na mniejszy model, zwiększając wyniki BrowseComp nawet o 21.2 punktu. Wynika to z szybszego zużycia kontekstu przez Iris-mini, który potrzebuje więcej kroków do wykonania tych samych zadań.

Niespodziewane korzyści i dostępność

Autorzy raportują również nieoczekiwany efekt uboczny: zarówno wygenerowane dane treningowe, jak i wyspecjalizowane modele poprawiły wydajność w zadaniach, do których nie były szkolone, w tym w ogólnym użyciu narzędzi i pracach biurowych. Zespół sugeruje, że wyszukiwanie może funkcjonować bardziej jako umiejętność fundamentalna niż wąska specjalizacja, ponieważ nabyte zachowania pomagają wszędzie tam, gdzie agent musi pracować z niekompletnymi informacjami.

Wagi modeli dla Iris-mini i Iris-pro są dostępne na Hugging Face, a kod na GitHubie. Obecna wersja zawiera Iris Harness z pętlą agenta, narzędziami, strategiami zarządzania kontekstem i wszystkimi czterema benchmarkami do oceny. Zespół planuje udostępnić konstrukcję danych i potoki treningowe w późniejszym terminie.

Rozwój agentów takich jak Iris-mini i Iris-pro wskazuje na rosnące możliwości otwartych modeli AI w zakresie rozumienia i interakcji z informacjami online. Ich zdolność do samodzielnego przeszukiwania i wnioskowania, połączona z innowacyjnymi metodami treningowymi, może znacząco wpłynąć na przyszłość automatyzacji zadań wymagających dostępu do dynamicznych danych, otwierając drogę do bardziej zaawansowanych i autonomicznych systemów AI w wielu dziedzinach.

Źródło: the-decoder.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Inwestycja Nvidii w Anthropic to strategiczny ruch, nie tylko finansowy
Jak inżynieria kontekstu zapobiega przepełnieniu i utracie celu w długich zadaniach AI
Newsy

Jak inżynieria kontekstu zapobiega przepełnieniu i utracie celu w długich zadaniach AI

Artykuł MarkTechPost analizuje cztery mechanizmy inżynierii kontekstu, które rozwiązują problemy przepełnienia kontekstu i utraty celu w długoterminowych zadaniach realizowanych przez agenty AI.

Redakcja Aigest11 godz. temu

Model językowy FLM zintegrowany z konektomem muszki owocowej nie poprawia wydajności
GPT-6 Astra wykazuje znaczący postęp w rozumowaniu przestrzennym w testach robotycznych
Agenci AI OpenAI przeprowadzili cyberatak na RubyGems, tworząc ponad 2000 pakietów
Google prezentuje TimesFM-3: nowy model AI do prognozowania przyszłości na podstawie danych sprzedażowych i pogodowych

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.