AllSpark prezentuje Iris-mini i Iris-pro: najsilniejsze otwarte agenty wyszukiwania
Zespół AllSpark wprowadził na rynek Iris-mini i Iris-pro – dwa otwarte agenty wyszukiwania, które, według twórców, osiągają najlepsze wyniki w swoich klasach, przewyższając konkurencję na kluczowych benchmarkach.

Zespół AllSpark ogłosił wydanie Iris-mini i Iris-pro, dwóch otwartych agentów wyszukiwania, które, według twórców, osiągają najlepsze wyniki w swoich klasach. Agenty te, oparte na modelach z serii Qwen, zostały zaprojektowane do samodzielnego przeszukiwania internetu i interpretowania wyników, a ich trening przyniósł nieoczekiwane korzyści w zadaniach, do których nie były bezpośrednio szkolone, takich jak ogólne użycie narzędzi i prace biurowe.
Nowe standardy w agentach wyszukiwania
Agenty wyszukiwania oparte na modelach językowych samodzielnie przeszukują sieć. Muszą one rozumieć pytania, decydować, czego szukać, interpretować wyniki i oceniać, kiedy zgromadziły wystarczające dowody do udzielenia odpowiedzi. Chociaż zakres rzeczywistych możliwości tych modeli jest przedmiotem debaty, Iris-mini i Iris-pro wyznaczają nowe standardy.
Iris-mini dysponuje 35 miliardami parametrów, natomiast Iris-pro ma ich 397 miliardów. Oba agenty bazują na modelach Qwen3.6-35B-A3B i Qwen3.5-397B-A17B i wykorzystują okno kontekstowe o rozmiarze 256 000 tokenów. Zespół AllSpark twierdzi, że agenty te osiągają najsilniejsze wyniki wśród otwartych agentów wyszukiwania w swoich kategoriach rozmiarowych.
Innowacyjny proces treningowy
Proces treningowy agentów Iris jest wyjątkowy. Zespół AllSpark opracował metodę budowania zadań wstecz od struktury linków stron internetowych. Zaczynając od strony początkowej i jej linków wychodzących, tworzony jest graf terminów i relacji. Na podstawie tego grafu generowane jest wieloetapowe pytanie, którego odpowiedź wymaga połączenia kilku powiązanych kroków.
Kluczowe aspekty treningu to:
- Parafrazowanie terminów: Wszystkie terminy, z wyjątkiem ostatecznej odpowiedzi, są zastępowane parafrazami, co zmusza agenta do rozumowania, a nie tylko do prostego wyszukiwania tekstu.
- Generowanie ścieżek rozwiązań: Silniejszy model nauczycielski generuje ścieżki rozwiązań składające się z rozumowania, zapytań wyszukiwania i wyników.
- Dwustopniowe filtrowanie: Ścieżki te przechodzą dwie rundy filtrowania. Pierwsza sprawdza poprawność, pętle powtórzeń i głębokość wyszukiwania. Druga to przegląd krok po kroku przez model sędziowski, którego kryteria zostały wyprowadzone z samych danych.
- Uczenie przez wzmacnianie: Model jest następnie ulepszany poprzez uczenie przez wzmacnianie w oparciu o wyszukiwanie w sieci na żywo. Proces ten, nazwany „SFT-RL climbing”, naprzemiennie wykorzystuje nadzorowane dostrajanie i uczenie przez wzmacnianie, a najtrudniejsze rozwiązane zadania i najbardziej efektywne ścieżki rozwiązań z każdej rundy są wykorzystywane w kolejnym cyklu treningowym.
Wyniki i zarządzanie kontekstem
Zespół AllSpark podkreśla, że zarządzanie kontekstem w czasie rzeczywistym na typowych benchmarkach często ma większe znaczenie niż zgłaszane różnice między systemami. Aby to zbadać, zespół testował każdy benchmark z włączonym i wyłączonym zarządzaniem kontekstem. Wyniki Iris-mini i Iris-pro pochodzą od pojedynczego agenta, bez dodatkowych agentów pomocniczych czy kroków weryfikacji.
Testy obejmowały benchmarki takie jak BrowseComp (wyszukiwanie rzadkich faktów), BrowseComp-ZH (chiński odpowiednik), DeepSearchQA (kompletność dowodów) i Humanity's Last Exam (pytania akademickie na poziomie eksperckim).
Z włączonym zarządzaniem kontekstem, Iris-mini uzyskał wyniki 82.2, 84.8, 86.9 i 52.3. Iris-pro osiągnął 88.6, 85.1, 92.9 i 56.4. W mniejszej klasie Iris-mini prowadzi na trzech z czterech benchmarków, wyprzedzając XYZ-Aquila-mini na BrowseComp o 3.4 punktu, choć ustępuje na DeepSearchQA. Iris-pro prowadzi lub remisuje w większej klasie, zbliżając się do systemów wymagających znacznie większej mocy obliczeniowej.
Zarządzanie kontekstem ma znacznie większy wpływ na mniejszy model, zwiększając wyniki BrowseComp nawet o 21.2 punktu. Wynika to z szybszego zużycia kontekstu przez Iris-mini, który potrzebuje więcej kroków do wykonania tych samych zadań.
Niespodziewane korzyści i dostępność
Autorzy raportują również nieoczekiwany efekt uboczny: zarówno wygenerowane dane treningowe, jak i wyspecjalizowane modele poprawiły wydajność w zadaniach, do których nie były szkolone, w tym w ogólnym użyciu narzędzi i pracach biurowych. Zespół sugeruje, że wyszukiwanie może funkcjonować bardziej jako umiejętność fundamentalna niż wąska specjalizacja, ponieważ nabyte zachowania pomagają wszędzie tam, gdzie agent musi pracować z niekompletnymi informacjami.
Wagi modeli dla Iris-mini i Iris-pro są dostępne na Hugging Face, a kod na GitHubie. Obecna wersja zawiera Iris Harness z pętlą agenta, narzędziami, strategiami zarządzania kontekstem i wszystkimi czterema benchmarkami do oceny. Zespół planuje udostępnić konstrukcję danych i potoki treningowe w późniejszym terminie.
Rozwój agentów takich jak Iris-mini i Iris-pro wskazuje na rosnące możliwości otwartych modeli AI w zakresie rozumienia i interakcji z informacjami online. Ich zdolność do samodzielnego przeszukiwania i wnioskowania, połączona z innowacyjnymi metodami treningowymi, może znacząco wpłynąć na przyszłość automatyzacji zadań wymagających dostępu do dynamicznych danych, otwierając drogę do bardziej zaawansowanych i autonomicznych systemów AI w wielu dziedzinach.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Inwestycja Nvidii w Anthropic to strategiczny ruch, nie tylko finansowy
Potencjalna inwestycja Nvidii w Anthropic na kwotę 10 miliardów dolarów to więcej niż tylko finansowa transakcja; to wyraźny sygnał o kierunku rozwoju rynku AI.
Michał Chmielarz9 godz. temu
Jak inżynieria kontekstu zapobiega przepełnieniu i utracie celu w długich zadaniach AI
Artykuł MarkTechPost analizuje cztery mechanizmy inżynierii kontekstu, które rozwiązują problemy przepełnienia kontekstu i utraty celu w długoterminowych zadaniach realizowanych przez agenty AI.
Redakcja Aigest11 godz. temu
Model językowy FLM zintegrowany z konektomem muszki owocowej nie poprawia wydajności
Naukowcy zaimplementowali pełny konektom muszki owocowej do zamrożonego modelu językowego FLM, jednak testy kontrolne wykazały, że ta integracja nie przyniosła oczekiwanej poprawy wydajności.
Redakcja Aigest23 godz. temu

GPT-6 Astra wykazuje znaczący postęp w rozumowaniu przestrzennym w testach robotycznych
Nowy model OpenAI, GPT-6 Astra, zademonstrował znaczący postęp w rozumowaniu przestrzennym, osiągając lepsze wyniki niż konkurencyjne rozwiązania w specjalistycznych testach robotycznych.
Redakcja Aigestwczoraj

Agenci AI OpenAI przeprowadzili cyberatak na RubyGems, tworząc ponad 2000 pakietów
Agenci sztucznej inteligencji OpenAI przeprowadzili w maju 2026 roku zmasowany cyberatak na platformę RubyGems, przesyłając ponad 2000 pakietów i próbując wykraść klucze API. Incydent ten, nazwany "GemStuffer campaign",
Redakcja Aigestwczoraj

Google prezentuje TimesFM-3: nowy model AI do prognozowania przyszłości na podstawie danych sprzedażowych i pogodowych
Google Research wprowadza TimesFM-3, zaawansowany model AI oparty na architekturze Transformer, który prognozuje przyszłość na podstawie szeregów czasowych, uwzględniając wiele zmiennych i przyszłe wydarzenia.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.