Artificial Analysis publikuje "Search Index" – ranking API wyszukiwania dla agentów AI
Firma Artificial Analysis wprowadziła nowy benchmark "Search Index", który ocenia dostawców API wyszukiwania pod kątem jakości, kosztów i szybkości działania dla agentów AI.

Firma Artificial Analysis zaprezentowała „Search Index”, nowy benchmark służący do oceny dostawców API wyszukiwania pod kątem ich przydatności dla agentów sztucznej inteligencji. Narzędzie to analizuje kluczowe aspekty, takie jak jakość wyników, koszty operacyjne oraz szybkość działania, dostarczając kompleksowej oceny rynkowej.
Metodologia i testowani dostawcy
W początkowej fazie benchmark objął siedmiu dostawców: Parallel, Exa, Firecrawl, You.com, Tavily, Keenable oraz Brave. Każdy z nich został przetestowany w ustandaryzowanym środowisku agenta AI, wykorzystując ten sam model – GPT-5.6 Luna. Jedyną zmienną w testach był dostawca wyszukiwania. Agent działał na Stirrup, otwartym frameworku stworzonym przez Artificial Analysis, wykonując 25 przebiegów na każde zadanie, aby wyszukać i pobrać strony internetowe.
„Search Index” łączy w sobie trzy równoważne podbenchmarki:
- DeepSearchQA: zawiera 900 pytań badawczych, z których każde wymagało wielu zapytań wyszukiwania.
- BrowseComp: podzbiór testujący 200 trudnych do znalezienia faktów, które wymagały wieloetapowego przeglądania.
- AA-Omniscience: obejmuje 600 pytań z sześciu różnych dziedzin wiedzy.
Jako punkt odniesienia służyła bazowa ocena, w której model odpowiadał na pytania samodzielnie, bez użycia narzędzi wyszukiwania.
Wpływ jakości na koszty i szybkość
Analiza wykazała, że wyższa jakość wyszukiwania bezpośrednio przekłada się na niższe całkowite koszty. Model, otrzymując lepsze wyniki już na początku, zużywa mniej tokenów. Na przykład, w przypadku Parallel Search (wersja zaawansowana), zużycie tokenów spadło o ponad 40 procent w porównaniu do wersji podstawowej. Chociaż koszty wyszukiwania na zadanie wzrosły, całkowity koszt okazał się niższy (0,084 USD wobec 0,11 USD).
Interesujące jest również to, że sama szybkość odpowiedzi na pojedyncze zapytanie nie zawsze oznacza szybsze wyniki ogólne. Parallel Search (turbo) osiągnął najkrótszy czas odpowiedzi na zapytanie (0,51 sekundy w porównaniu do 1,03 sekundy dla wersji podstawowej). Jednakże, niższa jakość wyników tej wersji (67 wobec 73) zmuszała agenta do wykonania większej liczby przebiegów. W efekcie, całkowity czas potrzebny na wykonanie zadania pozostał mniej więcej taki sam.
Liderzy i przyszłość benchmarku
Według Artificial Analysis, dostawcy Parallel, Firecrawl oraz Parallel (turbo) oferują najlepsze połączenie kosztów i wydajności. Firma zaznacza, że inni dostawcy mogą ubiegać się o dołączenie do benchmarku, a pełna metodologia testów jest publicznie dostępna.
Publikacja „Search Index” stanowi istotny krok w kierunku standaryzacji oceny i wyboru narzędzi wyszukiwania dla dynamicznie rozwijającego się sektora agentów AI. Dostarcza ona cennego wglądu w to, jak jakość, koszty i szybkość API wyszukiwania wpływają na efektywność i ekonomię działania systemów opartych na sztucznej inteligencji, co jest kluczowe dla ich dalszego rozwoju i komercjalizacji.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

OpenAI spowalnia rozwój modeli AI z powodu rosnących zagrożeń cyberbezpieczeństwa
OpenAI ogłosiło spowolnienie rozwoju swoich modeli AI, w tym nadchodzącego modelu Astra, powołując się na rosnące ryzyko cyberbezpieczeństwa i potrzebę wzmocnienia zabezpieczeń.
Redakcja Aigest3 godz. temu

Nowe badanie podważa narrację firm AI o sposobach użytkowania ich modeli
Niezależny projekt AI Observatory odkrywa, że firmy AI pomijają w swoich raportach znaczną część prywatnego i wrażliwego użytkowania modeli, koncentrując się na zastosowaniach biznesowych.
Redakcja Aigest11 godz. temu

Samodoskonalenie AI: Badanie podważa szybkie prognozy postępu
Nowe badanie sugeruje, że agentom AI brakuje kreatywności i oceny, by prowadzić innowacyjne badania naukowe, co może opóźnić ich samodoskonalenie.
Redakcja Aigest12 godz. temu
Anthropic i OpenRouter pokazują, że rynek AI konsoliduje się wokół gigantów i niszowych specjalistów
Wzrost Anthropic i przejęcie OpenRouter przez Stripe to wyraźne sygnały, że branża AI wchodzi w fazę konsolidacji. Duże pieniądze idą za sprawdzonymi modelami i specjalistycznymi rozwiązaniami, co ma swoje konsekwencje d
Michał Chmielarz13 godz. temu

DeepSeek AI udostępnia DeepSeek Harness w wersji deweloperskiej – modułową platformę dla agentów AI
DeepSeek AI zaprezentowało DeepSeek Harness v0.1, platformę dla agentów AI z otwartym kodem źródłowym na licencji MIT, charakteryzującą się pełną modułowością.
Redakcja Aigestwczoraj

Dlaczego wizja przyszłości AI według Marka Zuckerberga nie przekonuje?
Mark Zuckerberg opublikował esej o przyszłości AI, ale jego optymistyczna wizja spotyka się ze sceptycyzmem, zwłaszcza w kontekście historii Meta Platforms.
Redakcja Aigest2 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.