Aigest.
Newsy

Artificial Analysis publikuje "Search Index" – ranking API wyszukiwania dla agentów AI

Firma Artificial Analysis wprowadziła nowy benchmark "Search Index", który ocenia dostawców API wyszukiwania pod kątem jakości, kosztów i szybkości działania dla agentów AI.

RA

Udostępnij
Artificial Analysis publikuje "Search Index" – ranking API wyszukiwania dla agentów AI
Fot. The Decoder

Firma Artificial Analysis zaprezentowała „Search Index”, nowy benchmark służący do oceny dostawców API wyszukiwania pod kątem ich przydatności dla agentów sztucznej inteligencji. Narzędzie to analizuje kluczowe aspekty, takie jak jakość wyników, koszty operacyjne oraz szybkość działania, dostarczając kompleksowej oceny rynkowej.

Metodologia i testowani dostawcy

W początkowej fazie benchmark objął siedmiu dostawców: Parallel, Exa, Firecrawl, You.com, Tavily, Keenable oraz Brave. Każdy z nich został przetestowany w ustandaryzowanym środowisku agenta AI, wykorzystując ten sam model – GPT-5.6 Luna. Jedyną zmienną w testach był dostawca wyszukiwania. Agent działał na Stirrup, otwartym frameworku stworzonym przez Artificial Analysis, wykonując 25 przebiegów na każde zadanie, aby wyszukać i pobrać strony internetowe.

„Search Index” łączy w sobie trzy równoważne podbenchmarki:

  • DeepSearchQA: zawiera 900 pytań badawczych, z których każde wymagało wielu zapytań wyszukiwania.
  • BrowseComp: podzbiór testujący 200 trudnych do znalezienia faktów, które wymagały wieloetapowego przeglądania.
  • AA-Omniscience: obejmuje 600 pytań z sześciu różnych dziedzin wiedzy.

Jako punkt odniesienia służyła bazowa ocena, w której model odpowiadał na pytania samodzielnie, bez użycia narzędzi wyszukiwania.

Wpływ jakości na koszty i szybkość

Analiza wykazała, że wyższa jakość wyszukiwania bezpośrednio przekłada się na niższe całkowite koszty. Model, otrzymując lepsze wyniki już na początku, zużywa mniej tokenów. Na przykład, w przypadku Parallel Search (wersja zaawansowana), zużycie tokenów spadło o ponad 40 procent w porównaniu do wersji podstawowej. Chociaż koszty wyszukiwania na zadanie wzrosły, całkowity koszt okazał się niższy (0,084 USD wobec 0,11 USD).

Interesujące jest również to, że sama szybkość odpowiedzi na pojedyncze zapytanie nie zawsze oznacza szybsze wyniki ogólne. Parallel Search (turbo) osiągnął najkrótszy czas odpowiedzi na zapytanie (0,51 sekundy w porównaniu do 1,03 sekundy dla wersji podstawowej). Jednakże, niższa jakość wyników tej wersji (67 wobec 73) zmuszała agenta do wykonania większej liczby przebiegów. W efekcie, całkowity czas potrzebny na wykonanie zadania pozostał mniej więcej taki sam.

Liderzy i przyszłość benchmarku

Według Artificial Analysis, dostawcy Parallel, Firecrawl oraz Parallel (turbo) oferują najlepsze połączenie kosztów i wydajności. Firma zaznacza, że inni dostawcy mogą ubiegać się o dołączenie do benchmarku, a pełna metodologia testów jest publicznie dostępna.

Publikacja „Search Index” stanowi istotny krok w kierunku standaryzacji oceny i wyboru narzędzi wyszukiwania dla dynamicznie rozwijającego się sektora agentów AI. Dostarcza ona cennego wglądu w to, jak jakość, koszty i szybkość API wyszukiwania wpływają na efektywność i ekonomię działania systemów opartych na sztucznej inteligencji, co jest kluczowe dla ich dalszego rozwoju i komercjalizacji.

Źródło: the-decoder.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

OpenAI spowalnia rozwój modeli AI z powodu rosnących zagrożeń cyberbezpieczeństwa
Newsy

OpenAI spowalnia rozwój modeli AI z powodu rosnących zagrożeń cyberbezpieczeństwa

OpenAI ogłosiło spowolnienie rozwoju swoich modeli AI, w tym nadchodzącego modelu Astra, powołując się na rosnące ryzyko cyberbezpieczeństwa i potrzebę wzmocnienia zabezpieczeń.

Redakcja Aigest3 godz. temu

Nowe badanie podważa narrację firm AI o sposobach użytkowania ich modeli
Samodoskonalenie AI: Badanie podważa szybkie prognozy postępu
Newsy

Samodoskonalenie AI: Badanie podważa szybkie prognozy postępu

Nowe badanie sugeruje, że agentom AI brakuje kreatywności i oceny, by prowadzić innowacyjne badania naukowe, co może opóźnić ich samodoskonalenie.

Redakcja Aigest12 godz. temu

Anthropic i OpenRouter pokazują, że rynek AI konsoliduje się wokół gigantów i niszowych specjalistów
DeepSeek AI udostępnia DeepSeek Harness w wersji deweloperskiej – modułową platformę dla agentów AI
Newsy

DeepSeek AI udostępnia DeepSeek Harness w wersji deweloperskiej – modułową platformę dla agentów AI

DeepSeek AI zaprezentowało DeepSeek Harness v0.1, platformę dla agentów AI z otwartym kodem źródłowym na licencji MIT, charakteryzującą się pełną modułowością.

Redakcja Aigestwczoraj

Dlaczego wizja przyszłości AI według Marka Zuckerberga nie przekonuje?
Newsy

Dlaczego wizja przyszłości AI według Marka Zuckerberga nie przekonuje?

Mark Zuckerberg opublikował esej o przyszłości AI, ale jego optymistyczna wizja spotyka się ze sceptycyzmem, zwłaszcza w kontekście historii Meta Platforms.

Redakcja Aigest2 dni temu

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.