Keenable AI udostępnia NEEDLE: dynamiczny benchmark wyszukiwarek z godzinową aktualizacją zapytań
Firma Keenable AI zaprezentowała NEEDLE, innowacyjny benchmark open-source, który na bieżąco generuje zestawy zapytań, aby precyzyjnie oceniać wydajność API wyszukiwarek w kontekście dynamicznych danych.

Tradycyjne metody benchmarkingu API wyszukiwarek często napotykają na problem, gdy testowany system może uzyskać dostęp do "klucza odpowiedzi" – na przykład poprzez pobranie publicznych zbiorów danych lub wykorzystanie już zakodowanych informacji w pamięci modelu. W odpowiedzi na to wyzwanie, firma Keenable AI opracowała i udostępniła NEEDLE (News, Everyday, Expert, Deep-tail, and Legal Evaluation) – innowacyjny, otwarty benchmark, który na bieżąco generuje zestawy zapytań z aktualnych źródeł, zamiast polegać na statycznych danych.
Jak działa NEEDLE?
NEEDLE rozwiązuje problem statycznych zbiorów danych, dynamicznie odświeżając swoje zapytania. Zapytania dotyczące wiadomości są regenerowane co godzinę z kanałów RSS i Google Trends. Z kolei zapytania finansowe, naukowe, prawne oraz dotyczące rzadkich jednostek są odświeżane codziennie z takich źródeł jak SEC XBRL, arXiv, Europe PMC, CourtListener i publiczne logi agentów. Benchmark testuje piętnaście różnych API wyszukiwarek, używając tego samego tekstu zapytania i protokołu. Każdy wynik jest porównywany z "ultimate" – syntetycznym silnikiem wyroczni, który agreguje i ocenia wszystko, co udało się znaleźć wszystkim testowanym silnikom.
NEEDLE to narzędzie wiersza poleceń (CLI) dla Pythona, instalowane za pomocą uv sync. Do działania wymaga klucza OpenRouter do oceny wyników oraz po jednym kluczu API dla każdego testowanego silnika. Może być uruchamiane na laptopie lub w środowisku CI, umożliwiając odtworzenie wszystkich strumieni zapytań i ocen jakości rankingów.
Kategorie zapytań i metody oceny
Nazwa NEEDLE odzwierciedla pięć głównych kategorii zapytań, z których każda symuluje inną intencję agenta:
- News (Wiadomości): Wykorzystuje około 124 wyselekcjonowanych kanałów RSS i Google Trends, aby generować zapytania o najnowsze informacje.
- Everyday (Codzienne): W źródle nie ma szczegółów na temat tej kategorii, ale nazwa sugeruje ogólne, codzienne zapytania.
- Expert (Eksperckie): W źródle nie ma szczegółów na temat tej kategorii, ale nazwa sugeruje zapytania wymagające specjalistycznej wiedzy.
- Deep-tail (Długi ogon): Pobiera zapytania dotyczące rzadkich słów z publicznych trajektorii agentów, takich jak DeepResearchGym, OpenResearcher i LRAT.
- Legal (Prawne): Wykorzystuje najnowsze opinie CourtListener z 14 sądów federalnych i sekcji eCFR.
System oceniania różni się w zależności od kategorii:
- News i Deep-tail: Nie mają pojedynczego poprawnego wyniku. Sędzia LLM ocenia każdy wynik w skali od 0 do 4, a narzędzie raportuje nDCG@5 z karą za duplikaty URL.
- Finance (Finanse): Raportuje answer-recall@5, sprawdzając, czy fakt dociera do agenta w pięciu najlepszych fragmentach.
- Scholar (Naukowe) i Legal (Prawne): Są to zadania typu "znany element", oceniane na podstawie dopasowania identyfikatora.
Każdy silnik otrzymuje identyczny tekst zapytania, a wywołania są wykonywane pojedynczo, co pozwala na porównywalność opóźnień. Ocenianie odbywa się na podstawie rankingu, tytułów i fragmentów dostarczonych przez sam silnik; strony nigdy nie są pobierane ani ponownie rankowane. Dowody są obcinane do 2000 znaków, a sędzia nie widzi nazwy silnika.
Wyniki i znaczenie "ultimate ceiling"
Kluczowym elementem analizy NEEDLE jest "ultimate ceiling". Dla każdego zapytania, NEEDLE łączy wyniki zwrócone przez wszystkie silniki w syntetyczny silnik wyroczni, a następnie porządkuje ten połączony zestaw według trafności. Tworzy to empiryczny pułap oparty na tym, co cała branża była w stanie odzyskać. Luka między dostarczoną jakością a "ultimate ceiling" wskazuje na górną granicę jakości wyszukiwania agentowego. Duża luka oznacza, że istniały lepsze wyniki, ale żaden silnik nie był w stanie ich dobrze wyświetlić lub uszeregować. Niski wynik "ultimate" sugeruje, że nawet po połączeniu wszystkich dostawców, benchmark znalazł niewiele mocnych dowodów.
Opublikowane 7-dniowe średnie z okresu kończącego się 28 sierpnia 2026 roku pokazują interesujące tendencje:
- Finanse: Jest bliskie rozwiązania. Exa osiągnęła 0.910, Keenable 0.872, Perplexity 0.871, a Google 0.847, przy pułapie 0.965.
- Naukowe: Wyniki są bardziej zróżnicowane, od Keenable 0.774 do Tavily 0.310, przy pułapie 0.869. Różnica wynika z tego, że zapytania tytułowe są łatwiejsze do odpowiedzi z metadanych, a zapytania dotyczące treści już nie.
- Deep-tail: Jest najtrudniejszą kategorią i najbardziej zbliżoną do rzeczywistego ruchu agentów. Exa prowadzi z wynikiem 0.557 (w stosunku do pułapu), Keenable ma 0.470, a Bing 0.199.
Opóźnienia są również kluczową metryką, ponieważ agenci wykonują dziesiątki wywołań wyszukiwania na zadanie. W tym samym okresie, Keenable-realtime osiągnęło 193 ms (p50) / 284 ms (p95), Exa 1,876 ms / 2,955 ms, a Bing 2,767 ms / 9,381 ms.
Udostępnienie NEEDLE przez Keenable AI stanowi istotny krok w kierunku bardziej rzetelnej i dynamicznej oceny systemów wyszukiwania opartych na sztucznej inteligencji. Dzięki ciągłej aktualizacji zapytań i unikalnej metodologii "ultimate ceiling", benchmark ten pozwala nie tylko porównywać wydajność poszczególnych silników, ale także identyfikować fundamentalne problemy w zdolności całej branży do pozyskiwania i rankowania informacji, co jest kluczowe dla rozwoju agentów AI nowej generacji.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

OpenClaw 2.0: Uproszczona konfiguracja, nowa aplikacja przeglądarkowa i sesje wieloosobowe
Fundacja OpenClaw wydała wersję 2.0 swojej platformy AI, wprowadzając uproszczoną konfigurację, przebudowaną aplikację przeglądarkową oraz funkcję współdzielonych sesji w chmurze.
Redakcja Aigest2 dni temu

IBM udostępnia modele Granite 4.2 z funkcjami agentowymi oraz Granite Speech 5.0 Turbo CTC
IBM wprowadza na rynek nową rodzinę modeli językowych Granite 4.2 oraz modele mowy Granite Speech 5.0 Turbo CTC, dostępne na licencji Apache 2.0.
Redakcja Aigest26 sie 2026

IBM prezentuje Granite 4.2: Nowe modele językowe z zaawansowanym rozumowaniem i uczeniem agentowym
IBM wprowadza na rynek Granite 4.2 – rodzinę otwartych modeli językowych o rozmiarach 3B, 8B i 30B parametrów, skupionych na zdolnościach rozumowania i uczeniu agentowym.
Redakcja Aigest26 sie 2026

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Max Spero, CEO firmy Pangram, ostrzega przed rosnącym problemem zaufania w internecie, wynikającym z powszechnego użycia treści generowanych przez sztuczną inteligencję. Jego firma oferuje narzędzia do wykrywania AI, aby
Redakcja Aigest9 godz. temu

Amazon wykorzystuje AI do walki z oszustwami, Alexa pomoże rozpoznać scamy
Amazon wprowadza nowe funkcje oparte na sztucznej inteligencji, aby pomóc klientom w identyfikacji fałszywych wiadomości i oszustw. Usługa Alexa for Shopping będzie teraz w stanie potwierdzić autentyczność komunikacji od
Redakcja Aigest11 godz. temu

IBM i Confluent łączą siły: modele szeregów czasowych dla inteligencji w czasie rzeczywistym
IBM i Confluent wprowadzają modele fundamentowe szeregów czasowych (TSFM) do przetwarzania danych strumieniowych, umożliwiając podejmowanie decyzji w czasie rzeczywistym w różnych branżach. Rozwiązanie jest dostępne w Co
Redakcja Aigest12 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.