Optima rozwiązuje kluczowy problem benchmarków AI, umożliwiając testowanie modeli na własnych danych
Firma Artificial Analysis wprowadziła platformę Optima, która pozwala użytkownikom tworzyć niestandardowe benchmarki AI, oceniając modele pod kątem jakości, kosztów i szybkości działania w oparciu o ich własne dane i spe

Firma Artificial Analysis, znana z niezależnych ocen dużych modeli językowych (LLM) oraz implementacji benchmarków takich jak GDPval-AA i AA-Briefcase, uruchomiła nową platformę o nazwie Optima. Jej głównym celem jest umożliwienie użytkownikom tworzenia niestandardowych benchmarków i porównywania modeli sztucznej inteligencji pod kątem jakości, kosztów i szybkości działania, dostosowanych do ich specyficznych przypadków użycia.
Powszechne benchmarki często opierają się na z góry zdefiniowanych zadaniach i kryteriach, co nie zawsze przekłada się na realną użyteczność modelu w konkretnym środowisku. Optima ma za zadanie wypełnić tę lukę, oferując porównania dopasowane do indywidualnych procesów pracy.
Tworzenie niestandardowych benchmarków
Użytkownicy Optima mogą budować własne benchmarki, wykorzystując swoje własne dane, procesy pracy lub szczegółowe opisy przypadków użycia. Następnie mogą uruchamiać te benchmarki na wiodących, dostępnych obecnie modelach i porównywać wyniki pod kątem:
- Jakości
- Kosztu za zadanie
- Czasu wykonania zadania
Platforma akceptuje różnorodne materiały źródłowe. Użytkownicy mogą przesyłać istniejące zestawy danych ewaluacyjnych z własnych plików lub z platformy Hugging Face. Możliwe jest również importowanie śladów agentów AI z platform takich jak Arize, Braintrust czy Langfuse. Deweloperzy mają także opcję zainstalowania wtyczki, która zbiera informacje z ich środowiska kodowania i poprzednich sesji.
Ci, którzy nie dysponują własnymi danymi, mogą opisać zamierzony przypadek użycia i dostarczyć przykładowe dane wejściowe oraz oczekiwane wyniki. Optima na tej podstawie generuje sugerowane dane testowe, kryteria oceny i przykładowe zadania. Użytkownicy mogą następnie przeglądać i dopracowywać te elementy, zanim uruchomią właściwy benchmark.
Metody oceny i rozliczanie kosztów
Optima oferuje dwa podejścia do oceny wyników:
- Ocena rubrykowa – bazująca na obiektywnych kryteriach.
- Metoda porównań parami – stosowana przez Artificial Analysis również w benchmarkach takich jak GDPval-AA i AA-Briefcase. W tej metodzie użytkownicy najpierw oceniają próbkę par odpowiedzi, wskazując preferowaną. Optima następnie na podstawie tych preferencji ustala pełny ranking w całym zbiorze danych testowych.
Platforma śledzi nie tylko jakość modeli, ale także koszt za zadanie i czas wykonania zadania jako niezależne wymiary porównawcze. Dzięki temu możliwe jest sprawdzenie, czy wzrost wydajności rzeczywiście uzasadnia wyższy koszt lub dłuższy czas przetwarzania danego modelu. Jest to szczególnie istotne w przypadku aplikacji agentowych, gdzie sama cena tokena może być myląca. Tańszy model może w rzeczywistości okazać się droższy, jeśli wymaga więcej prób, częściej zawodzi lub generuje dodatkowe prace porządkowe. Koszt za ukończone zadanie jest często bardziej miarodajną metryką.
Pierwsi testerzy Optima budowali benchmarki dla agentów finansowych i księgowych, aby znaleźć model, który mógłby obniżyć koszty dziesięciokrotnie bez znaczącej utraty jakości. Inni testowali, który model najlepiej odpowiada stylowi pisania prawników lub najdokładniej identyfikuje elementy w zastrzeżonym zbiorze danych obrazów.
Podczas budowania i uruchamiania benchmarków, Optima nalicza jedynie rzeczywiste koszty tokenów używanych modeli, bez dodatkowych marż. Oceny rubrykowe kosztują 0,125 USD za kryterium na model, a oceny parami 0,375 USD za porównanie. Na początku tworzenia benchmarku, każdego uruchomienia i każdej rundy oceny, platforma blokuje środki na podstawie szacowanego kosztu, a rozliczenie następuje na podstawie faktycznego zużycia i poniesionych kosztów oceny.
Odpowiedź na wady istniejących benchmarków
Optima odpowiada na dobrze znany problem benchmarków AI. Analiza przeprowadzona przez Epoch AI wykazała, że wyniki benchmarków zależą od szczegółów implementacji, które rzadko są ujawniane. Różne sformułowania promptów i ustawienia temperatury powodowały, że ten sam model uzyskiwał zauważalnie odmienne wyniki w zależności od konfiguracji. W przypadku benchmarków agentowych, takich jak SWE-bench, sama zmiana scaffoldingu (oprogramowania sterującego agenta i środowiska narzędziowego) mogła odpowiadać za różnicę do 15 punktów procentowych.
Szersze badanie, analizujące 445 artykułów dotyczących benchmarków z wiodących konferencji AI, ujawniło jeszcze bardziej systemowe problemy. Prawie wszystkie miały słabości metodologiczne w co najmniej jednym obszarze, w tym niejasne definicje, niereprezentatywne próbki i brak walidacji statystycznej. Tylko około 10 procent badanych benchmarków wykorzystywało kompletne zadania z prawdziwego świata, które odzwierciedlały rzeczywiste scenariusze zastosowań. Kluczowe koncepcje, takie jak rozumowanie czy wyrównanie, były często słabo zdefiniowane, co ograniczało wiarygodność wszelkich wyciąganych z nich wniosków.
Optima może rozwiązać problem ogólnych benchmarków, które nie są w stanie uchwycić specyficznego przypadku użycia. Jednak głębsze wyzwania metodologiczne związane z benchmarkowaniem pozostają. Nawet w przypadku benchmarku dostosowanego do własnych zadań, jego użyteczność zależy od tego, jak precyzyjnie zdefiniowane są docelowe możliwości, jak reprezentatywne są przypadki testowe oraz jak implementowana i dokumentowana jest ocena. Warto również pamiętać, że nawet koszt i czas wykonania zadania nie mówią o rzeczywistej wartości wyniku dla biznesu. Tani i szybki przepływ pracy AI może być nadal nieefektywny, jeśli jego wyniki wymagają znacznej przeróbki lub wnoszą niewielką wartość do procesu, którego są częścią. W tym kontekście Optima stanowi krok w kierunku bardziej praktycznego i biznesowo zorientowanego podejścia do oceny modeli AI, choć ostateczna wartość zawsze będzie zależeć od precyzyjnego zdefiniowania celów i kryteriów przez użytkownika.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Anthropic ujawnia szczegóły działania znaków wodnych w chatbotach Claude
Anthropic przedstawił nowe informacje dotyczące implementacji znaków wodnych w tekstach generowanych przez swojego chatbota Claude, odpowiadając na pytania użytkowników i regulacje UE.
Redakcja Aigest13 godz. temu

Chińska konkurencja wymusza obniżki cen modeli AI, co jest korzystne dla rynku
Ceny modeli AI spadają, a to dzięki chińskim firmom. Ta rywalizacja nie tylko obniża koszty, ale także przyspiesza innowacje, z korzyścią dla wszystkich użytkowników.
Michał Chmielarz23 godz. temu

Tragedia poznawczej wspólnoty: Jak racjonalne wdrażanie AI może zniszczyć wiedzę zawodową
Nowe badania wskazują, że racjonalne wdrażanie sztucznej inteligencji przez firmy może nieświadomie prowadzić do erozji zbiorowej wiedzy i doświadczenia w całych zawodach, szczególnie wśród młodych pracowników.
Redakcja Aigestwczoraj

Modele AI nadal słabo radzą sobie z percepcją wizualną, ujawnia nowy benchmark PerceptionBench
Nowy benchmark PerceptionBench, stworzony przez Moonshot AI, ujawnia, że nawet najbardziej zaawansowane multimodalne modele AI osiągają słabe wyniki w zadaniach związanych z percepcją wizualną, niezależnie od zdolności r
Redakcja Aigestwczoraj

Zespół Qwen firmy Alibaba udostępnia modele Qwen 3.8 z otwartymi wagami
Zespół Qwen firmy Alibaba udostępnił otwarte wagi modeli Qwen 3.8, w tym Qwen3.8-27B i Qwen3.8-2.4T-A95B. Modele te oferują zaawansowane możliwości multimodalne i agentowe, dostępne na platformach takich jak Hugging Face
Redakcja Aigestwczoraj

Tydzień w AI: Agenty AI na krawędzi autonomii i etyki
Miniony tydzień przyniósł fascynujący obraz dynamicznego rozwoju sztucznej inteligencji, gdzie obok innowacji w modelach językowych i sprzęcie, coraz wyraźniej rysują się wyzwania związane z autonomią agentów AI, ich bez
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.