Aigest.
Narzędzia AI

Supabase udostępnia Evals – otwarty benchmark dla agentów AI w zadaniach programistycznych

Supabase wprowadziło Evals, otwarty benchmark i framework do oceny agentów AI w zadaniach związanych z platformą Supabase, testując ich na rzeczywistych scenariuszach.

RA

Udostępnij
Supabase udostępnia Evals – otwarty benchmark dla agentów AI w zadaniach programistycznych
Fot. MarkTechPost

Supabase, platforma do tworzenia aplikacji, udostępniła Supabase Evals – otwarty benchmark i framework do testowania skuteczności agentów sztucznej inteligencji w budowaniu rozwiązań z wykorzystaniem jej narzędzi. Narzędzie to ocenia agenty kodujące, takie jak Claude Code, Codex i OpenCode, wykonujące rzeczywiste zadania, w tym tworzenie schematów baz danych, debugowanie funkcji Edge Function czy naprawianie polityk RLS (Row Level Security). Wyniki są publikowane na publicznej tablicy wyników na stronie supabase.com/evals, a także wykorzystywane wewnętrznie do codziennego monitorowania regresji.

Supabase Evals jest dostępne publicznie na licencji Apache-2.0 i może być uruchamiane lokalnie za pomocą pnpm.

Metodologia oceny i scenariusze testowe

Supabase opracowało trójwymiarową strukturę do definiowania scenariuszy testowych. Obejmuje ona:

  • Produkty: baza danych, uwierzytelnianie (auth), przechowywanie (storage), funkcje brzegowe (edge-functions), realtime, cron, kolejki (queues), wektory (vectors), API danych.
  • Tematy: RLS, bezpieczeństwo, migracje, SQL, SDK, obserwowalność, samodzielne hostowanie, testy, deklaratywne schematy.
  • Etapy: budowanie (build), wdrażanie (deploy), badanie (investigate), rozwiązywanie (resolve).

Następnie wybrano minimalny zestaw scenariuszy, który dotykał każdego z tych wymiarów, opierając się na rzeczywistych zgłoszeniach do wsparcia technicznego, raportach o błędach i problemach z GitHub. Scenariusze podzielono na dwie kategorie:

  • Scenariusze benchmarkowe: mają na celu szerokie pokrycie funkcjonalności i są publicznie dostępne.
  • Scenariusze regresyjne: koncentrują się na znanych trybach awarii, są codziennie odświeżane i nie wpływają na publikowane wyniki.

Każdy scenariusz jest uruchamiany w rzeczywistym środowisku. Framework uruchamia stos podobny do hostowanego oraz lokalny projekt CLI w kontenerach, co pozwala agentom na wywoływanie rzeczywistego serwera MCP i CLI. Lekki runtime platformy udostępnia interfejs kompatybilny z Management API, wspierany przez @supabase/lite. Ocenianie łączy deterministyczne sprawdzenia z wykorzystaniem LLM-as-a-judge (modelu językowego jako sędziego). Agenci mają jedną próbę ponownego wykonania zadania przed ostateczną oceną.

Każdy katalog ewaluacyjny zawiera plik PROMPT.md (zadanie wraz z metadanymi), EVAL.ts (skrypt oceniający) oraz opcjonalne stany początkowe remote/ i local/. Dostarczenie obszaru roboczego local/ lub zadeklarowanie interface: cli uruchamia sandbox Docker z zainstalowanym rzeczywistym CLI.

Wyniki i zidentyfikowane słabości agentów AI

Agenci AI przechodzą większość scenariuszy bez dodatkowych umiejętności. W fazie Build modele Opus 5 i Kimi K3 osiągnęły 100% bez wsparcia. Dodatkowe umiejętności pozwoliły zniwelować pozostałe luki: Sonnet 5 poprawił się z 78% do 100%, GPT-5.6 Sol z 89% do 100%, a GPT-5.4 mini z 78% do 89%.

Zidentyfikowano trzy główne słabości agentów:

  • Agenci ręcznie piszą migracje zamiast korzystać z deklaratywnych schematów, co skłoniło do aktualizacji wskazówek dotyczących umiejętności.
  • Agenci ręcznie weryfikują uwierzytelnianie zamiast używać pakietu @supabase/server, co doprowadziło do stworzenia przewodnika wyboru pakietów.
  • Wykorzystanie dokumentacji jest zróżnicowane: Codex / GPT-5.6 czyta około 8 stron dokumentacji na scenariusz, podczas gdy Claude Code sprawdza dokumentację w mniej niż 40% scenariuszy, nawet z załadowanymi umiejętnościami, czytając około 2 strony.

Udostępnienie Supabase Evals jako otwartego narzędzia stanowi ważny krok w kierunku standaryzacji oceny agentów AI w kontekście rzeczywistych zadań programistycznych. Pozwala to nie tylko na transparentne porównywanie różnych modeli, ale także na identyfikowanie ich słabych punktów i ukierunkowane doskonalenie, co jest kluczowe dla rozwoju bardziej niezawodnych i efektywnych narzędzi opartych na sztucznej inteligencji w dziedzinie tworzenia oprogramowania.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Tencent udostępnia AngelSpec: ujednolicony framework do trenowania modeli MTP i blokowo-równoległego dekodowania spekula
Alibaba prezentuje Qwen 3.8: nowy model AI z 2,4 biliona parametrów, konkurencja dla Kimi K3
Thinking Machines prezentuje Inkling Small: mniejszy model AI, większa efektywność
Oszuści AI skuteczniejsi w budowaniu zaufania niż ludzie – zaskakujące wyniki badań
JetBrains udostępnia KotlinLLM: inteligentne makra generujące kod Kotlin w czasie rzeczywistym
Niewykorzystane GPU: Nowe Uziemione Samoloty w Erze AI

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.