Aigest.
Narzędzia AI

Supabase udostępnia Evals – otwarty benchmark dla agentów AI w zadaniach programistycznych

Supabase wprowadziło Evals, otwarty benchmark i framework do oceny agentów AI w zadaniach związanych z platformą Supabase, testując ich na rzeczywistych scenariuszach.

RA

Udostępnij
Supabase udostępnia Evals – otwarty benchmark dla agentów AI w zadaniach programistycznych
Fot. MarkTechPost

Supabase, platforma do tworzenia aplikacji, udostępniła Supabase Evals – otwarty benchmark i framework do testowania skuteczności agentów sztucznej inteligencji w budowaniu rozwiązań z wykorzystaniem jej narzędzi. Narzędzie to ocenia agenty kodujące, takie jak Claude Code, Codex i OpenCode, wykonujące rzeczywiste zadania, w tym tworzenie schematów baz danych, debugowanie funkcji Edge Function czy naprawianie polityk RLS (Row Level Security). Wyniki są publikowane na publicznej tablicy wyników na stronie supabase.com/evals, a także wykorzystywane wewnętrznie do codziennego monitorowania regresji.

Supabase Evals jest dostępne publicznie na licencji Apache-2.0 i może być uruchamiane lokalnie za pomocą pnpm.

Metodologia oceny i scenariusze testowe

Supabase opracowało trójwymiarową strukturę do definiowania scenariuszy testowych. Obejmuje ona:

  • Produkty: baza danych, uwierzytelnianie (auth), przechowywanie (storage), funkcje brzegowe (edge-functions), realtime, cron, kolejki (queues), wektory (vectors), API danych.
  • Tematy: RLS, bezpieczeństwo, migracje, SQL, SDK, obserwowalność, samodzielne hostowanie, testy, deklaratywne schematy.
  • Etapy: budowanie (build), wdrażanie (deploy), badanie (investigate), rozwiązywanie (resolve).

Następnie wybrano minimalny zestaw scenariuszy, który dotykał każdego z tych wymiarów, opierając się na rzeczywistych zgłoszeniach do wsparcia technicznego, raportach o błędach i problemach z GitHub. Scenariusze podzielono na dwie kategorie:

  • Scenariusze benchmarkowe: mają na celu szerokie pokrycie funkcjonalności i są publicznie dostępne.
  • Scenariusze regresyjne: koncentrują się na znanych trybach awarii, są codziennie odświeżane i nie wpływają na publikowane wyniki.

Każdy scenariusz jest uruchamiany w rzeczywistym środowisku. Framework uruchamia stos podobny do hostowanego oraz lokalny projekt CLI w kontenerach, co pozwala agentom na wywoływanie rzeczywistego serwera MCP i CLI. Lekki runtime platformy udostępnia interfejs kompatybilny z Management API, wspierany przez @supabase/lite. Ocenianie łączy deterministyczne sprawdzenia z wykorzystaniem LLM-as-a-judge (modelu językowego jako sędziego). Agenci mają jedną próbę ponownego wykonania zadania przed ostateczną oceną.

Każdy katalog ewaluacyjny zawiera plik PROMPT.md (zadanie wraz z metadanymi), EVAL.ts (skrypt oceniający) oraz opcjonalne stany początkowe remote/ i local/. Dostarczenie obszaru roboczego local/ lub zadeklarowanie interface: cli uruchamia sandbox Docker z zainstalowanym rzeczywistym CLI.

Wyniki i zidentyfikowane słabości agentów AI

Agenci AI przechodzą większość scenariuszy bez dodatkowych umiejętności. W fazie Build modele Opus 5 i Kimi K3 osiągnęły 100% bez wsparcia. Dodatkowe umiejętności pozwoliły zniwelować pozostałe luki: Sonnet 5 poprawił się z 78% do 100%, GPT-5.6 Sol z 89% do 100%, a GPT-5.4 mini z 78% do 89%.

Zidentyfikowano trzy główne słabości agentów:

  • Agenci ręcznie piszą migracje zamiast korzystać z deklaratywnych schematów, co skłoniło do aktualizacji wskazówek dotyczących umiejętności.
  • Agenci ręcznie weryfikują uwierzytelnianie zamiast używać pakietu @supabase/server, co doprowadziło do stworzenia przewodnika wyboru pakietów.
  • Wykorzystanie dokumentacji jest zróżnicowane: Codex / GPT-5.6 czyta około 8 stron dokumentacji na scenariusz, podczas gdy Claude Code sprawdza dokumentację w mniej niż 40% scenariuszy, nawet z załadowanymi umiejętnościami, czytając około 2 strony.

Udostępnienie Supabase Evals jako otwartego narzędzia stanowi ważny krok w kierunku standaryzacji oceny agentów AI w kontekście rzeczywistych zadań programistycznych. Pozwala to nie tylko na transparentne porównywanie różnych modeli, ale także na identyfikowanie ich słabych punktów i ukierunkowane doskonalenie, co jest kluczowe dla rozwoju bardziej niezawodnych i efektywnych narzędzi opartych na sztucznej inteligencji w dziedzinie tworzenia oprogramowania.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Apple wprowadza odnowioną Siri opartą na Google Gemini, ale początkowo bez UE
Spowolnienie rozwoju AI: Czy bezpieczeństwo to tylko zasłona dymna dla dominacji rynkowej?
Boty AI zalewają media społecznościowe spamem, udając ludzi
Superhuman przejmuje Fathom: Platformy produktywności stawiają na autonomiczne AI
AI w służbie natury: Colossal Biosciences i de-ekstynkcja na TechCrunch Disrupt 2026
NVIDIA udostępnia OSMO: jeden plik YAML do orkiestracji AI w robotyce

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.