Supabase udostępnia Evals – otwarty benchmark dla agentów AI w zadaniach programistycznych
Supabase wprowadziło Evals, otwarty benchmark i framework do oceny agentów AI w zadaniach związanych z platformą Supabase, testując ich na rzeczywistych scenariuszach.

Supabase, platforma do tworzenia aplikacji, udostępniła Supabase Evals – otwarty benchmark i framework do testowania skuteczności agentów sztucznej inteligencji w budowaniu rozwiązań z wykorzystaniem jej narzędzi. Narzędzie to ocenia agenty kodujące, takie jak Claude Code, Codex i OpenCode, wykonujące rzeczywiste zadania, w tym tworzenie schematów baz danych, debugowanie funkcji Edge Function czy naprawianie polityk RLS (Row Level Security). Wyniki są publikowane na publicznej tablicy wyników na stronie supabase.com/evals, a także wykorzystywane wewnętrznie do codziennego monitorowania regresji.
Supabase Evals jest dostępne publicznie na licencji Apache-2.0 i może być uruchamiane lokalnie za pomocą pnpm.
Metodologia oceny i scenariusze testowe
Supabase opracowało trójwymiarową strukturę do definiowania scenariuszy testowych. Obejmuje ona:
- Produkty: baza danych, uwierzytelnianie (auth), przechowywanie (storage), funkcje brzegowe (edge-functions), realtime, cron, kolejki (queues), wektory (vectors), API danych.
- Tematy: RLS, bezpieczeństwo, migracje, SQL, SDK, obserwowalność, samodzielne hostowanie, testy, deklaratywne schematy.
- Etapy: budowanie (build), wdrażanie (deploy), badanie (investigate), rozwiązywanie (resolve).
Następnie wybrano minimalny zestaw scenariuszy, który dotykał każdego z tych wymiarów, opierając się na rzeczywistych zgłoszeniach do wsparcia technicznego, raportach o błędach i problemach z GitHub. Scenariusze podzielono na dwie kategorie:
- Scenariusze benchmarkowe: mają na celu szerokie pokrycie funkcjonalności i są publicznie dostępne.
- Scenariusze regresyjne: koncentrują się na znanych trybach awarii, są codziennie odświeżane i nie wpływają na publikowane wyniki.
Każdy scenariusz jest uruchamiany w rzeczywistym środowisku. Framework uruchamia stos podobny do hostowanego oraz lokalny projekt CLI w kontenerach, co pozwala agentom na wywoływanie rzeczywistego serwera MCP i CLI. Lekki runtime platformy udostępnia interfejs kompatybilny z Management API, wspierany przez @supabase/lite. Ocenianie łączy deterministyczne sprawdzenia z wykorzystaniem LLM-as-a-judge (modelu językowego jako sędziego). Agenci mają jedną próbę ponownego wykonania zadania przed ostateczną oceną.
Każdy katalog ewaluacyjny zawiera plik PROMPT.md (zadanie wraz z metadanymi), EVAL.ts (skrypt oceniający) oraz opcjonalne stany początkowe remote/ i local/. Dostarczenie obszaru roboczego local/ lub zadeklarowanie interface: cli uruchamia sandbox Docker z zainstalowanym rzeczywistym CLI.
Wyniki i zidentyfikowane słabości agentów AI
Agenci AI przechodzą większość scenariuszy bez dodatkowych umiejętności. W fazie Build modele Opus 5 i Kimi K3 osiągnęły 100% bez wsparcia. Dodatkowe umiejętności pozwoliły zniwelować pozostałe luki: Sonnet 5 poprawił się z 78% do 100%, GPT-5.6 Sol z 89% do 100%, a GPT-5.4 mini z 78% do 89%.
Zidentyfikowano trzy główne słabości agentów:
- Agenci ręcznie piszą migracje zamiast korzystać z deklaratywnych schematów, co skłoniło do aktualizacji wskazówek dotyczących umiejętności.
- Agenci ręcznie weryfikują uwierzytelnianie zamiast używać pakietu @supabase/server, co doprowadziło do stworzenia przewodnika wyboru pakietów.
- Wykorzystanie dokumentacji jest zróżnicowane: Codex / GPT-5.6 czyta około 8 stron dokumentacji na scenariusz, podczas gdy Claude Code sprawdza dokumentację w mniej niż 40% scenariuszy, nawet z załadowanymi umiejętnościami, czytając około 2 strony.
Udostępnienie Supabase Evals jako otwartego narzędzia stanowi ważny krok w kierunku standaryzacji oceny agentów AI w kontekście rzeczywistych zadań programistycznych. Pozwala to nie tylko na transparentne porównywanie różnych modeli, ale także na identyfikowanie ich słabych punktów i ukierunkowane doskonalenie, co jest kluczowe dla rozwoju bardziej niezawodnych i efektywnych narzędzi opartych na sztucznej inteligencji w dziedzinie tworzenia oprogramowania.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Apple wprowadza odnowioną Siri opartą na Google Gemini, ale początkowo bez UE
Apple udostępnia nową generację Siri, zasilaną modelami Google Gemini, oferującą zaawansowane funkcje kontekstowe i integrację z aplikacjami, jednak początkowo nie będzie dostępna w Unii Europejskiej.
Redakcja Aigest4 godz. temu

Spowolnienie rozwoju AI: Czy bezpieczeństwo to tylko zasłona dymna dla dominacji rynkowej?
Propozycje gigantów AI, takich jak OpenAI i Anthropic, dotyczące spowolnienia rozwoju sztucznej inteligencji, rzekomo w imię bezpieczeństwa, budzą kontrowersje i oskarżenia o próbę monopolizacji rynku.
Redakcja Aigest5 godz. temu

Boty AI zalewają media społecznościowe spamem, udając ludzi
Boty AI, takie jak „Timmy”, „Ren” i „Jackie”, stworzone przez firmę iLands, zalewają media społecznościowe i skrzynki e-mailowe, próbując promować swoją platformę i oferować usługi pisarskie, co budzi obawy o przyszłość
Redakcja Aigest17 godz. temu

Superhuman przejmuje Fathom: Platformy produktywności stawiają na autonomiczne AI
Firma Superhuman, dostawca narzędzi zwiększających produktywność, przejęła Fathom, notatnik wspierany przez Y Combinator. Akwizycja ma na celu wzmocnienie możliwości platformy w zakresie autonomicznego działania AI, szcz
Redakcja Aigestwczoraj

AI w służbie natury: Colossal Biosciences i de-ekstynkcja na TechCrunch Disrupt 2026
Na konferencji TechCrunch Disrupt 2026 Ben Lamm z Colossal Biosciences omówi rolę sztucznej inteligencji w przywracaniu wymarłych gatunków i jej wpływ na ochronę przyrody. Dyskusja skupi się na technologiach de-ekstynkcj
Redakcja Aigestwczoraj
NVIDIA udostępnia OSMO: jeden plik YAML do orkiestracji AI w robotyce
NVIDIA udostępniła OSMO, narzędzie do orkiestracji przepływów pracy oparte na Kubernetesie, które umożliwia definiowanie zadań AI dla robotyki w jednym pliku YAML.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.