Supabase udostępnia Evals – otwarty benchmark dla agentów AI w zadaniach programistycznych
Supabase wprowadziło Evals, otwarty benchmark i framework do oceny agentów AI w zadaniach związanych z platformą Supabase, testując ich na rzeczywistych scenariuszach.

Supabase, platforma do tworzenia aplikacji, udostępniła Supabase Evals – otwarty benchmark i framework do testowania skuteczności agentów sztucznej inteligencji w budowaniu rozwiązań z wykorzystaniem jej narzędzi. Narzędzie to ocenia agenty kodujące, takie jak Claude Code, Codex i OpenCode, wykonujące rzeczywiste zadania, w tym tworzenie schematów baz danych, debugowanie funkcji Edge Function czy naprawianie polityk RLS (Row Level Security). Wyniki są publikowane na publicznej tablicy wyników na stronie supabase.com/evals, a także wykorzystywane wewnętrznie do codziennego monitorowania regresji.
Supabase Evals jest dostępne publicznie na licencji Apache-2.0 i może być uruchamiane lokalnie za pomocą pnpm.
Metodologia oceny i scenariusze testowe
Supabase opracowało trójwymiarową strukturę do definiowania scenariuszy testowych. Obejmuje ona:
- Produkty: baza danych, uwierzytelnianie (auth), przechowywanie (storage), funkcje brzegowe (edge-functions), realtime, cron, kolejki (queues), wektory (vectors), API danych.
- Tematy: RLS, bezpieczeństwo, migracje, SQL, SDK, obserwowalność, samodzielne hostowanie, testy, deklaratywne schematy.
- Etapy: budowanie (build), wdrażanie (deploy), badanie (investigate), rozwiązywanie (resolve).
Następnie wybrano minimalny zestaw scenariuszy, który dotykał każdego z tych wymiarów, opierając się na rzeczywistych zgłoszeniach do wsparcia technicznego, raportach o błędach i problemach z GitHub. Scenariusze podzielono na dwie kategorie:
- Scenariusze benchmarkowe: mają na celu szerokie pokrycie funkcjonalności i są publicznie dostępne.
- Scenariusze regresyjne: koncentrują się na znanych trybach awarii, są codziennie odświeżane i nie wpływają na publikowane wyniki.
Każdy scenariusz jest uruchamiany w rzeczywistym środowisku. Framework uruchamia stos podobny do hostowanego oraz lokalny projekt CLI w kontenerach, co pozwala agentom na wywoływanie rzeczywistego serwera MCP i CLI. Lekki runtime platformy udostępnia interfejs kompatybilny z Management API, wspierany przez @supabase/lite. Ocenianie łączy deterministyczne sprawdzenia z wykorzystaniem LLM-as-a-judge (modelu językowego jako sędziego). Agenci mają jedną próbę ponownego wykonania zadania przed ostateczną oceną.
Każdy katalog ewaluacyjny zawiera plik PROMPT.md (zadanie wraz z metadanymi), EVAL.ts (skrypt oceniający) oraz opcjonalne stany początkowe remote/ i local/. Dostarczenie obszaru roboczego local/ lub zadeklarowanie interface: cli uruchamia sandbox Docker z zainstalowanym rzeczywistym CLI.
Wyniki i zidentyfikowane słabości agentów AI
Agenci AI przechodzą większość scenariuszy bez dodatkowych umiejętności. W fazie Build modele Opus 5 i Kimi K3 osiągnęły 100% bez wsparcia. Dodatkowe umiejętności pozwoliły zniwelować pozostałe luki: Sonnet 5 poprawił się z 78% do 100%, GPT-5.6 Sol z 89% do 100%, a GPT-5.4 mini z 78% do 89%.
Zidentyfikowano trzy główne słabości agentów:
- Agenci ręcznie piszą migracje zamiast korzystać z deklaratywnych schematów, co skłoniło do aktualizacji wskazówek dotyczących umiejętności.
- Agenci ręcznie weryfikują uwierzytelnianie zamiast używać pakietu @supabase/server, co doprowadziło do stworzenia przewodnika wyboru pakietów.
- Wykorzystanie dokumentacji jest zróżnicowane: Codex / GPT-5.6 czyta około 8 stron dokumentacji na scenariusz, podczas gdy Claude Code sprawdza dokumentację w mniej niż 40% scenariuszy, nawet z załadowanymi umiejętnościami, czytając około 2 strony.
Udostępnienie Supabase Evals jako otwartego narzędzia stanowi ważny krok w kierunku standaryzacji oceny agentów AI w kontekście rzeczywistych zadań programistycznych. Pozwala to nie tylko na transparentne porównywanie różnych modeli, ale także na identyfikowanie ich słabych punktów i ukierunkowane doskonalenie, co jest kluczowe dla rozwoju bardziej niezawodnych i efektywnych narzędzi opartych na sztucznej inteligencji w dziedzinie tworzenia oprogramowania.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Tencent udostępnia AngelSpec: ujednolicony framework do trenowania modeli MTP i blokowo-równoległego dekodowania spekula
Tencent udostępnił AngelSpec, framework do trenowania modeli draftowych dla dekodowania spekulacyjnego, wspierający zarówno predykcję wielotokenową (MTP), jak i rodzinę DFlash.
Redakcja Aigest2 dni temu

Alibaba prezentuje Qwen 3.8: nowy model AI z 2,4 biliona parametrów, konkurencja dla Kimi K3
Alibaba wprowadza Qwen 3.8, swój najnowszy model AI o otwartym kodzie, który ma konkurować z czołowymi rozwiązaniami na rynku, w tym z Kimi K3.
Redakcja Aigest19 lip 2026

Thinking Machines prezentuje Inkling Small: mniejszy model AI, większa efektywność
Thinking Machines, laboratorium AI założone przez byłą CTO OpenAI, Mira Murati, wprowadziło na rynek Inkling Small. Ten model otwarty wyróżnia się efektywnością i kompaktowym rozmiarem, przewyższając większe odpowiedniki
Redakcja Aigest19 godz. temu

Oszuści AI skuteczniejsi w budowaniu zaufania niż ludzie – zaskakujące wyniki badań
Badania przeprowadzone przez międzynarodowy zespół naukowców wykazały, że chatboty AI są bardziej efektywne w budowaniu zaufania u potencjalnych ofiar oszustw niż ludzcy oszuści, co może zwiastować nową erę w cyberprzest
Redakcja Aigest23 godz. temu

JetBrains udostępnia KotlinLLM: inteligentne makra generujące kod Kotlin w czasie rzeczywistym
JetBrains Research udostępniło KotlinLLM, wtyczkę do IntelliJ IDEA, która wprowadza inteligentne makra generujące i dynamicznie przeładowujące kod Kotlin w czasie działania aplikacji.
Redakcja Aigestwczoraj

Niewykorzystane GPU: Nowe Uziemione Samoloty w Erze AI
Zarządzanie zasobami GPU staje się kluczowym wyzwaniem w obliczu rosnących kosztów i złożoności projektów AI. Niewykorzystane jednostki generują straty i spowalniają innowacje.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.