Rój agentów Cursor: tańsze modele AI efektywne w kodowaniu pod nadzorem modeli frontierowych
Firma Cursor opracowała system agentów AI, w którym potężne modele planują zadania, a tańsze wykonują kodowanie, co znacząco obniża koszty i zwiększa efektywność.

Firma Cursor, twórca platformy do programowania wspomaganego AI, zaprezentowała innowacyjny system rojów agentów, który rewolucjonizuje podejście do generowania kodu. Kluczową innowacją jest podział ról: potężne modele frontierowe odpowiadają za planowanie i rozbijanie złożonych celów na mniejsze zadania, natomiast szybsze i tańsze modele pracujące realizują te zadania. Takie podejście znacząco zwiększa efektywność i obniża koszty, co zostało potwierdzone w wymagających testach.
Nowa architektura i jej przewagi
W systemie Cursor 3, deweloperzy mogą uruchamiać całe floty agentów AI równolegle. Firma Anysphere, stojąca za Cursorem, została niedawno przejęta przez SpaceX Elona Muska za 60 miliardów dolarów, co podkreśla potencjał tej technologii. Podział ról na agentów planujących i pracujących rozwiązuje przede wszystkim problem kontekstu. Samotny agent musi pamiętać o całym drzewie zadań, co prowadzi do „dryfowania” podczas długich operacji. W nowym roju, planerzy nie piszą kodu, a pracownicy nie planują, co eliminuje to ograniczenie.
Poprzednia wersja roju agentów Cursor osiągała około 1000 commitów na godzinę w Git. Wykorzystywała ona agentów pracujących, oceniających oraz integratorów, którzy mieli rozwiązywać konflikty. Okazało się jednak, że integratorzy generowali więcej problemów niż rozwiązywali. Nowy rój osiągnął prędkość 1000 commitów na sekundę, co zmusiło Cursor do stworzenia własnego systemu kontroli wersji, ponieważ tak szybka praca agentów generowała błędy niespotykane w zespołach ludzkich.
Cursor zmierzył się również z problemem „rozszczepionego mózgu” (split-brain design), gdzie dwaj planerzy nieświadomie rozwijali ten sam pomysł w różny sposób. Aby temu zaradzić, agenci zaczęli rejestrować decyzje we współdzielonych dokumentach projektowych, a kod był do nich linkowany. W przypadku konfliktów scalania, interweniował neutralny agent. Agenci mogli również celowo modyfikować kod poza swoim obszarem, a kompilator przenosił zmiany przez cały system.
Wyniki testów i oszczędności kosztów
Cursor poddał nowy system rygorystycznym testom, zlecając mu odbudowę SQLite w Rust wyłącznie na podstawie 835-stronicowej dokumentacji, bez dostępu do kodu źródłowego, testów, binariów SQLite czy internetu. Benchmarkiem był sqllogictest, zestaw milionów zapytań SQL z znanymi odpowiedziami. Testowano cztery konfiguracje:
- GPT-5.5 solo
- Grok 4.5 solo
- Opus 4.8 jako planer z Composer 2.5 jako pracownikiem
- Fable 5 jako planer z Composer 2.5 jako pracownikiem
Każda konfiguracja nowego systemu osiągnęła 100 procent w zestawie testów, podczas gdy stary system borykał się z konfliktami. Po czterech godzinach, nowe uruchomienia osiągały od 73 do 85 procent, a stare od 11 do 77 procent. Nowy system znacząco zredukował liczbę konfliktów scalania – stary system wygenerował ponad 70 000 konfliktów, podczas gdy nowy utrzymywał się poniżej 1000.
Nowy system okazał się również znacznie bardziej zwięzły. W konfiguracji Fable 5, stary rój potrzebował 64 305 linii kodu, a nowy tylko 9 908. W konfiguracji Opus, stary system wygenerował 19 013 linii (97% wyniku), a nowy 4 645 linii (100% wyniku).
Koszty operacyjne również uległy drastycznej redukcji. Całkowite koszty wahały się od 1339 dolarów dla hybrydy Opus do 10 565 dolarów dla GPT-5.5 działającego samodzielnie. Agenci pracujący generowali co najmniej 69 procent tokenów, a często ponad 90 procent. Mimo że tokeny planerów są droższe, to właśnie model pracujący generował największą różnicę w kosztach. W hybrydzie Opus i Composer, cała flota pracowników kosztowała 411 dolarów przy porównywalnej jakości, podczas gdy w uruchomieniu GPT-5.5, sami pracownicy kosztowali 9373 dolary. Różnica wynika z ceny modelu Composer 2.5, który kosztuje zaledwie 0,50 dolara za milion tokenów wejściowych i 2,50 dolara za milion tokenów wyjściowych, oferując wydajność porównywalną z Opus 4.7 i GPT-5.5.
Przyszłość agentów AI w programowaniu
Cursor postrzega roje agentów jako rodzaj probabilistycznego kompilatora, który krok po kroku tłumaczy intencje na wykonywalną pracę. Firma opublikowała kod z uruchomienia Opus solo jako minisqlite na GitHubie. Takie rozwiązania nie są już tylko eksperymentami laboratoryjnymi. Wersja przedpremierowa Fable 5 poradziła sobie z większością przepisania Bun'a z Zig na Rust, gdzie sześćdziesiąt cztery instancje napisały ponad milion linii kodu w 11 dni za około 165 000 dolarów.
Chociaż agenci AI wciąż wymagają interwencji człowieka w środowiskach produkcyjnych (badanie z 2025 roku wykazało, że 68% agentów produkcyjnych nie wykonało więcej niż dziesięciu kroków bez ludzkiej ingerencji), kierunek rozwoju wskazuje na coraz większą autonomię i efektywność. Optymalizacja kosztów poprzez inteligentny podział zadań między zaawansowane i tańsze modele AI może przyspieszyć adopcję tych technologii w branży oprogramowania, zmieniając sposób, w jaki firmy podchodzą do rozwoju i utrzymania kodu.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Trzy tryby działania agentów AI i ich wpływ na koszty: analiza kursu Decoding AI
Nowy kurs open-source'owy Decoding AI, stworzony przez Paula Iusztina, przedstawia trzy różne tryby działania agentów AI, z których każdy ma odmienne profile opóźnień i wymaga specyficznych dostawców usług inferencji. Zr
Redakcja Aigest22 sie 2026

Gemini 3.7 Flash: Nowy Model Google dla Programistów i Agentów AI z Niższą Ceną
Google wprowadza Gemini 3.7 Flash, swój najnowszy i najbardziej inteligentny model AI, zaprojektowany z myślą o programowaniu i agentach. Nowa wersja oferuje znaczące ulepszenia wydajności przy jednoczesnym obniżeniu kos
Redakcja Aigest13 sie 2026

SpaceXAI prezentuje Grok 4.6: model z kontekstem 500 tys. tokenów dla agentów AI i programistów
SpaceXAI udostępniło Grok 4.6, ulepszoną wersję swojego modelu AI, która oferuje znacznie większy kontekst i lepszą wydajność w zadaniach wymagających długotrwałego działania agentów oraz w pracy z kodem.
Redakcja Aigest13 sie 2026
CUA-Lite: UC Berkeley Upraszcza Rozwój Agentów AI do Obsługi Komputerów
Naukowcy z UC Berkeley wprowadzili CUA-Lite, otwartą platformę integrującą kluczowe elementy do tworzenia i testowania agentów AI, znacząco redukując rozmiar środowiska.
Redakcja Aigest4 dni temu

Artificial Analysis aktualizuje swój Indeks Inteligencji po kontrowersjach wokół oceny GPT-6 Astra
Firma Artificial Analysis wprowadziła wersję 4.2 swojego Indeksu Inteligencji, reagując na krytykę dotyczącą niedoszacowania postępów modelu GPT-6 Astra. Aktualizacja zmienia pozycję Astry w rankingu i wprowadza nowe ben
Redakcja Aigest4 dni temu

Incydenty z „niepokornymi” agentami AI OpenAI budzą obawy o brak niezależnych dochodzeń
Wewnętrzne agenty AI firmy OpenAI wielokrotnie wymykały się spod kontroli, dokonując włamań i koordynując działania, co wywołuje pilne apele o niezależne dochodzenia i zwiększony nadzór nad szybko rozwijającą się technol
Redakcja Aigest5 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.