Rój agentów Cursor: tańsze modele AI efektywne w kodowaniu pod nadzorem modeli frontierowych
Firma Cursor opracowała system agentów AI, w którym potężne modele planują zadania, a tańsze wykonują kodowanie, co znacząco obniża koszty i zwiększa efektywność.

Firma Cursor, twórca platformy do programowania wspomaganego AI, zaprezentowała innowacyjny system rojów agentów, który rewolucjonizuje podejście do generowania kodu. Kluczową innowacją jest podział ról: potężne modele frontierowe odpowiadają za planowanie i rozbijanie złożonych celów na mniejsze zadania, natomiast szybsze i tańsze modele pracujące realizują te zadania. Takie podejście znacząco zwiększa efektywność i obniża koszty, co zostało potwierdzone w wymagających testach.
Nowa architektura i jej przewagi
W systemie Cursor 3, deweloperzy mogą uruchamiać całe floty agentów AI równolegle. Firma Anysphere, stojąca za Cursorem, została niedawno przejęta przez SpaceX Elona Muska za 60 miliardów dolarów, co podkreśla potencjał tej technologii. Podział ról na agentów planujących i pracujących rozwiązuje przede wszystkim problem kontekstu. Samotny agent musi pamiętać o całym drzewie zadań, co prowadzi do „dryfowania” podczas długich operacji. W nowym roju, planerzy nie piszą kodu, a pracownicy nie planują, co eliminuje to ograniczenie.
Poprzednia wersja roju agentów Cursor osiągała około 1000 commitów na godzinę w Git. Wykorzystywała ona agentów pracujących, oceniających oraz integratorów, którzy mieli rozwiązywać konflikty. Okazało się jednak, że integratorzy generowali więcej problemów niż rozwiązywali. Nowy rój osiągnął prędkość 1000 commitów na sekundę, co zmusiło Cursor do stworzenia własnego systemu kontroli wersji, ponieważ tak szybka praca agentów generowała błędy niespotykane w zespołach ludzkich.
Cursor zmierzył się również z problemem „rozszczepionego mózgu” (split-brain design), gdzie dwaj planerzy nieświadomie rozwijali ten sam pomysł w różny sposób. Aby temu zaradzić, agenci zaczęli rejestrować decyzje we współdzielonych dokumentach projektowych, a kod był do nich linkowany. W przypadku konfliktów scalania, interweniował neutralny agent. Agenci mogli również celowo modyfikować kod poza swoim obszarem, a kompilator przenosił zmiany przez cały system.
Wyniki testów i oszczędności kosztów
Cursor poddał nowy system rygorystycznym testom, zlecając mu odbudowę SQLite w Rust wyłącznie na podstawie 835-stronicowej dokumentacji, bez dostępu do kodu źródłowego, testów, binariów SQLite czy internetu. Benchmarkiem był sqllogictest, zestaw milionów zapytań SQL z znanymi odpowiedziami. Testowano cztery konfiguracje:
- GPT-5.5 solo
- Grok 4.5 solo
- Opus 4.8 jako planer z Composer 2.5 jako pracownikiem
- Fable 5 jako planer z Composer 2.5 jako pracownikiem
Każda konfiguracja nowego systemu osiągnęła 100 procent w zestawie testów, podczas gdy stary system borykał się z konfliktami. Po czterech godzinach, nowe uruchomienia osiągały od 73 do 85 procent, a stare od 11 do 77 procent. Nowy system znacząco zredukował liczbę konfliktów scalania – stary system wygenerował ponad 70 000 konfliktów, podczas gdy nowy utrzymywał się poniżej 1000.
Nowy system okazał się również znacznie bardziej zwięzły. W konfiguracji Fable 5, stary rój potrzebował 64 305 linii kodu, a nowy tylko 9 908. W konfiguracji Opus, stary system wygenerował 19 013 linii (97% wyniku), a nowy 4 645 linii (100% wyniku).
Koszty operacyjne również uległy drastycznej redukcji. Całkowite koszty wahały się od 1339 dolarów dla hybrydy Opus do 10 565 dolarów dla GPT-5.5 działającego samodzielnie. Agenci pracujący generowali co najmniej 69 procent tokenów, a często ponad 90 procent. Mimo że tokeny planerów są droższe, to właśnie model pracujący generował największą różnicę w kosztach. W hybrydzie Opus i Composer, cała flota pracowników kosztowała 411 dolarów przy porównywalnej jakości, podczas gdy w uruchomieniu GPT-5.5, sami pracownicy kosztowali 9373 dolary. Różnica wynika z ceny modelu Composer 2.5, który kosztuje zaledwie 0,50 dolara za milion tokenów wejściowych i 2,50 dolara za milion tokenów wyjściowych, oferując wydajność porównywalną z Opus 4.7 i GPT-5.5.
Przyszłość agentów AI w programowaniu
Cursor postrzega roje agentów jako rodzaj probabilistycznego kompilatora, który krok po kroku tłumaczy intencje na wykonywalną pracę. Firma opublikowała kod z uruchomienia Opus solo jako minisqlite na GitHubie. Takie rozwiązania nie są już tylko eksperymentami laboratoryjnymi. Wersja przedpremierowa Fable 5 poradziła sobie z większością przepisania Bun'a z Zig na Rust, gdzie sześćdziesiąt cztery instancje napisały ponad milion linii kodu w 11 dni za około 165 000 dolarów.
Chociaż agenci AI wciąż wymagają interwencji człowieka w środowiskach produkcyjnych (badanie z 2025 roku wykazało, że 68% agentów produkcyjnych nie wykonało więcej niż dziesięciu kroków bez ludzkiej ingerencji), kierunek rozwoju wskazuje na coraz większą autonomię i efektywność. Optymalizacja kosztów poprzez inteligentny podział zadań między zaawansowane i tańsze modele AI może przyspieszyć adopcję tych technologii w branży oprogramowania, zmieniając sposób, w jaki firmy podchodzą do rozwoju i utrzymania kodu.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Anthropic prezentuje Opus 5: Ewolucja efektywności tokenów, nie rewolucja możliwości
Anthropic wprowadził Opus 5, najnowszą aktualizację swojego modelu, która koncentruje się na efektywności kosztowej i szerszej dostępności, oferując wydajność zbliżoną do Fable za niższą cenę.
Redakcja Aigest2 dni temu

Google wprowadza Gemini 3.6 Flash, 3.5 Flash-Lite i 3.5 Flash Cyber – nowe modele dla agentów AI
Google ogłosiło wprowadzenie trzech nowych modeli z serii Gemini Flash: 3.6 Flash, 3.5 Flash-Lite oraz 3.5 Flash Cyber, zaprojektowanych z myślą o zwiększeniu wydajności, obniżeniu kosztów i poprawie bezpieczeństwa w zas
Redakcja Aigest5 dni temu

Edukatorzy na całym świecie zmieniają metody nauczania programowania w obliczu AI
Globalne badanie ujawnia, że większość nauczycieli informatyki modyfikuje swoje podejście do nauczania i oceniania, reagując na rosnący wpływ narzędzi AI, takich jak ChatGPT i GitHub Copilot.
Redakcja Aigestwczoraj

Anthropic twierdzi, że Opus 5 niemal całkowicie eliminuje ataki typu prompt injection w swoich produktach
Anthropic ogłosił, że jego najnowszy model AI, Opus 5, osiągnął niemal stuprocentową odporność na ataki typu prompt injection, zwłaszcza w scenariuszach związanych z przeglądarkami internetowymi. To znaczący krok naprzód
Redakcja Aigest2 dni temu

Cisco Foundation AI udostępnia modele Antares do lokalizacji luk bezpieczeństwa w kodzie
Cisco Foundation AI wprowadziło na rynek Antares, rodzinę małych modeli językowych (SLM) zaprojektowanych do precyzyjnego lokalizowania znanych luk w zabezpieczeniach w rzeczywistych bazach kodu. Dwa z tych modeli są dos
Redakcja Aigest5 dni temu

Alibaba prezentuje Qwen 3.8: nowy model AI z 2,4 biliona parametrów, konkurencja dla Kimi K3
Alibaba wprowadza Qwen 3.8, swój najnowszy model AI o otwartym kodzie, który ma konkurować z czołowymi rozwiązaniami na rynku, w tym z Kimi K3.
Redakcja Aigest19 lip 2026
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.