Aigest.
Newsy

SpaceXAI prezentuje Grok 4.6: model z kontekstem 500 tys. tokenów dla agentów AI i programistów

SpaceXAI udostępniło Grok 4.6, ulepszoną wersję swojego modelu AI, która oferuje znacznie większy kontekst i lepszą wydajność w zadaniach wymagających długotrwałego działania agentów oraz w pracy z kodem.

RA

Udostępnij
SpaceXAI prezentuje Grok 4.6: model z kontekstem 500 tys. tokenów dla agentów AI i programistów
Fot. MarkTechPost

SpaceXAI ogłosiło premierę Grok 4.6, stanowiącego znaczące ulepszenie w stosunku do poprzedniej wersji, Grok 4.5. Nowy model nie jest większą wersją bazową, lecz wynikiem intensywnego procesu post-treningowego, który obejmował dłuższe dodatkowe szkolenie, regenerację trajektorii nadzorowanego dostrajania oraz uczenie wzmacniające w środowiskach agentowych. Grok 4.6 został zaprojektowany z myślą o agentach AI, którzy muszą utrzymywać się przy zadaniu przez wiele kroków bez utraty spójności.

Model osiągnął wynik 61 punktów w indeksie Artificial Analysis Intelligence Index, co oznacza wzrost o pięć punktów w porównaniu do Grok 4.5 i stawia go na równi z GPT-5.6 Sol Max. Kluczową cechą jest obsługa 500 000 tokenów kontekstu, co otwiera nowe możliwości dla złożonych zadań. Grok 4.6 jest już dostępny w Cursor i Grok Build, a także wprowadza nowy poziom wysiłku rozumowania xhigh, rozszerzając możliwości dostępne w Grok 4.5.

Dostępność i architektura Grok 4.6

Grok 4.6 jest już ogólnie dostępny poprzez xAI API pod nazwą grok-4.6 i stanowi domyślny model w Grok Build. Został również zintegrowany z Cursor we wszystkich planach oraz jest dostępny przez OpenRouter, Vercel i Cloudflare. Ważne jest, że SpaceXAI nie udostępniło modelu w wersji open-weights ani ścieżki do samodzielnego hostowania, co wyklucza wdrożenia w środowiskach air-gapped.

Ulepszenia w Grok 4.6 nie wynikają z powiększenia modelu bazowego. SpaceXAI skupiło się na dłuższym, dodatkowym cyklu szkoleniowym niż w przypadku Grok 4.5. Wykorzystano wyselekcjonowane dane generowane przez model do rozumowania i zaawansowanych koncepcji technicznych, wysokiej jakości dane inżynierskie oraz ulepszony optymalizator i recepturę treningową.

Proces obejmował również regenerację trajektorii nadzorowanego dostrajania przy użyciu Grok 4.5, obejmujących różne poziomy wysiłku rozumowania, uprzęże agentowe i dziedziny takie jak STEM, inżynieria oprogramowania i praca koncepcyjna. Problematyczne ślady były filtrowane za pomocą kontroli opartych na modelu. Następnie zastosowano uczenie wzmacniające w środowiskach agentowych, obejmujących pracę koncepcyjną, ogólne kodowanie, rozwój stron internetowych, projektowanie wspomagane komputerowo (CAD) i optymalizację jądra systemu.

SpaceXAI zaobserwowało, że na dłuższych trajektoriach model wykazuje więcej samokontroli i weryfikacji, sprawdzając własną pracę przed przejściem do kolejnego etapu. Jest to jednak obserwacja wewnętrzna, a nie niezależnie zmierzony wynik.

Możliwości i wydajność

Grok 4.6 obsługuje 500 000 tokenów kontekstu, akceptuje dane wejściowe w postaci tekstu i obrazu, generując wyłącznie tekst. Nie ma określonego limitu długości tekstu wyjściowego, a jego wiedza jest aktualna do 1 lutego 2026 roku. Nowy poziom xhigh dla reasoning_effort dołącza do istniejących low, medium i high (domyślny). SpaceXAI nie podało liczby parametrów dla Grok 4.6.

W tabeli wyników xAI, Grok 4.6 (High) osiąga 61 punktów w Artificial Analysis Intelligence Index, przewyższając 56 punktów Grok 4.5 i dorównując GPT-5.6 Sol Max. Model prowadzi w testach GDPval-AA v2 (1753 Elo, w porównaniu do 1526 dla Grok 4.5), AA-Briefcase (1577, w porównaniu do 1313) oraz Harvey LAB.

Jednak w kategoriach związanych z kodowaniem, kluczowych dla zespołów inżynierskich, Grok 4.6 pozostaje w tyle. W teście DeepSWE v1.1 osiąga 65,9% (wzrost o 11,9 punktu), ale ustępuje GPT-5.6 Sol Max (73%). W Terminal-Bench v3.0 wynik to 26%, co jest niemal dwukrotnie lepszym rezultatem niż 15,7% Grok 4.5, ale nadal jest to ostatnie miejsce wśród czterech wymienionych modeli. W CursorBench v3.2 model osiąga 69,9%, w FrontierCode v1.1 Extended 61,3%, a w APEX-Agents 57,5%.

Warto zauważyć, że zwycięstwa w GDPval-AA v2 i AA-Briefcase mieszczą się w opublikowanych przedziałach ufności Artificial Analysis, co oznacza, że są to statystyczne remisy, a nie wyraźne prowadzenie. Ponadto, zestaw porównawczy nie uwzględnia Claude Opus 5 firmy Anthropic, który obecnie zajmuje czołowe miejsce w tym indeksie. Ujawnione słabości w kodowaniu są zatem bardziej wiarygodnym sygnałem.

Ceny i optymalizacja kosztów

Zgodnie z informacjami o wydaniu, Grok 4.6 jest wyceniony na 2 USD / 0,50 USD / 6 USD za 1 milion tokenów (wejście / buforowane wejście / wyjście) dla promptów poniżej 200 000 tokenów. Powyżej tego progu ceny wynoszą 4 USD / 1 USD / 12 USD. Strona startowa wspomina również o szybszym wariancie modelu, który jest dwukrotnie droższy, lecz bez oddzielnego identyfikatora modelu. Grok Build i Cursor oferują dwukrotnie większe wliczone użycie przez pierwszy tydzień.

Zespoły powinny ustawić prompt_cache_key (lub nagłówek x-grok-conv-id w Chat Completions). Bez tego żądania są rozpraszane po serwerach, a trafienia w pamięci podręcznej stają się zawodne, co skutkuje naliczaniem pełnej ceny za wejście.

Premiera Grok 4.6 przez SpaceXAI podkreśla rosnące znaczenie modeli AI zdolnych do utrzymywania długiego kontekstu i efektywnego działania w złożonych, wieloetapowych zadaniach. Mimo że model wykazuje imponujące możliwości w rozumowaniu i pracy koncepcyjnej, jego wyniki w specyficznych zadaniach kodowania wskazują na obszary do dalszego rozwoju. Rynek modeli językowych staje się coraz bardziej konkurencyjny, a innowacje takie jak te w Grok 4.6, choć nie zawsze prowadzące we wszystkich kategoriach, przyczyniają się do szybkiego postępu w dziedzinie sztucznej inteligencji, szczególnie w kontekście agentów AI i automatyzacji złożonych procesów. Koncentracja na optymalizacji treningu zamiast na prostym zwiększaniu rozmiaru modelu może być również sygnałem nowego kierunku w rozwoju AI, gdzie efektywność i specjalizacja stają się równie ważne, jak surowa moc obliczeniowa.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

ChatGPT udostępnia nielimitowane czaty tekstowe dla darmowych użytkowników
OpenAI Presence: Agenci AI gotowi do wdrożeń biznesowych
Meta AI wykorzystuje drugiego agenta AI jako "trenera pamięci" do długotrwałych zadań
Aplikacja Gemini Google'a przekroczyła miliard użytkowników
Meta AI prezentuje Muse Glimmer: model agentowy 30B działający na pojedynczej karcie GPU
Recenzowanie naukowe w kryzysie: Czy system peer review przetrwa erę AI?

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.