SpaceXAI prezentuje Grok 4.6: model z kontekstem 500 tys. tokenów dla agentów AI i programistów
SpaceXAI udostępniło Grok 4.6, ulepszoną wersję swojego modelu AI, która oferuje znacznie większy kontekst i lepszą wydajność w zadaniach wymagających długotrwałego działania agentów oraz w pracy z kodem.

SpaceXAI ogłosiło premierę Grok 4.6, stanowiącego znaczące ulepszenie w stosunku do poprzedniej wersji, Grok 4.5. Nowy model nie jest większą wersją bazową, lecz wynikiem intensywnego procesu post-treningowego, który obejmował dłuższe dodatkowe szkolenie, regenerację trajektorii nadzorowanego dostrajania oraz uczenie wzmacniające w środowiskach agentowych. Grok 4.6 został zaprojektowany z myślą o agentach AI, którzy muszą utrzymywać się przy zadaniu przez wiele kroków bez utraty spójności.
Model osiągnął wynik 61 punktów w indeksie Artificial Analysis Intelligence Index, co oznacza wzrost o pięć punktów w porównaniu do Grok 4.5 i stawia go na równi z GPT-5.6 Sol Max. Kluczową cechą jest obsługa 500 000 tokenów kontekstu, co otwiera nowe możliwości dla złożonych zadań. Grok 4.6 jest już dostępny w Cursor i Grok Build, a także wprowadza nowy poziom wysiłku rozumowania xhigh, rozszerzając możliwości dostępne w Grok 4.5.
Dostępność i architektura Grok 4.6
Grok 4.6 jest już ogólnie dostępny poprzez xAI API pod nazwą grok-4.6 i stanowi domyślny model w Grok Build. Został również zintegrowany z Cursor we wszystkich planach oraz jest dostępny przez OpenRouter, Vercel i Cloudflare. Ważne jest, że SpaceXAI nie udostępniło modelu w wersji open-weights ani ścieżki do samodzielnego hostowania, co wyklucza wdrożenia w środowiskach air-gapped.
Ulepszenia w Grok 4.6 nie wynikają z powiększenia modelu bazowego. SpaceXAI skupiło się na dłuższym, dodatkowym cyklu szkoleniowym niż w przypadku Grok 4.5. Wykorzystano wyselekcjonowane dane generowane przez model do rozumowania i zaawansowanych koncepcji technicznych, wysokiej jakości dane inżynierskie oraz ulepszony optymalizator i recepturę treningową.
Proces obejmował również regenerację trajektorii nadzorowanego dostrajania przy użyciu Grok 4.5, obejmujących różne poziomy wysiłku rozumowania, uprzęże agentowe i dziedziny takie jak STEM, inżynieria oprogramowania i praca koncepcyjna. Problematyczne ślady były filtrowane za pomocą kontroli opartych na modelu. Następnie zastosowano uczenie wzmacniające w środowiskach agentowych, obejmujących pracę koncepcyjną, ogólne kodowanie, rozwój stron internetowych, projektowanie wspomagane komputerowo (CAD) i optymalizację jądra systemu.
SpaceXAI zaobserwowało, że na dłuższych trajektoriach model wykazuje więcej samokontroli i weryfikacji, sprawdzając własną pracę przed przejściem do kolejnego etapu. Jest to jednak obserwacja wewnętrzna, a nie niezależnie zmierzony wynik.
Możliwości i wydajność
Grok 4.6 obsługuje 500 000 tokenów kontekstu, akceptuje dane wejściowe w postaci tekstu i obrazu, generując wyłącznie tekst. Nie ma określonego limitu długości tekstu wyjściowego, a jego wiedza jest aktualna do 1 lutego 2026 roku. Nowy poziom xhigh dla reasoning_effort dołącza do istniejących low, medium i high (domyślny). SpaceXAI nie podało liczby parametrów dla Grok 4.6.
W tabeli wyników xAI, Grok 4.6 (High) osiąga 61 punktów w Artificial Analysis Intelligence Index, przewyższając 56 punktów Grok 4.5 i dorównując GPT-5.6 Sol Max. Model prowadzi w testach GDPval-AA v2 (1753 Elo, w porównaniu do 1526 dla Grok 4.5), AA-Briefcase (1577, w porównaniu do 1313) oraz Harvey LAB.
Jednak w kategoriach związanych z kodowaniem, kluczowych dla zespołów inżynierskich, Grok 4.6 pozostaje w tyle. W teście DeepSWE v1.1 osiąga 65,9% (wzrost o 11,9 punktu), ale ustępuje GPT-5.6 Sol Max (73%). W Terminal-Bench v3.0 wynik to 26%, co jest niemal dwukrotnie lepszym rezultatem niż 15,7% Grok 4.5, ale nadal jest to ostatnie miejsce wśród czterech wymienionych modeli. W CursorBench v3.2 model osiąga 69,9%, w FrontierCode v1.1 Extended 61,3%, a w APEX-Agents 57,5%.
Warto zauważyć, że zwycięstwa w GDPval-AA v2 i AA-Briefcase mieszczą się w opublikowanych przedziałach ufności Artificial Analysis, co oznacza, że są to statystyczne remisy, a nie wyraźne prowadzenie. Ponadto, zestaw porównawczy nie uwzględnia Claude Opus 5 firmy Anthropic, który obecnie zajmuje czołowe miejsce w tym indeksie. Ujawnione słabości w kodowaniu są zatem bardziej wiarygodnym sygnałem.
Ceny i optymalizacja kosztów
Zgodnie z informacjami o wydaniu, Grok 4.6 jest wyceniony na 2 USD / 0,50 USD / 6 USD za 1 milion tokenów (wejście / buforowane wejście / wyjście) dla promptów poniżej 200 000 tokenów. Powyżej tego progu ceny wynoszą 4 USD / 1 USD / 12 USD. Strona startowa wspomina również o szybszym wariancie modelu, który jest dwukrotnie droższy, lecz bez oddzielnego identyfikatora modelu. Grok Build i Cursor oferują dwukrotnie większe wliczone użycie przez pierwszy tydzień.
Zespoły powinny ustawić prompt_cache_key (lub nagłówek x-grok-conv-id w Chat Completions). Bez tego żądania są rozpraszane po serwerach, a trafienia w pamięci podręcznej stają się zawodne, co skutkuje naliczaniem pełnej ceny za wejście.
Premiera Grok 4.6 przez SpaceXAI podkreśla rosnące znaczenie modeli AI zdolnych do utrzymywania długiego kontekstu i efektywnego działania w złożonych, wieloetapowych zadaniach. Mimo że model wykazuje imponujące możliwości w rozumowaniu i pracy koncepcyjnej, jego wyniki w specyficznych zadaniach kodowania wskazują na obszary do dalszego rozwoju. Rynek modeli językowych staje się coraz bardziej konkurencyjny, a innowacje takie jak te w Grok 4.6, choć nie zawsze prowadzące we wszystkich kategoriach, przyczyniają się do szybkiego postępu w dziedzinie sztucznej inteligencji, szczególnie w kontekście agentów AI i automatyzacji złożonych procesów. Koncentracja na optymalizacji treningu zamiast na prostym zwiększaniu rozmiaru modelu może być również sygnałem nowego kierunku w rozwoju AI, gdzie efektywność i specjalizacja stają się równie ważne, jak surowa moc obliczeniowa.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

ChatGPT udostępnia nielimitowane czaty tekstowe dla darmowych użytkowników
OpenAI znosi limity na czaty tekstowe dla wszystkich użytkowników ChatGPT, co zbiega się z przekroczeniem miliarda użytkowników tygodniowo. Wprowadzono także nowe modele GPT-5.6 Luna i Sol.
Redakcja Aigest6 dni temu

OpenAI Presence: Agenci AI gotowi do wdrożeń biznesowych
OpenAI wprowadza Presence, nową ofertę skierowaną do przedsiębiorstw, mającą na celu uczynienie agentów AI niezawodnymi w rzeczywistych zastosowaniach biznesowych. Rozwiązanie to ma usprawnić obsługę klienta i wewnętrzne
Redakcja Aigest2 sie 2026

Meta AI wykorzystuje drugiego agenta AI jako "trenera pamięci" do długotrwałych zadań
Meta AI opracowała innowacyjny system, w którym drugi agent AI pełni funkcję "trenera pamięci", pomagając głównemu agentowi utrzymać spójność i unikać powtarzania błędów podczas złożonych zadań.
Redakcja Aigest2 sie 2026


Meta AI prezentuje Muse Glimmer: model agentowy 30B działający na pojedynczej karcie GPU
Meta AI wprowadza Muse Glimmer, 30-miliardowy multimodalny model agentowy, który dzięki optymalizacji może działać na pojedynczej konsumenckiej karcie graficznej lub Macu, bez potrzeby połączenia sieciowego.
Redakcja Aigest2 dni temu

Recenzowanie naukowe w kryzysie: Czy system peer review przetrwa erę AI?
Tradycyjny system recenzowania prac naukowych, kluczowy dla weryfikacji badań, zmaga się z narastającym kryzysem. Rosnąca liczba publikacji i wyzwania związane z AI obciążają wolontariuszy, zmuszając środowisko akademick
Redakcja Aigest2 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.