Kimi K3: Nowy model multimodalny z 2,8 biliona parametrów rzuca wyzwanie gigantom AI
Kimi wprowadza K3, multimodalny model z 2,8 biliona parametrów i oknem kontekstowym miliona tokenów, który w benchmarkach zbliża się do wiodących modeli własnościowych.

Firma Kimi zaprezentowała swój najnowszy, flagowy model multimodalny K3, który dysponuje imponującą liczbą 2,8 biliona parametrów i oknem kontekstowym zdolnym do przetwarzania miliona tokenów. Według wewnętrznych benchmarków firmy, K3 osiąga wyniki porównywalne z czołowymi, własnościowymi modelami sztucznej inteligencji, takimi jak Claude Fable 5 i GPT 5.6 Sol, jednocześnie wyznaczając nowy standard dla otwartych modeli w tej skali.
Wydajność i zastosowania Kimi K3
Kimi K3 jest pierwszym otwartym modelem w przedziale około 3 bilionów parametrów, zdolnym do natywnego przetwarzania obrazów i wideo. Jego główne zastosowania obejmują długotrwałe zadania programistyczne, prace wymagające specjalistycznej wiedzy oraz złożone rozumowanie. Pełne wagi modelu mają zostać udostępnione do 27 lipca.
W wewnętrznych testach Kimi, K3 ustępuje jedynie modelom Claude Fable 5 i GPT 5.6 Sol, ale przewyższa wszystkie inne testowane systemy, w tym modele Claude Opus i chińskiego rywala GLM-5.2. W 35 testach K3 zajął pierwsze miejsce około siedem razy, a w większości pozostałych uplasował się na drugim lub trzecim miejscu. Warto zaznaczyć, że wyniki te zostały osiągnięte przy maksymalnej lub wysokiej intensywności myślenia, a do testów używano różnych systemów agentowych (KimiCode, Claude Code, Codex), co oznacza, że warunki nie zawsze były identyczne.
Niezależne laboratorium Artificial Analysis również oceniło Kimi K3, przyznając mu 57 punktów w swoim Indeksie Inteligencji. To stawia model na równi z Opus 4.8 i GPT-5.5, choć nadal pozostaje w tyle za Fable 5 i GPT-5.6 Sol. Wyniki te w dużej mierze potwierdzają twierdzenia Kimi.
W zadaniach agentowych K3 osiągnął 1668 punktów Elo w teście GDPval v2, co stanowi znaczący wzrost w porównaniu do 1190 punktów K2.6. Przewyższa GLM-5.2 (1514), GPT-5.5 (1494) i Claude Opus 4.8 (1600), choć wciąż ustępuje Claude Fable 5 (1760). K3 zajął również pierwsze miejsce w AutomationBench-AA, wersji oceny przepływów pracy SaaS agentowych firmy Zapier, z wynikiem 53 procent.
W ocenie długoterminowej pracy z wiedzą AA-Briefcase, K3 osiągnął ogólny wynik Elo 1547 punktów, co oznacza wzrost o 732 punkty w stosunku do K2.6. Jedynie Claude Fable 5 uzyskał wyższy wynik. Artificial Analysis określa K3 jako wszechstronny model, którego jakość analityczna i ocena rubryk są zbliżone do poziomu Fable 5. GPT-5.6 Sol nadal prowadzi pod względem jakości prezentacji.
K3 poprawił również wskaźnik dokładności z 33 procent do 46 procent w AA-Omniscience Index, zwiększając ogólny wynik z +6 do +18. Należy jednak zauważyć, że wskaźnik halucynacji wzrósł z 39 procent do 51 procent, co oznacza, że K3 generuje więcej błędnych odpowiedzi, mimo że poprawnie odpowiada na więcej pytań.
Innowacje techniczne i koszty
Kimi K3 wykorzystuje architekturę mixture-of-experts, która aktywuje tylko 16 z 896 ekspertów jednocześnie. Jest ona połączona z nową architekturą uwagi o nazwie Kimi Delta Attention, która według Kimi umożliwia do 6,3 razy szybsze dekodowanie dla kontekstów miliona tokenów. „Attention residuals” mają zwiększać efektywność treningu o około 25 procent, dodając mniej niż 2 procent dodatkowego obciążenia obliczeniowego.
Model jest zaprojektowany do analizowania dużych baz kodu, koordynowania narzędzi terminalowych i utrzymywania koncentracji na zadaniu przez wiele etapów pracy. K3 łączy programowanie z wizualną informacją zwrotną, analizując zrzuty ekranu, modyfikując kod, a następnie sprawdzając widoczny wynik. Ten system zamkniętej pętli, nazwany „Vision in the Loop”, jest pozycjonowany jako podstawa do tworzenia gier, projektowania interfejsów użytkownika i CAD. Kimi zaprezentowało dema, takie jak proceduralnie generowana gra 3D z otwartym światem, stworzona w przeglądarce za pomocą Three.js, WebGPU i GPU Compute, a także interaktywna wizualizacja czarnej dziury, symulacja startu i powrotu rakiety Long March 10 oraz emulator Game Boy Advance.
Ceny za korzystanie z Kimi K3 również uległy zmianie. Milion tokenów wejściowych kosztuje 0,30 USD z trafieniem w pamięć podręczną i 3,00 USD bez niej. Milion tokenów wyjściowych, w tym rozumowanie, kosztuje 15,00 USD. Ceny te obowiązują niezależnie od długości kontekstu. Automatyczne buforowanie sprawia, że niezmienione długie prefiksy są szczególnie użyteczne dla agentów i dużych baz kodu.
To stawia K3 znacznie powyżej poziomu cenowego swojego poprzednika, K2.6, który kosztował 0,16 USD za milion tokenów z trafieniem w pamięć podręczną, 0,95 USD bez niej i 4,00 USD za wyjście. Chińscy dostawcy nie oferują już swoich najnowszych modeli po bardzo niskich cenach. Mimo to, K3 jest znacznie tańszy niż czołowe modele zachodnie i plasuje się w wyższym średnim segmencie. Na przykład, nowy Anthropic Sonnet 5 również kosztuje 3 USD za milion tokenów wejściowych i 15 USD za wyjście, ale oferuje niższą wydajność.
Według Artificial Analysis, K3 kosztuje średnio 0,94 USD za zadanie w Indeksie Inteligencji, co jest zbliżone do GPT-5.6 Sol (1,04 USD) i około połowy ceny Opus 4.8 (1,80 USD). Jest jednak znacznie droższy niż otwarte modele, takie jak GLM-5.2 (0,32 USD) i DeepSeek V4 Pro (0,04 USD).
K3 zużywa również mniej tokenów niż jego poprzednik. Potrzebował około 132 milionów tokenów wyjściowych do ukończenia wszystkich dziewięciu ocen, w porównaniu do około 166 milionów dla K2.6, co stanowi redukcję o 21 procent, przy jednoczesnym uzyskaniu 13 punktów więcej. Ze względu na znacznie wyższe ceny tokenów, K3 prawdopodobnie będzie kosztował więcej za zadanie niż K2.6 w większości przypadków.
Dostępność i plany na przyszłość
K3 jest już dostępny za pośrednictwem Kimi.com, aplikacji mobilnej na iOS, Androida i HarmonyOS, klienta desktopowego Kimi Work (wersja 3.1.0 i nowsze) oraz Kimi Code. Na OpenRouter model jest wymieniony pod identyfikatorem „moonshotai/kimi-k3”, choć obecnie jest tam obsługiwany tylko przez Moonshot. Otwarte wagi modelu mają być dostępne do końca lipca.
Dla firm Kimi oferuje oddzielną wersję z zarządzaniem członkami i możliwością rozdzielenia kont osobistych i biznesowych. Planowana platforma Kimi Hosted Agent zapewni izolowane środowiska i środowiska wykonawcze dla długotrwałych zadań. Zainteresowani użytkownicy mogą już zapisywać się na listę oczekujących.
Wprowadzenie Kimi K3 na rynek, z jego imponującymi parametrami i konkurencyjną wydajnością, sygnalizuje rosnącą siłę chińskich firm w globalnym wyścigu AI. Mimo że ceny za korzystanie z modelu wzrosły w porównaniu do poprzednika, K3 nadal oferuje atrakcyjną alternatywę dla droższych modeli zachodnich, co może wpłynąć na dynamikę rynku i dostępność zaawansowanych technologii AI dla szerszego grona użytkowników i przedsiębiorstw.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Amazon wykorzystuje AI do walki z oszustwami, Alexa pomoże rozpoznać scamy
Amazon wprowadza nowe funkcje oparte na sztucznej inteligencji, aby pomóc klientom w identyfikacji fałszywych wiadomości i oszustw. Usługa Alexa for Shopping będzie teraz w stanie potwierdzić autentyczność komunikacji od
Redakcja Aigest11 godz. temu

Google DeepMind stawia na innowacje, ignorując ryzyko rynkowe i etyczne
Deklaracja szefa Google DeepMind o priorytecie innowacji w AI, w obliczu ostrzeżeń Banku Anglii i problemów z AI Overviews, budzi poważne pytania o odpowiedzialność liderów rynku.
Michał Chmielarz18 godz. temu
Meta Superintelligence Labs wprowadza Muse Voice Transcribe – jeden model dla transkrypcji, diaryzacji i detekcji końca
Meta Superintelligence Labs zaprezentowało Muse Voice Transcribe, innowacyjny model AI, który łączy funkcje transkrypcji mowy, rozdzielania mówców i detekcji końca wypowiedzi w jednym systemie, znacząco redukując opóźnie
Redakcja Aigest20 godz. temu

BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM
Artykuł analizuje skuteczność tradycyjnych benchmarków w ocenie dużych modeli językowych (LLM), wprowadzając koncepcję BenchMIRT, która ma lepiej oddawać ich rzeczywiste możliwości.
Redakcja Aigestwczoraj
Model Astra od OpenAI: Przełom w cyberbezpieczeństwie czy nowe zagrożenie?
OpenAI zapowiada model Astra, który jako pierwszy LLM osiągnął „krytyczny próg cyberbezpieczeństwa”, potrafiąc samodzielnie znajdować i wykorzystywać luki w systemach komputerowych. Firma planuje jego rychłe udostępnieni
Redakcja Aigestwczoraj

Google wprowadza agentowe rozumienie wideo do modeli Gemini Flash, obniżając koszty i zwiększając dokładność
Google ogłosiło wprowadzenie agentowego rozumienia wideo dla swoich modeli Gemini Flash, co ma zrewolucjonizować analizę treści wideo, znacząco obniżając koszty i zwiększając precyzję.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.