Anthropic prezentuje Claude Opus 5: Wysoka wydajność w niższej cenie
Anthropic wprowadza nowy flagowy model Claude Opus 5, który oferuje wydajność zbliżoną do Fable 5, ale przy znacznie niższych kosztach tokenów, odpowiadając na rosnącą presję cenową na rynku AI.

Anthropic zaprezentował swój nowy flagowy model językowy, Claude Opus 5, który osiąga czołowe wyniki w zadaniach związanych z kodowaniem i pracą koncepcyjną. Model ten zbliża się do wydajności Claude Fable 5, oferując jednocześnie dwukrotnie niższe stawki za tokeny, co stanowi odpowiedź na presję cenową ze strony konkurencji, takiej jak GPT-5.6 Sol oraz chińskich firm.
Opus 5 staje się domyślnym modelem w Claude Max i najbardziej zaawansowanym dostępnym dla użytkowników Claude Pro. Jego wprowadzenie ma na celu zniwelowanie luki między ceną a wydajnością w porównaniu do droższego Fable 5.
Ceny i efektywność tokenów
Model Opus 5 utrzymuje okno kontekstowe o rozmiarze 1 miliona tokenów oraz niezmienione stawki za tokeny. Podobnie jak jego poprzednik, Opus 4.8, kosztuje 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych. Anthropic wprowadził również nowy tryb Fast Mode, który zwiększa prędkość przetwarzania 2,5-krotnie, ale podwaja cenę.
Jednak same stawki za tokeny nie oddają pełnego obrazu bez uwzględnienia efektywności ich wykorzystania. Poprzednie doświadczenia, na przykład z modelem Opus 4.7, pokazały, że koszt zadania mógł być o 30-40% wyższy niż w przypadku Opus 4.6, mimo identycznych stawek bazowych. Podobna tendencja zaobserwowana została niedawno przy Claude Sonnet 5.
Aby zoptymalizować koszty i wydajność, użytkownicy mogą wybierać spośród pięciu ustawień wysiłku: low, medium, high, xhigh i max. Anthropic twierdzi, że Opus 5 oferuje lepszą wartość niż poprzednie modele na każdym poziomie wysiłku. Firma zaleca szerokie stosowanie ustawień low i medium, podkreślając, że zapewniają one dobre rezultaty przy ułamku zużycia tokenów i opóźnień, przewyższając jednocześnie te same ustawienia w starszych modelach Opus. Dla zadań związanych z kodowaniem i agentami, Anthropic nadal rekomenduje rozpoczynanie od ustawienia xhigh.
Wyniki w benchmarkach
Według wewnętrznych benchmarków Anthropic, Opus 5 ustanawia nowe rekordy w kilku kategoriach. Na Frontier-Bench v0.1 model osiąga 43,3% w kodowaniu agentowym w terminalu, znacząco przewyższając Fable 5 (33,7%), GPT-5.6 Sol (34,4%) oraz swojego poprzednika Opus 4.8 (21,1%). W benchmarku pracy koncepcyjnej GDPval-AA v2, Opus 5 prowadzi z wynikiem Elo 1861, wyprzedzając Fable 5 (1747) i GPT-5.6 Sol (1736).
Nie we wszystkich testach Opus 5 jest liderem. W kodowaniu agentowym za pośrednictwem DeepSWE v1.1, GPT-5.6 Sol osiąga 72,7%, wyprzedzając Fable 5 (69,7%) i Opus 5 (68,8%). W zadaniach medycznych i prawnych, Fable 5 i Mythos 5 odpowiednio przewyższają Opus 5.
Największą niespodzianką w benchmarkach Anthropic jest prawdopodobnie wynik w ARC-AGI-3, który mierzy zdolność do rozwiązywania nowych problemów bez zapamiętanych wzorców. Opus 5 osiąga 30,2%, podczas gdy Opus 4.8 zaledwie 1,5%, a GPT-5.6 Sol 7,8%. To prawie czterokrotna przewaga nad kolejnym najlepszym modelem. Brak jest wyniku dla Fable 5 w tym benchmarku, a Anthropic zaznacza, że nie jest jasne, czy tak duża przewaga w teście przełoży się na rzeczywiste zastosowania.
Opus 5 ustępuje modelowi Mythos 5 w zadaniach związanych z cyberbezpieczeństwem. Anthropic wyjaśnia, że celowo nie szkolił Opus 5 w tym obszarze, podobnie jak jego poprzednika. Model zbliża się do Mythos 5 w wykrywaniu luk, ale znacznie gorzej radzi sobie z ich wykorzystywaniem.
Inne ulepszenia i zastosowania
Anthropic podkreśla, że Opus 5 znacząco poprawił się w generowaniu wyników wizualnych oraz analizowaniu treści wizualnych, takich jak wykresy i diagramy. Model jest również znacznie lepszy w samodzielnym sprawdzaniu swojej pracy i iteracyjnym ulepszaniu. Przykładem jest zadanie na Frontier-Bench, gdzie Opus 5 otrzymał rysunek części maszyny i musiał stworzyć model 3D w FreeCAD. Model celowo nie miał bezpośredniego dostępu do rysunku, więc Opus 5 napisał własny potok wizji komputerowej, aby wyodrębnić geometrię z surowych pikseli, a następnie zrekonstruował kompletną część maszyny. Anthropic twierdzi, że żaden inny model nie rozwiązał tego zadania po pięciu próbach.
Opus 5 z powodzeniem zajął się również prawdziwym błędem w popularnym menedżerze pakietów open-source, znajdując jego przyczynę i naprawiając przypadek brzegowy, który został pominięty w poprawce społeczności. Konkurencyjny model naprawił jedynie objaw powierzchniowy, zgłaszając błąd jako rozwiązany.
Inżynier z firmy handlowej użył Opus 5 do zbudowania kanału danych rynkowych dla nowej giełdy podczas jednej sesji, co było niemożliwe dla poprzednich modeli, nawet z szczegółowymi planami.
Konfiguracja bezpieczeństwa Opus 5 pozwala na badania luk w kodzie źródłowym, ale blokuje skanowanie luk oparte na binariach, testy penetracyjne i generowanie exploitów. Klasyfikatory cybernetyczne uruchamiają się o około 85% rzadziej niż w Fable 5, którego częste interwencje spotkały się z krytyką. Zablokowane żądania w Claude.ai, Claude Code i Claude Cowork domyślnie przekierowywane są do Opus 4.8 jako rozwiązania awaryjnego, podobnie jak w przypadku Fable 5.
Anthropic określa Opus 5 jako najbardziej zdolny ogólnodostępny model do badań naukowych. Wykazuje on poprawę w stosunku do Opus 4.8 we wszystkich ocenach nauk przyrodniczych, z wyróżniającymi się ulepszeniami w chemii organicznej (wzrost o 10,2 punktu procentowego w wyprowadzaniu struktur molekularnych z danych spektroskopowych) i zadaniach związanych z białkami (wzrost o 7,7 punktu procentowego).
Obok Opus 5, Anthropic udostępnia dwie funkcje w wersji beta: Mid-Conversation Tool Changes na platformie Claude, umożliwiające deweloperom wymianę dostępnych narzędzi podczas rozmowy bez unieważniania pamięci podręcznej promptów, oraz Automatic Fallbacks w API, które automatycznie przekierowują zablokowane żądania do innego modelu.
Premiera Claude Opus 5 z niższymi cenami i imponującymi wynikami w benchmarkach, zwłaszcza w obszarach kodowania i rozwiązywania problemów, sygnalizuje intensyfikację konkurencji na rynku zaawansowanych modeli językowych. Zdolność modelu do samodzielnego ulepszania pracy i innowacyjne podejście do zadań, takich jak rekonstrukcja części maszyny, pokazują potencjał do rewolucjonizowania procesów w wielu branżach, jednocześnie stawiając nowe wyzwania w zakresie optymalizacji kosztów i efektywnego wykorzystania zasobów AI.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Danijar Hafner tworzy agentów AI zdolnych do przewidywania nieoczekiwanych sytuacji
Danijar Hafner, były badacz Google DeepMind, rozwija nowatorskie agenty AI, które potrafią planować i reagować na nieznane środowiska, wykorzystując modelowanie świata i uczenie ze wzmocnieniem.
Redakcja Aigest1 godz. temu
OpenBMB prezentuje MiniCPM5-2B: kompaktowy model językowy o wysokiej wydajności
OpenBMB wprowadziło MiniCPM5-2B, gęsty model językowy z 2,52 miliarda parametrów, który osiąga średni wynik 53,9 w 34 testach porównawczych, przewyższając konkurencję.
Redakcja Aigest16 godz. temu

GPT-6 Astra samodzielnie ukończyła grę Portal w mniej niż 24 godziny
Model sztucznej inteligencji GPT-6 Astra, stworzony przez cozyblaze, samodzielnie przeszedł całą grę Portal, osiągając napisy końcowe bez interwencji człowieka w czasie poniżej 24 godzin.
Redakcja Aigest18 godz. temu

Chatbot, który radzi, to chatbot, który bierze odpowiedzialność
Incydent z Google Gemini i Mount Shasta to nie tylko anegdota, ale poważne ostrzeżenie, że AI przestaje być tylko narzędziem, a staje się aktywnym doradcą, co rodzi nowe wyzwania etyczne i prawne.
Michał Chmielarzwczoraj
IFM prezentuje K2 Horizon: sześć modeli Apache 2.0 od 0.9B do 375B
Instytut Modeli Fundacyjnych (IFM) wprowadził na rynek K2 Horizon – zestaw sześciu modeli sztucznej inteligencji o zróżnicowanej skali, dostępnych na licencji Apache 2.0.
Redakcja Aigestwczoraj

H Company prezentuje NeoMME: Nowe multimodalne kodery bez wieży wizyjnej
Firma H Company wprowadza na rynek NeoMME, rodzinę multimodalnych koderów, które przetwarzają tekst i obrazy w jednym transformatorze, eliminując potrzebę oddzielnej wieży wizyjnej i dekodera przyczynowego.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.