Aigest.
Newsy

Anthropic prezentuje Claude Opus 5: Wysoka wydajność w niższej cenie

Anthropic wprowadza nowy flagowy model Claude Opus 5, który oferuje wydajność zbliżoną do Fable 5, ale przy znacznie niższych kosztach tokenów, odpowiadając na rosnącą presję cenową na rynku AI.

RA

Udostępnij
Anthropic prezentuje Claude Opus 5: Wysoka wydajność w niższej cenie
Fot. The Decoder

Anthropic zaprezentował swój nowy flagowy model językowy, Claude Opus 5, który osiąga czołowe wyniki w zadaniach związanych z kodowaniem i pracą koncepcyjną. Model ten zbliża się do wydajności Claude Fable 5, oferując jednocześnie dwukrotnie niższe stawki za tokeny, co stanowi odpowiedź na presję cenową ze strony konkurencji, takiej jak GPT-5.6 Sol oraz chińskich firm.

Opus 5 staje się domyślnym modelem w Claude Max i najbardziej zaawansowanym dostępnym dla użytkowników Claude Pro. Jego wprowadzenie ma na celu zniwelowanie luki między ceną a wydajnością w porównaniu do droższego Fable 5.

Ceny i efektywność tokenów

Model Opus 5 utrzymuje okno kontekstowe o rozmiarze 1 miliona tokenów oraz niezmienione stawki za tokeny. Podobnie jak jego poprzednik, Opus 4.8, kosztuje 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych. Anthropic wprowadził również nowy tryb Fast Mode, który zwiększa prędkość przetwarzania 2,5-krotnie, ale podwaja cenę.

Jednak same stawki za tokeny nie oddają pełnego obrazu bez uwzględnienia efektywności ich wykorzystania. Poprzednie doświadczenia, na przykład z modelem Opus 4.7, pokazały, że koszt zadania mógł być o 30-40% wyższy niż w przypadku Opus 4.6, mimo identycznych stawek bazowych. Podobna tendencja zaobserwowana została niedawno przy Claude Sonnet 5.

Aby zoptymalizować koszty i wydajność, użytkownicy mogą wybierać spośród pięciu ustawień wysiłku: low, medium, high, xhigh i max. Anthropic twierdzi, że Opus 5 oferuje lepszą wartość niż poprzednie modele na każdym poziomie wysiłku. Firma zaleca szerokie stosowanie ustawień low i medium, podkreślając, że zapewniają one dobre rezultaty przy ułamku zużycia tokenów i opóźnień, przewyższając jednocześnie te same ustawienia w starszych modelach Opus. Dla zadań związanych z kodowaniem i agentami, Anthropic nadal rekomenduje rozpoczynanie od ustawienia xhigh.

Wyniki w benchmarkach

Według wewnętrznych benchmarków Anthropic, Opus 5 ustanawia nowe rekordy w kilku kategoriach. Na Frontier-Bench v0.1 model osiąga 43,3% w kodowaniu agentowym w terminalu, znacząco przewyższając Fable 5 (33,7%), GPT-5.6 Sol (34,4%) oraz swojego poprzednika Opus 4.8 (21,1%). W benchmarku pracy koncepcyjnej GDPval-AA v2, Opus 5 prowadzi z wynikiem Elo 1861, wyprzedzając Fable 5 (1747) i GPT-5.6 Sol (1736).

Nie we wszystkich testach Opus 5 jest liderem. W kodowaniu agentowym za pośrednictwem DeepSWE v1.1, GPT-5.6 Sol osiąga 72,7%, wyprzedzając Fable 5 (69,7%) i Opus 5 (68,8%). W zadaniach medycznych i prawnych, Fable 5 i Mythos 5 odpowiednio przewyższają Opus 5.

Największą niespodzianką w benchmarkach Anthropic jest prawdopodobnie wynik w ARC-AGI-3, który mierzy zdolność do rozwiązywania nowych problemów bez zapamiętanych wzorców. Opus 5 osiąga 30,2%, podczas gdy Opus 4.8 zaledwie 1,5%, a GPT-5.6 Sol 7,8%. To prawie czterokrotna przewaga nad kolejnym najlepszym modelem. Brak jest wyniku dla Fable 5 w tym benchmarku, a Anthropic zaznacza, że nie jest jasne, czy tak duża przewaga w teście przełoży się na rzeczywiste zastosowania.

Opus 5 ustępuje modelowi Mythos 5 w zadaniach związanych z cyberbezpieczeństwem. Anthropic wyjaśnia, że celowo nie szkolił Opus 5 w tym obszarze, podobnie jak jego poprzednika. Model zbliża się do Mythos 5 w wykrywaniu luk, ale znacznie gorzej radzi sobie z ich wykorzystywaniem.

Inne ulepszenia i zastosowania

Anthropic podkreśla, że Opus 5 znacząco poprawił się w generowaniu wyników wizualnych oraz analizowaniu treści wizualnych, takich jak wykresy i diagramy. Model jest również znacznie lepszy w samodzielnym sprawdzaniu swojej pracy i iteracyjnym ulepszaniu. Przykładem jest zadanie na Frontier-Bench, gdzie Opus 5 otrzymał rysunek części maszyny i musiał stworzyć model 3D w FreeCAD. Model celowo nie miał bezpośredniego dostępu do rysunku, więc Opus 5 napisał własny potok wizji komputerowej, aby wyodrębnić geometrię z surowych pikseli, a następnie zrekonstruował kompletną część maszyny. Anthropic twierdzi, że żaden inny model nie rozwiązał tego zadania po pięciu próbach.

Opus 5 z powodzeniem zajął się również prawdziwym błędem w popularnym menedżerze pakietów open-source, znajdując jego przyczynę i naprawiając przypadek brzegowy, który został pominięty w poprawce społeczności. Konkurencyjny model naprawił jedynie objaw powierzchniowy, zgłaszając błąd jako rozwiązany.

Inżynier z firmy handlowej użył Opus 5 do zbudowania kanału danych rynkowych dla nowej giełdy podczas jednej sesji, co było niemożliwe dla poprzednich modeli, nawet z szczegółowymi planami.

Konfiguracja bezpieczeństwa Opus 5 pozwala na badania luk w kodzie źródłowym, ale blokuje skanowanie luk oparte na binariach, testy penetracyjne i generowanie exploitów. Klasyfikatory cybernetyczne uruchamiają się o około 85% rzadziej niż w Fable 5, którego częste interwencje spotkały się z krytyką. Zablokowane żądania w Claude.ai, Claude Code i Claude Cowork domyślnie przekierowywane są do Opus 4.8 jako rozwiązania awaryjnego, podobnie jak w przypadku Fable 5.

Anthropic określa Opus 5 jako najbardziej zdolny ogólnodostępny model do badań naukowych. Wykazuje on poprawę w stosunku do Opus 4.8 we wszystkich ocenach nauk przyrodniczych, z wyróżniającymi się ulepszeniami w chemii organicznej (wzrost o 10,2 punktu procentowego w wyprowadzaniu struktur molekularnych z danych spektroskopowych) i zadaniach związanych z białkami (wzrost o 7,7 punktu procentowego).

Obok Opus 5, Anthropic udostępnia dwie funkcje w wersji beta: Mid-Conversation Tool Changes na platformie Claude, umożliwiające deweloperom wymianę dostępnych narzędzi podczas rozmowy bez unieważniania pamięci podręcznej promptów, oraz Automatic Fallbacks w API, które automatycznie przekierowują zablokowane żądania do innego modelu.

Premiera Claude Opus 5 z niższymi cenami i imponującymi wynikami w benchmarkach, zwłaszcza w obszarach kodowania i rozwiązywania problemów, sygnalizuje intensyfikację konkurencji na rynku zaawansowanych modeli językowych. Zdolność modelu do samodzielnego ulepszania pracy i innowacyjne podejście do zadań, takich jak rekonstrukcja części maszyny, pokazują potencjał do rewolucjonizowania procesów w wielu branżach, jednocześnie stawiając nowe wyzwania w zakresie optymalizacji kosztów i efektywnego wykorzystania zasobów AI.

Źródło: the-decoder.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Microsoft stawia na otwarte modele AI, by wzmocnić Azure i obniżyć koszty
AlphaFold AI pomaga przeprojektować białka do edycji genów, zwiększając ich bezpieczeństwo
Tydzień w AI: Między globalną dominacją a lokalnymi wyzwaniami
Microsoft stawia na otwarte modele AI, by wzmocnić Azure i obniżyć koszty
Newsy

Microsoft stawia na otwarte modele AI, by wzmocnić Azure i obniżyć koszty

Microsoft zmienia strategię w dziedzinie sztucznej inteligencji, promując otwarte modele AI, co ma na celu wzmocnienie platformy Azure i zmniejszenie zależności od drogich dostawców zewnętrznych.

Redakcja Aigest17 godz. temu

OpenAI wprowadza tryb głosowy ChatGPT do aplikacji desktopowej
Kimi K3 Moonshot AI daleko za czołowymi modelami USA w cyberbezpieczeństwie, destylacja może być przyczyną

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.