Anthropic wprowadza Claude Opus 5.5: niższy koszt, lepsza wydajność i bardziej naturalny język
Anthropic zaprezentował Claude Opus 5.5, nowy model AI, który dorównuje wydajnością Fable 5.1, oferując jednocześnie znacznie niższe koszty operacyjne i bardziej naturalny styl komunikacji.

Anthropic ogłosił premierę Claude Opus 5.5, pierwszego modelu z nowej generacji, który ma dorównywać wydajnością Claude Fable 5.1, jednocześnie oferując znacznie niższe koszty i szybsze działanie. Firma zapowiada podobne ulepszenia w nadchodzących tygodniach dla modeli Claude Sonnet 5.5 i Haiku 5.5, koncentrując się na wydajności, efektywności i bezpieczeństwie. Według wewnętrznych testów Anthropic, nowy model Opus przewyższa zarówno Fable 5.1, jak i droższy GPT-6 Astra od OpenAI w większości zadań.
Optymalizacja kosztów i wydajności
Anthropic podkreśla, że nowa seria modeli jest odpowiedzią na uwagi klientów dotyczące kosztów, efektywności i jakości komunikacji, szczególnie w sektorach takich jak usługi finansowe, prawo i rozwój oprogramowania. Ceny za tokeny dla Opus 5.5 zostały obniżone o 20 procent w porównaniu do Opus 5, wynosząc 4 dolary za milion tokenów wejściowych i 20 dolarów za milion tokenów wyjściowych. Dodatkowo, koszty odczytu pamięci podręcznej zmniejszono o 60 procent.
Firma szacuje, że całkowite koszty operacyjne, uwzględniające zarówno ceny, jak i zużycie tokenów, będą niższe o około 40 procent w stosunku do Opus 5. Model zużywa mniej tokenów i generuje wyniki ponad 30 procent szybciej. Limity użytkowania dla subskrybentów, wynoszące pięć godzin, zostaną zwiększone o 20 procent, a dzięki niższym kosztom, Anthropic twierdzi, że te limity będą efektywniejsze o 25 procent. Użytkownicy zyskują również możliwość zachowania resetu limitu na moment, gdy będzie najbardziej potrzebny.
Konkurencja i benchmarki
Anthropic wykorzystuje benchmarki kodowania, aby udowodnić przewagę cenową i wydajnościową Opus 5.5. Na platformie FrontierCode model ma przewyższać GPT-6 Astra przy około 20 procentach kosztu zadania. Na Terminal-Bench 4.0 osiąga taką samą wydajność jak Astra, ale przy 40 procentach jej kosztów. Z kolei na CursorBench, Opus 5.5 pokonuje GPT-5.6 Sol o 11 punktów, kosztując jedną trzecią jego ceny. Obniżka cen jest reakcją na presję ze strony OpenAI oraz chińskich modeli AI, które oferują niższą wydajność, ale za ułamek ceny.
Niezależna platforma Artificial Analysis potwierdza wysoką wydajność Opus 5.5, przyznając mu 58 punktów w Artificial Analysis Intelligence Index – to najwyższy wynik w historii. Model prowadzi w sześciu z dziesięciu ocen, w tym w Humanity's Last Exam (61,4 procent) i SciCode (66,9 procent). Na Terminal-Bench 4.0, Opus 5.5 osiąga 59,6 procent, dorównując GPT-6 Astra i przewyższając Opus 5 o 11 punktów. Artificial Analysis wskazuje, że Opus 5.5 osiąga parytet z GPT-6 Astra na Terminal-Bench 4.0 i AutomationBench-AA, jednocześnie zwiększając przewagę w pracy agentowej wymagającej wiedzy. Na prywatnym benchmarku AA-Briefcase, Opus 5.5 osiąga Elo 1,822, co oznacza wzrost o 143 punkty w stosunku do Fable 5.1 i po raz pierwszy model Anthropic pokonuje GPT-5.6 Sol pod względem jakości prezentacji. Na GDPval-AA, benchmarku OpenAI dla pracy umysłowej, Opus 5.5 przewyższa Astrę we wszystkich trybach rozumowania z wyjątkiem niskiego.
Lepsza komunikacja i bezpieczeństwo
Opus 5.5 ma również komunikować się bardziej naturalnie niż poprzednie modele. Anthropic twierdzi, że model priorytetyzuje najważniejsze informacje, używa mniej żargonu i lepiej przestrzega instrukcji pisania. Wcześni testerzy opisali jego styl jako jaśniejszy i łatwiejszy do zrozumienia, co według Anthropic czyni go lepszym partnerem do długich sesji roboczych. Poprzednie modele Claude były krytykowane za ich formułowy i zawiły styl pisania, często nazywany „Claudish”.
Opus 5.5 to także pierwszy model Opus z zabezpieczeniami w obszarach cyberbezpieczeństwa, biologii i rozwoju granicznych LLM, które odpowiadają tym z Fable 5.1. W przypadku aktywacji tych zabezpieczeń, żądania są transparentnie przekierowywane do innego modelu. Anthropic planuje rozszerzyć swój program Cyber Verification Program na Opus 5.5 w nadchodzących tygodniach, a zweryfikowane organizacje mogą ubiegać się o wykorzystanie modelu do badań biologicznych poprzez Life Sciences Verification Program.
Model jest również wyposażony w mechanizmy znakowania wodnego, aby spełnić wymogi aktu o AI Unii Europejskiej. Nie może już działać z wyłączonym trybem „Thinking” i jest dostępny z funkcją Zero Data Retention. Anthropic wprowadza również środki przeciwko tzw. atakom destylacyjnym, które polegają na masowym wydobywaniu możliwości modelu przez cyberprzestępców. Opus 5.5 zawiera funkcję „Preserved Thinking”, zapobiegającą edycji kontekstu przez użytkowników API w celu ekstrakcji rozumowania modelu.
Dostępność i przyszłe kierunki
Claude Opus 5.5 jest już dostępny na wszystkich platformach, w tym Amazon Web Services, Google Cloud i Microsoft Azure. Deweloperzy korzystający z platformy Claude mogą uzyskać do niego dostęp za pomocą identyfikatora modelu claude-opus-5-5. Anthropic planuje również bardziej rygorystyczne monitorowanie środowisk uczenia ze wzmocnieniem, ponieważ wadliwe środowiska treningowe są głównym źródłem niewłaściwego zachowania modeli. Firma pracuje nad lepszymi nagrodami za dopasowanie, automatycznymi sposobami tworzenia scenariuszy treningowych bezpieczeństwa oraz silniejszymi środkami bezpieczeństwa i monitorowania.
Premiera Claude Opus 5.5 stanowi znaczący krok w ewolucji modeli językowych, łącząc zaawansowane możliwości z większą dostępnością i naciskiem na bezpieczeństwo. W obliczu rosnącej debaty na temat tempa rozwoju AI i potrzeby standardów bezpieczeństwa, Anthropic pozycjonuje się jako lider odpowiedzialnych innowacji, dążąc do wyznaczenia wyższych standardów dla modeli, które mogą zautomatyzować badania nad AI. To podejście, w połączeniu z konkurencyjną ceną i ulepszoną komunikacją, może znacząco wpłynąć na adopcję zaawansowanych modeli AI w różnych branżach, jednocześnie promując bezpieczniejszy rozwój technologii.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

OpenAI wzywa do międzynarodowych standardów dla samodoskonalącej się sztucznej inteligencji
OpenAI apeluje o globalne regulacje dotyczące zaawansowanych systemów AI, zwłaszcza tych zdolnych do samodoskonalenia. Firma podkreśla potrzebę bezpieczeństwa, zanim takie technologie staną się powszechne.
Redakcja Aigest5 godz. temu

Raport ONZ o kontroli nad AI to dzwonek alarmowy dla każdego z nas
Pierwszy raport panelu naukowego ONZ ds. AI sygnalizuje poważne ryzyko utraty kontroli nad autonomicznymi agentami AI. To nie science fiction, a realne wyzwanie, które musimy potraktować poważnie.
Michał Chmielarz12 godz. temu
NVIDIA prezentuje SoL-Pi: pętle auto-badawcze redukujące ruch tokenów agenta kodującego nawet o 49%
Badacze z NVIDII wprowadzili SoL-Pi, zestaw mechanizmów dla agenta kodującego Pi, które znacząco obniżają zużycie tokenów i koszty API, zachowując wysoką wydajność.
Redakcja Aigest15 godz. temu
SpaceXAI prezentuje Grok 4.7: Większy model bazowy w niezmienionej cenie
SpaceXAI wprowadziło na rynek Grok 4.7, swój nowy flagowy model AI, który oferuje większą bazę i dłuższy cykl uczenia wzmocnionego, zachowując jednocześnie dotychczasową cenę i szybkość działania.
Redakcja Aigest16 godz. temu

Twórca oMLX, Jun Kim, dołącza do Hugging Face, by wspierać społeczność MLX
Jun Kim, twórca i główny opiekun oMLX, dołączył do zespołu Hugging Face. Jego celem jest dalszy rozwój projektu oMLX oraz wspieranie szerszej społeczności MLX, szczególnie w kontekście lokalnej sztucznej inteligencji na
Redakcja Aigest20 godz. temu
Transformers integruje kwantyzację llama.cpp, przyspieszając wnioskowanie LLM
Hugging Face ogłosiło integrację kwantyzacji llama.cpp z biblioteką Transformers, co znacząco przyspiesza wnioskowanie dużych modeli językowych (LLM) na procesorach CPU. Umożliwia to efektywne uruchamianie skwantyzowanyc
Redakcja Aigest20 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.