Aigest.
Newsy

Anthropic wprowadza Claude Opus 5.5: niższy koszt, lepsza wydajność i bardziej naturalny język

Anthropic zaprezentował Claude Opus 5.5, nowy model AI, który dorównuje wydajnością Fable 5.1, oferując jednocześnie znacznie niższe koszty operacyjne i bardziej naturalny styl komunikacji.

RA

Udostępnij
Anthropic wprowadza Claude Opus 5.5: niższy koszt, lepsza wydajność i bardziej naturalny język
Fot. The Decoder

Anthropic ogłosił premierę Claude Opus 5.5, pierwszego modelu z nowej generacji, który ma dorównywać wydajnością Claude Fable 5.1, jednocześnie oferując znacznie niższe koszty i szybsze działanie. Firma zapowiada podobne ulepszenia w nadchodzących tygodniach dla modeli Claude Sonnet 5.5 i Haiku 5.5, koncentrując się na wydajności, efektywności i bezpieczeństwie. Według wewnętrznych testów Anthropic, nowy model Opus przewyższa zarówno Fable 5.1, jak i droższy GPT-6 Astra od OpenAI w większości zadań.

Optymalizacja kosztów i wydajności

Anthropic podkreśla, że nowa seria modeli jest odpowiedzią na uwagi klientów dotyczące kosztów, efektywności i jakości komunikacji, szczególnie w sektorach takich jak usługi finansowe, prawo i rozwój oprogramowania. Ceny za tokeny dla Opus 5.5 zostały obniżone o 20 procent w porównaniu do Opus 5, wynosząc 4 dolary za milion tokenów wejściowych i 20 dolarów za milion tokenów wyjściowych. Dodatkowo, koszty odczytu pamięci podręcznej zmniejszono o 60 procent.

Firma szacuje, że całkowite koszty operacyjne, uwzględniające zarówno ceny, jak i zużycie tokenów, będą niższe o około 40 procent w stosunku do Opus 5. Model zużywa mniej tokenów i generuje wyniki ponad 30 procent szybciej. Limity użytkowania dla subskrybentów, wynoszące pięć godzin, zostaną zwiększone o 20 procent, a dzięki niższym kosztom, Anthropic twierdzi, że te limity będą efektywniejsze o 25 procent. Użytkownicy zyskują również możliwość zachowania resetu limitu na moment, gdy będzie najbardziej potrzebny.

Konkurencja i benchmarki

Anthropic wykorzystuje benchmarki kodowania, aby udowodnić przewagę cenową i wydajnościową Opus 5.5. Na platformie FrontierCode model ma przewyższać GPT-6 Astra przy około 20 procentach kosztu zadania. Na Terminal-Bench 4.0 osiąga taką samą wydajność jak Astra, ale przy 40 procentach jej kosztów. Z kolei na CursorBench, Opus 5.5 pokonuje GPT-5.6 Sol o 11 punktów, kosztując jedną trzecią jego ceny. Obniżka cen jest reakcją na presję ze strony OpenAI oraz chińskich modeli AI, które oferują niższą wydajność, ale za ułamek ceny.

Niezależna platforma Artificial Analysis potwierdza wysoką wydajność Opus 5.5, przyznając mu 58 punktów w Artificial Analysis Intelligence Index – to najwyższy wynik w historii. Model prowadzi w sześciu z dziesięciu ocen, w tym w Humanity's Last Exam (61,4 procent) i SciCode (66,9 procent). Na Terminal-Bench 4.0, Opus 5.5 osiąga 59,6 procent, dorównując GPT-6 Astra i przewyższając Opus 5 o 11 punktów. Artificial Analysis wskazuje, że Opus 5.5 osiąga parytet z GPT-6 Astra na Terminal-Bench 4.0 i AutomationBench-AA, jednocześnie zwiększając przewagę w pracy agentowej wymagającej wiedzy. Na prywatnym benchmarku AA-Briefcase, Opus 5.5 osiąga Elo 1,822, co oznacza wzrost o 143 punkty w stosunku do Fable 5.1 i po raz pierwszy model Anthropic pokonuje GPT-5.6 Sol pod względem jakości prezentacji. Na GDPval-AA, benchmarku OpenAI dla pracy umysłowej, Opus 5.5 przewyższa Astrę we wszystkich trybach rozumowania z wyjątkiem niskiego.

Lepsza komunikacja i bezpieczeństwo

Opus 5.5 ma również komunikować się bardziej naturalnie niż poprzednie modele. Anthropic twierdzi, że model priorytetyzuje najważniejsze informacje, używa mniej żargonu i lepiej przestrzega instrukcji pisania. Wcześni testerzy opisali jego styl jako jaśniejszy i łatwiejszy do zrozumienia, co według Anthropic czyni go lepszym partnerem do długich sesji roboczych. Poprzednie modele Claude były krytykowane za ich formułowy i zawiły styl pisania, często nazywany „Claudish”.

Opus 5.5 to także pierwszy model Opus z zabezpieczeniami w obszarach cyberbezpieczeństwa, biologii i rozwoju granicznych LLM, które odpowiadają tym z Fable 5.1. W przypadku aktywacji tych zabezpieczeń, żądania są transparentnie przekierowywane do innego modelu. Anthropic planuje rozszerzyć swój program Cyber Verification Program na Opus 5.5 w nadchodzących tygodniach, a zweryfikowane organizacje mogą ubiegać się o wykorzystanie modelu do badań biologicznych poprzez Life Sciences Verification Program.

Model jest również wyposażony w mechanizmy znakowania wodnego, aby spełnić wymogi aktu o AI Unii Europejskiej. Nie może już działać z wyłączonym trybem „Thinking” i jest dostępny z funkcją Zero Data Retention. Anthropic wprowadza również środki przeciwko tzw. atakom destylacyjnym, które polegają na masowym wydobywaniu możliwości modelu przez cyberprzestępców. Opus 5.5 zawiera funkcję „Preserved Thinking”, zapobiegającą edycji kontekstu przez użytkowników API w celu ekstrakcji rozumowania modelu.

Dostępność i przyszłe kierunki

Claude Opus 5.5 jest już dostępny na wszystkich platformach, w tym Amazon Web Services, Google Cloud i Microsoft Azure. Deweloperzy korzystający z platformy Claude mogą uzyskać do niego dostęp za pomocą identyfikatora modelu claude-opus-5-5. Anthropic planuje również bardziej rygorystyczne monitorowanie środowisk uczenia ze wzmocnieniem, ponieważ wadliwe środowiska treningowe są głównym źródłem niewłaściwego zachowania modeli. Firma pracuje nad lepszymi nagrodami za dopasowanie, automatycznymi sposobami tworzenia scenariuszy treningowych bezpieczeństwa oraz silniejszymi środkami bezpieczeństwa i monitorowania.

Premiera Claude Opus 5.5 stanowi znaczący krok w ewolucji modeli językowych, łącząc zaawansowane możliwości z większą dostępnością i naciskiem na bezpieczeństwo. W obliczu rosnącej debaty na temat tempa rozwoju AI i potrzeby standardów bezpieczeństwa, Anthropic pozycjonuje się jako lider odpowiedzialnych innowacji, dążąc do wyznaczenia wyższych standardów dla modeli, które mogą zautomatyzować badania nad AI. To podejście, w połączeniu z konkurencyjną ceną i ulepszoną komunikacją, może znacząco wpłynąć na adopcję zaawansowanych modeli AI w różnych branżach, jednocześnie promując bezpieczniejszy rozwój technologii.

Źródło: the-decoder.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

OpenAI wzywa do międzynarodowych standardów dla samodoskonalącej się sztucznej inteligencji
Raport ONZ o kontroli nad AI to dzwonek alarmowy dla każdego z nas
NVIDIA prezentuje SoL-Pi: pętle auto-badawcze redukujące ruch tokenów agenta kodującego nawet o 49%
SpaceXAI prezentuje Grok 4.7: Większy model bazowy w niezmienionej cenie
Twórca oMLX, Jun Kim, dołącza do Hugging Face, by wspierać społeczność MLX
Newsy

Twórca oMLX, Jun Kim, dołącza do Hugging Face, by wspierać społeczność MLX

Jun Kim, twórca i główny opiekun oMLX, dołączył do zespołu Hugging Face. Jego celem jest dalszy rozwój projektu oMLX oraz wspieranie szerszej społeczności MLX, szczególnie w kontekście lokalnej sztucznej inteligencji na

Redakcja Aigest20 godz. temu

Transformers integruje kwantyzację llama.cpp, przyspieszając wnioskowanie LLM

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.