>_ NOWOŚCI AI

CLAUDE OPUS 5: MODEL, KTÓRY MYŚLI TYLE, ILE MU KAŻESZ

Anthropic wypuścił Claude Opus 5 w piątek 24 lipca 2026. Nie jest to najmocniejszy model firmy. Jest to model zbudowany po to, żeby używać go codziennie.

24.07.2026 · WYMIAR.AI · CZAS CZYTANIA 5 MIN

W skrócie

Opus 5 kosztuje dokładnie tyle, co Opus 4.8. Zbliża się do Fable 5 w większości zadań za połowę ceny. Pozwala dobierać poziom wysiłku do wartości pracy. Najważniejszą zmianą nie jest wyższy wynik w benchmarku. Jest nią lepszy wynik za ten sam budżet.

Ten tekst powstał na Opus 5. Nie jako ciekawostka – jako deklaracja metody. Wszystko, o czym piszemy, najpierw działa u nas.

Co się właściwie stało

Opus 5 jest dostępny od dziś na wszystkich platformach Anthropic. Cena: 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion wyjściowych. Dokładnie tyle, co poprzednik, Opus 4.8. Model wchodzi jako domyślny na planie Claude Max i najmocniejszy dostępny na Claude Pro.

Anthropic nie przedstawia Opus 5 jako swojego najmocniejszego modelu i warto rozumieć, jak ułożona jest ta drabina. Najwyżej stoi Mythos 5, udostępniony wyłącznie wąskiej grupie organizacji. Najmocniejszym modelem dostępnym publicznie pozostaje Fable 5, przeznaczony do wielodniowych, autonomicznych projektów. Opus 5 ma inne zadanie: zbliżyć się do tej klasy możliwości za połowę ceny i nadawać się do zwykłej, codziennej pracy.

To przesunięcie akcentu. Poprzednie premiery odpowiadały na pytanie „jak mądry jest model”. Ta odpowiada na pytanie „ile kosztuje jedno wykonane zadanie”.

Suwak wysiłku

Najważniejszy mechanizm tej premiery nie jest efektowny. To ustawienie effort – suwak, którym decydujesz, ile model ma myśleć przed odpowiedzią.

Sam suwak nie debiutuje razem z Opus 5. Anthropic wprowadził go wcześniej, a widać to nawet w materiale premierowym: jeden z partnerów porównuje wyniki do Opus 4.8 „na maksymalnym rozumowaniu”. Nowością jest to, że w tej premierze poziom wysiłku po raz pierwszy staje się główną osią całej opowieści o modelu. Anthropic pokazuje wyniki dla poziomów high, xhigh i max, a wykresy nie prezentują szczytowej wydajności, tylko wydajność przy danym koszcie.

Konsekwencja praktyczna jest prosta. Przestaje mieć znaczenie pytanie „jaki model wybrać”. Zaczyna mieć znaczenie pytanie „ile myślenia kupuję do tego konkretnego zadania”. Segregacja pracy przed jej zleceniem staje się umiejętnością, nie fanaberią.

Liczby, które warto znać

Wyniki podawane przez Anthropic w dniu premiery:

  • Frontier-Bench v0.1 – Opus 5 przebija wszystkie modele i ponad dwukrotnie poprawia wynik Opus 4.8, przy niższym koszcie na zadanie.
  • CursorBench 3.2 – przy maksymalnym wysiłku mieści się w granicy 0,5% szczytowego wyniku Fable 5, za połowę kosztu zadania.
  • ARC-AGI 3, test rozwiązywania nowych problemów – wynik trzykrotnie wyższy od kolejnego modelu.
  • OSWorld 2.0, obsługa komputera – przebija najlepszy rezultat Fable 5 za nieco ponad jedną trzecią kosztu.
  • Zapier AutomationBench, zadania biznesowe od początku do końca – około 1,5 raza wyższa zdawalność niż następny model przy tym samym koszcie. Nawet na najniższym ustawieniu wysiłku Opus 5 zalicza więcej zadań niż jakikolwiek inny model.

Relacje partnerów z wczesnego dostępu idą w tę samą stronę. Harvey, firma budująca AI dla prawników, raportuje wynik porównywalny z Opus 4.8 na maksymalnym rozumowaniu przy średnio 26% mniejszej liczbie generowanych tokenów. Fundamental Research Lab podaje przy trudnych zadaniach z modelowania finansowego średnio 9 punktów procentowych wyższą trafność, o jedną trzecią mniej tur i wywołań narzędzi oraz 60% krótszy czas. Box: 8% poprawy względem Opus 4.8 ogółem, 11% w analizie danych, 17% w due diligence.

Osobno warto odnotować warstwę bezpieczeństwa, bo rzadko trafia do nagłówków. Anthropic podaje, że w wewnętrznym audycie behawioralnym Opus 5 wypadł jako ich najlepiej dostosowany model dotychczas, z wynikiem 2,3 w skali zachowań niezgodnych – najniższym spośród ostatnich modeli.

Czego Anthropic nie mówi głośno

Trzy zastrzeżenia, bez których powyższe liczby są tylko materiałem marketingowym.

Pełnej niezależnej weryfikacji jeszcze nie ma

Tu trzeba rozdzielić dwie rzeczy, które łatwo skleić. Część benchmarków jest cudza – GDPval-AA prowadzi Artificial Analysis, Frontier-Bench również nie należy do Anthropic. Ale mierzenie się cudzą linijką to nie to samo, co oddanie tej linijki w obce ręce. Przypis pod głównym wykresem mówi wprost: wewnętrzny przebieg, własny harness, średnia z pięciu prób na zadanie. Reszta liczb pochodzi od firm z wczesnym dostępem, czyli od podmiotów zainteresowanych. Na dziś mamy mocny kierunek, nie zamknięty werdykt. Prawdziwe testy zaczynają się teraz, po publicznym udostępnieniu.

Bezpieczeństwo ma dwa różne wyniki, które łatwo skleić w jeden

Anthropic pisze, że Opus 5 zbliża się do Mythos 5 w znajdowaniu podatności w oprogramowaniu, ale pozostaje daleko w tyle w tworzeniu z nich działających exploitów. Różnica między jednym a drugim jest całą treścią komunikatu o ryzyku. W skrótach prasowych znika w pierwszej dobie.

Ta sama cena za token nie oznacza tego samego rachunku

Skoro poziom wysiłku podnosi zużycie tokenów, realny koszt zależy od tego, ile myślenia zamawiasz. Model tańszy w cenniku potrafi być droższy w miesiącu, jeśli wszystko puszczasz na maksimum.

Co z tego wynika dla ciebie

Jeśli używasz AI do pracy, a nie do zabawy, ta premiera zmienia jedną rzecz. Przewaga przestaje leżeć po stronie dostępu do najmocniejszego modelu. Zaczyna leżeć po stronie tego, czy wiesz, które zadanie wymaga pełnej mocy, a które załatwia ustawienie o dwa stopnie niżej.

To jest różnica między używaniem AI a posiadaniem systemu pracy z AI. Pierwsze polega na wpisywaniu poleceń w okno czatu i ocenianiu wyników na wyczucie. Drugie zaczyna się od pytania, jakiej klasy jest to zadanie, i dopiero potem dobiera narzędzie.

U nas ta zasada ma nazwę i miejsce w systemie: każde zadanie dostaje klasę mocy, zanim ktokolwiek zacznie je wykonywać. Nie dlatego, że to eleganckie. Dlatego, że bez tego płaci się maksymalną stawkę za pracę, która jej nie wymagała.

Nasza ocena

Opus 5 jest najlepszym modelem do codziennej pracy, jaki Anthropic udostępnił publicznie. Nie jest ich najmocniejszym modelem i firma tego nie ukrywa. Liczby premierowe są wiarygodne kierunkowo i niepotwierdzone niezależnie – do pierwszych zewnętrznych testów traktujemy je jako deklarację producenta.

Sprawdzimy go tak, jak sprawdzamy wszystko: na własnej pracy, na własnych zadaniach, z zapisanym wynikiem. Co z tego wyjdzie, opiszemy tutaj.

>_ ŹRÓDŁA

Anthropic, „Introducing Claude Opus 5″, 24.07.2026 – materiał pierwszej ręki: wszystkie liczby benchmarkowe, wyniki bezpieczeństwa i wypowiedzi partnerów. System Card Opus 5. Ewaluacja GDPval-AA. Kontekst rynkowy: VentureBeat, Fortune, CNBC, Yahoo Finance, 24.07.2026.

Wymiar.ai to polskie studio AI. Zamieniamy wiedzę i pomysły w produkty, chaos w procesy, a AI w realny system pracy. Wszystko, czego uczymy i co wdrażamy, najpierw działa u nas.

ZOBACZ PRODUKT WIĘCEJ WPISÓW