SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Sonnet 5 czy Opus 4.8? Nowy domyślny model Anthropica zmienia rachunek

Anthropic wypuścił 30 czerwca Claude Sonnet 5 i od razu uczynił go domyślnym modelem dla kont darmowych i Pro. Na papierze jest tańszy od Opusa 4.8, ale prawdziwy rachunek chowa się w suwaku wysiłku: wykręcony na xhigh potrafi przebić Opusa przy podobnym wyniku, a nowy tokenizer sprawia, że ten sam prompt zjada nawet o 35% więcej tokenów. Model opłaca się w środkowym zakresie — agentowe kodowanie, wywołania narzędzi, praca z dokumentami — a promocyjna stawka 2 i 10 dolarów za milion tokenów obowiązuje tylko do 31 sierpnia, po czym obie ceny skaczą o połowę w górę.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

Sonnet 5 czy Opus 4.8? Nowy domyślny model Anthropica zmienia rachunek
Ilustrację przygotowała AI.

Anthropic wypuścił 30 czerwca Claude Sonnet 5 i od razu zrobił z niego domyślny model dla kont darmowych i Pro. Brzmi jak zwykła aktualizacja średniej półki, dopóki nie policzysz, ile naprawdę zapłacisz za jego pracę. Firma reklamuje Sonneta 5 jako swój najbardziej agentowy model w tej cenie, czyli taki, który sam planuje zadanie, sam klika po przeglądarce i terminalu, po czym prowadzi wielokrokową robotę do końca bez ciągłego nadzoru. Cena za token faktycznie spadła. Ale to, czy Sonnet 5 naprawdę wychodzi taniej od mocniejszego Opusa 4.8, zależy od kilku rzeczy ukrytych poza samą stawką z cennika, a najważniejszą z nich jest jeden suwak, który łatwo przeoczyć.

W układance Anthropica Sonnet stoi w środku, nad tanim Haiku 4.5 i pod flagowym Opusem 4.8. Sonnet 5 zastępuje wersję 4.6 z lutego i, według producenta, bije ją na każdym opublikowanym teście. Na SWE-bench Pro, który sprawdza realne poprawki w prawdziwych repozytoriach, dostał 63,2%, o pięć punktów więcej niż poprzednik i o sześć mniej niż Opus 4.8. Na teście Humanity's Last Exam, zestawie wyjątkowo trudnych pytań z dziesiątek dziedzin rozwiązywanym z dostępem do narzędzi, sięga 57,4% i niemal dogania Opusa z jego 57,9%. Liczby pochodzą z materiałów Anthropica, więc traktuję je jako deklarację producenta, nie niezależny pomiar.

Za tymi wynikami stoi konkretna robota. Jeden z testerów kazał modelowi zbadać błąd w kodzie. Sonnet 5 sam napisał test, który ten błąd odtwarzał, potem wprowadził poprawkę, a na koniec cofnął własną zmianę, żeby upewnić się, że bez niej błąd faktycznie wraca. Całą tę sekwencję przeszedł za pierwszym podejściem, bez ani jednej dodatkowej podpowiedzi. Deweloperzy z CodeRabbit, firmy stojącej za narzędziem do automatycznego przeglądu kodu, zauważyli podobny nawyk: model najpierw pisze testy, a dopiero potem dokłada nową funkcję. To jest ta agentowa niezawodność, o którą Anthropic gra: dłuższe łańcuchy zadań bez gubienia kontekstu i sensowna reakcja, gdy wywołanie narzędzia padnie.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Anthropic domyka dystans Sonneta 5 do Opusa za jedną piątą ceny Model / Badania

Anthropic domyka dystans Sonneta 5 do Opusa za jedną piątą ceny

3 min

Claude Sonnet 5, wypuszczony przez Anthropic 30 czerwca, dobija do Opusa 4.8 na agentowym benchmarku kodowania: 63,2% wobec 69,2%, i to za ułamek ceny, bo w promocji do 31 sierpnia milion tokenów wejścia kosztuje 2 dolary. Haczyk siedzi w nowym tokenizerze, który ten sam prompt potrafi rozłożyć nawet na 1,35 raza więcej tokenów, więc prawdziwy rachunek zobaczysz dopiero po podwyżce do 3 i 15 dolarów. Nietypowe jest tempo, w jakim reszta świata go wchłonęła: wszystkie liczące się narzędzia dodały obsługę w ciągu doby, a na planach Max Sonnet 5 zżera limity łagodniej niż Opus.

Anthropic radzi w pierwszym akapicie, żeby zostać przy tańszym modelu Model / Badania

Anthropic radzi w pierwszym akapicie, żeby zostać przy tańszym modelu

5 min

Anthropic wypuścił 1 września Claude Fable 5.1 i już w pierwszym akapicie notatek o wydaniu poradził, żeby do większości zadań zostać przy tańszym Opusie 5. Cennik wejścia zostaje na 10 dolarach za milion tokenów, a prawdziwy koszt przesiadki leży w kodzie, bo model podpisuje bloki rozumowania stanem rozmowy i wycięcie starej tury czy odświeżenie daty w prompcie kończy się trwałym błędem 400. Nowe konta mają tę kontrolę domyślnie, starsze jeszcze nie, więc twój klucz może działać bez zarzutu, a pierwszy użytkownik z nowego konta zobaczy błąd, którego nigdy nie widziałeś.

Claude Opus 5.5 jest o 40% tańszy, ale obniżka kryje się w pamięci podręcznej Model / Badania

Claude Opus 5.5 jest o 40% tańszy, ale obniżka kryje się w pamięci podręcznej

3 min

Claude Opus 5.5 ma wyjść o 40% taniej niż Opus 5, ale cennik bazowy spadł tylko o 20%, a główna obniżka, aż o 60%, dotyczy odczytów z pamięci podręcznej, które przy agentach piszących kod stanowią większość rachunku. Resztę daje mniejsze zużycie tokenów, bo przy naprawie kodu liczącego 200 tysięcy linii Opus 5 spalił ich 2,5 raza więcej. Przed przesiadką sprawdziłbym, jak agent zniesie myślenie, którego nie da się już wyłączyć, oraz zachowane myślenie, które na nowych kontach API blokuje edycję historii rozmowy.