Model / Badania
Sonnet 5 czy Opus 4.8? Nowy domyślny model Anthropica zmienia rachunek
Anthropic wypuścił 30 czerwca Claude Sonnet 5 i od razu uczynił go domyślnym modelem dla kont darmowych i Pro. Na papierze jest tańszy od Opusa 4.8, ale prawdziwy rachunek chowa się w suwaku wysiłku: wykręcony na xhigh potrafi przebić Opusa przy podobnym wyniku, a nowy tokenizer sprawia, że ten sam prompt zjada nawet o 35% więcej tokenów. Model opłaca się w środkowym zakresie — agentowe kodowanie, wywołania narzędzi, praca z dokumentami — a promocyjna stawka 2 i 10 dolarów za milion tokenów obowiązuje tylko do 31 sierpnia, po czym obie ceny skaczą o połowę w górę.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 4 min ·
Anthropic wypuścił 30 czerwca Claude Sonnet 5 i od razu zrobił z niego domyślny model dla kont darmowych i Pro. Brzmi jak zwykła aktualizacja średniej półki, dopóki nie policzysz, ile naprawdę zapłacisz za jego pracę. Firma reklamuje Sonneta 5 jako swój najbardziej agentowy model w tej cenie, czyli taki, który sam planuje zadanie, sam klika po przeglądarce i terminalu, po czym prowadzi wielokrokową robotę do końca bez ciągłego nadzoru. Cena za token faktycznie spadła. Ale to, czy Sonnet 5 naprawdę wychodzi taniej od mocniejszego Opusa 4.8, zależy od kilku rzeczy ukrytych poza samą stawką z cennika, a najważniejszą z nich jest jeden suwak, który łatwo przeoczyć.
W układance Anthropica Sonnet stoi w środku, nad tanim Haiku 4.5 i pod flagowym Opusem 4.8. Sonnet 5 zastępuje wersję 4.6 z lutego i, według producenta, bije ją na każdym opublikowanym teście. Na SWE-bench Pro, który sprawdza realne poprawki w prawdziwych repozytoriach, dostał 63,2%, o pięć punktów więcej niż poprzednik i o sześć mniej niż Opus 4.8. Na teście Humanity's Last Exam, zestawie wyjątkowo trudnych pytań z dziesiątek dziedzin rozwiązywanym z dostępem do narzędzi, sięga 57,4% i niemal dogania Opusa z jego 57,9%. Liczby pochodzą z materiałów Anthropica, więc traktuję je jako deklarację producenta, nie niezależny pomiar.
Za tymi wynikami stoi konkretna robota. Jeden z testerów kazał modelowi zbadać błąd w kodzie. Sonnet 5 sam napisał test, który ten błąd odtwarzał, potem wprowadził poprawkę, a na koniec cofnął własną zmianę, żeby upewnić się, że bez niej błąd faktycznie wraca. Całą tę sekwencję przeszedł za pierwszym podejściem, bez ani jednej dodatkowej podpowiedzi. Deweloperzy z CodeRabbit, firmy stojącej za narzędziem do automatycznego przeglądu kodu, zauważyli podobny nawyk: model najpierw pisze testy, a dopiero potem dokłada nową funkcję. To jest ta agentowa niezawodność, o którą Anthropic gra: dłuższe łańcuchy zadań bez gubienia kontekstu i sensowna reakcja, gdy wywołanie narzędzia padnie.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.