Model / Badania
Anthropic domyka dystans Sonneta 5 do Opusa za jedną piątą ceny
Claude Sonnet 5, wypuszczony przez Anthropic 30 czerwca, dobija do Opusa 4.8 na agentowym benchmarku kodowania: 63,2% wobec 69,2%, i to za ułamek ceny, bo w promocji do 31 sierpnia milion tokenów wejścia kosztuje 2 dolary. Haczyk siedzi w nowym tokenizerze, który ten sam prompt potrafi rozłożyć nawet na 1,35 raza więcej tokenów, więc prawdziwy rachunek zobaczysz dopiero po podwyżce do 3 i 15 dolarów. Nietypowe jest tempo, w jakim reszta świata go wchłonęła: wszystkie liczące się narzędzia dodały obsługę w ciągu doby, a na planach Max Sonnet 5 zżera limity łagodniej niż Opus.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 3 min ·
Anthropic wypuścił 30 czerwca Claude Sonnet 5 i pierwszy raz cała reszta narzędzi nadążyła tego samego dnia. Sonnet to u Anthropica model ze średniej półki: tańszy i szybszy od topowego Opusa, a do tej pory wyraźnie od niego słabszy w zadaniach, w których model prowadzi całą robotę sam: planuje, klika po terminalu, poprawia własny kod i sprawdza, czy to w ogóle działa. Piątka ma ten dystans do Opusa 4.8 domknąć, i to za ułamek jego ceny.
Na sztandarowym benchmarku agentowego kodowania Anthropica Sonnet 5 dostaje 63,2%, podczas gdy Opus 4.8 ma 69,2%. Te sześć punktów różnicy to właśnie całe słynne "blisko Opusa": blisko, ale nie na styk. Cena za to nadrabia z nawiązką. W promocji do 31 sierpnia milion tokenów wejścia kosztuje 2 dolary, a po niej stawki idą o połowę w górę. Opus kosztuje wielokrotnie więcej, więc jeśli twoje zadanie mieści się w tych sześciu punktach, płacisz znacznie mniej za prawie to samo.
Najlepiej widać to w nudnej, wieloetapowej pracy, której nikt nie lubi. Jeden z partnerów testujących opisał, jak poprosił Sonneta 5 o zbadanie buga: model bez dodatkowej instrukcji napisał test odtwarzający błąd, wprowadził poprawkę, a potem odłożył ją na bok, żeby sprawdzić, czy bez niej błąd wraca, i zrobił to wszystko w jednym przebiegu. Anthropic chwali go też za brownfield, ten stary, zarośnięty kod, którego nikt nie chce dotykać: wyścigi między wątkami, ukryte testy, miejsca, gdzie trzeba naprawić przyczynę, a nie objaw. To są słowa firmy, która ten model sprzedaje, więc biorę je jak obietnicę, nie jak dowód. Ale opisują dokładnie tę robotę, przy której poprzednie Sonnety zwykle stawały w połowie.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.