SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Ornith-1.0 chwali się, że bije Opus 4.7. Tabela pokazuje co innego

DeepReinforce wypuściło 25 czerwca rodzinę modeli Ornith-1.0 na licencji MIT i ogłosiło, że największy wariant 397B bije Claude Opus 4.7 na SWE-Bench Verified (82,4) i Terminal-Bench 2.1 (77,5). Ta sama tabela pokazuje jednak Opus 4.8 z wynikiem 87,6, czyli wyżej, więc marketing wybrał sobie starszy model do pokonania, a komentatorzy tacy jak Teortaxes uznali wyniki za podejrzane do czasu niezależnego testu. Realna stawka leży niżej: model z otwartymi wagami, którego wariant 9B chodzi na domowym pececie, trzyma dane u siebie i nie generuje rachunku za tokeny.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  5 min  · 

Ornith-1.0 chwali się, że bije Opus 4.7. Tabela pokazuje co innego
Ilustrację przygotowała AI.

DeepReinforce wypuściło 25 czerwca rodzinę modeli Ornith-1.0 i od razu sięgnęło po najgłośniejszy nagłówek, jaki dziś istnieje w branży: open-source, który bije Claude'a. W komunikacie firmy największy wariant, Ornith-1.0-397B, dostaje 82,4 na SWE-Bench Verified i 77,5 na Terminal-Bench 2.1, czyli wynik wyższy niż Claude Opus 4.7 na obu testach. SWE-Bench Verified to zestaw prawdziwych zgłoszeń błędów z projektów open-source, w którym model dostaje repozytorium i ma samodzielnie napisać poprawkę, która przejdzie testy. Terminal-Bench sprawdza to samo, tylko w terminalu: czy agent potrafi doprowadzić zadanie do końca, klikając po linii poleceń jak człowiek przy klawiaturze.

Brzmi to jak koniec pewnej historii. Tyle że ta sama strona, która ogłasza zwycięstwo nad Opusem 4.7, publikuje pełną tabelę, w której obok stoi już Opus 4.8 z wynikiem 87,6 na SWE-Bench Verified, a więc o ponad pięć punktów wyżej niż Ornith. Porównanie z 4.7 jest więc porównaniem z modelem o jedną generację starszym. Co więcej, nagłówek serwisu Digg, który rozniósł tę premierę dalej, głosi, że Ornith bije Opusa 4.8 "na SWE-Bench Pro", a w tej samej tabeli Opus 4.8 ma na SWE-Bench Pro 69,2 wobec 62,2 dla Ornith. Czyli przegrywa też tam. Marketing wybrał sobie jedną kolumnę i jeden, wygodnie starszy model do bicia.

Liczbom uwierzą ci, którzy je powtórzą. Reszta poczeka.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Anthropic schował najmocniejszego Claude'a za bramą Project Glasswing Analiza / Opinia

Anthropic schował najmocniejszego Claude'a za bramą Project Glasswing

4 min

Anthropic przyznał wprost, że Claude Opus 4.7 z 16 kwietnia ma celowo obniżone zdolności cyberbezpieczeństwa — pełna wersja trafia tylko do ośmiu firm Project Glasswing, w tym AWS-a, Apple'a i JPMorgana. Publiczny model skoczył na SWE-bench Pro z 53,4% do 64,3%, dostał poziom wysiłku xhigh i budżety zadań od 20 tysięcy tokenów. Migracja boli: nowy tokenizer liczy nawet 1,35 raza więcej, a Messages API odcina thinking.budget_tokens i niedomyślne temperature. Na BrowseComp Opus spadł z 83,7% do 79,3%, więc do syntezy z wielu źródeł GPT-5.4 Pro nadal wygrywa.

Pusta rubryka w tabeli IBM mówi więcej niż wynik 57 na SWE-Bench Model / Badania

Pusta rubryka w tabeli IBM mówi więcej niż wynik 57 na SWE-Bench

5 min

IBM wypuścił 25 sierpnia Granite 4.2 na licencji Apache 2.0, ale w tabeli wyników najmniejszy model, na 3 miliardy parametrów, ma pustą rubrykę na SWE-Bench Verified i Terminal-Bench 2.1, bo nie przeszedł agentowego etapu uczenia ze wzmocnieniem. Wersja 30B kończy na 57%, podczas gdy Claude Opus 4.5 ma tam 76,4%, a agenta realnie poprowadzi dopiero 8B, które po kwantyzacji mieści się w mniej więcej 16 GB pamięci karty. Mocniejszym argumentem niż benchmark jest tu licencja, tylko że jej obietnica zaczyna się od 8B w górę, a nie od modelu, który zmieści się na laptopie.

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów Model / Badania

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów

3 min

Alibaba wypuściła 23 kwietnia Qwen3.6-27B: gęsty model open-source, który na SWE-Bench Verified osiąga 77,2%, ustępując tylko Claude 4.5 Opus (80,9%), a na Terminal-Bench 2.0 remisuje z nim na 59,3%. Przy 15 razy mniejszej liczbie wag niż poprzedni flagowiec Alibaby mieści się w FP8 na karcie z 32 GB, a w kwantyzacji 4-bitowej schodzi na sprzęt konsumencki. Architektura z proporcją 3:1 na korzyść uwagi liniowej daje natywne okno 262 144 tokenów, a opcja preserve_thinking pozwala agentowi nieść ślad rozumowania przez kolejne tury.