SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Wydanie · Tydzień 38 · 14–20 września 2026

Archiwum wydań →

Agent coraz rzadziej dostaje przymiotniki, a coraz częściej konkretne liczby i pliki w waszym repozytorium: reguła lintera wymienia dostępne rozmiary, DESIGN.md podaje paletę i skalę, auth.md warunki rejestracji. To, co zostało w prompcie, nowy model wykonuje dosłownie.

Premiera / Narzędzie · 16

Droższy model prowadzący ścina rachunek za całą sesję o 9% Premiera / Narzędzie

Droższy model prowadzący ścina rachunek za całą sesję o 9%

5 min

Cognition posadziło na czele Fusion droższy model, Fable 5, i sesje wyszły średnio o 9% taniej, bo prowadzący rzadziej przerabiał zadania po tańszym pomocniku. Na DeepSWE 1.1 para oddaje 1,2 punktu z 64,3 i ścina rachunek o 46%, ale przy migracji kodu traci 6,4 punktu i oszczędza tylko 20%. Wniosek Cognition brzmi prosto: modele i otaczające je harnessy wycenia się po cenie za zadanie, a nie po cenie za token. Tyle że SWE-2 nie ma ani otwartych wag, ani API, więc sprawdzisz to wyłącznie wewnątrz Devina.

Factory warte 5 miliardów, a zaczyna od sprawdzenia twojego repozytorium Premiera / Narzędzie

Factory warte 5 miliardów, a zaczyna od sprawdzenia twojego repozytorium

4 min

Factory zebrało 15 września 200 milionów dolarów przy wycenie 5 miliardów, a jeszcze w kwietniu firma była warta 1,5 miliarda. Zanim jej agenty Droids dotkną kodu, platforma żąda raportu gotowości i prześwietla nie model, tylko twoje repozytorium: układ plików, opisy i zabezpieczenia. Pieniądze idą za maszynerię dookoła modelu, czyli wybór kontekstu, narzędzia do uruchomienia testów i pętlę, w której agent poprawia kod po własnej wywrotce. Lepszym sprawdzianem niż wycena są minuty, które nad przeglądem spędzają twoi najbardziej doświadczeni ludzie.

Anthropic połączył Cowork z czatem i dołożył do tego Docs oraz Slides Premiera / Narzędzie

Anthropic połączył Cowork z czatem i dołożył do tego Docs oraz Slides

4 min

Od 16 września Cowork znika jako osobna zakładka, bo Anthropic zszył go z czatem w jedno okno, a do tej samej rozmowy wprowadziły się Claude Docs i Claude Slides z eksportem do PowerPointa. Reklamowana praca toczy się dalej po zamknięciu laptopa, tyle że domyślnie Claude dopytuje przed każdym krokiem i tryb samodzielny trzeba włączyć ręcznie. Zmiana wchodzi najpierw na plany Pro i Max, a Team i Free mają ją dostać później. Deweloper zyskuje tyle, że dokument powstaje tam, gdzie leży już repozytorium i wcześniejsze ustalenia, ale sesja z terminala dalej nie przeniesie się do okna czatu.

Dwa lata notowań w Claude Code bez klucza do API Premiera / Narzędzie

Dwa lata notowań w Claude Code bez klucza do API

3 min

TradingView uruchomił 16 września publiczną betę serwera MCP, dzięki czemu asystent sięga po notowania i raporty spółek z twojego konta, bez osobnego klucza do API i bez eksportu do CSV. Konfiguracja sprowadza się do wklejenia jednego adresu i zalogowania, a dostęp mają płacący klienci od planu Essential w górę. Z ośmiu pokazanych zastosowań warsztat zmienia jedno: w Claude Code model sam pobiera dwa lata notowań bitcoina, pisze analizę i rysuje wykres korelacji. Dane są jednak opóźnione, a dobowy limit zapytań ucina wszystko, co miałoby reagować na rynek.

Agent psuje wam przyciski, bo błąd nie mówi mu, co zrobić Premiera / Narzędzie

Agent psuje wam przyciski, bo błąd nie mówi mu, co zrobić

4 min

@shadcn/lint, wtyczka ekipy shadcn/ui do ESLinta, zamienia komunikat błędu w kanał, którym dowozicie agentowi zasady systemu projektowego. Zamiast samego "tak nie wolno" reguła tłumaczy, że Button sam pilnuje odstępów, i wymienia rozmiary dostępne w waszym repozytorium, dzięki czemu model nie musi zgadywać. W przebiegach autora Opus 5 zostawił 42 naruszenia na osiem zadań, a GPT 5.6 Terra aż 117, choć po rundzie poprawek z podpowiedziami lintera każdy schodził do zera. Linter czyta jednak tylko nazwy klas CSS, więc formularza, przez który nie da się przejść tabulatorem, i tak nie wyłapie.

Archiwum prawdziwych stron, które agent czyta, zanim napisze interfejs Premiera / Narzędzie

Archiwum prawdziwych stron, które agent czyta, zanim napisze interfejs

4 min

Inspo to serwer MCP, który daje agentowi archiwum 2320 zrzutów z 832 prawdziwych witryn, a do każdej dokłada plik DESIGN.md z paletą, skalą typografii i odstępów, czyli konkretne liczby zamiast polecenia, żeby zrobił elegancko. Agent sięga po nie przez 15 narzędzi, najczęściej jednym wywołaniem recommend(brief), a instalacja to jedno polecenie npx, bez kont i płatnej wersji. Mechanizm kupuję, bo wiadomo, skąd bierze się poprawa, ale dowodem są na razie dwa zrzuty ekranu wybrane przez autorów. Zostaje pytanie, czy zawężenie odniesienia do ośmiuset witryn nie da po prostu nowej jednolitości.

Google wystawiło inteligentny dom na MCP i od razu zabroniło agentom otwierać drzwi Premiera / Narzędzie

Google wystawiło inteligentny dom na MCP i od razu zabroniło agentom otwierać drzwi

4 min

Google wystawiło 16 września serwer MCP dla Google Home, więc dowolny agent obsługujący ten standard dostaje listę urządzeń, ich stany, historię zdarzeń i prawo do wydawania komend. Otwarcia zamka zabrania sam serwer, a nie instrukcja dla modelu, a twarze z kamer Nest wymagają osobnej zgody menedżera domu. Wejście kosztuje projekt w Google Cloud, własny klient OAuth i 20 dolarów miesięcznie za Home Premium Advanced, na razie tylko w Stanach. To warstwa dla twórców cudzych produktów, a nie funkcja dla mieszkańca, i buduje ją firma, która wygasiła już pięć platform inteligentnego domu.

WorkOS chce, żeby agent zakładał konto za ciebie, bez formularza Premiera / Narzędzie

WorkOS chce, żeby agent zakładał konto za ciebie, bez formularza

4 min

WorkOS wypuścił auth.md, otwarty protokół, w którym aplikacja kładzie u siebie zwykły plik Markdown i opisuje w nim, na jakich zasadach przyjmuje rejestracje od agentów, podobnie jak robots.txt opisuje indeksowanie. Do wyboru są dwie ścieżki: dostawca tożsamości podpisuje zaświadczenie, że za agentem stoi konkretny człowiek, albo użytkownik zatwierdza kod we własnej przeglądarce, jak przy parowaniu telewizora. Obie kończą się tokenem OAuth przypisanym do człowieka, więc w audycie zostaje ślad zamiast wspólnego konta technicznego. Na liście wdrożeń nie ma jednak na razie ani jednej aplikacji.

Po co budować własną pętlę agenta, skoro OpenAI poprowadzi ją za ciebie? Premiera / Narzędzie

Po co budować własną pętlę agenta, skoro OpenAI poprowadzi ją za ciebie?

4 min

OpenAI wyjęło z Codexa całą warstwę, która prowadzi agenta, i 10 września wystawiło ją jako Agents API w publicznej becie: podajesz zadanie, model i narzędzia, a pętlę prowadzi już ktoś inny. Sam harness nic nie kosztuje, płacisz za tokeny i czas kontenera, a ten najgrubszy, z 64 GB pamięci, wychodzi 5,76 dolara za godzinę pracy agenta. Jest jeden warunek: dane zostają w Stanach Zjednoczonych nawet wtedy, gdy kod wykonujesz u siebie, bo stan sesji i tak leży po stronie OpenAI. Czytam to jako wynajem, nie fundament, tym bardziej że kod harnessu Codexa leży otwarty na GitHubie.

Drugie okno terminala, w którym widać pracę agenta linia po linii Premiera / Narzędzie

Drugie okno terminala, w którym widać pracę agenta linia po linii

3 min

Odpalasz livediff w drugim oknie terminala i od tej chwili widzisz każdy zapis pliku na bieżąco, jako zwykły diff Gita, zamiast zsumowanego stanu, który pokazuje watch git diff. Liczy się kolejność: wyłapujesz moment, w którym agent poprawia funkcję, po 20 sekundach cofa własną poprawkę i pisze ją trzeci raz zupełnie inaczej. Narzędzie śledzi wyłącznie pliki znane Gitowi, więc build ani dociągane zależności nie zasypują okna tysiącem linii. Nie wie za to, kto zmianę wprowadził, i nie pokaże niczego sprzed uruchomienia.

Sprzątanie miliona linii kodu za 19 300 dolarów. Regresje wyłapali ludzie. Premiera / Narzędzie

Sprzątanie miliona linii kodu za 19 300 dolarów. Regresje wyłapali ludzie.

4 min

Nous Research puściło 1393 wykonawców swojego agenta Hermes na milion linii Pythona i w 19 godzin, za jakieś 19 300 dolarów w tokenach, skróciło kod o 34,4%. Kontrole oparto na tym, co maszyna porówna sama: niezmieniony schemat JSON narzędzi, wynik polecenia z flagą help bajt w bajt i zamrożoną listę testów, które sypały się już wcześniej. Dwóch regresji to nie złapało, bo agenty wycięły publiczne nazwy potrzebne wtyczkom i w około 65 miejscach zmieniły obsługę błędów, a wyłapały je dopiero dwie rundy przeglądu przez społeczność open-source.

OpenAI zabiera GPT-5.5 i nie zostawia furtki dla spóźnialskich Premiera / Narzędzie

OpenAI zabiera GPT-5.5 i nie zostawia furtki dla spóźnialskich

4 min

Od 14 października GPT-5.5 przestaje odpowiadać w ChatGPT i w Codexie na wszystkich planach, ale wywołania przez API OpenAI działają dalej, więc zacznij od sprawdzenia, którędy twoje zadania wołają model. Podmiana na gpt-5.6-sol zajmuje chwilę, gorzej z miejscami, których nikt nie ogląda: zadaniem wrzuconym kiedyś do harmonogramu albo krokiem w CI z flagą --model gpt-5.5, bo takie wywołanie nie przełączy się po cichu, tylko wróci błędem. Sol jest o jedną trzecią tańszy na tokenach wyjściowych od modelu, który znika, tyle że ta promocyjna stawka obowiązuje tylko do 21 listopada.

Agent przeszedł pilotaż. Co zrobi, gdy w połowie biegu wygaśnie klucz dostępu? Premiera / Narzędzie

Agent przeszedł pilotaż. Co zrobi, gdy w połowie biegu wygaśnie klucz dostępu?

4 min

Diagrid wydał 17 września pięć kryteriów gotowości produkcyjnej dla agentów: wznawianie od miejsca awarii, dostęp, który nie wygasa w połowie biegu, idempotentność, kontrola tego, co oddaje model, i trwały zapis przebiegu. Każde jest pytaniem, na które odpowiada się logami, a nie akapitem w dokumencie projektowym. To klasyczne wzorce systemów rozproszonych, z jedną różnicą: ponowiony krok agenta może wybrać inne narzędzie i inny plan, więc nie jest tą samą operacją. Tyle że Diagrid sprzedaje dokładnie tę warstwę uruchomieniową, a kryteria wyszły komunikatem prasowym bez jednej liczby.

Agent-Reach nie czyta za ciebie internetu, tylko pilnuje, którędy da się do niego wejść Premiera / Narzędzie

Agent-Reach nie czyta za ciebie internetu, tylko pilnuje, którędy da się do niego wejść

4 min

Agent-Reach, projekt jednego dewelopera, przez dobę wisiał na szczycie trendów GitHuba, choć sam nie pobiera ani jednej strony: trzyma uporządkowaną listę dróg dostępu do każdej platformy, z wariantami zapasowymi. Gdy w czerwcu Bilibili zaczęło odpowiadać kodem 412 na zapytania yt-dlp, wystarczyło przestawić kanał na bili-cli. Sześć kanałów działa bez konfiguracji, ale Reddit i X wymagają oddania skryptowi ciasteczka z zalogowanej sesji, więc autor radzi używać konta pomocniczego. Kupujesz tu czyjąś uwagę, bo gdy autor przestanie testować, lista dalej poda martwe drogi jako pierwszy wybór.

Cloudflare otworzył swojego audytora bezpieczeństwa i zabronił mu wierzyć samemu sobie Premiera / Narzędzie

Cloudflare otworzył swojego audytora bezpieczeństwa i zabronił mu wierzyć samemu sobie

4 min

Cloudflare wyłożył na GitHubie security-audit-skill, zestaw instrukcji na licencji MIT, który zamienia agenta kodującego w zespół audytorów, gdzie ten, kto znalazł dziurę, nie ma prawa jej potwierdzić, bo do sprawdzenia rusza świeży agent z zadaniem odwrotnym: obalić ustalenie. Pilnuje tego rejestr pokrycia i walidator w Node, dzięki czemu nic nie trafia do wyników bez wskazania miejsca w kodzie, a bez piaskownicy audyt kończy się na hipotezach. Pojedynczy bieg znajduje mniej więcej połowę tego, co wszystkie razem, więc to raczej dodatkowa para oczu przed wydaniem niż bramka w CI.

Fork Claude Code, który zdradza się już pierwszą zmienną środowiskową Premiera / Narzędzie

Fork Claude Code, który zdradza się już pierwszą zmienną środowiskową

4 min

OpenClaude to fork Claude Code, który po ustawieniu zmiennej CLAUDE_CODE_USE_OPENAI kieruje tego samego terminalowego agenta do ponad 20 dostawców modeli, z lokalną Ollamą włącznie, więc próg wejścia spada do zera. Narzędzia do plików, strumieniowanie i MCP zostają nietknięte, zmienia się tylko to, kto odpowiada po drugiej stronie. README przyznaje, że jakość pracy narzędziami zależy od wybranego modelu, a mniejsze modele lokalne gubią się w długich ciągach wywołań, czyli tam, gdzie agent ma pracować. Pochodzenie zdradza flaga tengu_hive_evidence, od wewnętrznej nazwy kodowej Claude Code.

Model / Badania · 5

Gemini 3.8 Live mówi dalej, kiedy myśli Model / Badania

Gemini 3.8 Live mówi dalej, kiedy myśli

4 min

Google wypuścił 15 września dwa modele głosowe, Gemini 3.8 Live do taniej obsługi dużego ruchu i wersję Extended Thinking, która rozumuje i mówi równocześnie, dzięki czemu rozmowa nie zamiera na czas wywołania narzędzia. Extended Thinking prowadzi w rankingu jakości rozmów Artificial Analysis z wynikiem 82,6 punktu, ale w bankowym wariancie testu agentowego τ-Voice domyka tylko 35,1% spraw, czyli dwie na trzy nie dochodzą do finału. Cennika Google nie podał, a przy rozmowie na żywo płaci się za godziny dźwięku, więc akurat ta liczba decyduje o sensie agenta na infolinii.

DeepSeek wygasza własnego flagowca, bo tańszy model wypada lepiej Model / Badania

DeepSeek wygasza własnego flagowca, bo tańszy model wypada lepiej

3 min

DeepSeek od zeszłego poniedziałku przekierowuje ruch z flagowego V4-Pro na tańszy V4.1-Flash i rozlicza go po niższych stawkach, więc w konfiguracji masz jeden model, a odpowiada inny. Firma tłumaczy to wynikami: 90,6 punktu na Terminal-Bench 2.1, prawie dwa oczka przed GPT-5.6 Sol i trzy przed własnym V4-Pro, przy pamięci ściętej z 3514 do 890 bajtów na token. Przy agencie, który pracuje godzinami nad jednym zadaniem, to właśnie pamięć bywa największą pozycją rachunku, więc czterokrotna oszczędność waży więcej niż miejsce w rankingu. Tyle że tabelkę mierzył sprzedawca, a wyboru już nie ma.

Model mieści się na laptopie, ale nie uruchomisz go na zwykłym llama.cpp Model / Badania

Model mieści się na laptopie, ale nie uruchomisz go na zwykłym llama.cpp

3 min

PrismML wypuścił 17 września Bonsai 2 27B, czyli model Alibaby ściśnięty do 5,9 GB z deklarowaną stratą 1,8% na benchmarkach, bo każda waga przyjmuje w nim już tylko trzy wartości zamiast szesnastobitowej liczby. Brakujący punkt procentowy jest tu najmniej ciekawy: prawdziwą przeszkodą jest to, że główna gałąź llama.cpp tego formatu nie obsługuje, więc do czasu przyjęcia poprawki trzeba korzystać z forka PrismML. Domyślna instalacja waży zresztą 7,8 GB razem z modułem do obrazów, a długa rozmowa w oknie 256 tysięcy tokenów potrafi zająć w pamięci więcej miejsca niż sam model.

Model przepisuje 90% migracji i dostaje za to zero punktów Model / Badania

Model przepisuje 90% migracji i dostaje za to zero punktów

4 min

Google przebudował Android Bench od podstaw: zamiast drobnych poprawek mierzy zadania, nad którymi inżynier siedzi kilka dni, a wynik podaje jako ciągły wskaźnik ukończenia. Czołówka, która na poprzedniej wersji meldowała ponad 90%, zjechała do 28% dla prowadzącego GPT-6 Astra, czyli tą samą drogą co wcześniej przy SWE-Bench Pro. Przepisywanie z Javy na Kotlina modele robią gładko, ale przeniesienia aplikacji wieloplatformowej na natywnego Androida nie domknął żaden. Oceniany jest przy tym model razem z harnessem, więc różnica między wierszami tabeli nie musi być różnicą między modelami.

Jedenaście plików GGUF i ani jednego pomiaru Model / Badania

Jedenaście plików GGUF i ani jednego pomiaru

4 min

Empero wrzucił na Hugging Face destylat Qwen3.8-35B-A3B w wersjach od 12,6 GB po pełne 71 GB, a zalecany czterobitowy plik waży 21,7 GB i mieści się na karcie z 24 GB pamięci albo w 32 GB RAM-u. Przy każdym tokenie pracuje tylko około 3 miliardów z 35 miliardów wag, dzięki czemu odpowiedzi lecą szybciej, niż sugeruje rozmiar, ale cały plik i tak musi wejść do pamięci, bo router sięga w każdej chwili po dowolny z 256 fragmentów. Karta nie podaje ani jednego pomiaru, więc dopóki nie przepuści tego ktoś przez niezależny benchmark, destylacja pozostaje zapowiedzią wydawcy, a nie faktem.

Bezpieczeństwo · 2

Poradnik / Praktyka · 4

Instrukcje pisane pod słabszy model dziś kosztują cię kontekst Poradnik / Praktyka

Instrukcje pisane pod słabszy model dziś kosztują cię kontekst

4 min

OpenAI przekonuje deweloperów, że instrukcje pisane pod słabszy model przy GPT-6 Astrze zaczynają działać przeciwko tobie, bo zjadają kontekst i ciągną agenta tam, gdzie już go nie chcesz. Stąd rada, żeby skrócić opisy skilli, zamienić rozdęty AGENTS.md w drogowskaz do reszty i wyciąć przepisy krok po kroku, z którymi Astra radzi sobie sama. Mocne "pytaj, zanim cokolwiek zrobisz" zostawiam tam, gdzie jest, bo nadgorliwy agent kosztuje 30 sekund, a przekonany o własnej racji cały wieczór odkręcania. A skille w repozytorium sterują też agentami współpracowników, którzy pracują na innym modelu.

Opus 5 bierze "bądź zachowawczy" dosłownie i przemilcza część błędów Poradnik / Praktyka

Opus 5 bierze "bądź zachowawczy" dosłownie i przemilcza część błędów

4 min

Anthropic ostrzega w przewodniku po promptowaniu Opus 5, że dopisane kiedyś do promptu "bądź zachowawczy" nowy model bierze dosłownie i razem z hałasem przemilcza część prawdziwych błędów. Parametr effort tnie czas myślenia, ale nie długość odpowiedzi, więc o zwięzłość trzeba poprosić wprost. Przy wyłączonym myśleniu model potrafi napisać coś, co wygląda na wywołanie narzędzia, choć nic się nie uruchomiło, a taki zapis zostaje w historii rozmowy i kolejne tury czytają go jak fakt. Bezpieczniej zostawić myślenie włączone i ciąć koszt niższym ustawieniem effort.

Recenzent nie pomylił się ani razu i to był problem Poradnik / Praktyka

Recenzent nie pomylił się ani razu i to był problem

5 min

Automatyczny recenzent Codex w projekcie AgentCoop nie pomylił się ani razu, a mimo to sześć rund recenzji rozdęło funkcję z 28 do 42 linii, bo zasada „każda uwaga załatwiona przed mergem” po cichu zmieniła się w „każdą poprawiamy”, a tak kończyło się 91% uwag. Zespół odpowiedział procedurą liczącą koszt w godzinach zamiast etykietek P1 i P2 oraz skryptem chain-check, który zatrzymuje pracę, gdy dwie rundy z rzędu trafiają w kod napisany pod wcześniejszą uwagę tego samego recenzenta. Arytmetyki nie kupuję, ale ktoś wreszcie spisał drugą stronę rachunku, czyli to, co naprawdę traci użytkownik.

Trzy wymagania, dwie asercje i poprawka, która wygląda poprawnie Poradnik / Praktyka

Trzy wymagania, dwie asercje i poprawka, która wygląda poprawnie

4 min

Poprawka jednym warunkiem zapala dwie asercje na zielono, ale kasuje trzeci punkt kontraktu, bo Python traktuje None i pustą listę tak samo. Człowiek taki wynik najwyżej przeoczy, natomiast agent naprawczy zbiega do testu zamiast do wymagania, więc odwrotnie napisana asercja potrafi go skłonić do zepsucia działającego kodu. W preprincie ExecCritic ten sam agent rozwiązywał 61,2% zadań z SWE-bench Verified, a ze słabszymi wygenerowanymi testami osuwał się do 57,3%, przy nierównych budżetach obliczeniowych. Stąd jedno pytanie do każdego testu: którą błędną implementację odrzuci.

Analiza / Opinia · 3

AI oszczędza 13 godzin tygodniowo, z których nie wraca ani jedna Analiza / Opinia

AI oszczędza 13 godzin tygodniowo, z których nie wraca ani jedna

4 min

Ankieta BairesDev za trzeci kwartał 2026 pokazuje, że AI oszczędza programistom już 13 godzin tygodniowo zamiast siedmiu rok temu, tylko że, jak przyznaje Darren Shimkus, nie wróciła z nich ani jedna. Godziny przeszły na przeglądanie kodu z modelu, szukanie w nim błędów i naukę narzędzi, która zjada dziś dziewięć godzin tygodniowo. Co najmniej połowę kodu oddaje maszynie 42% badanych, ponad trzy razy więcej niż rok wcześniej, a 58% czuje większą odpowiedzialność za kod, którego samo nie napisało. Ankietę zamówiła firma wynajmująca programistów, więc procenty czytałbym jako odczyt tendencji.

Agenty lepiej łatają cudzy kod, niż dopisują brakującą funkcję Analiza / Opinia

Agenty lepiej łatają cudzy kod, niż dopisują brakującą funkcję

3 min

Claude Opus 4.5 zamyka 74,4% zadań na SWE-bench, a na nowym benchmarku FeatureBench dowozi 11%, choć model jest ten sam i zmieniło się tylko to, o co go poproszono. Qixing Zhou i współautorzy, w pracy zgłoszonej na ICLR 2026, wycięli z 24 repozytoriów open-source kod stojący za wybranymi testami, tak że agent ma odtworzyć brakującą funkcję bez wskazanego miejsca i bez gotowych granic zmiany. Agenty domykają pętlę, którą ktoś już otworzył i opisał, a dużo gorzej radzą sobie z wykrojeniem zadania od zera. Ostrożnie z tą liczbą, bo trudność dziur ustawia sam twórca benchmarku.

Agenty gubią się w cudzym systemie, nie w składni Analiza / Opinia

Agenty gubią się w cudzym systemie, nie w składni

4 min

Real-SWE mierzy agenty na produkcyjnym kodzie licencjonowanym od prawdziwych firm, którego nie było w danych treningowych, i wyszło z tego 640 przebiegów ze średnią 26,9%, przy najlepszym wyniku 38,8% dla Fable 5.1 w Claude Code. Z 468 porażek tylko 5,1% to zepsuty kod, a 40,6% to pominięty wymóg, czyli instrukcja, której agent nie doczytał do końca. Kolejność w tabeli i tak niewiele znaczy, bo przedziały ufności czołówki nachodzą na siebie, a każdy model biegł w harnessie swojego producenta. Jedyna liczba, która cokolwiek rozstrzyga, to ta zmierzona na twoim repozytorium.