Analiza / Opinia
Tydzień 33 · 10–16 sierpnia 2026
Analiza / Opinia Który model do kodu? Tabela kosztów pokazuje cenę, nie odpowiedź
4 min
Netlify puściło jeden prompt, prostą wizytówkę kawiarni, przez 11 modeli i policzyło zużyte kredyty: od 2,4 przy DeepSeek V4 Flash do 519 przy Claude Opus 5, z jednym przebiegiem Opusa za 1055. Kusi, żeby odczytać z tabeli ranking i wziąć najtańszy model, ale test mierzył wyłącznie wygląd jednej strony, nie działający kod, a ocena była subiektywna. Kimi K3 wypada blado, bo jest zbudowany pod złożone zadania agentowe, nie pod rysowanie wizytówki. Wybór modelu jest empiryczny i zależy od zadania, więc tej tabeli nie da się przepisać jako gotowego rankingu.
Analiza / Opinia Największy skok w niszowym języku nie wziął się z nowszego modelu
4 min
Rok temu czołowe modele wykładały się na q, języku bazy kdb+, na której banki liczą na żywo strumienie notowań. Dziś agenty kodujące rozwiązują ponad 85% zadań z otwartego benchmarku QEval firmy KX, a Claude Fable 5 przekracza 95%. Największy skok nie wziął się jednak z nowszego modelu, tylko z pętli, w której agent odpala kod, ogląda błąd i poprawia się przez kilka tur, co podniosło skuteczność z około 50% do ponad 80%. Domenowe wskazówki dobiły resztę u słabszych modeli, najsilniejszym nie dały nic, a ostatnie kilkanaście procent, od architektury, wciąż broni się samo.
Tydzień 32 · 3–9 sierpnia 2026
Analiza / Opinia Praca z arXiv obiecuje tańszą pamięć agentów bez spadku dokładności
4 min
Nowa praca na arXiv, zgłoszona 23 lipca przez Gaurava Dadhicha z zespołu Maximem AI, przekonuje, że produkcyjne agenty zawodzą nie przez słabe rozumowanie, lecz przez brak panowania nad kontekstem: historią rozmowy, rozdętymi promptami i wynikami narzędzi. Najcenniejsza jest tu diagnoza kosztu: naiwne doklejanie historii rośnie kwadratowo, streszczanie na skróty tnie liniowo, ale ma swoje urwisko dokładności, a rozsądnym wyjściem jest kompresja z walidacją. Wyniki 92% na LongMemEval i 93,2% na LoCoMo firma zmierzyła jednak sama, na własnym produkcie Maximem Synap i bez punktu odniesienia.
Analiza / Opinia Twoje prompty od dawna są grafem, tylko nikt tego nie nazwał
3 min
Praca opublikowana 30 lipca na arXiv wprowadza pojęcie inżynierii grafu promptów i porządkuje słownictwo, w którym graf oznacza raz rozumowanie modelu, raz rozmowę agentów, a raz artefakt do orkiestracji. Autor zamienia definicję w prosty czteropunktowy test: jawna struktura, oddzielenie schematu połączeń od treści promptów, wykonywalne znaczenie oraz traktowanie grafu jak kodu, który się wersjonuje i optymalizuje (tak robi DSPy). Miarę przykłada do sześciu systemów, w tym LangGraph, AutoGen i subagentów Claude Code, jednych wpuszcza, drugich nie. To gotowa lista kontrolna na własny układ LLM.
Tydzień 31 · 27 lipca – 2 sierpnia 2026
Analiza / Opinia Poprawka w kodzie to jedno, działająca usługa w kontenerze to zupełnie inna liga
3 min
ABC-Bench, test opisany w Findings of ACL 2026, sprawdza agenty na pełnym cyklu pracy nad backendem: trzeba rozejrzeć się po repozytorium, postawić usługę w kontenerze i sprawić, żeby przeszła zewnętrzne testy API. Jie Yang i współpracownicy zebrali 224 praktyczne zadania z ośmiu języków i 19 frameworków, a nawet czołowe modele wypadają na nich słabo. Morał dla wyboru narzędzi jest prosty: dobry wynik na SWE-benchu nie znaczy, że agent postawi działającą usługę na produkcji, bo łatanie pojedynczych funkcji to co innego niż doprowadzenie backendu do stanu, w którym naprawdę wstaje i odpowiada.
Analiza / Opinia Autonomia agenta ma swoją cenę, liczoną w minutach i tokenach
4 min
Dwaj inżynierowie z IBM dali asystentowi kodu dokumentację LangChain4j i poprosili, żeby zbudował własną kopię, czyli działający system wielu agentów. Model sam wybrał wzorzec nadzorcy z czterema podwładnymi i odtworzył architekturę, na jakiej sam działa. Na słabszym gpt-4o system wpadł w pętlę i padł po 100 wywołaniach narzędzi, za to gpt-5-mini naprawił wszystkie cztery błędy w testowej klasie Calculator, a 11 testów przeszło na zielono. Druga, deterministyczna wersja oparta na workflow zrobiła to samo trzy razy szybciej, bo nie płaci za osobne wywołanie modelu przy każdej decyzji nadzorcy.
Analiza / Opinia Milion tokenów i 90 wywołań na jedno zadanie: jak w ogóle zmierzyć takiego agenta?
4 min
AgencyBench, benchmark z ACL 2026, mierzy agenty na zadaniach zbliżonych do całodziennej pracy: 138 zleceń, w których rozwiązanie jednego wymaga średnio 90 wywołań narzędzi i około miliona tokenów. Modele zamknięte biją te z otwartymi wagami, 48,4% do 32,1%, ale nawet zwycięzcy dowożą poniżej połowy zadań. Ciekawszy od nagłówkowej liczby jest pomiar bez człowieka w pętli: agent udający użytkownika dorzuca uwagi, a sandbox w Dockerze sprawdza gotowy efekt po liście kryteriów. Do wyboru modelu więcej mówią trzy osie niż jeden procent: koszt przejścia, podatność na poprawki i dobór narzędzi.
Tydzień 30 · 20–26 lipca 2026
Analiza / Opinia Otwarte modele kodują już jak zamknięte. Zatrzymuje je droga na produkcję.
4 min
Doroczny raport Mozilli o otwartym AI pokazuje, że różnica w jakości między najlepszymi otwartymi a zamkniętymi modelami skurczyła się średnio do 3,3%, a na samym kodowaniu modele się zrównały. Cała gra przenosi się teraz do harnessu, czyli warstwy dookoła modelu: na Terminal-Benchu te same wagi Anthropica dawały 79,8% z niezależnym harnessem i tylko 58% w firmowym Claude Code. Otwarte wagi tną też koszty, bo Stripe przeniósł 50 milionów dziennych wywołań na własną infrastrukturę i ściął rachunek o 73%.
Analiza / Opinia Który model wpiąć w agenta? Nowy test z ACL sprawdza to na realnej robocie
3 min
AgencyBench, praca z ACL 2026 autorstwa Keyu Li i Pengfei Liu, sprawdza modele na 138 zadaniach odwzorowujących wielogodzinną robotę z agentami, gdzie jedno zlecenie potrafi pochłonąć 90 wywołań narzędzi i milion tokenów. Modele zamknięte biją te z otwartymi wagami, 48,4% do 32,1%, ale nawet zwycięska grupa rozwiązuje poniżej połowy zadań, więc do powierzenia agentowi roboty bez nadzoru wciąż daleko. Dla wyboru modelu najwięcej mówią trzy osie: ile tokenów i wywołań model spala, czy nadrabia pod wpływem uwag i po jakie narzędzia sięga.
Analiza / Opinia Tanio napisać, drogo utrzymać: nowy rachunek kosztów w pracy z agentami
4 min
Dalia Abuadas, inżynierka z zespołu Copilota w GitHubie, przekonuje w eseju, że najdroższym krokiem przy drobnej prośbie o funkcję nie jest już napisanie kodu, tylko spotkanie o tym, czy go w ogóle pisać. Skoro agent wypluwa pierwszą wersję poprawki, zanim wątek się rozkręci, warto ją wygenerować jako zwiad, bo zamienia spór o przeczucia w spór o dowody. Sedno brzmi tak: kod da się tanio napisać, ale zmiana jest tania tylko wtedy, gdy człowiek potrafi ją z przekonaniem przejrzeć i za nią ręczyć, więc wąskie gardło przenosi się na przegląd, a nową umiejętnością jest szybka wycena niepewności.
Analiza / Opinia Trzy reakcje programistów na to, że kod pisze już AI
4 min
Guardian wypytał kilkunastu programistów o to, jak AI zmienia ich zawód. Samo pisanie kodu traci na wartości: Google przyznaje, że AI pisze już 75% jego kodu, a od premiery ChatGPT branża technologiczna w USA straciła ponad 600 tysięcy miejsc pracy. Reakcje są trzy: Matt pisze grę ręcznie, żeby nie stracić formy, George Dover po 400 zgłoszeniach przekwalifikował się na inżyniera nastawionego na AI, a Kaitlin Cort zakłada związki zawodowe dla zwalnianych. Każde z tych działań to próba znalezienia gruntu pod nogami, zanim rynek zdecyduje za człowieka.
Tydzień 29 · 13–19 lipca 2026
Tydzień 28 · 6–12 lipca 2026
Analiza / Opinia Self-Harness: agent czyta własne logi i sam łata swoje opakowanie
4 min
Self-Harness, opisany w pracy z arXiv z 8 czerwca, każe agentowi czytać własne logi z awarii i samodzielnie przepisywać reguły swojego opakowania w pętli: znajdź słabość, załataj, przepuść zmianę przez testy regresji. Na Terminal-Bench-2.0 największy skok zaliczył najsłabszy model, Qwen3.5, który z 23,8% doszedł do 38,1%, podczas gdy mocniejsze MiniMax M2.5 i GLM-5 podniosły się słabiej. Wygląda to więc na sposób, żeby tańszy albo hostowany lokalnie model podciągnąć do poziomu, na którym w ogóle nadaje się do roboty, choć zostaje pytanie, kto potem czyta reguły, które napisał model.
Analiza / Opinia Skąd wiesz, że twój recenzent kodu AI jest dobry? Wskaźnik akceptacji kłamie
4 min
DoorDash pokazuje, dlaczego popularny wskaźnik akceptacji uwag kłamie przy ocenie recenzentów kodu opartych na AI: nie policzy błędu, którego agent w ogóle nie zgłosił. Ich odpowiedzią jest DashBench, wewnętrzny benchmark odtwarzający 105 dawnych PR-ów i zestawiający adnotacje inżynierów, zgłoszenia recenzenta i osąd modelu-sędziego. Para Kimi K2.6 i Claude Fable 5 wyłapała najwięcej, 65,2% ważonej wykrywalności za 3,81 dolara na PR-a, ale jednego zwycięzcy nie ma: wybór zależy od tego, co bardziej boli, przeoczony krytyczny błąd, szum fałszywych alarmów czy rachunek.
Analiza / Opinia Prawie 100% na benchmarku, którego jedna trzecia nie działała
4 min
OpenAI w lutym namawiało branżę na SWE-bench Pro, a w lipcu wycofało własną rekomendację, bo ludzki przegląd uznał 34,1% zadań za zepsute. Głośne „prawie 100%" ze Stanford AI Index to wynik przeskalowany względem poziomu odniesienia, a nie odsetek rozwiązanych zgłoszeń — surowo najlepszy model ruszył z 74,9% do 80,9%. Benchmarki psują się przez skażenie danych treningowych i wadliwe testy odrzucające poprawny kod. Zanim uwierzysz w tabelę, sprawdź, którą wersję testu i który wynik mierzy, a potem i tak puść model na własnym repozytorium.
Tydzień 27 · 29 czerwca – 5 lipca 2026
Analiza / Opinia JetSpec przyspiesza Qwen3 nawet 9,64 raza, ale tylko jeśli sam hostujesz model
4 min
JetSpec, praca z końca czerwca, przyspiesza spekulatywne dekodowanie na modelach Qwen3 nawet 9,64 raza, ale ta liczba pochodzi z zadań matematycznych z zestawu MATH-500, czyli najbardziej przewidywalnego przypadku. Na swobodnych rozmowach przyspieszenie spada do 4,58 raza, przy wyniku modelu identycznym co do bitu. Cały zysk trafia jednak tylko do tych, którzy sami hostują Qwen3 na własnych GPU, bo przez API w rodzaju Claude czy GPT nie ma gdzie go podpiąć. Autorzy udostępnili kod i gotowe głowice na GitHubie, więc każdy chętny może sprawdzić te liczby u siebie.
Analiza / Opinia Kod da się sprawdzić i na tym stoi cała przewaga agentów
4 min
Phillip Isola z MIT tłumaczy w rozmowie dla MIT News, dlaczego z całej fali agentów AI naprawdę wypaliła tylko jedna kategoria: te do pisania kodu. Powód jest prozaiczny, kod da się sprawdzić, więc agent może odpalić własne rozwiązanie, napisać test i kręcić pętlę prób i błędów, aż trafi na dobrą strategię, czego przy rezerwacji lotu czy w medycynie zrobić się nie da. Ta sama łatwość bywa jednak pułapką, bo przy vibe codingu człowiek świadomie rezygnuje z tej weryfikacji, przez co wkradają się błędy i wyciekają prywatne dane.
Analiza / Opinia Agent czyta specyfikację API sam i nie ma kogo dopytać
3 min
Analiza kategorii integracji i API z zestawienia SD Times 100 na 2026 rok stawia tezę, że po drugiej stronie wywołania API coraz częściej stoi agent AI, który sam czyta dokumentację i sam decyduje, jak jej użyć, zamiast wykonywać z góry napisany skrypt. Dwuznaczność, którą człowiek wyjaśniłby sobie krótkim pytaniem, dla agenta staje się twardym błędem, więc nazwy parametrów i komunikaty o błędach awansują z kosmetyki do właściwego interfejsu. Zmiana odbiorcy uderza też w limity zapytań i w uprawnienia, choć to wciąż argument redakcji bez liczb o wdrożeniach.
Tydzień 26 · 22–28 czerwca 2026
Tydzień 25 · 15–21 czerwca 2026
Analiza / Opinia Co naprawdę decyduje o sukcesie z agentem kodującym, według danych Anthropic
6 min
Anthropic przejrzał około 400 tysięcy sesji Claude Code od mniej więcej 235 tysięcy osób i uznał, że o sukcesie decyduje nie znajomość składni, tylko rozumienie dziedziny: człowiek podejmuje około 70% decyzji, co zrobić, a agent około 80%, jak to napisać. Potwierdzony sukces skacze z 15% u nowicjuszy do 28–33% u reszty, ale prawie cały przyrost bierze się z przejścia na poziom średniozaawansowany. Warto czytać to ostrożnie, bo to badanie firmy o własnym produkcie, a "sukces" mierzy zapis rozmowy, nie to, czy kod trafił na produkcję.
Analiza / Opinia 91 na 100 repozytoriów ma plik konfiguracyjny z usterką
5 min
Badacze z Federalnego Uniwersytetu Minas Gerais przejrzeli 100 projektów open-source z plikiem CLAUDE.md lub AGENTS.md i w 91 znaleźli przynajmniej jedną usterkę, nazwaną "zapachem" konfiguracji. Najczęstsze to wyciek reguł lintera (62%) i przerost kontekstu (42%), a wszystkie sprowadzają się do tego, że plik niesie materiał, którego model nie potrzebuje, więc przepala tokeny. Usterki się przy tym mnożą: gdy wyciek umiejętności idzie ze sprzecznymi instrukcjami, przerost kontekstu jest o 83% bardziej prawdopodobny. Wniosek: instrukcję dla agenta trzeba traktować jak kod podlegający przeglądom.
Analiza / Opinia Agent potrafi zmienić jeden kondensator, ale nie zbuduje obwodu od zera
6 min
Snorkel AI posadziło agenta opartego na Claude Sonnet 4.5 przed KiCadem i dało mu 25 zadań od praktykujących elektroników. Agent zaliczył tylko 4, wszystkie sprowadzające się do jednej edycji gotowego schematu, a na 16 zadaniach typu "zbuduj od zera" nie zdobył ani punktu. Granica okazała się ostra, choć nie z braku wiedzy: zaledwie 11% błędów dotyczyło dziedziny, a dwie piąte planowania. Większy budżet kroków nie pomógł, a agent ogłaszał "DONE", wierząc własnej narracji zamiast spojrzeć na ekran.
Tydzień 17 · 20–26 kwietnia 2026
Analiza / Opinia Większość produkcyjnych agentów to wciąż jedno wywołanie do jednego modelu
3 min
Raport Datadoga State of AI Engineering pokazuje, że 59% wywołań agentów u ponad tysiąca klientów to wciąż jeden model, jedno wywołanie, bez orkiestracji. OpenAI spadł z 75% do 63% organizacji między 2025 a marcem 2026, choć liczba klientów się podwoiła — Anthropic i Google rosły szybciej. Instrukcje systemowe to 69% tokenów wejściowych, ale tylko 28% wywołań korzysta z cache promptów. Część tej prostoty to dług, część rozsądek, a raport ich nie rozróżnia.
Analiza / Opinia 39 punktów różnicy między tym, co programista czuje przy AI, a tym, co mierzy stoper
3 min
Doświadczeni programiści open source spodziewali się, że asystent AI przyspieszy ich pracę o 24%. Po wszystkim nadal czuli zysk rzędu 20%. Stoper METR w randomizowanym badaniu pokazał coś odwrotnego: byli o 19% wolniejsi. Trzydzieści dziewięć punktów rozjazdu między odczuciem a zegarem bierze się z przeglądu wygenerowanego kodu, poprawiania promptów i przełączania uwagi. Cała branżowa narracja o produktywności AI opiera się na ankietach, a 87% deweloperów codziennie sięga po te narzędzia, nie wiedząc, kiedy faktycznie pomagają.