SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Analiza / Opinia

Tydzień 33 · 10–16 sierpnia 2026

Tydzień 32 · 3–9 sierpnia 2026

Tydzień 31 · 27 lipca – 2 sierpnia 2026

Poprawka w kodzie to jedno, działająca usługa w kontenerze to zupełnie inna liga Analiza / Opinia

Poprawka w kodzie to jedno, działająca usługa w kontenerze to zupełnie inna liga

3 min

ABC-Bench, test opisany w Findings of ACL 2026, sprawdza agenty na pełnym cyklu pracy nad backendem: trzeba rozejrzeć się po repozytorium, postawić usługę w kontenerze i sprawić, żeby przeszła zewnętrzne testy API. Jie Yang i współpracownicy zebrali 224 praktyczne zadania z ośmiu języków i 19 frameworków, a nawet czołowe modele wypadają na nich słabo. Morał dla wyboru narzędzi jest prosty: dobry wynik na SWE-benchu nie znaczy, że agent postawi działającą usługę na produkcji, bo łatanie pojedynczych funkcji to co innego niż doprowadzenie backendu do stanu, w którym naprawdę wstaje i odpowiada.

Autonomia agenta ma swoją cenę, liczoną w minutach i tokenach Analiza / Opinia

Autonomia agenta ma swoją cenę, liczoną w minutach i tokenach

4 min

Dwaj inżynierowie z IBM dali asystentowi kodu dokumentację LangChain4j i poprosili, żeby zbudował własną kopię, czyli działający system wielu agentów. Model sam wybrał wzorzec nadzorcy z czterema podwładnymi i odtworzył architekturę, na jakiej sam działa. Na słabszym gpt-4o system wpadł w pętlę i padł po 100 wywołaniach narzędzi, za to gpt-5-mini naprawił wszystkie cztery błędy w testowej klasie Calculator, a 11 testów przeszło na zielono. Druga, deterministyczna wersja oparta na workflow zrobiła to samo trzy razy szybciej, bo nie płaci za osobne wywołanie modelu przy każdej decyzji nadzorcy.

Milion tokenów i 90 wywołań na jedno zadanie: jak w ogóle zmierzyć takiego agenta? Analiza / Opinia

Milion tokenów i 90 wywołań na jedno zadanie: jak w ogóle zmierzyć takiego agenta?

4 min

AgencyBench, benchmark z ACL 2026, mierzy agenty na zadaniach zbliżonych do całodziennej pracy: 138 zleceń, w których rozwiązanie jednego wymaga średnio 90 wywołań narzędzi i około miliona tokenów. Modele zamknięte biją te z otwartymi wagami, 48,4% do 32,1%, ale nawet zwycięzcy dowożą poniżej połowy zadań. Ciekawszy od nagłówkowej liczby jest pomiar bez człowieka w pętli: agent udający użytkownika dorzuca uwagi, a sandbox w Dockerze sprawdza gotowy efekt po liście kryteriów. Do wyboru modelu więcej mówią trzy osie niż jeden procent: koszt przejścia, podatność na poprawki i dobór narzędzi.

Tydzień 30 · 20–26 lipca 2026

Otwarte modele kodują już jak zamknięte. Zatrzymuje je droga na produkcję. Analiza / Opinia

Otwarte modele kodują już jak zamknięte. Zatrzymuje je droga na produkcję.

4 min

Doroczny raport Mozilli o otwartym AI pokazuje, że różnica w jakości między najlepszymi otwartymi a zamkniętymi modelami skurczyła się średnio do 3,3%, a na samym kodowaniu modele się zrównały. Cała gra przenosi się teraz do harnessu, czyli warstwy dookoła modelu: na Terminal-Benchu te same wagi Anthropica dawały 79,8% z niezależnym harnessem i tylko 58% w firmowym Claude Code. Otwarte wagi tną też koszty, bo Stripe przeniósł 50 milionów dziennych wywołań na własną infrastrukturę i ściął rachunek o 73%.

Który model wpiąć w agenta? Nowy test z ACL sprawdza to na realnej robocie Analiza / Opinia

Który model wpiąć w agenta? Nowy test z ACL sprawdza to na realnej robocie

3 min

AgencyBench, praca z ACL 2026 autorstwa Keyu Li i Pengfei Liu, sprawdza modele na 138 zadaniach odwzorowujących wielogodzinną robotę z agentami, gdzie jedno zlecenie potrafi pochłonąć 90 wywołań narzędzi i milion tokenów. Modele zamknięte biją te z otwartymi wagami, 48,4% do 32,1%, ale nawet zwycięska grupa rozwiązuje poniżej połowy zadań, więc do powierzenia agentowi roboty bez nadzoru wciąż daleko. Dla wyboru modelu najwięcej mówią trzy osie: ile tokenów i wywołań model spala, czy nadrabia pod wpływem uwag i po jakie narzędzia sięga.

Tanio napisać, drogo utrzymać: nowy rachunek kosztów w pracy z agentami Analiza / Opinia

Tanio napisać, drogo utrzymać: nowy rachunek kosztów w pracy z agentami

4 min

Dalia Abuadas, inżynierka z zespołu Copilota w GitHubie, przekonuje w eseju, że najdroższym krokiem przy drobnej prośbie o funkcję nie jest już napisanie kodu, tylko spotkanie o tym, czy go w ogóle pisać. Skoro agent wypluwa pierwszą wersję poprawki, zanim wątek się rozkręci, warto ją wygenerować jako zwiad, bo zamienia spór o przeczucia w spór o dowody. Sedno brzmi tak: kod da się tanio napisać, ale zmiana jest tania tylko wtedy, gdy człowiek potrafi ją z przekonaniem przejrzeć i za nią ręczyć, więc wąskie gardło przenosi się na przegląd, a nową umiejętnością jest szybka wycena niepewności.

Trzy reakcje programistów na to, że kod pisze już AI Analiza / Opinia

Trzy reakcje programistów na to, że kod pisze już AI

4 min

Guardian wypytał kilkunastu programistów o to, jak AI zmienia ich zawód. Samo pisanie kodu traci na wartości: Google przyznaje, że AI pisze już 75% jego kodu, a od premiery ChatGPT branża technologiczna w USA straciła ponad 600 tysięcy miejsc pracy. Reakcje są trzy: Matt pisze grę ręcznie, żeby nie stracić formy, George Dover po 400 zgłoszeniach przekwalifikował się na inżyniera nastawionego na AI, a Kaitlin Cort zakłada związki zawodowe dla zwalnianych. Każde z tych działań to próba znalezienia gruntu pod nogami, zanim rynek zdecyduje za człowieka.

Tydzień 29 · 13–19 lipca 2026

Tydzień 28 · 6–12 lipca 2026

Self-Harness: agent czyta własne logi i sam łata swoje opakowanie Analiza / Opinia

Self-Harness: agent czyta własne logi i sam łata swoje opakowanie

4 min

Self-Harness, opisany w pracy z arXiv z 8 czerwca, każe agentowi czytać własne logi z awarii i samodzielnie przepisywać reguły swojego opakowania w pętli: znajdź słabość, załataj, przepuść zmianę przez testy regresji. Na Terminal-Bench-2.0 największy skok zaliczył najsłabszy model, Qwen3.5, który z 23,8% doszedł do 38,1%, podczas gdy mocniejsze MiniMax M2.5 i GLM-5 podniosły się słabiej. Wygląda to więc na sposób, żeby tańszy albo hostowany lokalnie model podciągnąć do poziomu, na którym w ogóle nadaje się do roboty, choć zostaje pytanie, kto potem czyta reguły, które napisał model.

Skąd wiesz, że twój recenzent kodu AI jest dobry? Wskaźnik akceptacji kłamie Analiza / Opinia

Skąd wiesz, że twój recenzent kodu AI jest dobry? Wskaźnik akceptacji kłamie

4 min

DoorDash pokazuje, dlaczego popularny wskaźnik akceptacji uwag kłamie przy ocenie recenzentów kodu opartych na AI: nie policzy błędu, którego agent w ogóle nie zgłosił. Ich odpowiedzią jest DashBench, wewnętrzny benchmark odtwarzający 105 dawnych PR-ów i zestawiający adnotacje inżynierów, zgłoszenia recenzenta i osąd modelu-sędziego. Para Kimi K2.6 i Claude Fable 5 wyłapała najwięcej, 65,2% ważonej wykrywalności za 3,81 dolara na PR-a, ale jednego zwycięzcy nie ma: wybór zależy od tego, co bardziej boli, przeoczony krytyczny błąd, szum fałszywych alarmów czy rachunek.

Prawie 100% na benchmarku, którego jedna trzecia nie działała Analiza / Opinia

Prawie 100% na benchmarku, którego jedna trzecia nie działała

4 min

OpenAI w lutym namawiało branżę na SWE-bench Pro, a w lipcu wycofało własną rekomendację, bo ludzki przegląd uznał 34,1% zadań za zepsute. Głośne „prawie 100%" ze Stanford AI Index to wynik przeskalowany względem poziomu odniesienia, a nie odsetek rozwiązanych zgłoszeń — surowo najlepszy model ruszył z 74,9% do 80,9%. Benchmarki psują się przez skażenie danych treningowych i wadliwe testy odrzucające poprawny kod. Zanim uwierzysz w tabelę, sprawdź, którą wersję testu i który wynik mierzy, a potem i tak puść model na własnym repozytorium.

Tydzień 27 · 29 czerwca – 5 lipca 2026

JetSpec przyspiesza Qwen3 nawet 9,64 raza, ale tylko jeśli sam hostujesz model Analiza / Opinia

JetSpec przyspiesza Qwen3 nawet 9,64 raza, ale tylko jeśli sam hostujesz model

4 min

JetSpec, praca z końca czerwca, przyspiesza spekulatywne dekodowanie na modelach Qwen3 nawet 9,64 raza, ale ta liczba pochodzi z zadań matematycznych z zestawu MATH-500, czyli najbardziej przewidywalnego przypadku. Na swobodnych rozmowach przyspieszenie spada do 4,58 raza, przy wyniku modelu identycznym co do bitu. Cały zysk trafia jednak tylko do tych, którzy sami hostują Qwen3 na własnych GPU, bo przez API w rodzaju Claude czy GPT nie ma gdzie go podpiąć. Autorzy udostępnili kod i gotowe głowice na GitHubie, więc każdy chętny może sprawdzić te liczby u siebie.

Kod da się sprawdzić i na tym stoi cała przewaga agentów Analiza / Opinia

Kod da się sprawdzić i na tym stoi cała przewaga agentów

4 min

Phillip Isola z MIT tłumaczy w rozmowie dla MIT News, dlaczego z całej fali agentów AI naprawdę wypaliła tylko jedna kategoria: te do pisania kodu. Powód jest prozaiczny, kod da się sprawdzić, więc agent może odpalić własne rozwiązanie, napisać test i kręcić pętlę prób i błędów, aż trafi na dobrą strategię, czego przy rezerwacji lotu czy w medycynie zrobić się nie da. Ta sama łatwość bywa jednak pułapką, bo przy vibe codingu człowiek świadomie rezygnuje z tej weryfikacji, przez co wkradają się błędy i wyciekają prywatne dane.

Agent czyta specyfikację API sam i nie ma kogo dopytać Analiza / Opinia

Agent czyta specyfikację API sam i nie ma kogo dopytać

3 min

Analiza kategorii integracji i API z zestawienia SD Times 100 na 2026 rok stawia tezę, że po drugiej stronie wywołania API coraz częściej stoi agent AI, który sam czyta dokumentację i sam decyduje, jak jej użyć, zamiast wykonywać z góry napisany skrypt. Dwuznaczność, którą człowiek wyjaśniłby sobie krótkim pytaniem, dla agenta staje się twardym błędem, więc nazwy parametrów i komunikaty o błędach awansują z kosmetyki do właściwego interfejsu. Zmiana odbiorcy uderza też w limity zapytań i w uprawnienia, choć to wciąż argument redakcji bez liczb o wdrożeniach.

Tydzień 26 · 22–28 czerwca 2026

Tydzień 25 · 15–21 czerwca 2026

Co naprawdę decyduje o sukcesie z agentem kodującym, według danych Anthropic Analiza / Opinia

Co naprawdę decyduje o sukcesie z agentem kodującym, według danych Anthropic

6 min

Anthropic przejrzał około 400 tysięcy sesji Claude Code od mniej więcej 235 tysięcy osób i uznał, że o sukcesie decyduje nie znajomość składni, tylko rozumienie dziedziny: człowiek podejmuje około 70% decyzji, co zrobić, a agent około 80%, jak to napisać. Potwierdzony sukces skacze z 15% u nowicjuszy do 28–33% u reszty, ale prawie cały przyrost bierze się z przejścia na poziom średniozaawansowany. Warto czytać to ostrożnie, bo to badanie firmy o własnym produkcie, a "sukces" mierzy zapis rozmowy, nie to, czy kod trafił na produkcję.

91 na 100 repozytoriów ma plik konfiguracyjny z usterką Analiza / Opinia

91 na 100 repozytoriów ma plik konfiguracyjny z usterką

5 min

Badacze z Federalnego Uniwersytetu Minas Gerais przejrzeli 100 projektów open-source z plikiem CLAUDE.md lub AGENTS.md i w 91 znaleźli przynajmniej jedną usterkę, nazwaną "zapachem" konfiguracji. Najczęstsze to wyciek reguł lintera (62%) i przerost kontekstu (42%), a wszystkie sprowadzają się do tego, że plik niesie materiał, którego model nie potrzebuje, więc przepala tokeny. Usterki się przy tym mnożą: gdy wyciek umiejętności idzie ze sprzecznymi instrukcjami, przerost kontekstu jest o 83% bardziej prawdopodobny. Wniosek: instrukcję dla agenta trzeba traktować jak kod podlegający przeglądom.

Agent potrafi zmienić jeden kondensator, ale nie zbuduje obwodu od zera Analiza / Opinia

Agent potrafi zmienić jeden kondensator, ale nie zbuduje obwodu od zera

6 min

Snorkel AI posadziło agenta opartego na Claude Sonnet 4.5 przed KiCadem i dało mu 25 zadań od praktykujących elektroników. Agent zaliczył tylko 4, wszystkie sprowadzające się do jednej edycji gotowego schematu, a na 16 zadaniach typu "zbuduj od zera" nie zdobył ani punktu. Granica okazała się ostra, choć nie z braku wiedzy: zaledwie 11% błędów dotyczyło dziedziny, a dwie piąte planowania. Większy budżet kroków nie pomógł, a agent ogłaszał "DONE", wierząc własnej narracji zamiast spojrzeć na ekran.

Tydzień 17 · 20–26 kwietnia 2026