SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Analiza / Opinia

Co naprawdę decyduje o sukcesie z agentem kodującym, według danych Anthropic

Anthropic przejrzał około 400 tysięcy sesji Claude Code od mniej więcej 235 tysięcy osób i uznał, że o sukcesie decyduje nie znajomość składni, tylko rozumienie dziedziny: człowiek podejmuje około 70% decyzji, co zrobić, a agent około 80%, jak to napisać. Potwierdzony sukces skacze z 15% u nowicjuszy do 28–33% u reszty, ale prawie cały przyrost bierze się z przejścia na poziom średniozaawansowany. Warto czytać to ostrożnie, bo to badanie firmy o własnym produkcie, a "sukces" mierzy zapis rozmowy, nie to, czy kod trafił na produkcję.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Analiza / Opinia  ·  6 min  · 

Co naprawdę decyduje o sukcesie z agentem kodującym, według danych Anthropic
Ilustrację przygotowała AI.

Anthropic przejrzał zapisy około 400 tysięcy sesji Claude Code od mniej więcej 235 tysięcy osób, zebrane między październikiem 2025 a kwietniem 2026, i opublikował z nich badanie, które uderza w jedno z popularniejszych założeń o narzędziach AI do programowania. Założenie brzmi mniej więcej tak: skoro model sam pisze kod, to znajomość składni przestaje się liczyć, a programowanie się "demokratyzuje" i spłaszcza. Dane Anthropic mówią coś subtelniejszego. To prawda, że formalne wykształcenie programistyczne przestaje być przepustką, ale na jego miejsce wchodzi inna rzecz, którą trudniej kupić w kursie online: znajomość dziedziny, w której się pracuje.

Zacznijmy od tego, jak w ogóle wygląda typowa sesja, bo to tłumaczy resztę. Claude Code to asystent działający w terminalu albo w osobnej aplikacji, który sam wykonuje robotę: czyta pliki, edytuje kod, odpala komendy. Anthropic rozdzielił decyzje w sesji na dwie warstwy. Pierwsza to planowanie, czyli co zrobić i kiedy uznać zadanie za skończone, a druga to wykonanie, czyli które pliki ruszyć i jaki kod napisać. Z analizy wyszło, że człowiek podejmuje średnio około 70% decyzji planistycznych, a Claude około 80% wykonawczych. Mówiąc wprost: ty decydujesz, co ma powstać, a agent decyduje, jak to sklecić. I to jest oś całego badania, bo skoro człowiek odpowiada głównie za "co", to liczy się przede wszystkim to, czy wie, co właściwie chce osiągnąć.

Ekspertyza, która nie ma nic wspólnego z dyplomem programisty

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Agent robi 2,4 razy więcej, kiedy wie, czego chcesz Analiza / Opinia

Agent robi 2,4 razy więcej, kiedy wie, czego chcesz

5 min

Anthropic prześwietlił około 400 tysięcy sesji Claude Code i odkrył, że na ten sam prompt agent wykonuje ekspertowi 2,4 raza więcej działań niż nowicjuszowi. O wyniku decyduje nie znajomość składni, tylko wiedza o dziedzinie: prawnik czy księgowy, który wie, jak ma wyglądać poprawny wynik, wypada równie dobrze co programista. Przewaga otwiera się najszerzej wtedy, gdy sesja się sypie, bo doświadczony użytkownik wychodzi z błędów, zamiast porzucić terminal. Sama firma przyznaje, że nie wie, czy ten kod trafia do użytku, a dane pomijają konkurencyjne narzędzia.

Kod da się sprawdzić i na tym stoi cała przewaga agentów Analiza / Opinia

Kod da się sprawdzić i na tym stoi cała przewaga agentów

4 min

Phillip Isola z MIT tłumaczy w rozmowie dla MIT News, dlaczego z całej fali agentów AI naprawdę wypaliła tylko jedna kategoria: te do pisania kodu. Powód jest prozaiczny, kod da się sprawdzić, więc agent może odpalić własne rozwiązanie, napisać test i kręcić pętlę prób i błędów, aż trafi na dobrą strategię, czego przy rezerwacji lotu czy w medycynie zrobić się nie da. Ta sama łatwość bywa jednak pułapką, bo przy vibe codingu człowiek świadomie rezygnuje z tej weryfikacji, przez co wkradają się błędy i wyciekają prywatne dane.

Agenty gubią się w cudzym systemie, nie w składni Analiza / Opinia

Agenty gubią się w cudzym systemie, nie w składni

4 min

Real-SWE mierzy agenty na produkcyjnym kodzie licencjonowanym od prawdziwych firm, którego nie było w danych treningowych, i wyszło z tego 640 przebiegów ze średnią 26,9%, przy najlepszym wyniku 38,8% dla Fable 5.1 w Claude Code. Z 468 porażek tylko 5,1% to zepsuty kod, a 40,6% to pominięty wymóg, czyli instrukcja, której agent nie doczytał do końca. Kolejność w tabeli i tak niewiele znaczy, bo przedziały ufności czołówki nachodzą na siebie, a każdy model biegł w harnessie swojego producenta. Jedyna liczba, która cokolwiek rozstrzyga, to ta zmierzona na twoim repozytorium.