SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Analiza / Opinia

Kod da się sprawdzić i na tym stoi cała przewaga agentów

Phillip Isola z MIT tłumaczy w rozmowie dla MIT News, dlaczego z całej fali agentów AI naprawdę wypaliła tylko jedna kategoria: te do pisania kodu. Powód jest prozaiczny, kod da się sprawdzić, więc agent może odpalić własne rozwiązanie, napisać test i kręcić pętlę prób i błędów, aż trafi na dobrą strategię, czego przy rezerwacji lotu czy w medycynie zrobić się nie da. Ta sama łatwość bywa jednak pułapką, bo przy vibe codingu człowiek świadomie rezygnuje z tej weryfikacji, przez co wkradają się błędy i wyciekają prywatne dane.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Analiza / Opinia  ·  4 min  · 

Kod da się sprawdzić i na tym stoi cała przewaga agentów
Ilustrację przygotowała AI.

Agentów AI w ostatnim roku zrobiło się wszędzie pełno. Listopadowy raport MIT Sloan i Boston Consulting Group mówił, że 35% firm już wpuściło je do siebie, a kolejne 44% się do tego szykuje. Ale z całej tej fali tylko jedna kategoria naprawdę działa i akurat ta stoi programiście na biurku: agenty do pisania kodu. Phillip Isola, profesor nadzwyczajny (associate professor) na wydziale EECS i członek laboratorium CSAIL na MIT, który bada, ile właściwie rozumu mają takie systemy, w rozmowie opublikowanej pod koniec czerwca przez MIT News tłumaczy, dlaczego kod poszedł najlepiej ze wszystkiego. Powód jest zaskakująco prozaiczny: kod da się sprawdzić.

Pod maską prawie zawsze pracuje ten sam model

Isola mówi to wprost: "agent" to w dużej mierze nazwa handlowa. Większość firm, które sprzedają agentów, sięga pod spodem po te same kilka modeli i dokłada im dwie rzeczy: możliwość wykonywania akcji i pamięć tego, co się wydarzyło. W środku pracuje zwykły model generatywny, na przykład Claude, a firma owija go warstwą narzędzi dobranych pod konkretne zastosowanie. Dasz mu kalkulator, rozwiąże zadanie z matematyki. Dasz mu dostęp do dysku z historią firmowych negocjacji, będzie się do niej odwoływał.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

AI pisze 80% testów, resztę wciąż dopina człowiek Analiza / Opinia

AI pisze 80% testów, resztę wciąż dopina człowiek

4 min

Suneet Malhotra, od dwudziestu lat budujący automatyzację testów, rozkłada slogan o AI piszącej 80% testów: model przejmuje 80% klepania w klawiaturę, nie 80% inżynierii, a cała trudność tkwi w pozostałych 20%. Jego pipeline zamienia projekt z Figmy w testy WebDriverIO w jakieś 16 minut, ale kładła go nie halucynacja modelu, tylko hydraulika wokół niego: backend gubił dane logowania, a przestawiona zmienna kazała agentom generować puste dokumenty. Cztery podręcznikowe zabezpieczenia to naprawiły, a człowiekowi i tak zostaje od 20 do 30 procent wysiłku, głównie na przeglądaniu.

Trzy reakcje programistów na to, że kod pisze już AI Analiza / Opinia

Trzy reakcje programistów na to, że kod pisze już AI

4 min

Guardian wypytał kilkunastu programistów o to, jak AI zmienia ich zawód. Samo pisanie kodu traci na wartości: Google przyznaje, że AI pisze już 75% jego kodu, a od premiery ChatGPT branża technologiczna w USA straciła ponad 600 tysięcy miejsc pracy. Reakcje są trzy: Matt pisze grę ręcznie, żeby nie stracić formy, George Dover po 400 zgłoszeniach przekwalifikował się na inżyniera nastawionego na AI, a Kaitlin Cort zakłada związki zawodowe dla zwalnianych. Każde z tych działań to próba znalezienia gruntu pod nogami, zanim rynek zdecyduje za człowieka.

Co naprawdę decyduje o sukcesie z agentem kodującym, według danych Anthropic Analiza / Opinia

Co naprawdę decyduje o sukcesie z agentem kodującym, według danych Anthropic

6 min

Anthropic przejrzał około 400 tysięcy sesji Claude Code od mniej więcej 235 tysięcy osób i uznał, że o sukcesie decyduje nie znajomość składni, tylko rozumienie dziedziny: człowiek podejmuje około 70% decyzji, co zrobić, a agent około 80%, jak to napisać. Potwierdzony sukces skacze z 15% u nowicjuszy do 28–33% u reszty, ale prawie cały przyrost bierze się z przejścia na poziom średniozaawansowany. Warto czytać to ostrożnie, bo to badanie firmy o własnym produkcie, a "sukces" mierzy zapis rozmowy, nie to, czy kod trafił na produkcję.