SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Analiza / Opinia

Agent potrafi zmienić jeden kondensator, ale nie zbuduje obwodu od zera

Snorkel AI posadziło agenta opartego na Claude Sonnet 4.5 przed KiCadem i dało mu 25 zadań od praktykujących elektroników. Agent zaliczył tylko 4, wszystkie sprowadzające się do jednej edycji gotowego schematu, a na 16 zadaniach typu "zbuduj od zera" nie zdobył ani punktu. Granica okazała się ostra, choć nie z braku wiedzy: zaledwie 11% błędów dotyczyło dziedziny, a dwie piąte planowania. Większy budżet kroków nie pomógł, a agent ogłaszał "DONE", wierząc własnej narracji zamiast spojrzeć na ekran.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Analiza / Opinia  ·  6 min  · 

Agent potrafi zmienić jeden kondensator, ale nie zbuduje obwodu od zera
Ilustrację przygotowała AI.

Snorkel AI postawiło czołowemu agentowi komputerowemu zadanie, które dla inżyniera elektronika jest rozgrzewką: usiądź przed KiCadem i popraw schemat. KiCad to otwarty pakiet do projektowania elektroniki, rozdzielony na dwa osobne edytory: w edytorze schematu rysuje się obwód i rozmieszcza komponenty, a w edytorze płytki układa się to fizycznie pod produkcję. Z edytora schematu wychodzi lista połączeń, czyli spis, który element łączy się z którym. To ona jest sprawdzianem: albo wszystkie elementy są połączone tak, jak każe zadanie, albo nie, i da się to zweryfikować maszynowo. Inżynier robi w tym pakiecie takie rzeczy codziennie. Agent oparty na Claude Sonnet 4.5 dostał dwadzieścia pięć zadań napisanych przez praktykujących elektroników i zaliczył w pełni cztery. To 16%. I już ta liczba mówi mniej niż jej rozkład.

Bo te cztery zaliczenia mają jeden wspólny kształt: otwórz projekt, znajdź ten jeden element, który trzeba ruszyć, zmień go, zapisz, zgłoś koniec. Zmiana wartości kondensatora. Podmiana portu zasilania z +9V na +5V. Przeskalowanie rezystora pod zadany prąd. Wyśrodkowanie punktu pracy mikrofonu. Wszystkie to pojedyncze edycje na gotowym schemacie. A teraz druga liczba, ta naprawdę ważna: na szesnaście zadań typu "zbuduj od zera" agent zaliczył zero. Każde zadanie, które wymagało postawienia trzech albo więcej komponentów i pociągnięcia między nimi przewodów, kończyło się porażką albo częściowym wynikiem.

Granica nie biegnie tam, gdzie myślicie

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Czy model zbuduje agenta bez inżyniera? Na razie co czwarte zadanie. Analiza / Opinia

Czy model zbuduje agenta bez inżyniera? Na razie co czwarte zadanie.

4 min

Sierra otworzyła hyper-tau-bench: 53 zadania, w których agent ma sam zbudować działającego agenta obsługi klienta. Najlepiej wypadł Claude Opus 5 z maksymalnym rozumowaniem, ale zaliczył 23,9% rozmów testowych, podczas gdy ten sam model prowadzony przez inżyniera dochodzi na tych samych zadaniach do 82,2%. Przepaść nie bierze się z pisania kodu: w zadaniach bankowych agent zaglądał do mniej niż 80 z około 1700 plików i zadawał symulowanemu klientowi najwyżej cztery pytania, choć już dwa podnosiły skuteczność z 5% do 25%. Ta różnica to po prostu cena braku nadzoru.

Agent odpala kod z cudzego repozytorium, zanim w ogóle zapyta model Bezpieczeństwo

Agent odpala kod z cudzego repozytorium, zanim w ogóle zapyta model

5 min

Manifold Security opisało osiem dziur w siedmiu agentach z konsoli i nazwało całość GitSpawn: wystarczy rozpakować cudzą paczkę z nietkniętym katalogiem .git, a agent sam odpali git status i wykona program wskazany w core.fsmonitor, na twoich prawach i zanim model zobaczy choć jeden znak. Poprawki wyszły dla goose, Claude Code i Cursora, ale przy powtórnym teście 1 września komendy z repozytorium wciąż wykonywały Hermes Agent, Qwen Code i Grok Build. Moim zdaniem to nie jest historia o AI, tylko stara wada gita, którą agenty odpalają teraz same, w tle, przy każdym otwarciu katalogu.

Agent robi 2,4 razy więcej, kiedy wie, czego chcesz Analiza / Opinia

Agent robi 2,4 razy więcej, kiedy wie, czego chcesz

5 min

Anthropic prześwietlił około 400 tysięcy sesji Claude Code i odkrył, że na ten sam prompt agent wykonuje ekspertowi 2,4 raza więcej działań niż nowicjuszowi. O wyniku decyduje nie znajomość składni, tylko wiedza o dziedzinie: prawnik czy księgowy, który wie, jak ma wyglądać poprawny wynik, wypada równie dobrze co programista. Przewaga otwiera się najszerzej wtedy, gdy sesja się sypie, bo doświadczony użytkownik wychodzi z błędów, zamiast porzucić terminal. Sama firma przyznaje, że nie wie, czy ten kod trafia do użytku, a dane pomijają konkurencyjne narzędzia.