SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Analiza / Opinia

Agent czyta AGENTS.md aż za dokładnie

Zespół laboratorium SRI z ETH w Zurychu sprawdził na SWE-bench i na zgłoszeniach z repozytoriów, w których deweloperzy sami napisali AGENTS.md, czy taki plik pomaga agentom do programowania. Odsetek rozwiązanych zadań nie rośnie, a koszt pracy modelu idzie w górę o ponad 20%, bo agent posłusznie wykonuje każde polecenie z pliku, przegląda więcej plików i więcej testuje. Dlatego zostawiłbym w AGENTS.md tylko to, czego agent nie wyczyta z kodu, na przykład że testy wymagają uruchomionej lokalnej bazy.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Analiza / Opinia  ·  4 min  · 

Agent czyta AGENTS.md aż za dokładnie
Ilustrację przygotowała AI.

Agent do programowania robi dokładnie to, co mu każecie w pliku AGENTS.md, i moim zdaniem właśnie w tym tkwi problem. Tak czytam pracę zespołu z laboratorium SRI na ETH w Zurychu, który sprawdził, czy pliki z opisem repozytorium realnie pomagają agentom w pracy. Nie pomagają: odsetek rozwiązanych zadań nie rośnie, a koszt pracy modelu idzie w górę o ponad 20%, co oznacza, że przy tej samej skuteczności każde pięć zadań kosztuje was mniej więcej tyle, ile wcześniej kosztowało sześć.

Pisałem o tym wyniku w sierpniu, wtedy głównie o rachunku. Dziś bardziej interesuje mnie drugi wątek tej pracy: dlaczego posłuszny agent nie wypada lepiej i co z tego wynika dla pliku, który pewnie leży w waszym repozytorium.

Skąd się wziął zwyczaj pisania AGENTS.md

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Ponad 20% drożej i ani jednego zadania więcej Analiza / Opinia

Ponad 20% drożej i ani jednego zadania więcej

3 min

Zespół z laboratorium SRI na ETH w Zurychu sprawdził, czy pliki kontekstowe w repozytorium, jak AGENTS.md, realnie pomagają agentom do programowania, i wyszło, że nie: skuteczność mierzona odsetkiem ukończonych zadań ani drgnęła, a rachunek za pracę agenta urósł o ponad 20%. Wynik trzyma się także wtedy, gdy kontekst pisali ręcznie sami deweloperzy, nie tylko model. Pliki zmieniają zachowanie agenta: więcej testuje i dokładniej przegląda repozytorium, co spala tokeny, ale nie zamyka więcej zgłoszeń. Autorzy nie każą wyrzucać AGENTS.md, tylko skrócić go do rzeczy, których agent sam nie zgadnie.

Nowy benchmark Supabase pokazuje, czego agenty nie doczytują Premiera / Narzędzie

Nowy benchmark Supabase pokazuje, czego agenty nie doczytują

4 min

Supabase 31 lipca udostępnił Evals, otwarty benchmark, który uruchamia agenty AI na żywej bazie i sprawdza, jak stawiają schemat i reguły bezpieczeństwa, a nie tylko czy piszą poprawny kod. Powód jest konkretny: ponad 60% nowych baz zakłada u firmy narzędzie AI, a nie człowiek. Najciekawsze okazały się nawyki agentów, czyli ręczne migracje mimo deklaratywnego schematu i rozjazd w czytaniu dokumentacji, gdzie Codex zaglądał średnio do ośmiu stron na scenariusz, a Claude Code do dwóch. Test projektuje jednak sam Supabase, który na każdym agencie zarabia, więc nie jest neutralny.

Co się dzieje z uwagami, które wpisujesz agentowi tuż przed końcem sesji? Premiera / Narzędzie

Co się dzieje z uwagami, które wpisujesz agentowi tuż przed końcem sesji?

5 min

Warp opisał u Anthropica układ dwóch umiejętności: bazowa trzyma zasady przeglądu kodu, a druga rusza z harmonogramu, zbiera uwagi ludzi i proponuje jedną małą poprawkę do pliku bazowego, która wchodzi zwykłym pull requestem. Publiczne demo z agentem porządkującym zgłoszenia pokazuje całą pętlę, a komenda Skill Doctor ocenia wcześniejsze rozmowy agenta i podsuwa gotowy diff. Kupuję ten wzorzec z jednym zastrzeżeniem: uwagi ludzi prawie zawsze mówią, czego agentowi zabrakło, więc plik SKILL.md tylko puchnie, a im dłuższy, tym gorzej agent trafia do właściwej wiedzy.