Analiza / Opinia
Ponad 20% drożej i ani jednego zadania więcej
Zespół z laboratorium SRI na ETH w Zurychu sprawdził, czy pliki kontekstowe w repozytorium, jak AGENTS.md, realnie pomagają agentom do programowania, i wyszło, że nie: skuteczność mierzona odsetkiem ukończonych zadań ani drgnęła, a rachunek za pracę agenta urósł o ponad 20%. Wynik trzyma się także wtedy, gdy kontekst pisali ręcznie sami deweloperzy, nie tylko model. Pliki zmieniają zachowanie agenta: więcej testuje i dokładniej przegląda repozytorium, co spala tokeny, ale nie zamyka więcej zgłoszeń. Autorzy nie każą wyrzucać AGENTS.md, tylko skrócić go do rzeczy, których agent sam nie zgadnie.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Analiza / Opinia · 3 min ·
Twórcy narzędzi do programowania z agentami od miesięcy powtarzają to samo zalecenie: dołóż do repozytorium plik kontekstowy. AGENTS.md, czasem CLAUDE.md, to zwykły markdown, w którym opisujesz agentowi projekt: jak uruchamia się testy, którego menedżera pakietów używacie, jakich konwencji się trzymać. Pomysł jest zdroworozsądkowy. Skoro nowa osoba w zespole dostaje takie wprowadzenie, to model też powinien pracować lepiej, gdy mu je damy. Zespół z laboratorium SRI na ETH w Zurychu postanowił to wreszcie sprawdzić i wynik przeczy tej intuicji: pliki kontekstowe nie poprawiły skuteczności agentów w zadaniach, a rachunek za ich pracę urósł o ponad 20%.
Badacze zmierzyli to na dwa sposoby, żeby nie opierać wniosku na jednym typie danych. Pierwszy zestaw to zadania z SWE-bench, czyli realne zgłoszenia błędów z popularnych repozytoriów open-source, do których pliki kontekstowe wygenerował model według zaleceń samych twórców agentów. Drugi to nowa kolekcja zgłoszeń, tym razem z plikami napisanymi ręcznie przez deweloperów prowadzących te projekty. W obu wariantach, na kilku różnych agentach i modelach, skuteczność mierzona odsetkiem ukończonych zadań ani drgnęła.
Ten drugi wariant jest tu najważniejszy. Łatwo byłoby machnąć ręką na plik, który wygenerował model, i powiedzieć, że po prostu wyszedł słaby. Ale kiedy kontekst pisali ręcznie sami deweloperzy, a nie model, wynik był ten sam. Kontekst nie zaszkodził, ale też nie pomógł.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.