SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Analiza / Opinia

Ponad 20% drożej i ani jednego zadania więcej

Zespół z laboratorium SRI na ETH w Zurychu sprawdził, czy pliki kontekstowe w repozytorium, jak AGENTS.md, realnie pomagają agentom do programowania, i wyszło, że nie: skuteczność mierzona odsetkiem ukończonych zadań ani drgnęła, a rachunek za pracę agenta urósł o ponad 20%. Wynik trzyma się także wtedy, gdy kontekst pisali ręcznie sami deweloperzy, nie tylko model. Pliki zmieniają zachowanie agenta: więcej testuje i dokładniej przegląda repozytorium, co spala tokeny, ale nie zamyka więcej zgłoszeń. Autorzy nie każą wyrzucać AGENTS.md, tylko skrócić go do rzeczy, których agent sam nie zgadnie.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Analiza / Opinia  ·  3 min  · 

Ponad 20% drożej i ani jednego zadania więcej
Ilustrację przygotowała AI.

Twórcy narzędzi do programowania z agentami od miesięcy powtarzają to samo zalecenie: dołóż do repozytorium plik kontekstowy. AGENTS.md, czasem CLAUDE.md, to zwykły markdown, w którym opisujesz agentowi projekt: jak uruchamia się testy, którego menedżera pakietów używacie, jakich konwencji się trzymać. Pomysł jest zdroworozsądkowy. Skoro nowa osoba w zespole dostaje takie wprowadzenie, to model też powinien pracować lepiej, gdy mu je damy. Zespół z laboratorium SRI na ETH w Zurychu postanowił to wreszcie sprawdzić i wynik przeczy tej intuicji: pliki kontekstowe nie poprawiły skuteczności agentów w zadaniach, a rachunek za ich pracę urósł o ponad 20%.

Badacze zmierzyli to na dwa sposoby, żeby nie opierać wniosku na jednym typie danych. Pierwszy zestaw to zadania z SWE-bench, czyli realne zgłoszenia błędów z popularnych repozytoriów open-source, do których pliki kontekstowe wygenerował model według zaleceń samych twórców agentów. Drugi to nowa kolekcja zgłoszeń, tym razem z plikami napisanymi ręcznie przez deweloperów prowadzących te projekty. W obu wariantach, na kilku różnych agentach i modelach, skuteczność mierzona odsetkiem ukończonych zadań ani drgnęła.

Ten drugi wariant jest tu najważniejszy. Łatwo byłoby machnąć ręką na plik, który wygenerował model, i powiedzieć, że po prostu wyszedł słaby. Ale kiedy kontekst pisali ręcznie sami deweloperzy, a nie model, wynik był ten sam. Kontekst nie zaszkodził, ale też nie pomógł.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Milion tokenów i 90 wywołań na jedno zadanie: jak w ogóle zmierzyć takiego agenta? Analiza / Opinia

Milion tokenów i 90 wywołań na jedno zadanie: jak w ogóle zmierzyć takiego agenta?

4 min

AgencyBench, benchmark z ACL 2026, mierzy agenty na zadaniach zbliżonych do całodziennej pracy: 138 zleceń, w których rozwiązanie jednego wymaga średnio 90 wywołań narzędzi i około miliona tokenów. Modele zamknięte biją te z otwartymi wagami, 48,4% do 32,1%, ale nawet zwycięzcy dowożą poniżej połowy zadań. Ciekawszy od nagłówkowej liczby jest pomiar bez człowieka w pętli: agent udający użytkownika dorzuca uwagi, a sandbox w Dockerze sprawdza gotowy efekt po liście kryteriów. Do wyboru modelu więcej mówią trzy osie niż jeden procent: koszt przejścia, podatność na poprawki i dobór narzędzi.

OpenAI opublikowało własny rachunek za agenty do kodu Analiza / Opinia

OpenAI opublikowało własny rachunek za agenty do kodu

4 min

OpenAI pokazało własny rachunek za pisanie kodu z agentami: w połowie sierpnia badacz ze środka stawki zużywał tokeny za ponad 600 dolarów dziennie, a najbardziej rozpędzona dziesiąta część działu za ponad 7 tysięcy, choć wyliczono to po cenniku API, którego sama firma nie płaci. Więcej o samych agentach mówi inna liczba, bo wśród udanych zadań na cztery do ośmiu godzin ponad połowa wymagała po drodze poprawki człowieka. Tokeny zwracają się tam, gdzie ktoś grzęźnie w infrastrukturze, a nie tam, gdzie trzeba wymyślić, co w ogóle budować.

Czy agent sam rozszerzy opublikowaną pracę badawczą? W teście RExBench udaje się to co trzeci raz Premiera / Narzędzie

Czy agent sam rozszerzy opublikowaną pracę badawczą? W teście RExBench udaje się to co trzeci raz

3 min

RExBench, benchmark z konferencji ACL z lipca 2026, bierze 12 prawdziwych prac naukowych z kodem i każe agentowi kodującemu samodzielnie rozszerzyć je o nową hipotezę, więc sprawdza coś trudniejszego niż łatanie zgłoszonych błędów. Autorzy przetestowali 12 konfiguracji agentów na frameworkach aider i OpenHands, a najlepszy dowiózł zaledwie 33% zadań. Nawet gdy dołożono wskazówki napisane przez człowieka, wynik nie przekroczył 44%, co pokazuje, że bariera nie leży w zrozumieniu polecenia. Im bardziej zadanie jest otwarte i badawcze, tym mocniej skuteczność agenta bez nadzoru spada.