Premiera / Narzędzie
Czy agent sam rozszerzy opublikowaną pracę badawczą? W teście RExBench udaje się to co trzeci raz
RExBench, benchmark z konferencji ACL z lipca 2026, bierze 12 prawdziwych prac naukowych z kodem i każe agentowi kodującemu samodzielnie rozszerzyć je o nową hipotezę, więc sprawdza coś trudniejszego niż łatanie zgłoszonych błędów. Autorzy przetestowali 12 konfiguracji agentów na frameworkach aider i OpenHands, a najlepszy dowiózł zaledwie 33% zadań. Nawet gdy dołożono wskazówki napisane przez człowieka, wynik nie przekroczył 44%, co pokazuje, że bariera nie leży w zrozumieniu polecenia. Im bardziej zadanie jest otwarte i badawcze, tym mocniej skuteczność agenta bez nadzoru spada.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 3 min ·
Weź opublikowaną pracę naukową razem z jej kodem, dołóż do tego instrukcję napisaną przez eksperta z danej dziedziny, coś w duchu "sprawdź teraz tę nową hipotezę, rozwijając istniejący kod", i każ całość wykonać agentowi AI, bez zaglądania mu przez ramię. Tak wygląda pojedyncze zadanie w RExBench, benchmarku przedstawionym na konferencji ACL w lipcu 2026 roku, który sprawdza umiejętność trudniejszą niż łatanie zgłoszonych błędów: czy agent kodujący potrafi samodzielnie rozszerzyć czyjąś pracę badawczą o nowy wątek.
Różnica względem znanych testów jest konkretna. Popularne benchmarki agentów z rodziny SWE-bench dają modelowi opisany błąd w znanym repozytorium i sprawdzają, czy powstała poprawka przechodzi testy. To realna praca, ale zamknięta: z góry wiadomo, jak wygląda dobra odpowiedź. RExBench bierze 12 prawdziwych prac naukowych i do każdej dokłada realistyczne rozszerzenie, które ma zbadać nową hipotezę, jakiej w oryginale nie było. Agent nie naprawia więc czegoś, co się zepsuło, tylko dopisuje do cudzego kodu fragment, którego wcześniej nikt nie napisał.
I tu robi się nieprzyjemnie dla zwolenników pełnej autonomii. Autorzy, zespół Nicholasa Edwardsa, sprawdzili 12 różnych konfiguracji agentów, zbudowanych na dwóch frameworkach, czyli aider i OpenHands. To dwie popularne warstwy agentowe, które zamieniają zwykły model językowy w agenta czytającego i piszącego pliki. Wszystkie poległy na większości rozszerzeń. Najlepszy dowiózł 33% zadań.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.