SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Czy agent sam rozszerzy opublikowaną pracę badawczą? W teście RExBench udaje się to co trzeci raz

RExBench, benchmark z konferencji ACL z lipca 2026, bierze 12 prawdziwych prac naukowych z kodem i każe agentowi kodującemu samodzielnie rozszerzyć je o nową hipotezę, więc sprawdza coś trudniejszego niż łatanie zgłoszonych błędów. Autorzy przetestowali 12 konfiguracji agentów na frameworkach aider i OpenHands, a najlepszy dowiózł zaledwie 33% zadań. Nawet gdy dołożono wskazówki napisane przez człowieka, wynik nie przekroczył 44%, co pokazuje, że bariera nie leży w zrozumieniu polecenia. Im bardziej zadanie jest otwarte i badawcze, tym mocniej skuteczność agenta bez nadzoru spada.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  3 min  · 

Czy agent sam rozszerzy opublikowaną pracę badawczą? W teście RExBench udaje się to co trzeci raz
Ilustrację przygotowała AI.

Weź opublikowaną pracę naukową razem z jej kodem, dołóż do tego instrukcję napisaną przez eksperta z danej dziedziny, coś w duchu "sprawdź teraz tę nową hipotezę, rozwijając istniejący kod", i każ całość wykonać agentowi AI, bez zaglądania mu przez ramię. Tak wygląda pojedyncze zadanie w RExBench, benchmarku przedstawionym na konferencji ACL w lipcu 2026 roku, który sprawdza umiejętność trudniejszą niż łatanie zgłoszonych błędów: czy agent kodujący potrafi samodzielnie rozszerzyć czyjąś pracę badawczą o nowy wątek.

Różnica względem znanych testów jest konkretna. Popularne benchmarki agentów z rodziny SWE-bench dają modelowi opisany błąd w znanym repozytorium i sprawdzają, czy powstała poprawka przechodzi testy. To realna praca, ale zamknięta: z góry wiadomo, jak wygląda dobra odpowiedź. RExBench bierze 12 prawdziwych prac naukowych i do każdej dokłada realistyczne rozszerzenie, które ma zbadać nową hipotezę, jakiej w oryginale nie było. Agent nie naprawia więc czegoś, co się zepsuło, tylko dopisuje do cudzego kodu fragment, którego wcześniej nikt nie napisał.

I tu robi się nieprzyjemnie dla zwolenników pełnej autonomii. Autorzy, zespół Nicholasa Edwardsa, sprawdzili 12 różnych konfiguracji agentów, zbudowanych na dwóch frameworkach, czyli aider i OpenHands. To dwie popularne warstwy agentowe, które zamieniają zwykły model językowy w agenta czytającego i piszącego pliki. Wszystkie poległy na większości rozszerzeń. Najlepszy dowiózł 33% zadań.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Agenty lepiej łatają cudzy kod, niż dopisują brakującą funkcję Analiza / Opinia

Agenty lepiej łatają cudzy kod, niż dopisują brakującą funkcję

3 min

Claude Opus 4.5 zamyka 74,4% zadań na SWE-bench, a na nowym benchmarku FeatureBench dowozi 11%, choć model jest ten sam i zmieniło się tylko to, o co go poproszono. Qixing Zhou i współautorzy, w pracy zgłoszonej na ICLR 2026, wycięli z 24 repozytoriów open-source kod stojący za wybranymi testami, tak że agent ma odtworzyć brakującą funkcję bez wskazanego miejsca i bez gotowych granic zmiany. Agenty domykają pętlę, którą ktoś już otworzył i opisał, a dużo gorzej radzą sobie z wykrojeniem zadania od zera. Ostrożnie z tą liczbą, bo trudność dziur ustawia sam twórca benchmarku.

Nowy benchmark Supabase pokazuje, czego agenty nie doczytują Premiera / Narzędzie

Nowy benchmark Supabase pokazuje, czego agenty nie doczytują

4 min

Supabase 31 lipca udostępnił Evals, otwarty benchmark, który uruchamia agenty AI na żywej bazie i sprawdza, jak stawiają schemat i reguły bezpieczeństwa, a nie tylko czy piszą poprawny kod. Powód jest konkretny: ponad 60% nowych baz zakłada u firmy narzędzie AI, a nie człowiek. Najciekawsze okazały się nawyki agentów, czyli ręczne migracje mimo deklaratywnego schematu i rozjazd w czytaniu dokumentacji, gdzie Codex zaglądał średnio do ośmiu stron na scenariusz, a Claude Code do dwóch. Test projektuje jednak sam Supabase, który na każdym agencie zarabia, więc nie jest neutralny.

Milion tokenów i 90 wywołań na jedno zadanie: jak w ogóle zmierzyć takiego agenta? Analiza / Opinia

Milion tokenów i 90 wywołań na jedno zadanie: jak w ogóle zmierzyć takiego agenta?

4 min

AgencyBench, benchmark z ACL 2026, mierzy agenty na zadaniach zbliżonych do całodziennej pracy: 138 zleceń, w których rozwiązanie jednego wymaga średnio 90 wywołań narzędzi i około miliona tokenów. Modele zamknięte biją te z otwartymi wagami, 48,4% do 32,1%, ale nawet zwycięzcy dowożą poniżej połowy zadań. Ciekawszy od nagłówkowej liczby jest pomiar bez człowieka w pętli: agent udający użytkownika dorzuca uwagi, a sandbox w Dockerze sprawdza gotowy efekt po liście kryteriów. Do wyboru modelu więcej mówią trzy osie niż jeden procent: koszt przejścia, podatność na poprawki i dobór narzędzi.