SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Pięć podejść agenta, jeden sędzia i żadnych testów

LLM-as-a-Verifier bierze pulę podejść agenta do jednego zadania i każe modelowi porównywać je parami, licząc przy tym nie samą notę, tylko pewność, z jaką model ją stawia. Na Terminal-Bench 2.1 model deepseek-v4-flash pojedynczym podejściem zaliczał 78,7% zadań, a wybór najlepszego z pięciu podniósł wynik do 88,0%, tyle że płaci się wtedy pięć razy zamiast raz. Ciekawszy jest drugi tryb, który ocenia jedno podejście krok po kroku, dzięki czemu beznadziejne da się przerwać po trzecim ruchu i ten rachunek raczej zbić niż napompować.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Pięć podejść agenta, jeden sędzia i żadnych testów
Ilustrację przygotowała AI.

Agent dostaje zadanie, grzebie w repozytorium, zmienia trzy pliki i oznajmia, że gotowe. Jeśli akurat nie ma testu, który by to rozstrzygnął, nikt nie wie, czy trafił. Standardowe obejście jest brutalnie proste: puść agenta pięć razy i weź najlepsze podejście. Tyle że ktoś to najlepsze musi wskazać, a wskazanie zwykle oznacza dokładnie ten zestaw testów, którego nie ma.

Polecenie pip install llm-verifier instaluje bibliotekę, która próbuje wskazać zwycięskie podejście bez testów. LLM-as-a-Verifier bierze pulę podejść agenta do jednego zadania, każe modelowi porównywać je parami i zwraca indeks zwycięzcy. Nic się nie trenuje, nie dochodzi żaden osobny model oceniający, zostaje zwykłe wywołanie API z kryteriami zapisanymi normalnym zdaniem w pliku markdown. Działa to lepiej, niż się spodziewałem, i kosztuje wyraźnie więcej, niż sugerowałby opis.

Nie sama nota, tylko pewność, z jaką model ją stawia

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

CLM-8B nie pisze ani słowa, tylko wybiera najlepszy ruch agenta Model / Badania

CLM-8B nie pisze ani słowa, tylko wybiera najlepszy ruch agenta

4 min

CLM-8B od związanego ze Stanfordem zespołu Contrastive-LM nie generuje tekstu, tylko przypisuje prawdopodobieństwo każdemu możliwemu ruchowi agenta, dzięki czemu jest szybszy od zamkniętego Jev, w grze T-Rex nawet dziewięciokrotnie. Jako sędzia łatek podniósł wynik na DeepSWE z 73,7 do 81,6%, podczas gdy Jev wybierał gorzej niż branie pierwszego rozwiązania z brzegu. Rekord liczono jednak na 38 i 30 zadaniach, więc szybkość broni się lepiej niż jakość, a nakładkę o wadze 75 MB na licencji Apache 2.0 można sprawdzić na własnych zadaniach.

Który model wpiąć w agenta? Nowy test z ACL sprawdza to na realnej robocie Analiza / Opinia

Który model wpiąć w agenta? Nowy test z ACL sprawdza to na realnej robocie

3 min

AgencyBench, praca z ACL 2026 autorstwa Keyu Li i Pengfei Liu, sprawdza modele na 138 zadaniach odwzorowujących wielogodzinną robotę z agentami, gdzie jedno zlecenie potrafi pochłonąć 90 wywołań narzędzi i milion tokenów. Modele zamknięte biją te z otwartymi wagami, 48,4% do 32,1%, ale nawet zwycięska grupa rozwiązuje poniżej połowy zadań, więc do powierzenia agentowi roboty bez nadzoru wciąż daleko. Dla wyboru modelu najwięcej mówią trzy osie: ile tokenów i wywołań model spala, czy nadrabia pod wpływem uwag i po jakie narzędzia sięga.

Milion tokenów i 90 wywołań na jedno zadanie: jak w ogóle zmierzyć takiego agenta? Analiza / Opinia

Milion tokenów i 90 wywołań na jedno zadanie: jak w ogóle zmierzyć takiego agenta?

4 min

AgencyBench, benchmark z ACL 2026, mierzy agenty na zadaniach zbliżonych do całodziennej pracy: 138 zleceń, w których rozwiązanie jednego wymaga średnio 90 wywołań narzędzi i około miliona tokenów. Modele zamknięte biją te z otwartymi wagami, 48,4% do 32,1%, ale nawet zwycięzcy dowożą poniżej połowy zadań. Ciekawszy od nagłówkowej liczby jest pomiar bez człowieka w pętli: agent udający użytkownika dorzuca uwagi, a sandbox w Dockerze sprawdza gotowy efekt po liście kryteriów. Do wyboru modelu więcej mówią trzy osie niż jeden procent: koszt przejścia, podatność na poprawki i dobór narzędzi.