SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Poradnik / Praktyka

Sędzia z paskiem błędu: instrukcja budowy harnessu do oceny LLM

Niedeterministyczny system AI trzeba mierzyć przyrządem z paskiem błędu, a nie testować na zasadzie zielone-czerwone światełko. Harness opisany na dev.to przepuszcza szablon przez tanie bramki, zanim włączy drogiego sędziego, ocenia w skali 1-5 i próbkuje trzy razy nawet w temperaturze 0, bo ten sam wymiar dał raz 4,00, a raz 2,67. Kluczem jest podział ról: tani Amazon Nova 2 Lite pilnuje struktury i poprawnego JSON-a, DeepSeek V3.2 pisze treść jakieś siedem razy taniej niż Sonnet, a sędzia z innej rodziny ocenia tylko sens.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Poradnik / Praktyka  ·  6 min  · 

Sędzia z paskiem błędu: instrukcja budowy harnessu do oceny LLM
Ilustrację przygotowała AI.

Test jednostkowy sprawdza, czy add(2,2) daje 4. Znasz poprawną odpowiedź, więc albo się zgadza, albo nie. Ale kiedy model generuje dialog nieufnego rozmówcy w siódmej scenie interaktywnej fabuły, nie ma żadnej "poprawnej linijki", z którą można by go porównać. Można tylko ocenić, na ile to dobre, i to przyrządem, który sam ma swój błąd pomiaru. Autor wpisu na dev.to, który opisał budowę swojego harnessu do oceny modeli, zaczyna właśnie od tego rozróżnienia: jego symulator treningowy każe modelowi wygenerować całą rozgałęzioną przygodę naraz, scena po scenie, z wyborami, dialogami i punktacją. Przy średnim szablonie to jakieś 21 scen razy 4 wybory razy kilka stanów relacji razy kilkoro postaci, czyli rzędu tysiąca osobno ocenianych reakcji. Nie da się tego przeczytać, a każda zmiana jednej linijki w prompcie każe wygenerować całość od nowa.

To jego główna teza i kupuję ją w całości: dla systemu, który nie jest deterministyczny, potrzebujesz przyrządu pomiarowego z paskiem błędu, a nie zielonego albo czerwonego światełka. Recenzent-człowiek się tu nie nadaje z trzech powodów naraz. Przy takiej objętości nie ma klucza odpowiedzi, więc koło czterechsetnej reakcji robi się po prostu pobłażliwy. Każde uruchomienie to inna ścieżka, więc to, co przeczytał raz, przy następnym generowaniu już nie istnieje. I nie wyczuje regresji, która ma znaczenie, bo spadek jakiegoś wymiaru z 4,3 na 4,0 jest niewidzialny dla kogoś, kto nie ma pod ręką poprzedniej liczby.

Najpierw tanie bramki, potem drogi sędzia

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Pięć podejść agenta, jeden sędzia i żadnych testów Premiera / Narzędzie

Pięć podejść agenta, jeden sędzia i żadnych testów

4 min

LLM-as-a-Verifier bierze pulę podejść agenta do jednego zadania i każe modelowi porównywać je parami, licząc przy tym nie samą notę, tylko pewność, z jaką model ją stawia. Na Terminal-Bench 2.1 model deepseek-v4-flash pojedynczym podejściem zaliczał 78,7% zadań, a wybór najlepszego z pięciu podniósł wynik do 88,0%, tyle że płaci się wtedy pięć razy zamiast raz. Ciekawszy jest drugi tryb, który ocenia jedno podejście krok po kroku, dzięki czemu beznadziejne da się przerwać po trzecim ruchu i ten rachunek raczej zbić niż napompować.

Self-Harness: agent czyta własne logi i sam łata swoje opakowanie Analiza / Opinia

Self-Harness: agent czyta własne logi i sam łata swoje opakowanie

4 min

Self-Harness, opisany w pracy z arXiv z 8 czerwca, każe agentowi czytać własne logi z awarii i samodzielnie przepisywać reguły swojego opakowania w pętli: znajdź słabość, załataj, przepuść zmianę przez testy regresji. Na Terminal-Bench-2.0 największy skok zaliczył najsłabszy model, Qwen3.5, który z 23,8% doszedł do 38,1%, podczas gdy mocniejsze MiniMax M2.5 i GLM-5 podniosły się słabiej. Wygląda to więc na sposób, żeby tańszy albo hostowany lokalnie model podciągnąć do poziomu, na którym w ogóle nadaje się do roboty, choć zostaje pytanie, kto potem czyta reguły, które napisał model.

Z 30% do 95,5% na tym samym benchmarku, bez ruszania wag modelu Premiera / Narzędzie

Z 30% do 95,5% na tym samym benchmarku, bez ruszania wag modelu

4 min

Prime Intellect opublikował 24 sierpnia raport, z którego wynika, że wymiana samego harnessu podnosi wynik na ARC-AGI-3 z 30% do 95,5%, przy nietkniętych wagach modelu. Prime Agent trzyma przez cały bieg jedną sesję IPythona, więc model filtruje własny dziennik pracy kodem zamiast przepychać go przez okno kontekstowe, a zapisane notatki i umiejętności przechodzą do następnego uruchomienia. Skłaniam się ku tezie autorów, że wcześniejsze pomiary mówiły głównie o cudzych harnessach, ale liczba jest ich własna i nikt jej niezależnie nie powtórzył.