SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Poradnik / Praktyka

Zestaw testów agenta potrafi wysłać prawdziwy przelew

Braintrust tłumaczy, dlaczego test jednostkowy odrzuca poprawny przebieg agenta tylko za to, że sprawdził regulamin przed zamówieniem, i w miejsce asercji wstawia funkcję oceniającą cały zapis pracy w skali od 0 do 1, puszczaną kilka razy na to samo zgłoszenie. Zestaw wpięty w prawdziwe API płatnicze wysyłałby przy tym prawdziwe przelewy, więc usługi trzeba podstawić jako atrapy. Zapamiętałbym stąd liczbę kroków jako sygnał regresji, bo zapala się, zanim wynik zdąży się popsuć. Gorzej, że bramka w CI blokuje merge na ocenie modelu w roli sędziego, którego zgodności z ludźmi nikt nie podaje.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Poradnik / Praktyka  ·  4 min  · 

Zestaw testów agenta potrafi wysłać prawdziwy przelew
Ilustrację przygotowała AI.

Model językowy wpięty w prawdziwą bazę zamówień i w prawdziwe API płatnicze dostaje zgłoszenie: klient chce zwrotu za spóźnioną paczkę. W pierwszym uruchomieniu agent sprawdza najpierw zamówienie, potem regulamin zwrotów, a dopiero na końcu oddaje pieniądze. W drugim zaczyna od regulaminu i zamówienie sprawdza zaraz po nim. Oba przebiegi są poprawne, bo wymagane kontrole odbyły się przed przelewem, a stan końcowy wyszedł identyczny.

Klasyczny test jednostkowy mimo to odrzuci drugi przebieg, bo asercję napisano pod kolejność z pierwszego, przy założeniu, że to samo wejście da dokładnie to samo wyjście. Asercja na treść ostatniej wiadomości do klienta wywróci się jeszcze łatwiej, bo model za każdym razem dobiera trochę inne słowa.

Ten sam przykład ciągnie się przez cały przewodnik po testowaniu agentów, który opublikował Braintrust, firma sprzedająca platformę do oceniania modeli. Czytam go jako dobrą diagnozę z doklejonym cennikiem i to właśnie diagnoza jest tu warta czasu.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Pięć podejść agenta, jeden sędzia i żadnych testów Premiera / Narzędzie

Pięć podejść agenta, jeden sędzia i żadnych testów

4 min

LLM-as-a-Verifier bierze pulę podejść agenta do jednego zadania i każe modelowi porównywać je parami, licząc przy tym nie samą notę, tylko pewność, z jaką model ją stawia. Na Terminal-Bench 2.1 model deepseek-v4-flash pojedynczym podejściem zaliczał 78,7% zadań, a wybór najlepszego z pięciu podniósł wynik do 88,0%, tyle że płaci się wtedy pięć razy zamiast raz. Ciekawszy jest drugi tryb, który ocenia jedno podejście krok po kroku, dzięki czemu beznadziejne da się przerwać po trzecim ruchu i ten rachunek raczej zbić niż napompować.

Kod przechodzi linter i testy, a i tak bywa błędny Bezpieczeństwo

Kod przechodzi linter i testy, a i tak bywa błędny

4 min

Agent od kodu w jedno popołudnie otwiera kilkadziesiąt pull requestów, ale liczy się dla niego skończenie zadania, a nie to, żeby wyszło bezpiecznie. AWS proponuje na to trójwarstwową ramę: twarde automaty jak linter i skanery, model w roli sędziego oceniający intencję zmiany, oraz człowieka rezerwowanego tylko do kodu wrażliwego albo nowej logiki. Największy problem to kod, który przechodzi wszystkie automaty, a mimo to jest funkcjonalnie błędny. Rama zostaje mapą, nie dowodem, bo brakuje w niej choćby jednej liczby na to, że realnie zbija liczbę wpadek.

Kod da się sprawdzić i na tym stoi cała przewaga agentów Analiza / Opinia

Kod da się sprawdzić i na tym stoi cała przewaga agentów

4 min

Phillip Isola z MIT tłumaczy w rozmowie dla MIT News, dlaczego z całej fali agentów AI naprawdę wypaliła tylko jedna kategoria: te do pisania kodu. Powód jest prozaiczny, kod da się sprawdzić, więc agent może odpalić własne rozwiązanie, napisać test i kręcić pętlę prób i błędów, aż trafi na dobrą strategię, czego przy rezerwacji lotu czy w medycynie zrobić się nie da. Ta sama łatwość bywa jednak pułapką, bo przy vibe codingu człowiek świadomie rezygnuje z tej weryfikacji, przez co wkradają się błędy i wyciekają prywatne dane.