Premiera / Narzędzie
Kiedy poprawka promptu naprawdę coś daje? Claude Code dostał narzędzie, które to mierzy
Claude Code dostał w skillu claude-api dwie komendy: build-eval buduje zestaw testów z prawdziwych rozmów i zgłoszeń, a hillclimb poprawia aplikację krok po kroku i cofa każdą zmianę, która nie pomaga na odłożonej, niewidzianej puli przypadków. Na 44 zgłoszeniach do obsługi klienta wynik na zakrytej puli wzrósł z około 11 do prawie 13 na 14 przy jednej piątej kosztu, choć oszczędność przyniosła głównie przesiadka na Sonnet 5. Najcenniejsze jest jednak to, że narzędzie umie przyznać, że poprawka nic nie dała, i wskazać zepsuty test.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 4 min ·
Druga poprawka promptu wyglądała obiecująco. Claude dopisał dwa wzorcowe przykłady do promptu aplikacji, która rozdziela przychodzące maile między kolejki działów, i wynik na przypadkach, nad którymi pracował, poszedł w górę. Mimo to zmiana została wycofana. Część przykładów od początku odłożono na bok i Claude nigdy ich nie oglądał, właśnie po to, żeby sprawdzić, czy poprawka działa poza materiałem, na którym powstała. Na tej odłożonej puli nie poprawiło się nic. Tę scenę Anthropic pokazuje jako ilustrację nowej komendy /claude-api hillclimb w Claude Code i moim zdaniem to wycofanie jest w całej zapowiedzi ważniejsze niż sama poprawa wyniku.
Obie nowości trafiły do skilla claude-api, czyli pakietu instrukcji, który Claude Code wczytuje, kiedy piszesz kod korzystający z API Claude'a. Pierwsza komenda, /claude-api build-eval, buduje w repozytorium zestaw testów sprawdzających, jak twoja aplikacja z modelem w środku radzi sobie z prawdziwymi zadaniami. Druga poprawia aplikację krok po kroku i zostawia zmianę tylko wtedy, gdy wynik naprawdę rośnie. Opisał je zespół Claude Devs na swoim blogu. To moje jedyne źródło i pochodzi od producenta, a opisane w nim przykłady powstały na jego własnych zestawach testów, więc liczby z niego traktuję jako deklarację, nie niezależny pomiar.
Test, któremu można uwierzyć
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.