Premiera / Narzędzie
Microsoft otwiera dwa narzędzia, które sprawdzają, czy agent trzyma się reguł, zanim trafi na produkcję
Na Build 2026, 2 czerwca, Microsoft wypuścił na licencji MIT dwa narzędzia, które sprawdzają, czy agent trzyma się wyznaczonych mu reguł, zanim trafi na produkcję. ASSERT zamienia spisaną politykę czy prompt systemowy w działające testy i ocenia je modelem jako sędzią, który w wewnętrznych testach zgadzał się z ludźmi w 80-90% przypadków. ACS wpina twarde kontrole w pięciu punktach cyklu życia agenta, opisane w przenośnym pliku YAML, z wtyczkami do LangChain, CrewAI czy Anthropic Agents SDK. Microsoft daje wspólny język, ale nie zdejmuje z nikogo odpowiedzialności, gdy agent się pomyli.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 5 min ·
Na Build 2026, 2 czerwca, Microsoft wypuścił dwa otwarte projekty, które biorą się za problem, na który do tej pory nikt nie miał dobrej odpowiedzi: skąd właściwie wiesz, że twój agent trzyma się reguł, które mu wyznaczyłeś, zanim wpuścisz go na produkcję. Pierwszy z nich, ASSERT, bierze twoje reguły zapisane zwykłym językiem i zamienia je w testy. Drugi, ACS, pilnuje, żeby agent tych reguł przestrzegał w trakcie działania. Oba na licencji MIT, oba pomyślane tak, żeby działały niezależnie od tego, w czym zbudowałeś samego agenta.
Zacznijmy od tego, czego dzisiaj brakuje, bo bez tego trudno docenić, po co to powstało. Klasyczny benchmark sprawdza, czy model dobrze rozwiązuje uniwersalne zadania, ale nie ma pojęcia o twoich zasadach, twoim produkcie i twoich przypadkach brzegowych. A agenci psują się właśnie tam, gdzie tego nie widać. "Odchodzą od polityki, w nietypowych sytuacjach generują niebezpieczne wyniki, na produkcji zachowują się inaczej niż w testach", napisał Microsoft na blogu zapowiadającym ASSERT. Innymi słowy, agent przechodzi testy, a potem u prawdziwego użytkownika robi coś, czego nikt nie sprawdził. Skala problemu jest taka, że niemal nikt tego nie sprawdza. "Większość organizacji, a właściwie 99% z nich, nie ocenia żadnych agentów przed wdrożeniem na produkcję", mówi Anushree Verma, starsza analityczka w Gartnerze.
ASSERT zamienia spisaną politykę w działające testy
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.