SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Microsoft otwiera dwa narzędzia, które sprawdzają, czy agent trzyma się reguł, zanim trafi na produkcję

Na Build 2026, 2 czerwca, Microsoft wypuścił na licencji MIT dwa narzędzia, które sprawdzają, czy agent trzyma się wyznaczonych mu reguł, zanim trafi na produkcję. ASSERT zamienia spisaną politykę czy prompt systemowy w działające testy i ocenia je modelem jako sędzią, który w wewnętrznych testach zgadzał się z ludźmi w 80-90% przypadków. ACS wpina twarde kontrole w pięciu punktach cyklu życia agenta, opisane w przenośnym pliku YAML, z wtyczkami do LangChain, CrewAI czy Anthropic Agents SDK. Microsoft daje wspólny język, ale nie zdejmuje z nikogo odpowiedzialności, gdy agent się pomyli.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  5 min  · 

Microsoft otwiera dwa narzędzia, które sprawdzają, czy agent trzyma się reguł, zanim trafi na produkcję
Ilustrację przygotowała AI.

Na Build 2026, 2 czerwca, Microsoft wypuścił dwa otwarte projekty, które biorą się za problem, na który do tej pory nikt nie miał dobrej odpowiedzi: skąd właściwie wiesz, że twój agent trzyma się reguł, które mu wyznaczyłeś, zanim wpuścisz go na produkcję. Pierwszy z nich, ASSERT, bierze twoje reguły zapisane zwykłym językiem i zamienia je w testy. Drugi, ACS, pilnuje, żeby agent tych reguł przestrzegał w trakcie działania. Oba na licencji MIT, oba pomyślane tak, żeby działały niezależnie od tego, w czym zbudowałeś samego agenta.

Zacznijmy od tego, czego dzisiaj brakuje, bo bez tego trudno docenić, po co to powstało. Klasyczny benchmark sprawdza, czy model dobrze rozwiązuje uniwersalne zadania, ale nie ma pojęcia o twoich zasadach, twoim produkcie i twoich przypadkach brzegowych. A agenci psują się właśnie tam, gdzie tego nie widać. "Odchodzą od polityki, w nietypowych sytuacjach generują niebezpieczne wyniki, na produkcji zachowują się inaczej niż w testach", napisał Microsoft na blogu zapowiadającym ASSERT. Innymi słowy, agent przechodzi testy, a potem u prawdziwego użytkownika robi coś, czego nikt nie sprawdził. Skala problemu jest taka, że niemal nikt tego nie sprawdza. "Większość organizacji, a właściwie 99% z nich, nie ocenia żadnych agentów przed wdrożeniem na produkcję", mówi Anushree Verma, starsza analityczka w Gartnerze.

ASSERT zamienia spisaną politykę w działające testy

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Microsoft otwiera agenta, który czyta repozytorium, zanim napisze testy Premiera / Narzędzie

Microsoft otwiera agenta, który czyta repozytorium, zanim napisze testy

4 min

Microsoft udostępnił na licencji MIT agenta code-testing-generator, który zanim napisze testy jednostkowe, przeszukuje repozytorium, wykrywa język i framework oraz ustala prawdziwe komendy budowania. Na wewnętrznym benchmarku ze 152 zadań zaliczył 140 wobec 120 Copilota na tym samym modelu, czyli o 63% mniej porażek. Cały zysk skupia się w ogólnikowych poleceniach typu „napisz testy”, gdzie liczba porażek spadła z 30 do 10; przy szczegółowych promptach oba wypadły tak samo. To nie przełom, tylko porządne rusztowanie automatyzujące nudne rozeznanie pomijane przy jednej linijce polecenia.

Twoje narzędzie pisze kod, którego skaner zobaczy dopiero po fakcie Bezpieczeństwo

Twoje narzędzie pisze kod, którego skaner zobaczy dopiero po fakcie

4 min

Agentowe pisanie kodu psuje stary układ, w którym skaner sprawdzał gotowy kod, bo między napisaniem a kontrolą nie ma już człowieka pilnującego narzędzia. Z tej luki wyrósł nowy gatunek produktów, które Techloy zebrał w zestawieniu siedmiu platform na 2026 rok: od Apiiro sprawdzającego zmianę po fakcie, przez Arnicę wstrzykującą reguły wprost do Claude czy Cursora w chwili generowania, po narzędzia pilnujące wdrożeń i agentów poza repozytoriami. Że to realna kategoria, potwierdza AMTSO, które otworzyło do recenzji pierwsze wytyczne testowania agentów. Brakuje jednak twardych liczb.

Microsoft pozwala AI napisać test tylko raz, resztę robi już zwykły skrypt Premiera / Narzędzie

Microsoft pozwala AI napisać test tylko raz, resztę robi już zwykły skrypt

3 min

Zespół Commerce Platforms w Microsofcie obszedł konflikt między probabilistyczną naturą AI a wymogiem, by test zgodności za każdym razem przebiegał identycznie: agent tylko raz układa przypadki testowe z istniejącej dokumentacji, człowiek je zatwierdza, a wynik zostaje zamrożony w deterministyczny skrypt, którego AI już nie dotyka. Drugi agent podważa to, co stworzył pierwszy, zanim cokolwiek zostanie zatwierdzone. Cotygodniowe testy regresji przy migracji Global Trade Services na SAP S/4HANA spadły z trzech dni do niespełna godziny, choć liczby pochodzą wyłącznie z firmowego bloga Microsoftu.