SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Microsoft pozwala AI napisać test tylko raz, resztę robi już zwykły skrypt

Zespół Commerce Platforms w Microsofcie obszedł konflikt między probabilistyczną naturą AI a wymogiem, by test zgodności za każdym razem przebiegał identycznie: agent tylko raz układa przypadki testowe z istniejącej dokumentacji, człowiek je zatwierdza, a wynik zostaje zamrożony w deterministyczny skrypt, którego AI już nie dotyka. Drugi agent podważa to, co stworzył pierwszy, zanim cokolwiek zostanie zatwierdzone. Cotygodniowe testy regresji przy migracji Global Trade Services na SAP S/4HANA spadły z trzech dni do niespełna godziny, choć liczby pochodzą wyłącznie z firmowego bloga Microsoftu.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  3 min  · 

Microsoft pozwala AI napisać test tylko raz, resztę robi już zwykły skrypt
Ilustrację przygotowała AI.

Testy zgodności mają jedną nieprzyjemną właściwość: ten sam test musi za każdym razem przebiec identycznie, bo inaczej audytor nie ma pod czym się podpisać. Generatywna AI z natury tak nie działa, bo ten sam prompt potrafi dać dwie różne odpowiedzi. Właśnie dlatego w większości firm AI do testowania wciąż jest eksperymentem, a nie realną infrastrukturą. Zespół Commerce Platforms w Microsofcie opisał na firmowym blogu, jak ten konflikt obszedł, i jest to ciekawsze niż liczby, którymi się chwali.

Pretekstem był twardy termin. System Global Trade Services, który w Microsofcie obsługuje odprawy celne i wystawianie faktur przy przewozie towarów przez granice, musiał do grudnia 2025 przejść ze starego SAP ERP na SAP S/4HANA, bo inaczej, dosłownie, stanęłyby wysyłki. Zespół miał na to 10 miesięcy, a same cotygodniowe testy regresji, sprawdzające po każdej zmianie, czy nie popsuło się coś, co wcześniej działało, zjadały trzy pełne dni. Starym sposobem nie dało się zdążyć.

Cała sztuczka polega na tym, żeby AI dotknęła testu tylko raz

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Microsoft otwiera agenta, który czyta repozytorium, zanim napisze testy Premiera / Narzędzie

Microsoft otwiera agenta, który czyta repozytorium, zanim napisze testy

4 min

Microsoft udostępnił na licencji MIT agenta code-testing-generator, który zanim napisze testy jednostkowe, przeszukuje repozytorium, wykrywa język i framework oraz ustala prawdziwe komendy budowania. Na wewnętrznym benchmarku ze 152 zadań zaliczył 140 wobec 120 Copilota na tym samym modelu, czyli o 63% mniej porażek. Cały zysk skupia się w ogólnikowych poleceniach typu „napisz testy”, gdzie liczba porażek spadła z 30 do 10; przy szczegółowych promptach oba wypadły tak samo. To nie przełom, tylko porządne rusztowanie automatyzujące nudne rozeznanie pomijane przy jednej linijce polecenia.

Microsoft otwiera dwa narzędzia, które sprawdzają, czy agent trzyma się reguł, zanim trafi na produkcję Premiera / Narzędzie

Microsoft otwiera dwa narzędzia, które sprawdzają, czy agent trzyma się reguł, zanim trafi na produkcję

5 min

Na Build 2026, 2 czerwca, Microsoft wypuścił na licencji MIT dwa narzędzia, które sprawdzają, czy agent trzyma się wyznaczonych mu reguł, zanim trafi na produkcję. ASSERT zamienia spisaną politykę czy prompt systemowy w działające testy i ocenia je modelem jako sędzią, który w wewnętrznych testach zgadzał się z ludźmi w 80-90% przypadków. ACS wpina twarde kontrole w pięciu punktach cyklu życia agenta, opisane w przenośnym pliku YAML, z wtyczkami do LangChain, CrewAI czy Anthropic Agents SDK. Microsoft daje wspólny język, ale nie zdejmuje z nikogo odpowiedzialności, gdy agent się pomyli.

AI pisze 80% testów, resztę wciąż dopina człowiek Analiza / Opinia

AI pisze 80% testów, resztę wciąż dopina człowiek

4 min

Suneet Malhotra, od dwudziestu lat budujący automatyzację testów, rozkłada slogan o AI piszącej 80% testów: model przejmuje 80% klepania w klawiaturę, nie 80% inżynierii, a cała trudność tkwi w pozostałych 20%. Jego pipeline zamienia projekt z Figmy w testy WebDriverIO w jakieś 16 minut, ale kładła go nie halucynacja modelu, tylko hydraulika wokół niego: backend gubił dane logowania, a przestawiona zmienna kazała agentom generować puste dokumenty. Cztery podręcznikowe zabezpieczenia to naprawiły, a człowiekowi i tak zostaje od 20 do 30 procent wysiłku, głównie na przeglądaniu.