Poradnik / Praktyka
Testy przeszły, panel zielony, a system podaje stare ceny
Freddy Daniel Alvarez Pinto opisał w The New Stack, dlaczego klasyczne CI/CD zawodzi przy systemach LLM: jego system RAG przeszedł wszystkie testy i świecił na zielono, a przez weekend model zamieniający teksty na wektory rozjechał się tak, że w poniedziałek podawał klientom stare ceny. Zamiast pytać tylko "czy test przeszedł", proponuje cztery bramki wydania, z których najważniejsza porównuje trafność z ruchomą średnią z ostatnich wydań i pewnego czwartku wychwyciła 6-procentowy spadek, zanim dotarłby do 200 użytkowników. To praktyka jednego inżyniera, nie branżowy standard.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Poradnik / Praktyka · 3 min ·
Freddy Daniel Alvarez Pinto wypuścił w piątek po południu nową wersję swojego systemu RAG. Wszystkie testy przeszły, wskaźniki podobieństwa wyglądały świetnie, panel świecił się na zielono. W poniedziałek rano ten sam system z pełnym przekonaniem podawał klientom nieaktualne cenniki: model zamieniający teksty na wektory zdążył się przez weekend na tyle rozjechać, że zaczął przedkładać stare fragmenty nad świeże. Żaden alarm się nie odezwał, żaden test nie padł, a odpowiedzi były śmieciowe.
To jest ten moment, w którym zielony pasek przestaje cokolwiek znaczyć. Alvarez Pinto, inżynier infrastruktury z ponad 20-letnim stażem, opisał tę historię na łamach The New Stack i wyciągnął z niej prosty wniosek: to nie był problem z wdrożeniem, tylko z bramką, która to wdrożenie przepuściła. Klasyczne CI/CD zaprojektowano dla oprogramowania deterministycznego, gdzie ten sam kod daje ten sam wynik. LLM jest probabilistyczny, więc bramka, która pyta tylko "czy test przeszedł", jest ślepa na to, co naprawdę się psuje.
Systemy AI nie wybuchają, tylko gniją
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.