SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Poradnik / Praktyka

Testy przeszły, panel zielony, a system podaje stare ceny

Freddy Daniel Alvarez Pinto opisał w The New Stack, dlaczego klasyczne CI/CD zawodzi przy systemach LLM: jego system RAG przeszedł wszystkie testy i świecił na zielono, a przez weekend model zamieniający teksty na wektory rozjechał się tak, że w poniedziałek podawał klientom stare ceny. Zamiast pytać tylko "czy test przeszedł", proponuje cztery bramki wydania, z których najważniejsza porównuje trafność z ruchomą średnią z ostatnich wydań i pewnego czwartku wychwyciła 6-procentowy spadek, zanim dotarłby do 200 użytkowników. To praktyka jednego inżyniera, nie branżowy standard.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Poradnik / Praktyka  ·  3 min  · 

Testy przeszły, panel zielony, a system podaje stare ceny
Ilustrację przygotowała AI.

Freddy Daniel Alvarez Pinto wypuścił w piątek po południu nową wersję swojego systemu RAG. Wszystkie testy przeszły, wskaźniki podobieństwa wyglądały świetnie, panel świecił się na zielono. W poniedziałek rano ten sam system z pełnym przekonaniem podawał klientom nieaktualne cenniki: model zamieniający teksty na wektory zdążył się przez weekend na tyle rozjechać, że zaczął przedkładać stare fragmenty nad świeże. Żaden alarm się nie odezwał, żaden test nie padł, a odpowiedzi były śmieciowe.

To jest ten moment, w którym zielony pasek przestaje cokolwiek znaczyć. Alvarez Pinto, inżynier infrastruktury z ponad 20-letnim stażem, opisał tę historię na łamach The New Stack i wyciągnął z niej prosty wniosek: to nie był problem z wdrożeniem, tylko z bramką, która to wdrożenie przepuściła. Klasyczne CI/CD zaprojektowano dla oprogramowania deterministycznego, gdzie ten sam kod daje ten sam wynik. LLM jest probabilistyczny, więc bramka, która pyta tylko "czy test przeszedł", jest ślepa na to, co naprawdę się psuje.

Systemy AI nie wybuchają, tylko gniją

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Kod przestał być drogi, utrzymanie nie Analiza / Opinia

Kod przestał być drogi, utrzymanie nie

4 min

Avery Pennarun z Tailscale twierdzi, że narzędzia AI przesuwają drobne programy z kategorii "nie warto się za to brać" do "zrobię po obiedzie", i proponuje test trzech pytań: czy ktoś poza tobą już na tym polega, czy program rusza wrażliwe dane i czy jego awaria zatrzymałaby czyjąś pracę. Test jest dobry, tylko zadany o pół roku za wcześnie, bo narzędzie robi się ważne dopiero wtedy, gdy ktoś wpisze je do procedury. Pisanie kodu potaniało, ale drugi rachunek, czyli zmienione API, przegląd uprawnień i niezgodne liczby w panelu, wraca co miesiąc.

GitHub skrócił wyjście z terminala i zapłacił za to więcej Analiza / Opinia

GitHub skrócił wyjście z terminala i zapłacił za to więcej

5 min

GitHub podpiął do Copilota RTK, narzędzie skracające wyjście z powłoki, i na własnych benchmarkach agentowych zadanie wyszło średnio drożej, bo model wracał po wycięty fragment i tracił kolejne tury. Cztery poprawki, które trafiły do Copilot CLI, łączy to, że żadna nie wyrzuca informacji bezpowrotnie: wycięcie numerów linii z odczytu plików zbiło koszt inferencji o około 5% na benchmarkach i 3% dziennie u użytkowników, a dwukrotne skrócenie promptu dało 2,9% taniej, ale po cichu zamieniło sugestię o równoległości w regułę kolejkowania i regresję wyłapali dopiero użytkownicy.

Programiści przeszli żałobę po AI i wrócili z fakturą za tokeny Premiera / Narzędzie

Programiści przeszli żałobę po AI i wrócili z fakturą za tokeny

5 min

Z relacji Marka Pesce'a w The Register z konferencji AI Engineer Melbourne wynika, że programiści przestali bać się AI i zaczęli budować narzędzia, które ustawiają ją po swojej stronie. AJ Fisher pokazał, jak tani model dyfuzyjny puszczany w kółko nad jednym problemem schodzi z kosztem do połowy, a czasem do jednej dziesiątej, co Google potwierdził świeżym DiffusionGemmą. Daniel Rodgers-Pryor uruchomił zaś pipeline CI/CD, w którym agenty same diagnozują usterki i wypuszczają poprawki, działając tym lepiej, im większe dostają obciążenie.