SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Poradnik / Praktyka

Tydzień 28 · 6–12 lipca 2026

Tydzień 27 · 29 czerwca – 5 lipca 2026

Darmowy przewodnik po budowie agentów, od modelu po wdrożenie na produkcji Poradnik / Praktyka

Darmowy przewodnik po budowie agentów, od modelu po wdrożenie na produkcji

3 min

Haggai Roitman wrzucił 22 czerwca na arXiv „The Hitchhiker's Guide to Agentic AI", darmową książkę na licencji CC BY-SA 4.0, która opisuje budowę agentów AI w całości: od architektury transformera i RLHF, przez pamięć, harness, MCP i RAG, aż po wdrożenie na produkcji. Jeden autor bierze na klatę cały ten zakres, więc ryzyko jest jedno: że któryś rozdział okaże się płytkim przeglądem zamiast przewodnika, po którym da się coś zbudować. Na razie znam sam abstrakt, ale i tak bym zajrzał, bo nawet jeśli gdzieś zabraknie głębi, sama mapa układająca te kawałki w całość ma wartość.

Testy przeszły, panel zielony, a system podaje stare ceny Poradnik / Praktyka

Testy przeszły, panel zielony, a system podaje stare ceny

3 min

Freddy Daniel Alvarez Pinto opisał w The New Stack, dlaczego klasyczne CI/CD zawodzi przy systemach LLM: jego system RAG przeszedł wszystkie testy i świecił na zielono, a przez weekend model zamieniający teksty na wektory rozjechał się tak, że w poniedziałek podawał klientom stare ceny. Zamiast pytać tylko "czy test przeszedł", proponuje cztery bramki wydania, z których najważniejsza porównuje trafność z ruchomą średnią z ostatnich wydań i pewnego czwartku wychwyciła 6-procentowy spadek, zanim dotarłby do 200 użytkowników. To praktyka jednego inżyniera, nie branżowy standard.

Duolingo wygenerowało 85 tysięcy linii testów w 17 tygodni. Recenzja stała się wąskim gardłem. Poradnik / Praktyka

Duolingo wygenerowało 85 tysięcy linii testów w 17 tygodni. Recenzja stała się wąskim gardłem.

4 min

Duolingo zbudowało proces, w którym zdalne sesje Claude Code same piszą testy jednostkowe do aplikacji na iOS: w 17 tygodni zmergowały 250 PR-ów, dołożyły około 85 tysięcy linii kodu testowego i podniosły pokrycie głównych komponentów z 9 do 30 procent. Agent pisze jednak w ciemno, bo serwery chodzą pod Linuksem, a kod kompiluje się tylko na Macu, więc 13,6% zgłoszeń poległo na CI. Sami autorzy przyznają, że generowanie testów stało się łatwą częścią, a prawdziwym wąskim gardłem jest recenzja, którą wciąż musi wykonać żywy inżynier.

Tydzień 26 · 22–28 czerwca 2026

Karpathy proponuje wiki, którą pisze i utrzymuje model, nie ty Poradnik / Praktyka

Karpathy proponuje wiki, którą pisze i utrzymuje model, nie ty

5 min

Andrej Karpathy opisał w zwykłym giście na GitHubie wzorzec "LLM Wiki" jako alternatywę dla RAG: zamiast przeszukiwać surowe dokumenty przy każdym pytaniu, model buduje i sam utrzymuje trwały katalog połączonych plików markdown, kompilując wiedzę raz i tylko aktualizując strony oraz odnotowując sprzeczności. Kluczowy jest schemat w stylu CLAUDE.md, który mówi modelowi, co robić z nowym źródłem. Gist zebrał ponad pięć tysięcy gwiazdek nie dzięki nowej technologii, lecz dlatego, że nazwał coś, co wielu po cichu sklejało, i odpowiada na stare pytanie: kto zniesie nudę utrzymania wiki.

Prompty, które kiedyś wymuszały dokładność, dziś psują wynik Poradnik / Praktyka

Prompty, które kiedyś wymuszały dokładność, dziś psują wynik

4 min

Anthropic zebrał wskazówki promptowania dla swojej rodziny modeli z 2026 roku w jednym przewodniku, a jego sednem jest lista rzeczy do odkręcenia w starych promptach po przejściu na nowszy model. Stanowcze instrukcje typu "KRYTYCZNE: MUSISZ użyć narzędzia" teraz przesadzają, więc trzeba zdjąć wykrzykniki i zamienić ogólne nakazy na celowane. Twardo znikają dwie rzeczy: prefill (od modeli 4.6 zwraca błąd 400) i budget_tokens, którego rolę przejmuje effort i adaptacyjne myślenie, gdzie model sam decyduje, jak głęboko się zastanowić.

Model nigdy nie widział twojego kodu, więc zgaduje, do czego jest podobny Poradnik / Praktyka

Model nigdy nie widział twojego kodu, więc zgaduje, do czego jest podobny

8 min

Gdy agent AI pracuje z twoim wewnętrznym SDK, którego model nigdy nie widział w treningu, nie przyzna się do niewiedzy, tylko przepisze twoją technologię na najbliższy znany wzorzec, jak AWS, OAuth czy REST, i wygeneruje kod, który wygląda wiarygodnie, a jest błędny. Waldek Mastykarz z Microsoftu nazywa to pułapką najbliższego dopasowania i radzi uczyć model od podstaw w pięciu warstwach, pokazując tylko różnicę wobec standardów, które już zna. Koszt jest realny: zamiast około 500 tokenów na znany framework potrzeba nawet 3000.

Jak zbudować narzędzie linii poleceń, którego konsumentem jest AI Poradnik / Praktyka

Jak zbudować narzędzie linii poleceń, którego konsumentem jest AI

4 min

Justin Poehnelt, autor otwartego CLI do Google Workspace, twierdzi, że jeśli głównym użytkownikiem narzędzia linii poleceń ma być agent AI, to projektowanie pod wygodę człowieka gra przeciwko tobie. Zamiast kilkunastu płaskich flag agent dostaje cały ładunek żądania przez `--json`, a dokumentację zastępuje komenda zwracająca aktualny schemat metody. Kluczowa obserwacja: agent nie halucynuje literówek, lecz sklejone identyfikatory i podwójnie zakodowane ścieżki, więc CLI musi walidować wejście tak jak publiczne API. To jeden głos i jedno wdrożenie, ale poparte działającym kodem.

Stare praktyki, wyższa stawka: czego LY Corporation nauczyło się, puszczając agenty na kod Poradnik / Praktyka

Stare praktyki, wyższa stawka: czego LY Corporation nauczyło się, puszczając agenty na kod

5 min

Inżynierowie z LY Corporation, twórcy Flava API Gateway, opisali, że agenty kodujące nie psują starych zasad dobrego programowania, tylko je obnażają: to, co człowiek nadrabiał uwagą, agentowi trzeba podać wprost, jako automatyczne kontrole. Ich trzy filary to spisanie specyfikacji przed kodem, szybka weryfikacja przez testy i lintery (2754 testów w jakieś 15 sekund dzięki izolacji schematów) oraz powtarzalne środowisko na Devenv i Nix. Dyscyplina, którą dawniej można było po cichu wyciąć pod presją terminu, przy agencie przestaje być opcją.

Wtyczka, która układa twoją historię w wątki, a model dokłada etykiety na końcu Poradnik / Praktyka

Wtyczka, która układa twoją historię w wątki, a model dokłada etykiety na końcu

4 min

openloops, otwartoźródłowa wtyczka do Chrome'a z poradnika FreeCodeCampu autorstwa Shola Jegede, skanuje historię przeglądania i grupuje ją w wątki intencji, licząc podobieństwo domen i słów miarą Jaccarda. Cały rdzeń działa lokalnie w IndexedDB, bez jednego wywołania sieci, a Claude (model Haiku) tylko opcjonalnie dokłada tytuły i następne kroki. Pouczający jest moment, w którym pierwsza wersja po cichu się wywaliła: przy 30 wątkach odpowiedź uderzyła w limit max_tokens i urwała JSON. Lekcja brzmi tak, że model wpina się jako wycinalny dodatek, nie jako centrum produktu.

Tydzień 25 · 15–21 czerwca 2026

Boris Cherny już nie pisze promptów. Pisze pętle Poradnik / Praktyka

Boris Cherny już nie pisze promptów. Pisze pętle

5 min

Boris Cherny, twórca Claude Code, mówi CNBC, że nie pisze już promptów, tylko rozmawia z agentem koordynującym całość, a Addy Osmani z Google Cloud nazwał to podejście loop engineering. Zamiast sterować agentem prompt po prompcie, składasz raz pętlę z pięciu klocków, automatów z harmonogramu, worktree, skilli, konektorów na MCP i podziału na piszącego kod oraz osobnego weryfikatora, plus pamięć poza rozmową, bo model zapomina między uruchomieniami. Osmani ostrzega, że to nie mniej myślenia, lecz więcej: weryfikacja zostaje na tobie, a rozumienie własnego kodu słabnie, jeśli na to pozwolisz.

Najtrudniejsze w pracy z agentem jest wiedzieć, kiedy kazać mu przestać Poradnik / Praktyka

Najtrudniejsze w pracy z agentem jest wiedzieć, kiedy kazać mu przestać

5 min

Menedżer produktu Zephyr w Espressif opisuje, jak po raz drugi zbudował to samo firmware z pomocą agenta, tym razem w C zamiast Rust, i wyciąga z tego jeden wniosek: skoro model pisze kod szybciej, niż człowiek nadąża go ocenić, praca nie znika, tylko przenosi się z pisania na ocenianie. Jego receptą jest rytm plan, wykonanie, commit, test, z commitem przed testowaniem, żeby zawsze był punkt powrotu. Reszta reguł pilnuje granic: kodu z upstreamu agent nie rusza bez pozwolenia, a dziennik prób chroni przed zapętlaniem nieudanych poprawek.

Sto procent poprawnego JSON-a, zero zgodności ze schematem Poradnik / Praktyka

Sto procent poprawnego JSON-a, zero zgodności ze schematem

5 min

Prototyp Microsoftu zamieniający dziennik zmiany operatora przemysłowego na ustrukturyzowany JSON zdał test poprawności składniowej w 100%, a test zgodności ze schematem oblał na zero, bo model po cichu gubił całe wymagane sekcje. Zamiast poprawiać prompt, zespół przeszedł pole po polu i odkrył, że ponad połowa wartości już jest na wejściu, więc powinien je przepisać kod, nie model. Po rozdzieleniu pól deterministycznych od wymagających interpretacji zgodność wzrosła z zera do 47%, a metoda dociągnęła ją do 100% i utrzymała się nawet po podmianie modelu bazowego.

Sędzia z paskiem błędu: instrukcja budowy harnessu do oceny LLM Poradnik / Praktyka

Sędzia z paskiem błędu: instrukcja budowy harnessu do oceny LLM

6 min

Niedeterministyczny system AI trzeba mierzyć przyrządem z paskiem błędu, a nie testować na zasadzie zielone-czerwone światełko. Harness opisany na dev.to przepuszcza szablon przez tanie bramki, zanim włączy drogiego sędziego, ocenia w skali 1-5 i próbkuje trzy razy nawet w temperaturze 0, bo ten sam wymiar dał raz 4,00, a raz 2,67. Kluczem jest podział ról: tani Amazon Nova 2 Lite pilnuje struktury i poprawnego JSON-a, DeepSeek V3.2 pisze treść jakieś siedem razy taniej niż Sonnet, a sędzia z innej rodziny ocenia tylko sens.

Tydzień 17 · 20–26 kwietnia 2026

Tydzień 16 · 13–19 kwietnia 2026

Cztery zasady Karpathy'ego w jednym pliku CLAUDE.md, 33 tysiące gwiazdek na GitHubie Poradnik / Praktyka

Cztery zasady Karpathy'ego w jednym pliku CLAUDE.md, 33 tysiące gwiazdek na GitHubie

3 min

Forrest Chang zamknął cztery obserwacje Andreja Karpathy'ego o słabościach LLM-ów w jednym pliku CLAUDE.md i w niespełna dwa miesiące zebrał 33,2 tysiąca gwiazdek na GitHubie. Reguły "myśl przed kodowaniem", "prostota najpierw", "chirurgiczne zmiany" i "sterowanie celem" odpowiadają na konkretne grzechy modeli: ciche wybieranie interpretacji, puchnięcie abstrakcjami i refaktoryzowanie tego, o co nikt nie prosił. Żaden benchmark tego nie potwierdza, ale koszt jest zerowy, a markdown powoli staje się standardową warstwą programowania agentów.

Gemma 4 26B sprawdza się w lokalnych agentach. Google trzyma najszybszą wersję dla siebie. Poradnik / Praktyka

Gemma 4 26B sprawdza się w lokalnych agentach. Google trzyma najszybszą wersję dla siebie.

4 min

Gemma 4 26B-A4B aktywuje tylko 3,8 miliarda parametrów na token, więc generuje z prędkością modelu 4B, a na AIME 2026 wyciąga 88,3%, punkt poniżej dużo cięższego 31B dense. Sześć specjalnych tokenów do narzędzi wbitych prosto w architekturę robi z niej pierwszy otwarty model, z którym lokalny agent realnie wie, kiedy zawołać funkcję. Tyle że głowice Multi-Token Prediction, dające niemal dwukrotne przyspieszenie, Google zostawił sobie w LiteRT. Wagi na Hugging Face są na Apache 2.0, ale najszybsza wersja zostaje w prywatnym stosie.

Trzeci raz odrzucasz tę samą uwagę i agent przestaje ją powtarzać Poradnik / Praktyka

Trzeci raz odrzucasz tę samą uwagę i agent przestaje ją powtarzać

3 min

Jerin Mathew Vinu zbudował agenta do code review, który zapamiętuje, które uwagi zespół akceptuje, a które odrzuca — po trzech kliknięciach Reject komentarz znika z czwartego PR-a. Pamięć trzyma Hindsight, recenzje generuje qwen3-32b przez Groq, a całość spina FastAPI. Kluczowa obserwacja: decyzje lądują w bazie jako jedno zdanie po angielsku, bo i tak wracają prosto do promptu — format zapisu warto dopasować do formatu odczytu. To weekendowy projekt bez pomiarów, ale wzorzec jest na tyle prosty, że można go sprawdzić u siebie.