SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Poradnik / Praktyka

Poradniki, warsztaty i sprawdzone praktyki pracy z AI.

44 art.

Tydzień 40 · 28 września – 4 października 2026

Tydzień 39 · 21–27 września 2026

Tydzień 38 · 14–20 września 2026

Instrukcje pisane pod słabszy model dziś kosztują cię kontekst Poradnik / Praktyka

Instrukcje pisane pod słabszy model dziś kosztują cię kontekst

4 min

OpenAI przekonuje deweloperów, że instrukcje pisane pod słabszy model przy GPT-6 Astrze zaczynają działać przeciwko tobie, bo zjadają kontekst i ciągną agenta tam, gdzie już go nie chcesz. Stąd rada, żeby skrócić opisy skilli, zamienić rozdęty AGENTS.md w drogowskaz do reszty i wyciąć przepisy krok po kroku, z którymi Astra radzi sobie sama. Mocne "pytaj, zanim cokolwiek zrobisz" zostawiam tam, gdzie jest, bo nadgorliwy agent kosztuje 30 sekund, a przekonany o własnej racji cały wieczór odkręcania. A skille w repozytorium sterują też agentami współpracowników, którzy pracują na innym modelu.

Opus 5 bierze "bądź zachowawczy" dosłownie i przemilcza część błędów Poradnik / Praktyka

Opus 5 bierze "bądź zachowawczy" dosłownie i przemilcza część błędów

4 min

Anthropic ostrzega w przewodniku po promptowaniu Opus 5, że dopisane kiedyś do promptu "bądź zachowawczy" nowy model bierze dosłownie i razem z hałasem przemilcza część prawdziwych błędów. Parametr effort tnie czas myślenia, ale nie długość odpowiedzi, więc o zwięzłość trzeba poprosić wprost. Przy wyłączonym myśleniu model potrafi napisać coś, co wygląda na wywołanie narzędzia, choć nic się nie uruchomiło, a taki zapis zostaje w historii rozmowy i kolejne tury czytają go jak fakt. Bezpieczniej zostawić myślenie włączone i ciąć koszt niższym ustawieniem effort.

Recenzent nie pomylił się ani razu i to był problem Poradnik / Praktyka

Recenzent nie pomylił się ani razu i to był problem

5 min

Automatyczny recenzent Codex w projekcie AgentCoop nie pomylił się ani razu, a mimo to sześć rund recenzji rozdęło funkcję z 28 do 42 linii, bo zasada „każda uwaga załatwiona przed mergem” po cichu zmieniła się w „każdą poprawiamy”, a tak kończyło się 91% uwag. Zespół odpowiedział procedurą liczącą koszt w godzinach zamiast etykietek P1 i P2 oraz skryptem chain-check, który zatrzymuje pracę, gdy dwie rundy z rzędu trafiają w kod napisany pod wcześniejszą uwagę tego samego recenzenta. Arytmetyki nie kupuję, ale ktoś wreszcie spisał drugą stronę rachunku, czyli to, co naprawdę traci użytkownik.

Trzy wymagania, dwie asercje i poprawka, która wygląda poprawnie Poradnik / Praktyka

Trzy wymagania, dwie asercje i poprawka, która wygląda poprawnie

4 min

Poprawka jednym warunkiem zapala dwie asercje na zielono, ale kasuje trzeci punkt kontraktu, bo Python traktuje None i pustą listę tak samo. Człowiek taki wynik najwyżej przeoczy, natomiast agent naprawczy zbiega do testu zamiast do wymagania, więc odwrotnie napisana asercja potrafi go skłonić do zepsucia działającego kodu. W preprincie ExecCritic ten sam agent rozwiązywał 61,2% zadań z SWE-bench Verified, a ze słabszymi wygenerowanymi testami osuwał się do 57,3%, przy nierównych budżetach obliczeniowych. Stąd jedno pytanie do każdego testu: którą błędną implementację odrzuci.

Tydzień 37 · 7–13 września 2026

Tydzień 36 · 31 sierpnia – 6 września 2026

Tydzień 34 · 17–23 sierpnia 2026

Wzorzec Karpathy'ego po czterech miesiącach: lista miejsc, w których się sypie Poradnik / Praktyka

Wzorzec Karpathy'ego po czterech miesiącach: lista miejsc, w których się sypie

5 min

Po czterech miesiącach ze wzorcem wiki Andreja Karpathy'ego komentujący pod gistem zgłaszają te same pęknięcia: notatki zgadzają się z notatkami, a sprzeczność leży w linijce kodu, której wiki nigdy nie przeczytała. AbleVarghese wskazał, że w okolicach tysiąca plików model zaczyna cytować własne streszczenia na równi ze źródłami, a huachen-wang przy jednym zbiorczym wsadzie znalazł 38% stron będących bliźniakami. Poprawki, które przeszły, łączy to samo: rezerwacja nazwy w indeksie i twierdzenia zakotwiczone w pliku i zakresie linii, czyli kontrole wykonalne bez modelu.

Pięć linijek, które piszesz, zanim odpalisz drugiego agenta Poradnik / Praktyka

Pięć linijek, które piszesz, zanim odpalisz drugiego agenta

4 min

Poradnik Warpa o pracy z kilkoma agentami naraz sprowadza się do pięciu linijek wklejanych każdej sesji na start: kto odpowiada za które katalogi, na jakiej gałęzi pracuje i co ma zameldować na koniec. Warp rozpisuje to na osiem kroków, sadza każdego agenta we własnym worktree i wprost zabrania automatycznego scalania, bo cudzy błąd łapiesz tylko przy przeglądzie. Chmurowe polecenie /orchestrate zostawiłbym na migracje monorepo, bo poradnik nie podaje ani kosztu, ani oszczędności, a cztery agenty skracają czas pisania kodu i wydłużają czas jego czytania.

Zestaw testów agenta potrafi wysłać prawdziwy przelew Poradnik / Praktyka

Zestaw testów agenta potrafi wysłać prawdziwy przelew

4 min

Braintrust tłumaczy, dlaczego test jednostkowy odrzuca poprawny przebieg agenta tylko za to, że sprawdził regulamin przed zamówieniem, i w miejsce asercji wstawia funkcję oceniającą cały zapis pracy w skali od 0 do 1, puszczaną kilka razy na to samo zgłoszenie. Zestaw wpięty w prawdziwe API płatnicze wysyłałby przy tym prawdziwe przelewy, więc usługi trzeba podstawić jako atrapy. Zapamiętałbym stąd liczbę kroków jako sygnał regresji, bo zapala się, zanim wynik zdąży się popsuć. Gorzej, że bramka w CI blokuje merge na ocenie modelu w roli sędziego, którego zgodności z ludźmi nikt nie podaje.

Tydzień 33 · 10–16 sierpnia 2026

Tydzień 32 · 3–9 sierpnia 2026

Tydzień 31 · 27 lipca – 2 sierpnia 2026

Kiedy graf agenta opłaca się bardziej niż logika schowana w promptcie Poradnik / Praktyka

Kiedy graf agenta opłaca się bardziej niż logika schowana w promptcie

4 min

Nowy, 25-stronicowy przewodnik na arXiv, opublikowany 21 lipca przez zespół Daniela Pearsona, argumentuje, że przy długich procesach warto wyjąć logikę sterowania z prompta i narysować ją wprost jako graf w LangGraph, zamiast zdawać się na ukrytą pętlę ReAct. Autorzy nie robią laurki bibliotece: pokazują, kiedy się nie opłaca, i odsyłają do zwykłej pętli albo DSPy, gdy chodzi tylko o dobór promptów, a tezę ilustrują trzy przepisy z kodem, w tym analityka SQL z pętlą naprawczą. Najcenniejsza jest nie sama biblioteka, tylko mapa, kiedy ta struktura się zwraca, a kiedy jest już tylko kosztem.

NVIDIA pokazuje, jak wpuścić asystenta AI do wrażliwego kodu, nie oddając mu kontroli Poradnik / Praktyka

NVIDIA pokazuje, jak wpuścić asystenta AI do wrażliwego kodu, nie oddając mu kontroli

4 min

NVIDIA pokazuje, jak wpuścić asystenta AI do wrażliwego kodu, nie oddając mu kontroli: model tylko podpowiada, a pilnowanie zasad, skanowanie zależności i pomiar żyją poza nim, w systemach, którym zespoły już ufają. Na własnych kartach stoi StarCoder2 o 7 miliardach parametrów w kontenerze udającym API OpenAI, NeMo Guardrails odrzuca ryzykowne zapytania, a bramka w CI wyłapuje slopsquatting, czyli wymyślone przez model nazwy paczek. Zastrzeżenie jest poważne: to przepis, nie wynik, bez ani jednej liczby, a robotę nie tyle zdejmuje z zespołu, ile przesuwa na pisanie i utrzymanie reguł.

Trzy komendy dzielą pusty katalog od zdalnego serwera MCP Poradnik / Praktyka

Trzy komendy dzielą pusty katalog od zdalnego serwera MCP

3 min

Dokumentacja Cloudflare Agents sprowadza postawienie zdalnego serwera MCP do trzech komend, tak że w kilkanaście minut pusty katalog zmienia się w narzędzie na workers.dev, którego używa prawdziwy agent. Wzorzec Code Mode idzie dalej: zamiast wystawiać każdy z ponad 2500 endpointów API Cloudflare jako osobne narzędzie, co zjadłoby modelowi ponad milion tokenów, serwer daje tylko search() i execute() i mieści się w około tysiącu. Tyle że bezobsługowy hosting działa wyłącznie na Cloudflare, a oszczędność bierze się z typowanego opisu ich API, więc własne narzędzia i tak piszesz ręcznie.

Tydzień 30 · 20–26 lipca 2026

Rozmiar modelu przestał przewidywać jego prędkość Poradnik / Praktyka

Rozmiar modelu przestał przewidywać jego prędkość

4 min

Model Laguna S 2.1 ma 118 miliardów parametrów, ale generuje tekst szybciej niż czterokrotnie mniejszy Qwen3.6-27B, bo o prędkości decyduje nie całkowity rozmiar, tylko liczba aktywnych parametrów w architekturze MoE. Mori Shige z Classmethod przez pół roku mierzył lokalne modele na DGX Spark i zostały mu z tego dwa odruchy: czytać liczbę aktywnych parametrów zamiast łącznej wagi, a ściągając wersję 4-bitową, sprawdzić dwóch wydawców, bo ta sama kwantyzacja potrafi dać nawet 55% różnicy w prędkości. Dekodowanie spekulatywne podbiło Qwen3.6-35B-A3B o jakieś 40%.

Nowy cookbook Llamy to nie premiera, tylko uporządkowanie i jeden czytelny sygnał Poradnik / Praktyka

Nowy cookbook Llamy to nie premiera, tylko uporządkowanie i jeden czytelny sygnał

3 min

Meta przemianowała repozytorium llama-recipes na llama-cookbook i przebudowała je od środka, ale to nie premiera, tylko zebranie w jednym miejscu trzech podstaw pracy z modelami Llama: inferencji, fine-tuningu i RAG. Prawdziwym sygnałem są wyróżnione na górze przepisy dla Llamy 4, gdzie wariant Scout dostaje okno kontekstowe 5 milionów tokenów, a Maverick analizator prac naukowych i bota na WhatsAppie. To pokazuje, do czego Meta faktycznie szykuje swój model, czyli długi kontekst i analiza dokumentów, a nie walka o czołowe miejsce w benchmarkach programistycznych.

Gemma 4 rusza lokalnie na pięć sposobów, a przejście z chmury to jedna linijka Poradnik / Praktyka

Gemma 4 rusza lokalnie na pięć sposobów, a przejście z chmury to jedna linijka

3 min

Gemma 4 od Google DeepMind ma już wagi na Hugging Face, a kurs Piyusha Thakura na PyImageSearch pokazuje pięć sposobów odpalenia jej lokalnie: Ollama, llama.cpp, MLX, LM Studio i Transformers.js, w większości bez sieci. Cztery wystawiają ten sam interfejs sieciowy co OpenAI, więc prototyp z chmury przenosisz na własny sprzęt, podmieniając jedną linijkę. Sens to nie sam offline, tylko prywatność danych i brak opłaty za token. Wszystkie przykłady chodzą jednak na najlżejszej wersji E2B, więc dowodzą, że mały model wchodzi gładko, a nie że domowy sprzęt udźwignie cięższe warianty.

Dziesięć awarii między działającym modelem a czystym bełkotem Poradnik / Praktyka

Dziesięć awarii między działającym modelem a czystym bełkotem

4 min

Deweloper tonyd2wild uruchomił GLM-5.2, otwarty model o 753 miliardach parametrów, na dwóch biurkowych DGX Spark, osiągając około 15 tokenów na sekundę. Zmieściło się to dzięki architekturze mixture-of-experts i kwantyzacji ekspertów do 2 bitów, kosztem jakości odpowiedzi. Sednem nie są jednak liczby, tylko lista 10 awarii dzielących "teoretycznie się da" od "faktycznie działa": różne nazwy użytkowników rozbiły ścieżkę do biblioteki NCCL, a brakujący plik z wagami sprawił, że model wstawał czysto i wypluwał bełkot. Główny wniosek: "wstało bez błędów" nie znaczy "działa poprawnie".

Tydzień 29 · 13–19 lipca 2026