SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Tydzień 25 · 15–21 czerwca 2026

Microsoft otwiera dwa narzędzia, które sprawdzają, czy agent trzyma się reguł, zanim trafi na produkcję Premiera / Narzędzie

Microsoft otwiera dwa narzędzia, które sprawdzają, czy agent trzyma się reguł, zanim trafi na produkcję

5 min

Na Build 2026, 2 czerwca, Microsoft wypuścił na licencji MIT dwa narzędzia, które sprawdzają, czy agent trzyma się wyznaczonych mu reguł, zanim trafi na produkcję. ASSERT zamienia spisaną politykę czy prompt systemowy w działające testy i ocenia je modelem jako sędzią, który w wewnętrznych testach zgadzał się z ludźmi w 80-90% przypadków. ACS wpina twarde kontrole w pięciu punktach cyklu życia agenta, opisane w przenośnym pliku YAML, z wtyczkami do LangChain, CrewAI czy Anthropic Agents SDK. Microsoft daje wspólny język, ale nie zdejmuje z nikogo odpowiedzialności, gdy agent się pomyli.

Wpisujesz prośbę, a Codex sam rozpisuje robotę na kilka agentów Premiera / Narzędzie

Wpisujesz prośbę, a Codex sam rozpisuje robotę na kilka agentów

4 min

Pietro Schirano z OpenAI pokazał 14 czerwca, że nie pisze już sam komendy /goal w Codeksie — prosi agenta, żeby sam ustalił sobie cel, rozbił robotę na kawałki i odpalił równoległe kopie, które złożyły symulację kolejki górskiej w Three.js. Thibault Sottiaux nazwał to uogólnieniem meta-promptingu, ale haczyk jest realny: kiedy agent sam wyznacza cel, sam decyduje, kiedy go spełnił, co otwiera furtkę na reward hacking i kręcenie się w kółko przy mglistych poleceniach. 16 czerwca błędy "model at capacity" odcięły część użytkowników od GPT-5.5, a Claude Code wciąż jest pierwszym wyborem na rynku.

Czy agent może nauczyć się waszych zasad code review z samych komentarzy w PR-ach? Premiera / Narzędzie

Czy agent może nauczyć się waszych zasad code review z samych komentarzy w PR-ach?

4 min

Kilo wprowadziło trzy zmiany w swoim agencie do recenzji kodu: plik REVIEWS.md z konwencjami zespołu, mechanizm Code Review Memory uczący się reguł z historii waszych reakcji na uwagi oraz lokalne podpowiedzi w VS Code jeszcze przed pushem. Code Review Memory brzmi najciekawiej, ale uczy się z ubogiego sygnału, bo jedno kliknięcie Reject może oznaczać trzy różne rzeczy, więc jego propozycje warto traktować jak pull request od kogoś, kto zna projekt powierzchownie. Najbardziej przekonuje lokalna recenzja niezacommitowanych zmian, która oszczędza całą rundę przez CI.

Nowy agent w AWS Transform sam otwiera poprawki, a wąskim gardłem staje się zaufanie Premiera / Narzędzie

Nowy agent w AWS Transform sam otwiera poprawki, a wąskim gardłem staje się zaufanie

4 min

Na szczycie AWS w Nowym Jorku Amazon pokazał podgląd agenta w AWS Transform, który asynchronicznie skanuje repozytoria pod kątem długu technicznego i sam otwiera pull requesty z poprawkami, także dla luk wykrytych przez AWS Security Agent. Sriram Devanathan podaje, że przez usługę przewinęło się już ponad 4,5 miliarda linii kodu. Sednem zapowiedzi jest jednak uwaga Mitcha Ashleya z Futurum Group: wąskim gardłem przestaje być wygenerowanie poprawki, a staje się potwierdzenie, że nie zmieniła ona po cichu zachowania aplikacji. Amazon zautomatyzował łatwiejszą połowę problemu.

Copilot zszedł z marginesu edytora i prosi, żebyś pilnował agentów Premiera / Narzędzie

Copilot zszedł z marginesu edytora i prosi, żebyś pilnował agentów

5 min

17 czerwca 2026 GitHub wypuścił stabilną, osobną aplikację Copilota na Windowsa, macOS i Linuksa, w której uruchamiasz i zatwierdzasz równoległe sesje kodujących agentów podpięte wprost pod issue, pull requesty i branche. Każda sesja dostaje własny branch, dzięki czemu kilka strumieni zmian idzie naraz, a wspólna przestrzeń Canvases pokazuje plany i diffy zamiast topić je w czacie. Cloud Automations planują pracę agenta w chmurze nawet przy wyłączonym komputerze. Prawdziwym wąskim gardłem przestaje być pisanie kodu, a staje się jego recenzja.

Next.js dla agentów, czyli stara zagrywka Vercela w nowej dekoracji Premiera / Narzędzie

Next.js dla agentów, czyli stara zagrywka Vercela w nowej dekoracji

3 min

Vercel ogłosił 17 czerwca na konferencji Ship 26 framework eve, otwartoźródłowy i nazwany "Next.js dla agentów": tworzysz katalog plików, a jego układ staje się całym agentem, bez konfiguracji w kodzie. Najmocniejszym argumentem jest własna flota firmy, ponad sto agentów na produkcji, w tym Lead Agent kosztujący około 5 tysięcy dolarów rocznie i zwracający 32 razy tyle przy jednej osobie na pół etatu. Sesja przeżywa crash i wdrożenie nowej wersji, ale każdy klocek stoi na platformie Vercela, więc realną przewagą nie jest technologia, tylko dystrybucja do ponad sześciu milionów deweloperów.

Programiści przeszli żałobę po AI i wrócili z fakturą za tokeny Premiera / Narzędzie

Programiści przeszli żałobę po AI i wrócili z fakturą za tokeny

5 min

Z relacji Marka Pesce'a w The Register z konferencji AI Engineer Melbourne wynika, że programiści przestali bać się AI i zaczęli budować narzędzia, które ustawiają ją po swojej stronie. AJ Fisher pokazał, jak tani model dyfuzyjny puszczany w kółko nad jednym problemem schodzi z kosztem do połowy, a czasem do jednej dziesiątej, co Google potwierdził świeżym DiffusionGemmą. Daniel Rodgers-Pryor uruchomił zaś pipeline CI/CD, w którym agenty same diagnozują usterki i wypuszczają poprawki, działając tym lepiej, im większe dostają obciążenie.

Agent w Xcode 27 edytuje cały projekt jednym promptem, a modele wybierasz sam Premiera / Narzędzie

Agent w Xcode 27 edytuje cały projekt jednym promptem, a modele wybierasz sam

4 min

Na WWDC26 Apple pokazało agenta w Xcode 27, który z jednego polecenia edytuje cały projekt naraz i buduje działającą aplikację, a programista głównie z nim rozmawia, zamiast pisać kod. Edytor wpuszcza modele Anthropica, OpenAI i Google oraz przyjmuje wtyczki w formacie stworzonym przez Anthropic, tym samym, którego używa Claude Code, co dla zwykle zamkniętego Apple jest rzadkim gestem otwartości. Na finał odpalono na scenie Kimi 2.6 lokalnie na czterech Mac Studio, a demonstracja kłóci się z niedawnym hasłem Craiga Federighiego, że AI nikogo nie zastąpi.

Podpięcie modelu lokalnego pod Claude Code zajmuje pięć minut. Zaufanie mu zajmuje znacznie dłużej. Premiera / Narzędzie

Podpięcie modelu lokalnego pod Claude Code zajmuje pięć minut. Zaufanie mu zajmuje znacznie dłużej.

6 min

Od stycznia 2026 podpięcie lokalnego modelu pod Claude Code to pięć minut i jedna zmienna środowiskowa, a modele jak Gemma 4 czy Qwen 3.6 (77,2% na SWE-Bench wobec 88,6% u Opusa 4.8) wreszcie się do czegoś nadają. Alex Ellis studzi jednak zapał: lokalny Qwen to nie gorszy Opus, tylko inne narzędzie, które zostawione samo wpada w pętlę i pali prąd przez pół godziny. Jego karta Nvidii za 12 tysięcy dolarów zwróciła się nie jako zamiennik Claude'a, lecz dzięki analizie poufnych danych klienta offline. Supermoc modeli lokalnych to czytanie i tłumaczenie kodu, nie pisanie go bez nadzoru.

Agent potrzebuje aktualnego kontraktu API. Kong chce mu go podać w JSON-ie Premiera / Narzędzie

Agent potrzebuje aktualnego kontraktu API. Kong chce mu go podać w JSON-ie

3 min

Kong wypuścił nowe CLI, które oddaje aktualne definicje firmowych API jako uporządkowany JSON, gotowy do odczytania przez modele językowe i samodzielnie działające agenty. Rozwiązuje to konkretny problem: agent wywołujący cudze API na podstawie nieaktualnego kontraktu błądzi po omacku, więc dotąd ludzie ręcznie kopiowali specyfikacje do promptów. Synchronizacja klienta Insomnia z platformą Konnect działa już teraz, ale część dla agentów to dopiero wersja testowa. Obiecywane skrócenie wdrożenia o 40% to wewnętrzny benchmark Konga bez pokazanej metody.

Arbor rozplątuje to, co Claude Code i Codex robią naraz Premiera / Narzędzie

Arbor rozplątuje to, co Claude Code i Codex robią naraz

5 min

Arbor, framework badaczy z Renmin University of China i Microsoft Research, rozdziela autonomiczną optymalizację kodu na długowiecznego koordynatora i krótko żyjących wykonawców, z których każdy testuje jedną hipotezę w osobnej kopii repozytorium gita. Sednem jest drzewo poszukiwań z bramką scalenia, która wpuszcza zmianę tylko wtedy, gdy realnie poprawia wynik na ukrytym zbiorze testowym. Na Terminal-Bench 2.0 Arbor sięgnął 77,36 punktu tam, gdzie Claude Code spadło do 71, a autorzy chwalą się ponad dwuipółkrotnie większymi zyskami niż Codex, choć to liczba z laboratorium.

Databricks otwiera Omnigent: nadzór nad agentami schodzi z promptu do jądra systemu Premiera / Narzędzie

Databricks otwiera Omnigent: nadzór nad agentami schodzi z promptu do jądra systemu

6 min

Matei Zaharia z Databricks wrzucił 13 czerwca na GitHuba Omnigent, meta-harness na licencji Apache 2.0, który stawia wspólny pulpit nad agentami od różnych dostawców i przenosi egzekwowanie reguł z promptu na poziom infrastruktury, gdzie polityki pamiętają stan sesji. Piaskownica Omnibox domyka dostęp na poziomie jądra, tak że agent nigdy nie widzi tokenu do GitHuba, bo trafia on do proxy dopiero przy zatwierdzonym żądaniu. Argument trafia w realny ból: Uber przepalił roczny budżet na AI w cztery miesiące, a Gartner prognozuje skasowanie ponad 40% projektów z agentami do 2027 roku.

Epic wpuszcza Claude i Gemini do edytora Unreal. Pytanie, czy ktoś im zaufa Premiera / Narzędzie

Epic wpuszcza Claude i Gemini do edytora Unreal. Pytanie, czy ktoś im zaufa

5 min

Na konferencji State of Unreal 2026 Epic pokazał eksperymentalną wtyczkę w Unreal Engine 5.8, która uruchamia lokalny serwer MCP wewnątrz edytora i daje modelom takim jak Claude czy Gemini dostęp do Blueprintów, zasobów i poziomów, tak że meblują scenę albo dopasowują światło zwykłym zdaniem. Żeby model nie improwizował, Epic dorzucił ponad 80 gotowych elementów proceduralnych i tak zwane Skills. Sęk w tym, że model myli się z przekonaniem, więc oszczędność czasu rodzi nową pracę nad kontrolą jakości, a w tegorocznym badaniu GDC aż 52% twórców uznało generatywne AI za szkodliwe dla branży.

Tydzień 17 · 20–26 kwietnia 2026

Agent Memory rusza w prywatnej becie: pięć poleceń dla modelu zamiast surowego SQL-a Premiera / Narzędzie

Agent Memory rusza w prywatnej becie: pięć poleceń dla modelu zamiast surowego SQL-a

4 min

Cloudflare 17 kwietnia wpuścił do prywatnej bety Agent Memory, usługę ratującą pamięć agenta w momencie, gdy okno kontekstowe się zapełnia i harness ucina historię. Zamiast surowego dostępu do bazy wektorowej model dostaje pięć operacji, w tym `recall`, który pod spodem odpala pięć równoległych kanałów wyszukiwania i zwraca gotowe zdanie syntezy. Czarną robotę robi tańszy Llama 4 Scout, większy Nemotron 3 wchodzi tylko do finalnej syntezy. Pamięć jako wąska usługa, nie baza do obsługi przez model, ma sens, choć porównania z własnym Postgresem z embeddingami jeszcze nie ma.

Wiadomość wchodzi do agenta, agent znika na godzinę, odpowiedź wraca tym samym kanałem Premiera / Narzędzie

Wiadomość wchodzi do agenta, agent znika na godzinę, odpowiedź wraca tym samym kanałem

3 min

Cloudflare 16 kwietnia otworzył Email Service w publicznej becie i domknął obieg: mail wchodzi do agenta, agent znika na godzinę, odpowiedź wraca tym samym wątkiem. Adres pod twoją domeną wybiera instancję agenta, a jej stan żyje w Durable Object przyklejonym do tej tożsamości — bez osobnej bazy mapującej maila na klucz. SPF, DKIM i DMARC ustawia sam Cloudflare, odpowiedzi można podpisać HMAC-SHA256. Cena: pamięć, załączniki w R2 i klasyfikacja w Workers AI zostają w jednym ekosystemie.

Awesome LLM Apps obiecuje agenta w 30 sekund. Reszta trwa dłużej. Premiera / Narzędzie

Awesome LLM Apps obiecuje agenta w 30 sekund. Reszta trwa dłużej.

3 min

Shubham Saboo zebrał w jednym repo ponad 100 szablonów aplikacji agentowych i RAG-owych, od zespołu do due diligence dla funduszu VC po 19 wariantów wyszukiwania w danych i 19 plików Agent Skills w formacie Anthropica. README obiecuje pierwszego agenta w 30 sekund, ale każdy szablon to demo na Streamlicie, bez autoryzacji i obserwowalności, więc tydzień, który niby oszczędzasz, wraca przy przepisywaniu warstwy interfejsu. Katalog Saboo działa najlepiej jako podręcznik wzorców, nie jako kod do skopiowania prosto na produkcję.

Cloudflare układa firmowe MCP na trzech zasadach: zdalne serwery, portal nad nimi, Code Mode na schematach Premiera / Narzędzie

Cloudflare układa firmowe MCP na trzech zasadach: zdalne serwery, portal nad nimi, Code Mode na schematach

4 min

Cloudflare 22 kwietnia opisała firmowy stos MCP na trzech zasadach: serwery tylko zdalnie na firmowej chmurze, portal z regułami Identity/Conditions/Scope nad nimi i Code Mode, który zwija 182 schematy w dwa wywołania, ścinając tokeny na schematach nawet o 99,9%. Ruch do modeli idzie przez AI Gateway — 241 mld tokenów miesięcznie — a agent bezpieczeństwa na Kimi K2.5 w Workers AI kosztuje 77% mniej. Firma wiąże z tym skok zmergeowanych PR-ów z 5 600 do 8 700 tygodniowo. Kontrola musi siedzieć obok protokołu, bo MCP zostaje na poziomie transportu.

Trzy wywołania API zamiast dwóch dni z kodem orkiestracji agenta Premiera / Narzędzie

Trzy wywołania API zamiast dwóch dni z kodem orkiestracji agenta

3 min

AWS 21 kwietnia wystawił Amazon Bedrock AgentCore — zarządzany harness, w którym deklarujesz model, narzędzia i instrukcje, a pętlę agentową, sandbox, pamięć sesji i odtwarzanie po awarii dostajesz w pakiecie. Pod spodem działa open-source SDK Strands Agents, CLI zwija prototyp i wdrożenie do jednego polecenia, a wtyczki MCP uczą Claude Code, Cursora i Kiro wzorców AgentCore. Rodrigo Moreira z VTEX chwali wymianę modelu jako parametr API zamiast przebudowy. Cena: kolejny czysty ślad uzależnienia od dostawcy.

Parametr effort zamiast budżetu tokenów: Anthropic zmienia API rozumowania Premiera / Narzędzie

Parametr effort zamiast budżetu tokenów: Anthropic zmienia API rozumowania

3 min

Anthropic w Opus 4.7 wycofał ręczny `budget_tokens` i zostawił tylko tryb adaptive, w którym o głębokości rozumowania decyduje sam model, a ty podajesz mu jedynie wskazówkę `effort` z pięcioma poziomami — od `low` po wyłączny dla 4.7 `xhigh`. Razem z adaptive wchodzi interleaved thinking, czyli możliwość zatrzymania się między wywołaniami narzędzi, której na 4.6 ze stałym budżetem po prostu nie było. Domyślna wartość pola `display` to teraz `omitted`: ślady myślenia znikają z odpowiedzi, ale Anthropic dalej liczy ci wszystkie tokeny, więc skracasz latencję, nie rachunek.

Codex zaczyna nagrywać pulpit, żeby zapamiętać, nad czym pracujesz Premiera / Narzędzie

Codex zaczyna nagrywać pulpit, żeby zapamiętać, nad czym pracujesz

3 min

OpenAI 20 kwietnia pokazało Chronicle, eksperymentalny dodatek do Codexa, który w tle robi zrzuty pulpitu i buduje z nich pamięć między sesjami, żeby agent nie zaczynał każdej sesji od pytania, nad czym pracujesz. Funkcja rusza w planie Pro za 200 dolarów miesięcznie, tylko na Macu. Wybór ekranu zamiast plików oznacza, że w pamięci modelu mogą wylądować Slack, poczta i CRM, a OpenAI nie mówi, co dokładnie trafia na ich serwery. Microsoft Recall już raz przerobił tę samą krytykę za prywatność.

Czterdzieści jeden agentów AI zgodziło się na ten sam plik markdownu Premiera / Narzędzie

Czterdzieści jeden agentów AI zgodziło się na ten sam plik markdownu

4 min

SKILL.md — markdown z dwulinijkowym nagłówkiem YAML — cicho stał się wspólnym formatem instrukcji dla agentów kodujących. Vercel Labs wypuścił `npx skills add`, które mapuje ten sam folder na 45 agentów, od Claude Code po Gemini CLI. Google w repo `google/agents-cli` publikuje siedem skilli uczących cudzych asystentów stawiać agenty ADK na Cloud Run, a Hugo He w PPT Master składa edytowalny PowerPoint za 0,08 dolara. Tylko Claude Code wspiera wszystkie cztery funkcje formatu, więc pierwsza zmiana schematu pokaże, czy to npm dla agentów.

OpenAI wypuścił framework agentowy, w którym ich własne modele są jedną z opcji Premiera / Narzędzie

OpenAI wypuścił framework agentowy, w którym ich własne modele są jedną z opcji

3 min

OpenAI w wersji 0.14.6 SDK openai-agents-python dorzuca Sandbox Agents — dziewiąty klocek obok handoffów, guardraili, sesji i tracingu — który rozdziela agenta na harness i kontener, więc po awarii runner podnosi go ze snapshotu zamiast zaczynać od zera. Ciekawsze jest jednak to, że pyproject.toml wymienia any-llm od Mozilla AI i LiteLLM jako opcjonalne integracje. W efekcie framework agentowy OpenAI nie wymaga modeli OpenAI: w pętli decyzyjnej spokojnie puścisz Claude'a 4.6 czy lokalnego Mistrala. To gra o standard koordynacji, nie o każdy token.

Co zmienia llm 0.31: dwie flagi, cicha poprawka i nowy model OpenAI Premiera / Narzędzie

Co zmienia llm 0.31: dwie flagi, cicha poprawka i nowy model OpenAI

3 min

Wersja 0.31 narzędzia llm Simona Willisona, wydana 24 kwietnia, dorzuca dwie flagi do wtyczki OpenAI: `-o verbosity low` ścisza model bez wpychania instrukcji do promptu, a osobny przełącznik decyduje, jak dokładnie API ogląda obrazek, z nową wartością `original` dla GPT-5.4 i 5.5. Pod spodem modele z `extra-openai-models.yaml` rejestrują się też jako asynchroniczne, więc własny serwer na vLLM albo Groq wystarczy wpisać raz. Dla skryptów przepuszczających setki zapytań to konkretna kontrola nad tokenami i kosztami.

Czego w MCP brakuje firmom: autentykacji między organizacjami, długich zadań i serwera, który sam się odzywa Premiera / Narzędzie

Czego w MCP brakuje firmom: autentykacji między organizacjami, długich zadań i serwera, który sam się odzywa

3 min

MCP zebrał 110 milionów pobrań SDK miesięcznie w 16 miesięcy, a na nowojorski MCP Dev Summit zjechało 1100 osób. David Soria Parra z Anthropica zapowiedział, czego brakuje pod produkcję: wymiany tokenów między firmami, trybu dla zadań na godziny, wyzwalaczy od serwera do agenta i transportu bezstanowego pod load balancer. Linux Foundation powołała w grudniu 2025 Agentic AI Foundation, a AWS Bedrock dopisał prymitywy Tasks i Elicitations, bo czterech dostawców rusza szybciej niż konsensus.