SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Tydzień 32 · 3–9 sierpnia 2026

Czy agent sam rozszerzy opublikowaną pracę badawczą? W teście RExBench udaje się to co trzeci raz Premiera / Narzędzie

Czy agent sam rozszerzy opublikowaną pracę badawczą? W teście RExBench udaje się to co trzeci raz

3 min

RExBench, benchmark z konferencji ACL z lipca 2026, bierze 12 prawdziwych prac naukowych z kodem i każe agentowi kodującemu samodzielnie rozszerzyć je o nową hipotezę, więc sprawdza coś trudniejszego niż łatanie zgłoszonych błędów. Autorzy przetestowali 12 konfiguracji agentów na frameworkach aider i OpenHands, a najlepszy dowiózł zaledwie 33% zadań. Nawet gdy dołożono wskazówki napisane przez człowieka, wynik nie przekroczył 44%, co pokazuje, że bariera nie leży w zrozumieniu polecenia. Im bardziej zadanie jest otwarte i badawcze, tym mocniej skuteczność agenta bez nadzoru spada.

Cloudflare OS: firmowy agent zaczyna od zera uprawnień i prosi o każdy dostęp z osobna Premiera / Narzędzie

Cloudflare OS: firmowy agent zaczyna od zera uprawnień i prosi o każdy dostęp z osobna

5 min

5 sierpnia Cloudflare udostępnił na licencji Apache 2.0 Cloudflare OS, platformę, w której każdy agent startuje bez uprawnień i o każdy dostęp prosi osobno. Wygenerowany kod nie dostaje klucza, tylko typowany obiekt uprawnień, a sekret zostaje w usłudze zwanej Gatekeeperem, która pilnuje reguł nawet przy prompt injection i sprawdza, czy odbiorca ma dostęp do danych przeczytanych po drodze przez agenta. Prawdziwą wartością jest nie świeżość pomysłu, bo uprawnienia zamiast kluczy i zero trust są dużo starsze, lecz kompletny, działający wzorzec na problem, który reszta branży łata politykami.

Cloudflare wystawia agentom narzędzia jednym przełącznikiem, bez linijki kodu Premiera / Narzędzie

Cloudflare wystawia agentom narzędzia jednym przełącznikiem, bez linijki kodu

4 min

Cloudflare uruchomił 8 sierpnia wczesny podgląd WebMCP: jeden przełącznik w panelu sprawia, że strona wystawia agentom AI gotowe narzędzia zamiast układu skrojonego pod człowieka, bez zmian w kodzie serwera. Na brzegu sieci firma wstrzykuje mostek do nowego, eksperymentalnego w Chrome 146 standardu przeglądarkowego. W podglądzie są dwie paczki: Content Credentials czyta metadane pochodzenia zdjęć w C2PA, ale ich kryptograficznie nie weryfikuje, a mocniejszy Site MCP Server łączy agenta z twoim własnym serwerem MCP, który i tak musisz zbudować sam.

Czternaście formatów dokumentów, jeden markdown na wyjściu Premiera / Narzędzie

Czternaście formatów dokumentów, jeden markdown na wyjściu

4 min

Firecrawl wypuścił AnyDoc, otwartą bibliotekę na licencji MIT, która zamienia 14 formatów dokumentów, od Worda i Excela po PDF, na jednolity markdown. Napisana w Ruście, bez modeli uczenia maszynowego, przerabia dokument w medianie 4,4 ms, a w benchmarku producenta z sędzią-LLM dostała 81 na 100 i wygrała w każdym ocenianym formacie. Wychodzi jako Agent Skill, więc po jednej komendzie agent kodujący sam czyta twoje pliki lokalnie i za darmo. Słabiej wypadają arkusze, a skanów będących samym obrazem biblioteka nie ruszy, kierując do płatnego Firecrawl Parse z modelami OCR.

Microsoft pozwala AI napisać test tylko raz, resztę robi już zwykły skrypt Premiera / Narzędzie

Microsoft pozwala AI napisać test tylko raz, resztę robi już zwykły skrypt

3 min

Zespół Commerce Platforms w Microsofcie obszedł konflikt między probabilistyczną naturą AI a wymogiem, by test zgodności za każdym razem przebiegał identycznie: agent tylko raz układa przypadki testowe z istniejącej dokumentacji, człowiek je zatwierdza, a wynik zostaje zamrożony w deterministyczny skrypt, którego AI już nie dotyka. Drugi agent podważa to, co stworzył pierwszy, zanim cokolwiek zostanie zatwierdzone. Cotygodniowe testy regresji przy migracji Global Trade Services na SAP S/4HANA spadły z trzech dni do niespełna godziny, choć liczby pochodzą wyłącznie z firmowego bloga Microsoftu.

MCP zrzuca stan i wychodzi z fazy eksperymentu Premiera / Narzędzie

MCP zrzuca stan i wychodzi z fazy eksperymentu

4 min

Specyfikacja z 28 lipca 2026 czyni protokół MCP w pełni bezstanowym: żądanie niesie wszystko, czego potrzebuje, więc serwer nie musi pamiętać sesji i obsłuży je dowolna wolna instancja, nawet pojedyncza funkcja na brzegu sieci Cloudflare. Simon Willison, który wcześniej odłożył MCP na półkę, zbudował na nowej wersji trzy narzędzia naraz, Sentry weszło z nią na produkcję przed zamknięciem specyfikacji, a Cloudflare podaje miliardy wywołań w codziennym ruchu. Dojrzałość ma cenę: protokół wciąż nie broni przed prompt injection, a za zgody i uprawnienia odpowiada ten, kto stawia serwer.

Serwer MCP zamiast dokumentacji, której model i tak nie doczytał Premiera / Narzędzie

Serwer MCP zamiast dokumentacji, której model i tak nie doczytał

3 min

Sinch, szwedzki dostawca infrastruktury komunikacyjnej, ogłosił 4 sierpnia Agent Tools: serwer MCP, który podsuwa asystentom takim jak Claude Code czy Cursor aktualne definicje ośmiu swoich usług, zamiast pozwolić modelowi zgadywać wywołania z pamięci. Tryb Simulator pozwala przetestować integrację z poziomu edytora, bez zakładania konta. Moim zdaniem to mniej historia o Sinchu, a bardziej zapowiedź tego, co każdy dostawca API będzie musiał robić. Otwarte pozostaje, czy aktualne definicje wycinają zmyślanie, czy tylko przesuwają je piętro wyżej.

Tydzień 31 · 27 lipca – 2 sierpnia 2026

MCP staje się bezstanowy i zaczyna skalować się jak zwykłe HTTP Premiera / Narzędzie

MCP staje się bezstanowy i zaczyna skalować się jak zwykłe HTTP

5 min

Specyfikacja MCP z 28 lipca 2026 wyrzuca mechanizm sesji, wymianę initialize i nagłówek Mcp-Session-Id, dzięki czemu każde żądanie niesie w sobie wszystko, czego potrzebuje, i trafia na dowolną instancję serwera za zwykłym load balancerem. To najpoważniejsza zmiana, odkąd Anthropic udostępnił protokół w listopadzie 2024, ale odpowiedzialność za stan przechodzi teraz na dewelopera. Nowe Multi Round-Trip Requests pozwala serwerowi dopytać użytkownika bez żywego połączenia, za to wycofano Sampling, Roots i Logging. Cała aktualizacja jest opcjonalna i wybierana osobno dla każdego żądania.

OptMem daje agentom pamięć, która przeżywa koniec sesji Premiera / Narzędzie

OptMem daje agentom pamięć, która przeżywa koniec sesji

4 min

Agent do kodu zaczyna każdą sesję od zera, bo harness ucina starą historię, gdy zapełni się okno kontekstowe. OptMem Victora Taelina odpowiada na tę amnezję jednym plikiem Pythona bez zależności i promptem na 426 tokenów wklejanym do CLAUDE.md: notatki lądują w bezstratnym, wiecznie rosnącym dzienniku, nad którym drzewo binarne streszczeń trzyma odczyt na stałym budżecie około 16 tysięcy tokenów. Cały ciężar spada jednak na model, bo to on musi konsekwentnie zapisywać i sięgać po pamięć we właściwym momencie, czego żaden świeżo wydany projekt jeszcze nie udowodnił.

Silnik sandboxów, na którym trenowano Kimi K3, jest już otwarty Premiera / Narzędzie

Silnik sandboxów, na którym trenowano Kimi K3, jest już otwarty

5 min

kvcache-ai otworzyło AgentENV, platformę do stawiania tysięcy odizolowanych sandboxów, na której trenowano agentową część Kimi K3, flagowego modelu Moonshot AI. Silnik stoi na mikromaszynach Firecracker ze snapshotami, więc sandbox wstaje w mniej niż 50 milisekund, a bezczynny oddaje pamięć hostowi i można go rozszczepić na kilka równoległych kopii. Wystawia API zgodne z E2B, więc kod z chmurowej usługi przenosisz na własny serwer bez zmiany linijki, ale liczby to na razie deklaracja producenta, a sam AgentENV nie ma autoryzacji, więc nie wolno wystawiać go do publicznej sieci.

25% na testach w C++: nowy benchmark pokazuje, gdzie agenty się sypią Premiera / Narzędzie

25% na testach w C++: nowy benchmark pokazuje, gdzie agenty się sypią

3 min

OmniCode, benchmark zespołu Atharvy Sonwane'a i Saikata Dutty przedstawiony na ACL 2026, sprawdza agenty programistyczne na 1794 zadaniach w Pythonie, Javie i C++, w czterech kategoriach: łatanie błędów, pisanie testów, poprawki z recenzji i porządkowanie stylu. Popularny SWE-Agent z modelem DeepSeek-V3.1 radzi sobie nieźle głównie z błędami w Pythonie, a na pisaniu testów w C++ wyciąga najwyżej 25%, i to w najlepszym przebiegu. Agenty są mocne tam, gdzie trenowano je najintensywniej, więc jeśli piszesz w Javie czy C++ albo oddajesz im testy, sprawdź je na własnym kodzie.

Bedrock przepisze twój prompt, metrykę wciąż musisz napisać sam Premiera / Narzędzie

Bedrock przepisze twój prompt, metrykę wciąż musisz napisać sam

3 min

Amazon Bedrock dostał Advanced Prompt Optimization, które przy migracji na nowszy model samo przepisuje prompt i w pętli sprawdza, czy nowa wersja wypada lepiej, celując naraz w maksymalnie pięć modeli i porównując jakość, koszt oraz czas do pierwszego tokenu. Sukces definiujesz na trzy sposoby: własną metryką, drugim modelem w roli sędziego albo opisem słowami. AWS chwali się skokami jakości od 35% do 143%, ale to pojedyncze przebiegi po pięć próbek, a optymalizator wspina się dokładnie po metryce, którą mu dasz, więc tę metrykę wciąż musisz napisać sam.

Numbat widzi, jak agent przekracza granice, ale zatrzyma go dopiero na rozkaz Premiera / Narzędzie

Numbat widzi, jak agent przekracza granice, ale zatrzyma go dopiero na rozkaz

4 min

Perplexity udostępniło jako open-source Numbat, niewielki program w Go, który pilnuje agentów programistycznych na urządzeniach pracowników nie przed napastnikiem z zewnątrz, tylko przed nimi samymi: przed agentem, który natrafia na przeszkodę i sam wymyśla obejście przechodzące przez kolejne zabezpieczenia. Kluczowe są hooki wstrzymujące akcję tuż przed jej wykonaniem, a na start dostajemy 52 reguły w 11 kategoriach. Haczyk w tym, że domyślnie wszystkie tylko obserwują: dopóki administrator ręcznie nie przełączy reguły na egzekwowanie, Numbat widzi ryzyko i nie robi z nim nic.

GitKraken Desktop 12 pokazuje na żywo, co zmienia agent w kodzie Premiera / Narzędzie

GitKraken Desktop 12 pokazuje na żywo, co zmienia agent w kodzie

3 min

GitKraken Desktop 12, ogłoszony 28 lipca 2026, sam wykrywa, że agent kodujący (choćby Claude Code) grzebie w plikach repozytorium, i podsuwa gotowy podgląd zmian, zanim o niego poprosisz. Sesje agenta odpalasz wprost z lewego panelu, obok grafu commitów, a poza Claude Code działają tu Codex, Gemini i Copilot przez wspólny Agent Client Protocol. Trafia to w realny ból, bo agent pisze kod szybciej, niż jesteś w stanie za nim nadążyć. Tyle że zobaczyć zmianę to nie to samo, co ją ocenić i wziąć na siebie decyzję o mergu, więc wąskiego gardła recenzji ta premiera nie rusza.

Ręczny bufor promptu w GPT-5.6: kiedy naprawdę tnie rachunek? Premiera / Narzędzie

Ręczny bufor promptu w GPT-5.6: kiedy naprawdę tnie rachunek?

4 min

GPT-5.6 trafił do ogólnej dostępności na Amazon Bedrock, a AWS dołożył ręczne sterowanie buforem promptu: sam wyznaczasz koniec powtarzalnego prefiksu, który potem czytasz z pamięci o 90% taniej przez 30 minut. Nowość ma drugą stronę, bo zapis do bufora, dotąd darmowy na GPT-5.5 i 5.4, kosztuje teraz 1,25 raza więcej niż zwykły token wejściowy, więc realnie oszczędzasz dopiero, gdy odczyty stanowią około 20% ruchu. To wygrana dla pętli agenta, gdzie ten sam prompt systemowy wraca dziesiątki razy, a przy pojedynczych zapytaniach najwięcej zyskujesz, zostając przy trybie automatycznym.

Greptile uczy swojego bota odpalać kod pull requesta, nie tylko go czytać Premiera / Narzędzie

Greptile uczy swojego bota odpalać kod pull requesta, nie tylko go czytać

3 min

Greptile wypuściło w becie TREX, funkcję przeglądu kodu, która pull requesta nie tylko czyta, ale faktycznie odpala go w sandboksie i wyłapuje błędy widoczne dopiero przy uruchomieniu, jak wyścigi między żądaniami czy wycieki sekretów. Zamiast tekstowego ostrzeżenia zostawia dowód pod pull requestem, log z przebiegu albo nagranie klikania po interfejsie, czego trudniej zignorować niż zwykłą adnotację bota. Chwaloną liczbę, około 20% więcej złapanych błędów, Greptile podaje jednak bez opisu metody, więc sam pomysł kupuję, tej liczby nie, dopóki nie zobaczę jej na cudzym repozytorium.

Nowy benchmark Supabase pokazuje, czego agenty nie doczytują Premiera / Narzędzie

Nowy benchmark Supabase pokazuje, czego agenty nie doczytują

4 min

Supabase 31 lipca udostępnił Evals, otwarty benchmark, który uruchamia agenty AI na żywej bazie i sprawdza, jak stawiają schemat i reguły bezpieczeństwa, a nie tylko czy piszą poprawny kod. Powód jest konkretny: ponad 60% nowych baz zakłada u firmy narzędzie AI, a nie człowiek. Najciekawsze okazały się nawyki agentów, czyli ręczne migracje mimo deklaratywnego schematu i rozjazd w czytaniu dokumentacji, gdzie Codex zaglądał średnio do ośmiu stron na scenariusz, a Claude Code do dwóch. Test projektuje jednak sam Supabase, który na każdym agencie zarabia, więc nie jest neutralny.

MiniMax sprzedaje już agenta, nie tylko tani model, ale dowodem są głównie dema Premiera / Narzędzie

MiniMax sprzedaje już agenta, nie tylko tani model, ale dowodem są głównie dema

3 min

MiniMax wychodzi poza tani model i sprzedaje agenta pod hasłem "Code is cheap, show me the requirement", ale ogłoszenie to dobrane przez firmę dema, bez benchmarku i wyniku na SWE-Bench. Dla programisty konkretem jest natywna integracja z MCP, dzięki której agent sam sięga do GitHuba, GitLaba, Slacka czy Figmy zamiast ręcznego wklejania. Sam żongluje kilkoma modelami naraz, co, jak przyznaje firma, kosztuje i obniża wydajność, więc hasło o tanim kodzie na razie się nie broni. Jedyny twardy sygnał to fakt, że po niecałych 60 dniach stał się codziennym narzędziem ponad połowy zespołu MiniMaxa.

Kiedy naprawdę warto zbudować graf wiedzy zamiast zwykłego RAG-u? Premiera / Narzędzie

Kiedy naprawdę warto zbudować graf wiedzy zamiast zwykłego RAG-u?

3 min

GraphRAG od Microsoftu znów zbiera rozgłos i 35,1 tysiąca gwiazdek na GitHubie, ale to nie darmowe ulepszenie zwykłego RAG-u. Klasyczne wyszukiwanie po podobieństwie embeddingów świetnie trafia w punktowe pytania, za to gubi się przy pytaniach o całość, na które nie odpowiada żaden pojedynczy fragment. GraphRAG odwraca kolejność: najpierw model czyta wszystkie dokumenty i buduje graf powiązań, potem streszcza całe skupiska, tyle że płacisz za to z góry drogim indeksowaniem. Moim zdaniem sięgaj po graf tylko przy pytaniach o wzorce w całym zbiorze, bo Microsoft sam nazywa go kodem pokazowym.

JetBrains otwiera KotlinLLM: model dopisuje kod, który zostaje w repo jak każdy inny Premiera / Narzędzie

JetBrains otwiera KotlinLLM: model dopisuje kod, który zostaje w repo jak każdy inny

3 min

JetBrains Research udostępnił na licencji Apache 2.0 KotlinLLM, wtyczkę do IntelliJ IDEA, która odwraca podejście do modeli w gotowej aplikacji: wywołanie asLlm model uzupełnia kodem Kotlina dopiero przy nieobsłużonej sytuacji, a poprawkę podmienia w locie przez JDI. Gotowy kod ląduje w repozytorium jak każdy inny plik, więc na produkcji modelu już nie ma, a wywołanie LLM staje się jednorazowym kosztem z etapu pisania. W testach 24 scenariusze przeszły po dopracowaniu, ale sam JetBrains studzi zapał: to prototyp badawczy, nie środowisko produkcyjne.

Tydzień 30 · 20–26 lipca 2026

Cursor sam wybiera model do każdego zapytania i obiecuje 60% oszczędności Premiera / Narzędzie

Cursor sam wybiera model do każdego zapytania i obiecuje 60% oszczędności

4 min

Cursor Router, uruchomiony w tym tygodniu, kieruje każde zapytanie do najtańszego modelu, który sobie z nim poradzi: rutyna trafia do tanich modeli, a trudne problemy do najdroższych. Jego przewagą są dane, których nie ma nikt inny: ponad 600 tysięcy prawdziwych zapytań o kod i wiedza, czy wygenerowany kod został w projekcie. Reklamowane 60% oszczędności liczone jest wobec Fable 5, a nie wobec realnych zespołów; koszt jednego commita w trybie Balance to 4,63 dolara wobec 7,34 na samym Opus 4.8. Router działa jednak tylko w planach Teams i Enterprise, więc samodzielnego programistę omija.

Najdroższy model potrzebny tylko do planu, resztę zrobi tańszy Premiera / Narzędzie

Najdroższy model potrzebny tylko do planu, resztę zrobi tańszy

3 min

Cursor dał rojowi agentów 835 stron dokumentacji SQLite i kazał odtworzyć bazę w Rust bez kodu źródłowego, a efekt przeszedł 100% ukrytych testów. Prawdziwy wniosek leży jednak w rachunku: przy niemal identycznej jakości koszt rozjechał się od 1339 dolarów, gdy planował Opus 4.8, a wykonywał tani Composer 2.5, po 10 565 dolarów za GPT-5.5 grający obie role naraz. Sztuczka polega na tym, że najdroższy model tylko rozbija cel na jednoznaczne instrukcje, a tańszy je wykonuje, bo naprawdę mało momentów w dużym zadaniu wymaga najkosztowniejszej inteligencji.

Czy agent do kodu, który gada jak kolega, pisze lepszy kod? Premiera / Narzędzie

Czy agent do kodu, który gada jak kolega, pisze lepszy kod?

3 min

Cognition, twórca autonomicznego agenta Devin, zapłaciło ponad 100 milionów dolarów za Poke, asystenta żyjącego w SMS-ach i iMessage. Oficjalnie kupuje osobowość, bo Poke jest proaktywny i miło się z nim rozmawia, ale sedno leży gdzie indziej: współzałożyciel Poke, Marvin von Hagen, widzi w nim warstwę rozdzielającą pracę na kilka równoległych sesji Devina i pamiętającą, co każda zdążyła zrobić. To odpowiedź na realny brak dzisiejszych agentów do kodu, które każdą sesję zaczynają z czystą kartą. Pełne połączenie z modelem SWE-1.7 ma jednak ruszyć dopiero w przyszłym roku.

LM Studio wypuszcza Bionic, lokalnego agenta, który nie oddaje twojego kodu w chmurę Premiera / Narzędzie

LM Studio wypuszcza Bionic, lokalnego agenta, który nie oddaje twojego kodu w chmurę

3 min

LM Studio wypuściło 22 lipca Bionic, agenta, który pisze kod i składa dokumenty na tej samej lokalnej infrastrukturze co czat, więc kod nie wędruje na cudze serwery. Więcej niż sam agent waży cicha aktualizacja 0.4.20: dzięki LM Link ciężki model chodzi na mocnej stacji, a pracujesz na lżejszym laptopie, zespół może też wskazać jeden model serwowany w sieci firmy, zamiast trzymać osobną kopię u każdego dewelopera. Do najtrudniejszych zadań Bionic i tak sięga po GLM 5.2 czy DeepSeek V4 Pro w płatnej chmurze Secure Cloud, a na razie działa tylko na Windowsie i macOS.