SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Premiery narzędzi, frameworków, IDE i agentów — co nowego trafia do warsztatu programisty.

282 art.

Tydzień 40 · 28 września – 4 października 2026

Uber chowa przed agentami katalog pięciu tysięcy narzędzi Premiera / Narzędzie

Uber chowa przed agentami katalog pięciu tysięcy narzędzi

4 min

Uber ma w produkcji ponad 800 serwerów MCP z 5 tysiącami narzędzi, więc agent, który dostałby pełny katalog, utonąłby w opisach, zanim przeczytałby polecenie. Dlatego na start dostaje tylko cztery narzędzia: do znalezienia serwera, przejrzenia jego narzędzi, pobrania schematu i wywołania, a z odpowiedzi usługi bierze wyłącznie potrzebne pola. Każde narzędzie opisane automatycznie przez model językowy trafia do katalogu wyłączone, dopóki nie włączy go zespół właściciela usługi. Ten sposób warto skopiować nawet przy dziesięciu narzędziach.

Pi 1.0 przyjęło MCP, które przez miesiące odrzucało Premiera / Narzędzie

Pi 1.0 przyjęło MCP, które przez miesiące odrzucało

4 min

Pi, otwartoźródłowy agent do pisania kodu Mario Zechnera, przez miesiące odrzucał MCP, bo opisy narzędzi zajmują kontekst modelu, a sam serwer Playwrighta zjadał na starcie około 13,7 tys. tokenów. Pi 1.0, które trafiło na szczyt Hacker News, obsługuje już protokół przez Codemode, czyli model pisze skrypt w JavaScripcie uruchamiany w piaskownicy, dzięki czemu do rozmowy wraca tylko wynik. Uważam ten zwrot za przemyślany, choć nikt jeszcze nie zmierzył, ile tokenów to realnie oszczędza.

Planista w chmurze i wykonawcy na karcie graficznej w Antigravity SDK Premiera / Narzędzie

Planista w chmurze i wykonawcy na karcie graficznej w Antigravity SDK

3 min

23 września Google dodał do Antigravity SDK obsługę modeli działających na własnym komputerze, na start Gemmy 4 26B na silniku LiteRT, ale też Ollamy czy LM Studio. W pokazie Gemini 3.8 Flash w chmurze rozplanował łatanie trzech modułów, widząc tylko nazwy plików i zużywając 95 tokenów, a kod poprawiały lokalne kopie Gemmy, więc nie opuścił maszyny. Dla firm, które nie mogą wysyłać kodu na zewnątrz, to rozsądny kierunek, choć pokaz jest skromny, a sprzęt potrzebuje ponad 24 GB pamięci karty graficznej.

Jevgrep szuka kodu za agenta. Ile naprawdę na tym oszczędzasz? Premiera / Narzędzie

Jevgrep szuka kodu za agenta. Ile naprawdę na tym oszczędzasz?

4 min

Jevgrep, narzędzie wiersza poleceń wypuszczone przez Davida Zhanga 26 września, szuka kodu po opisie jego zachowania, a o trafności wyników decyduje osobno płatny model Jev firmy TypeSafe AI. Obiecane 40% oszczędności okupiono gorszym wynikiem na SWE-bench, więc uczciwą liczbą jest 25,8% z powtórki na wersji 0.4.3, liczone razem z opłatami za Jev, choć tylko na dziesięciu zadaniach. Wersja 0.5 przerzuca część pracy z powrotem na agenta, przez co przy rozliczaniu za tokeny wychodzi o 2 do 3% drożej, a fragmenty kodu i tak trafiają do zewnętrznego modelu.

Pasek boczny, panel i przeglądarka plików: co OpenAI dało twórcom pluginów Premiera / Narzędzie

Pasek boczny, panel i przeglądarka plików: co OpenAI dało twórcom pluginów

4 min

Od DevDay 29 września plugin w ChatGPT może mieć własne okno: miejsce w pasku bocznym, panel obok rozmowy i przeglądarkę plików wybranego typu, na przykład modeli STL do druku 3D. Rozszerzenia opierają się na MCP i MCP Apps, a OpenAI dokłada do nich własne metadane oraz usługę Sites, która uruchamia serwer MCP w jego chmurze. To kolejne podejście firmy do sklepu z aplikacjami, więc serwer MCP traktowałbym jako część przenośną, a warstwę OpenAI robiłbym możliwie cienką, z klientem i rozliczeniami po swojej stronie.

Anthropic otwiera portal dla autorów wtyczek do Claude'a Premiera / Narzędzie

Anthropic otwiera portal dla autorów wtyczek do Claude'a

3 min

Od 25 września autorzy wtyczek do Claude'a mogą zgłaszać je do katalogu przez nowy portal Anthropica, a sama wtyczka łączy w jedną paczkę konektory MCP i Agent Skills. Dla autora liczy się głównie to, co widzi po publikacji: liczbę instalacji w podziale na produkt i wersję, wyświetlenia strony w katalogu i wyszukiwania, które do niej prowadzą. Zgłoszenie przechodzi automatyczny skan bezpieczeństwa i przegląd, tyle że ogłoszenie nie mówi, co sprawdza skan ani ile trwa przegląd, a liczby wtyczek w katalogu Anthropic nie podaje.

Cursor rysuje odpowiedź w czacie. Najlepiej wychodzi mu tłumaczenie własnych zmian Premiera / Narzędzie

Cursor rysuje odpowiedź w czacie. Najlepiej wychodzi mu tłumaczenie własnych zmian

3 min

Cursor od 29 września rozumie komendę /visualize, po której agent odpowiada wykresem albo diagramem wstawionym prosto w czat, co jest lżejszą wersją kwietniowych paneli z wersji 3.1. Najlepiej sprawdza się przy tłumaczeniu własnych zmian: użytkowniczka @fredrikalindh pokazała agenta, który krok po kroku rozrysowuje, co przestawił w kodzie. Ładny diagram nie jest jednak dowodem, więc rozsądnie jest kazać agentowi oddzielić połączenia potwierdzone w kodzie od tych, które tylko zakłada.

Agent AWS przejrzy twoją chmurę, ale nie zna powodów, dla których wygląda tak, a nie inaczej Premiera / Narzędzie

Agent AWS przejrzy twoją chmurę, ale nie zna powodów, dla których wygląda tak, a nie inaczej

4 min

Amazon Web Services udostępniło 1 października w wersji testowej AWS Well-Architected Agent, który przegląda konto w chmurze, ocenia ponad 65 usług i wycenia proponowane poprawki w dolarach, a przy większych problemach podsuwa gotową zmianę w plikach Terraform albo CloudFormation. Zalecenia mogą trafić przez serwer MCP prosto do edytora. Agent widzi każdy zasób, ale nie zna powodów, dla których system wygląda tak, a nie inaczej, i doradza w sprawie usług, które AWS sam sprzedaje, dlatego na początek dałbym mu wyłącznie prawo do czytania.

Microsoft wpuszcza agenta na całą dobę do Teams i Outlooka, ale silnik ma cudzy i dziurawy Premiera / Narzędzie

Microsoft wpuszcza agenta na całą dobę do Teams i Outlooka, ale silnik ma cudzy i dziurawy

5 min

Autopilot, nowy agent Microsoftu pracujący całą dobę w Teams i Outlooku, to przemianowany Scout zbudowany na otwartym frameworku OpenClaw, w którego wdrożeniach zgłoszono już ponad 138 podatności, w tym CVE-2026-32922 z oceną 9,9 na 10. Microsoft daje każdemu agentowi osobną tożsamość w Entra i wymaga zgody administratora, ale nie mówi, czy najgroźniejsze dziury załatano. Kto pisze integracje z Microsoft 365, musi przyciąć agentom uprawnienia i przygotować się na to, że Microsoft Graph będzie odpytywany także w nocy i w weekendy.

JetBrains Air: trafna diagnoza, cienka oferta Premiera / Narzędzie

JetBrains Air: trafna diagnoza, cienka oferta

4 min

JetBrains 22 września ogłosił Air, zestaw produktów, który ma objąć pracę agentów AI w całej firmie, a nie tylko w IDE. Diagnoza jest trafna: kod tanieje, a drożeje jego sprawdzanie, za które wciąż odpowiadają ludzie, więc lepszy model nie ustali zasad ani nie policzy kosztów. Oferta jest jednak cienka, bo Air Governance to marcowy Central pod nową nazwą, wpis nie mówi, co działa już dziś, a obietnica tańszych i dokładniejszych agentów dzięki analizie kodu w IDE nie ma za sobą ani jednej liczby.

Eleven v4 od ElevenLabs: głos, który słucha poleceń zapisanych w nawiasach Premiera / Narzędzie

Eleven v4 od ElevenLabs: głos, który słucha poleceń zapisanych w nawiasach

4 min

ElevenLabs wypuściło pod koniec września Eleven v4, model mowy z emocjami, oraz jego szybszą odmianę Turbo dla agentów głosowych rozmawiających na żywo. Sposób mówienia wpisuje się wprost w tekst poleceniami w nawiasach, takimi jak [laughs] czy [light rain], więc reżyserię może pisać ten sam model językowy, który układa odpowiedź agenta. Turbo potrzebuje około 150 ms do pierwszego słyszalnego dźwięku, ale to pomiar samego producenta bez łącza użytkownika, a wśród próbek w ogłoszeniu nie ma ani jednej po polsku.

Google Cloud API Gateway wystawia istniejące API agentom bez osobnego serwera MCP Premiera / Narzędzie

Google Cloud API Gateway wystawia istniejące API agentom bez osobnego serwera MCP

4 min

Google ogłosiło 24 września, że Cloud API Gateway w wersji testowej sama udaje serwer MCP, więc istniejące API trafia do agentów jako narzędzia po dopisaniu kilku adnotacji w pliku OpenAPI 3.0 lub 3.1. Wywołania agenta przechodzą przez te same tokeny, limity i dzienniki co ruch z aplikacji, dzięki czemu odpada osobny serwer, ale agent w pętli zjada też limit klientów. Prawdziwa praca to opisy operacji, z których model wnioskuje, kiedy sięgnąć po narzędzie, a listę narzędzi, domyślnie otwartą dla każdego, trzeba zamknąć tokenem JWT.

Agent w Android Studio na twój abonament, a nie na abonament Google Premiera / Narzędzie

Agent w Android Studio na twój abonament, a nie na abonament Google

4 min

W testowej wersji Rabbit 2 Android Studio wpuszcza do środka cudzych agentów, więc obok Antigravity od Google można wybrać Claude Agent od Anthropica albo Codex od OpenAI i zalogować się własnym planem lub kluczem API, o ile pozwala na to dostawca. Działa to dzięki otwartemu Agent Client Protocol, przez co każdy zgodny agent podłączy się bez osobnej wtyczki. Google jednocześnie zaleca przejście z wbudowanego Gemini na Antigravity z płatnym planem AI Pro lub Ultra, a obietnice szybszej i tańszej pracy nie mają za sobą żadnych liczb.

Mody w Claude Code: własny kod w środku pętli agenta Premiera / Narzędzie

Mody w Claude Code: własny kod w środku pętli agenta

5 min

Anthropic opisał mody do Claude Code, czyli małe pliki w JavaScripcie lub TypeScripcie, które ładują się do sesji i mogą każde zdarzenie przepuścić, przepisać albo zatrzymać. Moim zdaniem najwięcej dają te, które pokazują pracę agenta, jak Token Weather z prognozą zapełnienia okna kontekstowego czy Replay Theater z powtórką edycji po kolei. Blast Radius zatrzymuje komendy w rodzaju rm -rf, ale czyta tylko ich tekst, więc łatwo go obejść, co Anthropic sam przyznaje. Mody działają z twoimi uprawnieniami, dlatego cudzy kod trzeba przeczytać przed instalacją.

Dwie warstwy pilnowania agentów AI i tylko jedna na twoim laptopie Premiera / Narzędzie

Dwie warstwy pilnowania agentów AI i tylko jedna na twoim laptopie

5 min

NVIDIA odpowiada na serię wpadek agentów AI, od bazy danych skasowanej w dziewięć sekund po włamanie do Hugging Face, platformą Open Agent Safety Platform, która przenosi pilnowanie agenta poza jego zasięg. Pierwsza warstwa, otwarty OpenShell na licencji Apache 2.0, zamyka każdego agenta w piaskownicy na poziomie jądra systemu i działa też na zwykłej stacji roboczej. Druga, Sentry, wymaga kart BlueField-4 w serwerach Vera Rubin, więc deweloper bez własnej serwerowni dostaje tylko połowę ochrony, a lista ponad 100 partnerów to w dużej mierze same logotypy.

Kiedy poprawka promptu naprawdę coś daje? Claude Code dostał narzędzie, które to mierzy Premiera / Narzędzie

Kiedy poprawka promptu naprawdę coś daje? Claude Code dostał narzędzie, które to mierzy

4 min

Claude Code dostał w skillu claude-api dwie komendy: build-eval buduje zestaw testów z prawdziwych rozmów i zgłoszeń, a hillclimb poprawia aplikację krok po kroku i cofa każdą zmianę, która nie pomaga na odłożonej, niewidzianej puli przypadków. Na 44 zgłoszeniach do obsługi klienta wynik na zakrytej puli wzrósł z około 11 do prawie 13 na 14 przy jednej piątej kosztu, choć oszczędność przyniosła głównie przesiadka na Sonnet 5. Najcenniejsze jest jednak to, że narzędzie umie przyznać, że poprawka nic nie dała, i wskazać zepsuty test.

Stainless zniknął, a Cloudflare oddaje za darmo własny generator bibliotek do API Premiera / Narzędzie

Stainless zniknął, a Cloudflare oddaje za darmo własny generator bibliotek do API

4 min

Od 1 września nie działa Stainless, usługa generująca biblioteki do API dla OpenAI, Google DeepMind czy Cloudflare, którą w maju za ponad 300 milionów dolarów kupił Anthropic. Cloudflare udostępnił 21 września na licencji Apache 2.0 Forge, własny generator SDK, CLI i dokumentacji, który działa w CI i przy każdym pull requeście pokazuje, co zmiana w API zrobi z bibliotekami. Pierwszym produkcyjnym wynikiem jest nowe CLI cf z ponad 3000 operacji, a obietnicę generowania serwerów MCP radzę najpierw sprawdzić w repozytorium.

Agenty wpisują już prawie połowę poleceń w narzędziu Cloudflare Premiera / Narzędzie

Agenty wpisują już prawie połowę poleceń w narzędziu Cloudflare

4 min

Wrangler, narzędzie wiersza poleceń Cloudflare, obsługiwał w marcu 2026 agentów w co czwartym przypadku, a tuż przed premierą następcy już w 48%, więc firma zbudowała nowe narzędzie z myślą o nich. Następca o nazwie cf, wydany jako otwarta wersja testowa, zamiast około 280 ręcznie pisanych poleceń ma ponad 3000, generowanych z jednego opisu API, i domyślnie odpowiada w formacie JSON. Słabym punktem jest to, że żaden model jeszcze go nie zna, a przeprowadzka jest tania tylko dla projektów budowanych przez Vite, przez co aplikacje w Ruście i Pythonie na razie zostają przy Wranglerze.

MongoDB wpuszcza agentów AI do własnej bazy danych Premiera / Narzędzie

MongoDB wpuszcza agentów AI do własnej bazy danych

4 min

MongoDB ogłosiło 29 września Atlas Agent Engine, usługę w publicznym podglądzie, w której agent AI czyta i zmienia dane, pamięta poprzednie rozmowy dzięki modelom Voyage AI i zostawia dziennik każdej akcji przypisany do konkretnej tożsamości. Firma obiecuje swobodę wyboru modelu i chmury, ale zależność nie znika, tylko przenosi się na samą platformę MongoDB. Razem z nim wyszło MongoDB 9.0, według wewnętrznych testów nawet dwa razy szybsze, oraz Atlas Infinite, na razie dostępny tylko na AWS.

Company Brain za darmo: bot do Slacka, który wie tylko tyle, co pytający Premiera / Narzędzie

Company Brain za darmo: bot do Slacka, który wie tylko tyle, co pytający

5 min

Supermemory wygasiło płatnego bota do Slacka Company Brain i wypuściło jego kod na licencji Apache 2.0, tak że da się go postawić na własnym koncie Cloudflare z kluczem do Supermemory i do jednego z pięciu dostawców modeli. Bot zapamiętuje rozmowy zespołu, sam zabiera głos i przez MCP zakłada zgłoszenia w Linearze, ale najważniejsze jest to, że czyta wyłącznie z uprawnieniami osoby, która go pyta. Darmowy plan Cloudflare urywa odpowiedź po 50 wywołaniach, pamięć zostaje u dostawcy, a README milczy o ukrytych poleceniach w wiadomościach, więc zacząłbym od jednego kanału.

Tydzień 39 · 21–27 września 2026

Firecrawl buduje bibliotekę danych dla agentów AI i obiecuje płacić autorom Premiera / Narzędzie

Firecrawl buduje bibliotekę danych dla agentów AI i obiecuje płacić autorom

4 min

Firecrawl, z którego narzędzia do czytania stron korzysta ponad 1,5 miliona osób, zebrał 75 milionów dolarów i wypuścił Alexandrię, katalog źródeł danych dla agentów AI dostępny przez jedno API, serwer MCP albo wiersz poleceń. Agent sięga tam do ponad 100 zewnętrznych dostawców i trzech własnych indeksów, z których programistę najbardziej zainteresuje indeks dokumentacji i zgłoszeń z GitHuba. Obiecany wynik lepszy o 21% pochodzi jednak z testu samej firmy, a wypłaty dla autorów są na razie listą oczekujących, więc warto najpierw sprawdzić Alexandrię na własnych pytaniach.

AX od Google usypia bezczynnego agenta i budzi go w tym samym miejscu Premiera / Narzędzie

AX od Google usypia bezczynnego agenta i budzi go w tym samym miejscu

4 min

Google wypuścił AX, otwarty projekt na licencji Apache 2.0, który uruchamia autonomiczne agenty w klastrze Kubernetes podobnie jak Kubernetes uruchamia kontenery. Agenta opisuje się w pliku YAML jako zadanie z limitami, przestrzenią roboczą i bramą sieciową, a komendy ax suspend i ax resume usypiają go na czas czekania na człowieka i wznawiają dokładnie tam, gdzie przerwał. To wczesna alfa, która wymaga własnego klastra i projektu Agent Substrate, więc na razie przyda się głównie zespołom platformowym.

Microsoft przyznaje, że goni Anthropic, i skleja Copilota w jedną aplikację Premiera / Narzędzie

Microsoft przyznaje, że goni Anthropic, i skleja Copilota w jedną aplikację

4 min

Microsoft 25 września połączył Microsoft 365 Copilot i GitHub Copilot w jedną aplikację z zakładkami Home, Code i Autopilot, a wiceprezes Jacob Andreou przyznał w CNBC, że w programowaniu firma goni Anthropic. Zakładka Code pozwala budować aplikacje osobom, które nie programują, więc ich utrzymanie prędzej czy później trafi do deweloperów. Dla nich Microsoft otwiera Copilot Managed Runtime i wspólny katalog wtyczek, a nowe funkcje będą rozliczane od zużycia, obok licencji za 30 dolarów miesięcznie.

Benchmark Google mierzy teraz, ile pracy zostaje po agencie Premiera / Narzędzie

Benchmark Google mierzy teraz, ile pracy zostaje po agencie

4 min

Android Bench 2.0, nowy test Google dla agentów piszących aplikacje na Androida, obok pełnych zaliczeń pokazuje wskaźnik ukończenia, czyli to, jaką część pracy agent wykonał dobrze. GPT-6 Astra w Codeksie kończy 82,2% pracy, ale w całości zalicza tylko 28% przebiegów, a Claude Fable 5.1 w Claude Code ma 82,4% i 22,7%. Resztę stanowią błędy widoczne dopiero w działającej aplikacji, jak odtwarzacz grający w tle czy stan tracony po obróceniu telefonu, dlatego przegląd kodu warto przesunąć ze stylu na zachowanie aplikacji.