SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Tydzień 38 · 14–20 września 2026

Drugie okno terminala, w którym widać pracę agenta linia po linii Premiera / Narzędzie

Drugie okno terminala, w którym widać pracę agenta linia po linii

3 min

Odpalasz livediff w drugim oknie terminala i od tej chwili widzisz każdy zapis pliku na bieżąco, jako zwykły diff Gita, zamiast zsumowanego stanu, który pokazuje watch git diff. Liczy się kolejność: wyłapujesz moment, w którym agent poprawia funkcję, po 20 sekundach cofa własną poprawkę i pisze ją trzeci raz zupełnie inaczej. Narzędzie śledzi wyłącznie pliki znane Gitowi, więc build ani dociągane zależności nie zasypują okna tysiącem linii. Nie wie za to, kto zmianę wprowadził, i nie pokaże niczego sprzed uruchomienia.

Sprzątanie miliona linii kodu za 19 300 dolarów. Regresje wyłapali ludzie. Premiera / Narzędzie

Sprzątanie miliona linii kodu za 19 300 dolarów. Regresje wyłapali ludzie.

4 min

Nous Research puściło 1393 wykonawców swojego agenta Hermes na milion linii Pythona i w 19 godzin, za jakieś 19 300 dolarów w tokenach, skróciło kod o 34,4%. Kontrole oparto na tym, co maszyna porówna sama: niezmieniony schemat JSON narzędzi, wynik polecenia z flagą help bajt w bajt i zamrożoną listę testów, które sypały się już wcześniej. Dwóch regresji to nie złapało, bo agenty wycięły publiczne nazwy potrzebne wtyczkom i w około 65 miejscach zmieniły obsługę błędów, a wyłapały je dopiero dwie rundy przeglądu przez społeczność open-source.

OpenAI zabiera GPT-5.5 i nie zostawia furtki dla spóźnialskich Premiera / Narzędzie

OpenAI zabiera GPT-5.5 i nie zostawia furtki dla spóźnialskich

4 min

Od 14 października GPT-5.5 przestaje odpowiadać w ChatGPT i w Codexie na wszystkich planach, ale wywołania przez API OpenAI działają dalej, więc zacznij od sprawdzenia, którędy twoje zadania wołają model. Podmiana na gpt-5.6-sol zajmuje chwilę, gorzej z miejscami, których nikt nie ogląda: zadaniem wrzuconym kiedyś do harmonogramu albo krokiem w CI z flagą --model gpt-5.5, bo takie wywołanie nie przełączy się po cichu, tylko wróci błędem. Sol jest o jedną trzecią tańszy na tokenach wyjściowych od modelu, który znika, tyle że ta promocyjna stawka obowiązuje tylko do 21 listopada.

Agent przeszedł pilotaż. Co zrobi, gdy w połowie biegu wygaśnie klucz dostępu? Premiera / Narzędzie

Agent przeszedł pilotaż. Co zrobi, gdy w połowie biegu wygaśnie klucz dostępu?

4 min

Diagrid wydał 17 września pięć kryteriów gotowości produkcyjnej dla agentów: wznawianie od miejsca awarii, dostęp, który nie wygasa w połowie biegu, idempotentność, kontrola tego, co oddaje model, i trwały zapis przebiegu. Każde jest pytaniem, na które odpowiada się logami, a nie akapitem w dokumencie projektowym. To klasyczne wzorce systemów rozproszonych, z jedną różnicą: ponowiony krok agenta może wybrać inne narzędzie i inny plan, więc nie jest tą samą operacją. Tyle że Diagrid sprzedaje dokładnie tę warstwę uruchomieniową, a kryteria wyszły komunikatem prasowym bez jednej liczby.

Agent-Reach nie czyta za ciebie internetu, tylko pilnuje, którędy da się do niego wejść Premiera / Narzędzie

Agent-Reach nie czyta za ciebie internetu, tylko pilnuje, którędy da się do niego wejść

4 min

Agent-Reach, projekt jednego dewelopera, przez dobę wisiał na szczycie trendów GitHuba, choć sam nie pobiera ani jednej strony: trzyma uporządkowaną listę dróg dostępu do każdej platformy, z wariantami zapasowymi. Gdy w czerwcu Bilibili zaczęło odpowiadać kodem 412 na zapytania yt-dlp, wystarczyło przestawić kanał na bili-cli. Sześć kanałów działa bez konfiguracji, ale Reddit i X wymagają oddania skryptowi ciasteczka z zalogowanej sesji, więc autor radzi używać konta pomocniczego. Kupujesz tu czyjąś uwagę, bo gdy autor przestanie testować, lista dalej poda martwe drogi jako pierwszy wybór.

Cloudflare otworzył swojego audytora bezpieczeństwa i zabronił mu wierzyć samemu sobie Premiera / Narzędzie

Cloudflare otworzył swojego audytora bezpieczeństwa i zabronił mu wierzyć samemu sobie

4 min

Cloudflare wyłożył na GitHubie security-audit-skill, zestaw instrukcji na licencji MIT, który zamienia agenta kodującego w zespół audytorów, gdzie ten, kto znalazł dziurę, nie ma prawa jej potwierdzić, bo do sprawdzenia rusza świeży agent z zadaniem odwrotnym: obalić ustalenie. Pilnuje tego rejestr pokrycia i walidator w Node, dzięki czemu nic nie trafia do wyników bez wskazania miejsca w kodzie, a bez piaskownicy audyt kończy się na hipotezach. Pojedynczy bieg znajduje mniej więcej połowę tego, co wszystkie razem, więc to raczej dodatkowa para oczu przed wydaniem niż bramka w CI.

Fork Claude Code, który zdradza się już pierwszą zmienną środowiskową Premiera / Narzędzie

Fork Claude Code, który zdradza się już pierwszą zmienną środowiskową

4 min

OpenClaude to fork Claude Code, który po ustawieniu zmiennej CLAUDE_CODE_USE_OPENAI kieruje tego samego terminalowego agenta do ponad 20 dostawców modeli, z lokalną Ollamą włącznie, więc próg wejścia spada do zera. Narzędzia do plików, strumieniowanie i MCP zostają nietknięte, zmienia się tylko to, kto odpowiada po drugiej stronie. README przyznaje, że jakość pracy narzędziami zależy od wybranego modelu, a mniejsze modele lokalne gubią się w długich ciągach wywołań, czyli tam, gdzie agent ma pracować. Pochodzenie zdradza flaga tengu_hive_evidence, od wewnętrznej nazwy kodowej Claude Code.

Tydzień 37 · 7–13 września 2026

Jedno wywołanie, trzy subagenty i cała infrastruktura po stronie OpenAI Premiera / Narzędzie

Jedno wywołanie, trzy subagenty i cała infrastruktura po stronie OpenAI

4 min

Agents API, które OpenAI pokazało 10 września, wystawia wszystkim ten sam harness, który od ponad roku pilnuje Codexa: jedno wywołanie i agent sam rozbija zadanie na maksymalnie trzy subagenty z własną pamięcią, a przy limicie okna kontekstowego sam zwija starszą część zapisu. Za samą platformę nie płacisz nic, rachunek obejmuje tokeny, narzędzia i czas kontenera, tylko że dane leżą wyłącznie w Stanach, nawet gdy sandbox stoi u ciebie. To wygoda kupiona uzależnieniem od dostawcy, bo sesja razem ze swoim stanem zostaje już po jego stronie.

Cursor stawia nad agentami koordynatora, który sam nie tyka kodu Premiera / Narzędzie

Cursor stawia nad agentami koordynatora, który sam nie tyka kodu

4 min

Cursor wypuścił 10 września betę Projects: koordynator pracuje na osobnej maszynie w chmurze, sam nie tyka kodu, tylko rozsyła zadania podległym agentom, a projekt pamięta, czego się nauczyły, więc kolejny agent nie zaczyna od pustej kartki. Firma chwali się sześciokrotnie większą liczbą zmergeowanych pull requestów, ale nie podała ani wielkości grup, ani okresu pomiaru, a narzędzie rozbijające tę samą pracę na kilkanaście wątków z definicji pokaże więcej zamkniętych kawałków. Wąskim gardłem robi się wtedy ludzki przegląd kodu, więc przed pierwszym uruchomieniem warto ustawić limit wydatków.

Koniec zgadywania z drzewa dokumentu: Chrome testuje WebMCP Premiera / Narzędzie

Koniec zgadywania z drzewa dokumentu: Chrome testuje WebMCP

4 min

WebMCP odwraca sposób, w jaki agent działa na cudzej stronie: zamiast zgadywać z drzewa dokumentu, dostaje od niej gotową listę narzędzi z wejściem opisanym w JSON Schema, dzięki czemu rezerwacja czy zakup idą jednym wywołaniem zamiast serii kliknięć. Chrome pozwala to sprawdzić lokalnie pod flagą, a od wersji 149 także na produkcji, jeśli strona zapisze się do origin trial. Google samo wylicza trzy hamulce: nie ma katalogu takich stron, najbardziej rozbudowane serwisy mają najwyższy próg wejścia, a całość pomyślano pod człowieka przy przeglądarce, nie pod agenta na serwerze.

RadixArk otwiera kod maszynerii, która dotrenowuje największe modele Premiera / Narzędzie

RadixArk otwiera kod maszynerii, która dotrenowuje największe modele

4 min

RadixArk otworzył kod Miles v0.1, maszynerii do uczenia ze wzmocnieniem na modelach z najwyższej półki, i opisał ją w raporcie technicznym, który trafił na arXiv 8 września. Przykładowy przebieg ciągnął model GLM-5.2 o 744 miliardach parametrów na 64 kartach NVIDIA GB300, z medianą kroku 263 sekundy, więc otwarty kod barierę sprzętową raczej przesuwa, niż znosi. Zwykłemu zespołowi więcej dadzą boczne ścieżki, przede wszystkim uczenie ze wzmocnieniem na adapterach LoRA, bo mieści się w ułamku pamięci potrzebnej na pełny przebieg.

Artemis wpina prawdziwy telefon do Claude Code i Codexa Premiera / Narzędzie

Artemis wpina prawdziwy telefon do Claude Code i Codexa

4 min

Artemis, projekt Google na licencji Apache 2.0, wpina przez MCP prawdziwy telefon albo emulator w agenta z twojego edytora, dzięki czemu widzi on drzewo widoków, zrzuty ekranu i log systemowy, a do tego może dotknąć dowolnego punktu. Tryb Flash klika od razu, od 3 do 5 sekund na krok, a planujący Pro potrzebuje od 15 do 40, więc kilkanaście minut na przebieg wyklucza testy regresji przy każdym pull requeście. Głośne ponad 99% na benchmarku AndroidWorld zgłasza sam Google, na własnym zestawie aplikacji, a realna wartość leży w odtwarzaniu zgłoszonych błędów.

Świeżo sklonowany OpenBot wpuszcza każdego jako administratora Premiera / Narzędzie

Świeżo sklonowany OpenBot wpuszcza każdego jako administratora

5 min

Domyślny plik .env.example OpenBota od CopilotKit ustawia OPENBOT_SINGLE_USER=true, więc świeżo sklonowany panel wpuszcza każdego jako administratora, dopóki nie skasujesz tej linijki i nie podepniesz logowania przez Google, Microsoft albo Oktę. Poza tym widać tu przemyślaną robotę: osobny kontener i profil przeglądarki dla każdego bota, opcjonalnego gVisora, rejestr zapisujący długość sekretu zamiast jego treści i automaty gasnące po dziesięciu nieudanych przebiegach. Haczyk jest jeden, bo pamięć botów żyje w CopilotKit Intelligence i serwer nie wystartuje bez klucza INTELLIGENCE_API_KEY.

Model głosowy, który wie, kiedy się nie odzywać Premiera / Narzędzie

Model głosowy, który wie, kiedy się nie odzywać

4 min

OpenAI wystawiło w API GPT-Live-1, model, który słucha i mówi jednocześnie, więc na wejście w słowo reaguje w trakcie, a nie po fakcie, i zdejmuje z dewelopera sklejanie rozpoznawania mowy, modelu od odpowiedzi i syntezy głosu. Cięższe myślenie oddaje modelowi zaplecza, dzięki czemu rozmowa toczy się dalej, kiedy w tle trwa robota. Aplikacja Speak policzyła na własnych uczniach, że nowy model wchodzi im w słowo o niemal 80% rzadziej, a warstwa głosowa kosztuje 0,05 dolara za minutę, czyli 3 dolary za godzinę rozmowy, przy czym model zaplecza rozlicza się osobno.

Jedno polecenie w terminalu mówi, który model ruszy na twoim sprzęcie Premiera / Narzędzie

Jedno polecenie w terminalu mówi, który model ruszy na twoim sprzęcie

4 min

llmfit jednym poleceniem sprawdza, co masz w maszynie, i wypisuje tabelę modeli ocenionych na czterech osiach: czy się zmieszczą, jak szybko pójdą, jak dobre dają odpowiedzi i ile kontekstu uniosą. Liczy tylko te podsieci, które pracują przy każdym tokenie, więc Mixtral czy DeepSeek-V3 dostają werdykt "zmieści się" tam, gdzie kalkulator sumujący wszystkie wagi odsyła z kwitkiem. Własny pomiar tokenów na sekundę odsyłasz do projektu jako PR wprost z terminala, a polecenie llmfit info pokazuje, na jakich założeniach stoi każda liczba. Celności tych szacunków nikt niezależnie nie potwierdził.

AWS oddaje agentom skrzynkę odbiorczą, żeby przestać patrzeć im na ręce Premiera / Narzędzie

AWS oddaje agentom skrzynkę odbiorczą, żeby przestać patrzeć im na ręce

4 min

AWS wypuścił na GitHubie Pizza Bota, otwartego na licencji Apache 2.0 klienta, który zadania agentów układa jak skrzynkę pocztową: skończona praca trafia do kolejki Unread, a prośba o zgodę czeka w kolejce Action, więc odpowiadasz na nią godzinę później z telefonu. Uprawnienia każdego specjalisty opisujesz w pliku SKILL.md, a stan pracy zapisuje LangGraph, przez co zamknięcie okna kosztuje najwyżej jeden krok. Gorzej, że katalog gotowych specjalistów i serwerów MCP, z którego korzystało ponad 2000 osób w Amazonie, przy przepisywaniu na open source wypadł.

Google każe agentom nie ufać własnej pamięci o Mapach Premiera / Narzędzie

Google każe agentom nie ufać własnej pamięci o Mapach

4 min

Google Maps Platform wypuścił na GitHubie skilla dla agentów, który każe pisać nietrywialny kod dopiero po pobraniu świeżej dokumentacji z usługi Code Assist, a nie z tego, co model zapamiętał z trenowania. Jeden plik obsługuje cztery platformy, a do prototypu podpina publiczny klucz demonstracyjny, dzięki czemu pierwsza działająca mapa powstaje bez zakładania projektu w chmurze. Obiecaną dokładność i niższe zużycie tokenów Google podaje bez jednej liczby, a na końcu opisu zaznacza, że to nie jest oficjalnie wspierany produkt i nie obejmuje go program nagród za podatności.

Pamięć agenta w plikach Markdown, które przejrzysz grepem Premiera / Narzędzie

Pamięć agenta w plikach Markdown, które przejrzysz grepem

5 min

agent-memory od tigerless-labs trzyma całą pamięć agenta do kodu w zwykłych plikach Markdown, a leżący obok indeks SQLite wolno skasować i odtworzyć jednym poleceniem, więc notatki przejrzysz grepem i wrzucisz do gita. Stara notatka o npm test nie znika, kiedy projekt przechodzi na pnpm, tylko zostaje oznaczona jako nieaktualna, a osobny przebieg w tle scala zapisy i zapomina te bez wartości, przy czym każde skasowanie idzie do zatwierdzenia przez człowieka. W teście LongMemEval-S biblioteka wyciąga 52,9% poprawnych odpowiedzi wobec 35,8% dla MemCore.

Claude nigdy nie zobaczy pliku, który przeczytał za niego tańszy model Premiera / Narzędzie

Claude nigdy nie zobaczy pliku, który przeczytał za niego tańszy model

5 min

Dimitri Mazmanov ze Spotify najpierw prosił Claude Code w pliku CLAUDE.md, żeby wielkich plików nie czytał sam, i wychodziło z tego średnio; zadziałała dopiero twarda blokada, czyli hook PreToolUse, który powyżej 350 linii odsyła odczyt do tańszego modelu i ścina zużycie tokenów o jakieś 90%. Zysk narasta z każdą turą, bo raz wczytany plik wraca na wejście przy każdym kolejnym wywołaniu. Granice są za to twarde: rozumowania, edycji ani kodu krytycznego dla bezpieczeństwa oddać się nie da, a każde zlecenie to od 10 do 30 sekund czekania.

Google otworzył agentowy audyt bezpieczeństwa i sam odradza go na produkcji Premiera / Narzędzie

Google otworzył agentowy audyt bezpieczeństwa i sam odradza go na produkcji

4 min

Google wypuścił na GitHubie Mantis, kilkanaście poleceń dla agenta kodującego, który sam szuka podatności w repozytorium, odtwarza ją w odciętym od sieci sandboksie, nakłada łatkę i powtarza ten sam atak, żeby sprawdzić, czy przestał działać. Ważniejsza od samego zestawu jest reguła: znalezisko liczy się dopiero wtedy, gdy agent doprowadził kod do awarii, a łatka dopiero wtedy, gdy przeżyła powtórzony atak. Google odradza jednak uruchamianie tego przy dostępie do produkcji i nie podaje ani jednej liczby o skuteczności Mantisa.

Google Cloud zamyka podstawy swojej chmury w jednej wtyczce dla agentów Premiera / Narzędzie

Google Cloud zamyka podstawy swojej chmury w jednej wtyczce dla agentów

4 min

Google Cloud wypuścił wtyczkę google-cloud-developer, która w jednej instalacji łączy instrukcje o logowaniu, uprawnieniach i zakładaniu projektów z gotową konfiguracją serwera MCP z oficjalną dokumentacją, dzięki czemu agent rzadziej sięga po flagę gcloud, której już nie ma. Powstała według otwartej specyfikacji Agent Plugins i działa nie tylko w Antigravity CLI, ale też w Claude Code i Codex CLI. Obiecane bariery bezpieczeństwa są jednak tylko tekstem, więc realną granicą dalej pozostają uprawnienia konta, na którym agent pracuje.

Sanity radzi wyłączyć narzędzia agenta tylko tam, gdzie liczy kredyty Premiera / Narzędzie

Sanity radzi wyłączyć narzędzia agenta tylko tam, gdzie liczy kredyty

4 min

Sanity wystawiło serwer MCP pod adresem mcp.sanity.io: jedna zgoda i agent w edytorze dostaje 37 narzędzi do treści projektu, z publikowaniem włącznie, a podpięcie zajmuje jedną komendę npx sanity mcp configure. Dokumentacja odświeżona 11 września radzi wyłączyć narzędzia tylko w jednym miejscu, tym o rachunku za kredyty AI. Niewiele to zmienia, bo narzędzie run_sanity_cli przyjmuje komendy Sanity CLI i pozwala te same operacje wykonać drugimi drzwiami. Sam wziąłbym token o węższej roli zamiast OAuth na całe konto, którego sesja i tak wygasa po tygodniu.

Tydzień 36 · 31 sierpnia – 6 września 2026