Premiera / Narzędzie
Tydzień 38 · 14–20 września 2026
Premiera / Narzędzie Drugie okno terminala, w którym widać pracę agenta linia po linii
3 min
Odpalasz livediff w drugim oknie terminala i od tej chwili widzisz każdy zapis pliku na bieżąco, jako zwykły diff Gita, zamiast zsumowanego stanu, który pokazuje watch git diff. Liczy się kolejność: wyłapujesz moment, w którym agent poprawia funkcję, po 20 sekundach cofa własną poprawkę i pisze ją trzeci raz zupełnie inaczej. Narzędzie śledzi wyłącznie pliki znane Gitowi, więc build ani dociągane zależności nie zasypują okna tysiącem linii. Nie wie za to, kto zmianę wprowadził, i nie pokaże niczego sprzed uruchomienia.
Premiera / Narzędzie Sprzątanie miliona linii kodu za 19 300 dolarów. Regresje wyłapali ludzie.
4 min
Nous Research puściło 1393 wykonawców swojego agenta Hermes na milion linii Pythona i w 19 godzin, za jakieś 19 300 dolarów w tokenach, skróciło kod o 34,4%. Kontrole oparto na tym, co maszyna porówna sama: niezmieniony schemat JSON narzędzi, wynik polecenia z flagą help bajt w bajt i zamrożoną listę testów, które sypały się już wcześniej. Dwóch regresji to nie złapało, bo agenty wycięły publiczne nazwy potrzebne wtyczkom i w około 65 miejscach zmieniły obsługę błędów, a wyłapały je dopiero dwie rundy przeglądu przez społeczność open-source.
Premiera / Narzędzie OpenAI zabiera GPT-5.5 i nie zostawia furtki dla spóźnialskich
4 min
Od 14 października GPT-5.5 przestaje odpowiadać w ChatGPT i w Codexie na wszystkich planach, ale wywołania przez API OpenAI działają dalej, więc zacznij od sprawdzenia, którędy twoje zadania wołają model. Podmiana na gpt-5.6-sol zajmuje chwilę, gorzej z miejscami, których nikt nie ogląda: zadaniem wrzuconym kiedyś do harmonogramu albo krokiem w CI z flagą --model gpt-5.5, bo takie wywołanie nie przełączy się po cichu, tylko wróci błędem. Sol jest o jedną trzecią tańszy na tokenach wyjściowych od modelu, który znika, tyle że ta promocyjna stawka obowiązuje tylko do 21 listopada.
Premiera / Narzędzie Agent przeszedł pilotaż. Co zrobi, gdy w połowie biegu wygaśnie klucz dostępu?
4 min
Diagrid wydał 17 września pięć kryteriów gotowości produkcyjnej dla agentów: wznawianie od miejsca awarii, dostęp, który nie wygasa w połowie biegu, idempotentność, kontrola tego, co oddaje model, i trwały zapis przebiegu. Każde jest pytaniem, na które odpowiada się logami, a nie akapitem w dokumencie projektowym. To klasyczne wzorce systemów rozproszonych, z jedną różnicą: ponowiony krok agenta może wybrać inne narzędzie i inny plan, więc nie jest tą samą operacją. Tyle że Diagrid sprzedaje dokładnie tę warstwę uruchomieniową, a kryteria wyszły komunikatem prasowym bez jednej liczby.
Premiera / Narzędzie Agent-Reach nie czyta za ciebie internetu, tylko pilnuje, którędy da się do niego wejść
4 min
Agent-Reach, projekt jednego dewelopera, przez dobę wisiał na szczycie trendów GitHuba, choć sam nie pobiera ani jednej strony: trzyma uporządkowaną listę dróg dostępu do każdej platformy, z wariantami zapasowymi. Gdy w czerwcu Bilibili zaczęło odpowiadać kodem 412 na zapytania yt-dlp, wystarczyło przestawić kanał na bili-cli. Sześć kanałów działa bez konfiguracji, ale Reddit i X wymagają oddania skryptowi ciasteczka z zalogowanej sesji, więc autor radzi używać konta pomocniczego. Kupujesz tu czyjąś uwagę, bo gdy autor przestanie testować, lista dalej poda martwe drogi jako pierwszy wybór.
Premiera / Narzędzie Cloudflare otworzył swojego audytora bezpieczeństwa i zabronił mu wierzyć samemu sobie
4 min
Cloudflare wyłożył na GitHubie security-audit-skill, zestaw instrukcji na licencji MIT, który zamienia agenta kodującego w zespół audytorów, gdzie ten, kto znalazł dziurę, nie ma prawa jej potwierdzić, bo do sprawdzenia rusza świeży agent z zadaniem odwrotnym: obalić ustalenie. Pilnuje tego rejestr pokrycia i walidator w Node, dzięki czemu nic nie trafia do wyników bez wskazania miejsca w kodzie, a bez piaskownicy audyt kończy się na hipotezach. Pojedynczy bieg znajduje mniej więcej połowę tego, co wszystkie razem, więc to raczej dodatkowa para oczu przed wydaniem niż bramka w CI.
Premiera / Narzędzie Fork Claude Code, który zdradza się już pierwszą zmienną środowiskową
4 min
OpenClaude to fork Claude Code, który po ustawieniu zmiennej CLAUDE_CODE_USE_OPENAI kieruje tego samego terminalowego agenta do ponad 20 dostawców modeli, z lokalną Ollamą włącznie, więc próg wejścia spada do zera. Narzędzia do plików, strumieniowanie i MCP zostają nietknięte, zmienia się tylko to, kto odpowiada po drugiej stronie. README przyznaje, że jakość pracy narzędziami zależy od wybranego modelu, a mniejsze modele lokalne gubią się w długich ciągach wywołań, czyli tam, gdzie agent ma pracować. Pochodzenie zdradza flaga tengu_hive_evidence, od wewnętrznej nazwy kodowej Claude Code.
Tydzień 37 · 7–13 września 2026
Premiera / Narzędzie Jedno wywołanie, trzy subagenty i cała infrastruktura po stronie OpenAI
4 min
Agents API, które OpenAI pokazało 10 września, wystawia wszystkim ten sam harness, który od ponad roku pilnuje Codexa: jedno wywołanie i agent sam rozbija zadanie na maksymalnie trzy subagenty z własną pamięcią, a przy limicie okna kontekstowego sam zwija starszą część zapisu. Za samą platformę nie płacisz nic, rachunek obejmuje tokeny, narzędzia i czas kontenera, tylko że dane leżą wyłącznie w Stanach, nawet gdy sandbox stoi u ciebie. To wygoda kupiona uzależnieniem od dostawcy, bo sesja razem ze swoim stanem zostaje już po jego stronie.
Premiera / Narzędzie Cursor stawia nad agentami koordynatora, który sam nie tyka kodu
4 min
Cursor wypuścił 10 września betę Projects: koordynator pracuje na osobnej maszynie w chmurze, sam nie tyka kodu, tylko rozsyła zadania podległym agentom, a projekt pamięta, czego się nauczyły, więc kolejny agent nie zaczyna od pustej kartki. Firma chwali się sześciokrotnie większą liczbą zmergeowanych pull requestów, ale nie podała ani wielkości grup, ani okresu pomiaru, a narzędzie rozbijające tę samą pracę na kilkanaście wątków z definicji pokaże więcej zamkniętych kawałków. Wąskim gardłem robi się wtedy ludzki przegląd kodu, więc przed pierwszym uruchomieniem warto ustawić limit wydatków.
Premiera / Narzędzie Koniec zgadywania z drzewa dokumentu: Chrome testuje WebMCP
4 min
WebMCP odwraca sposób, w jaki agent działa na cudzej stronie: zamiast zgadywać z drzewa dokumentu, dostaje od niej gotową listę narzędzi z wejściem opisanym w JSON Schema, dzięki czemu rezerwacja czy zakup idą jednym wywołaniem zamiast serii kliknięć. Chrome pozwala to sprawdzić lokalnie pod flagą, a od wersji 149 także na produkcji, jeśli strona zapisze się do origin trial. Google samo wylicza trzy hamulce: nie ma katalogu takich stron, najbardziej rozbudowane serwisy mają najwyższy próg wejścia, a całość pomyślano pod człowieka przy przeglądarce, nie pod agenta na serwerze.
Premiera / Narzędzie RadixArk otwiera kod maszynerii, która dotrenowuje największe modele
4 min
RadixArk otworzył kod Miles v0.1, maszynerii do uczenia ze wzmocnieniem na modelach z najwyższej półki, i opisał ją w raporcie technicznym, który trafił na arXiv 8 września. Przykładowy przebieg ciągnął model GLM-5.2 o 744 miliardach parametrów na 64 kartach NVIDIA GB300, z medianą kroku 263 sekundy, więc otwarty kod barierę sprzętową raczej przesuwa, niż znosi. Zwykłemu zespołowi więcej dadzą boczne ścieżki, przede wszystkim uczenie ze wzmocnieniem na adapterach LoRA, bo mieści się w ułamku pamięci potrzebnej na pełny przebieg.
Premiera / Narzędzie Artemis wpina prawdziwy telefon do Claude Code i Codexa
4 min
Artemis, projekt Google na licencji Apache 2.0, wpina przez MCP prawdziwy telefon albo emulator w agenta z twojego edytora, dzięki czemu widzi on drzewo widoków, zrzuty ekranu i log systemowy, a do tego może dotknąć dowolnego punktu. Tryb Flash klika od razu, od 3 do 5 sekund na krok, a planujący Pro potrzebuje od 15 do 40, więc kilkanaście minut na przebieg wyklucza testy regresji przy każdym pull requeście. Głośne ponad 99% na benchmarku AndroidWorld zgłasza sam Google, na własnym zestawie aplikacji, a realna wartość leży w odtwarzaniu zgłoszonych błędów.
Premiera / Narzędzie Świeżo sklonowany OpenBot wpuszcza każdego jako administratora
5 min
Domyślny plik .env.example OpenBota od CopilotKit ustawia OPENBOT_SINGLE_USER=true, więc świeżo sklonowany panel wpuszcza każdego jako administratora, dopóki nie skasujesz tej linijki i nie podepniesz logowania przez Google, Microsoft albo Oktę. Poza tym widać tu przemyślaną robotę: osobny kontener i profil przeglądarki dla każdego bota, opcjonalnego gVisora, rejestr zapisujący długość sekretu zamiast jego treści i automaty gasnące po dziesięciu nieudanych przebiegach. Haczyk jest jeden, bo pamięć botów żyje w CopilotKit Intelligence i serwer nie wystartuje bez klucza INTELLIGENCE_API_KEY.
Premiera / Narzędzie Model głosowy, który wie, kiedy się nie odzywać
4 min
OpenAI wystawiło w API GPT-Live-1, model, który słucha i mówi jednocześnie, więc na wejście w słowo reaguje w trakcie, a nie po fakcie, i zdejmuje z dewelopera sklejanie rozpoznawania mowy, modelu od odpowiedzi i syntezy głosu. Cięższe myślenie oddaje modelowi zaplecza, dzięki czemu rozmowa toczy się dalej, kiedy w tle trwa robota. Aplikacja Speak policzyła na własnych uczniach, że nowy model wchodzi im w słowo o niemal 80% rzadziej, a warstwa głosowa kosztuje 0,05 dolara za minutę, czyli 3 dolary za godzinę rozmowy, przy czym model zaplecza rozlicza się osobno.
Premiera / Narzędzie Jedno polecenie w terminalu mówi, który model ruszy na twoim sprzęcie
4 min
llmfit jednym poleceniem sprawdza, co masz w maszynie, i wypisuje tabelę modeli ocenionych na czterech osiach: czy się zmieszczą, jak szybko pójdą, jak dobre dają odpowiedzi i ile kontekstu uniosą. Liczy tylko te podsieci, które pracują przy każdym tokenie, więc Mixtral czy DeepSeek-V3 dostają werdykt "zmieści się" tam, gdzie kalkulator sumujący wszystkie wagi odsyła z kwitkiem. Własny pomiar tokenów na sekundę odsyłasz do projektu jako PR wprost z terminala, a polecenie llmfit info pokazuje, na jakich założeniach stoi każda liczba. Celności tych szacunków nikt niezależnie nie potwierdził.
Premiera / Narzędzie AWS oddaje agentom skrzynkę odbiorczą, żeby przestać patrzeć im na ręce
4 min
AWS wypuścił na GitHubie Pizza Bota, otwartego na licencji Apache 2.0 klienta, który zadania agentów układa jak skrzynkę pocztową: skończona praca trafia do kolejki Unread, a prośba o zgodę czeka w kolejce Action, więc odpowiadasz na nią godzinę później z telefonu. Uprawnienia każdego specjalisty opisujesz w pliku SKILL.md, a stan pracy zapisuje LangGraph, przez co zamknięcie okna kosztuje najwyżej jeden krok. Gorzej, że katalog gotowych specjalistów i serwerów MCP, z którego korzystało ponad 2000 osób w Amazonie, przy przepisywaniu na open source wypadł.
Premiera / Narzędzie Google każe agentom nie ufać własnej pamięci o Mapach
4 min
Google Maps Platform wypuścił na GitHubie skilla dla agentów, który każe pisać nietrywialny kod dopiero po pobraniu świeżej dokumentacji z usługi Code Assist, a nie z tego, co model zapamiętał z trenowania. Jeden plik obsługuje cztery platformy, a do prototypu podpina publiczny klucz demonstracyjny, dzięki czemu pierwsza działająca mapa powstaje bez zakładania projektu w chmurze. Obiecaną dokładność i niższe zużycie tokenów Google podaje bez jednej liczby, a na końcu opisu zaznacza, że to nie jest oficjalnie wspierany produkt i nie obejmuje go program nagród za podatności.
Premiera / Narzędzie Pamięć agenta w plikach Markdown, które przejrzysz grepem
5 min
agent-memory od tigerless-labs trzyma całą pamięć agenta do kodu w zwykłych plikach Markdown, a leżący obok indeks SQLite wolno skasować i odtworzyć jednym poleceniem, więc notatki przejrzysz grepem i wrzucisz do gita. Stara notatka o npm test nie znika, kiedy projekt przechodzi na pnpm, tylko zostaje oznaczona jako nieaktualna, a osobny przebieg w tle scala zapisy i zapomina te bez wartości, przy czym każde skasowanie idzie do zatwierdzenia przez człowieka. W teście LongMemEval-S biblioteka wyciąga 52,9% poprawnych odpowiedzi wobec 35,8% dla MemCore.
Premiera / Narzędzie Claude nigdy nie zobaczy pliku, który przeczytał za niego tańszy model
5 min
Dimitri Mazmanov ze Spotify najpierw prosił Claude Code w pliku CLAUDE.md, żeby wielkich plików nie czytał sam, i wychodziło z tego średnio; zadziałała dopiero twarda blokada, czyli hook PreToolUse, który powyżej 350 linii odsyła odczyt do tańszego modelu i ścina zużycie tokenów o jakieś 90%. Zysk narasta z każdą turą, bo raz wczytany plik wraca na wejście przy każdym kolejnym wywołaniu. Granice są za to twarde: rozumowania, edycji ani kodu krytycznego dla bezpieczeństwa oddać się nie da, a każde zlecenie to od 10 do 30 sekund czekania.
Premiera / Narzędzie Google otworzył agentowy audyt bezpieczeństwa i sam odradza go na produkcji
4 min
Google wypuścił na GitHubie Mantis, kilkanaście poleceń dla agenta kodującego, który sam szuka podatności w repozytorium, odtwarza ją w odciętym od sieci sandboksie, nakłada łatkę i powtarza ten sam atak, żeby sprawdzić, czy przestał działać. Ważniejsza od samego zestawu jest reguła: znalezisko liczy się dopiero wtedy, gdy agent doprowadził kod do awarii, a łatka dopiero wtedy, gdy przeżyła powtórzony atak. Google odradza jednak uruchamianie tego przy dostępie do produkcji i nie podaje ani jednej liczby o skuteczności Mantisa.
Premiera / Narzędzie Google Cloud zamyka podstawy swojej chmury w jednej wtyczce dla agentów
4 min
Google Cloud wypuścił wtyczkę google-cloud-developer, która w jednej instalacji łączy instrukcje o logowaniu, uprawnieniach i zakładaniu projektów z gotową konfiguracją serwera MCP z oficjalną dokumentacją, dzięki czemu agent rzadziej sięga po flagę gcloud, której już nie ma. Powstała według otwartej specyfikacji Agent Plugins i działa nie tylko w Antigravity CLI, ale też w Claude Code i Codex CLI. Obiecane bariery bezpieczeństwa są jednak tylko tekstem, więc realną granicą dalej pozostają uprawnienia konta, na którym agent pracuje.
Premiera / Narzędzie Sanity radzi wyłączyć narzędzia agenta tylko tam, gdzie liczy kredyty
4 min
Sanity wystawiło serwer MCP pod adresem mcp.sanity.io: jedna zgoda i agent w edytorze dostaje 37 narzędzi do treści projektu, z publikowaniem włącznie, a podpięcie zajmuje jedną komendę npx sanity mcp configure. Dokumentacja odświeżona 11 września radzi wyłączyć narzędzia tylko w jednym miejscu, tym o rachunku za kredyty AI. Niewiele to zmienia, bo narzędzie run_sanity_cli przyjmuje komendy Sanity CLI i pozwala te same operacje wykonać drugimi drzwiami. Sam wziąłbym token o węższej roli zamiast OAuth na całe konto, którego sesja i tak wygasa po tygodniu.
Tydzień 36 · 31 sierpnia – 6 września 2026
Premiera / Narzędzie Nvidia kupuje miejsce, w którym deweloperzy wybierają modele
5 min
Nvidia kupuje Hugging Face za 12,93 miliarda dolarów, a transakcja zamknie się w pierwszej połowie 2027 roku, więc producent kart przejmuje sklep, w którym deweloperzy wybierają otwarte modele. Jensen Huang obiecał, że sprzęt jego firmy nie będzie potrzebny, żeby cokolwiek tam zbudować albo wdrożyć, i łatwo mu tej obietnicy dotrzymać, bo modele uruchamiają otwarte programy w rodzaju vLLM czy SGLang. Ryzyko leży w kolejności przykładów na kartach modeli oraz w ostrzeżeniu z formularza 8-K, że ograniczenia wobec modeli z Chin mogą zaszkodzić sklepowi, w którym leżą wagi DeepSeeka.
Premiera / Narzędzie Wykonanie na waszym sprzęcie, inferencja i zapisy sesji dalej w chmurze Cursora
5 min
Self-Hosted Machines przenosi agenty chmurowe Cursora na wasz sprzęt: worker sam dzwoni na zewnątrz przez HTTPS, więc klon repozytorium i sekrety zostają u was, a żaden port nie otwiera się do środka. Model jednak dalej pracuje w chmurze Cursora, więc czytane fragmenty plików i cały zapis sesji i tak tam wędrują. Wdrożenie to mały system rozproszony: token workera wygasa po godzinie, mikrowirtualka Vercela na darmowym planie ginie po 45 minutach, a sterowanie komputerem na Macu wymaga zgód Apple, które ktoś musi przyznać ręcznie.