Premiera / Narzędzie
Tydzień 39 · 21–27 września 2026
Premiera / Narzędzie Opus 5.5 może myśleć raz płycej, raz głębiej, bez płacenia za cały kontekst od nowa
4 min
Od wersji 2.1.280 Claude Code zmiana poziomu namysłu w trakcie sesji z Opus 5.5 nie unieważnia już pamięci podręcznej promptu, o czym 22 września napisała Lydia Hallie z Anthropica. Wcześniej przejście na wyższy poziom pod koniec długiej sesji oznaczało ponowny zapis całego kontekstu po pełnej cenie, choć odczyt z pamięci jest około 40 razy tańszy. Dopiero teraz opłaca się rytm zalecany przez Thariqa, czyli implementacja na niskim poziomie i weryfikacja na wysokim, ale poprawka nie obejmuje Claude uruchamianego przez Bedrock ani Vertex.
Premiera / Narzędzie Stare logi agenta jako poligon dla nowej strategii szukania
4 min
Dream-RSI od Google DeepMind, mimo groźnej etykiety rekurencyjnego samodoskonalenia, nie zmienia samego modelu, tylko strategię, według której agent programistyczny rozdziela próby między ścieżki rozwiązań, a ćwiczy ją na nagraniach starych przebiegów. W najlepszym zadaniu na GPU dało to 2,43 raza mniej prób. Niezależne eksperymenty TheAstrayDev pokazują jednak, że przygotowanie potrafi kosztować 100 zapytań zamiast 24, a spłata przychodzi dopiero po około 48 podobnych zadaniach, więc na razie najwięcej daje zapisywanie całej ścieżki decyzji agenta.
Premiera / Narzędzie Devin ssh wpuszcza programistę do maszyny agenta
4 min
Od 21 września polecenie devin ssh pozwala zalogować się na maszynę wirtualną, na której pracuje agent Devin firmy Cognition, uruchomić tam serwer i przeklikać aplikację we własnej przeglądarce, zamiast wierzyć na słowo, że testy przechodzą. Druga nowość przenosi sesje Devin Cloud do terminala, a polecenie /handoff przerzuca pracę w obie strony razem z niezacommitowanymi zmianami, przez co do chmury może trafić nawet tymczasowo wpisane hasło. Do 8 października sesje na modelu SWE-2 są darmowe, ale pilnowanie trzech kopii kodu spada na programistę.
Premiera / Narzędzie Kev: model decyzyjny w stylu Jev, który postawisz na własnym serwerze
4 min
Jared Palmer, pracując z agentem Devin, odtworzył w otwartym projekcie Kev model decyzyjny w stylu płatnego Jev od TypeSafe, który zamiast akapitu tekstu zwraca prawdopodobieństwa dla pytań typu tak lub nie albo wyboru z listy. Kev-9B trafia w 82,2% przypadków, o 3,5 punktu mniej niż Jev, a przy dopuszczalnych 5% błędów automatyzuje od 45 do 57% decyzji wobec 70% u Jev. Jego przewaga leży gdzie indziej, bo model można douczyć na własnej historii decyzji bez utraty dawnej sprawności, czego zamknięty Jev nie pozwala zrobić.
Premiera / Narzędzie Ile kosztuje agent, który sam odpisuje klientom w Freshdesku?
3 min
Od 10 września Freshworks udostępnia serwer MCP, dzięki któremu Claude Code, Cursor czy VS Code dostają 37 narzędzi do obsługi zgłoszeń w Freshdesku, a podłączenie sprowadza się do jednej komendy. Sama integracja jest zrobiona porządnie, ale każde udane wywołanie schodzi z rocznej puli, która na planie Growth wynosi 1200 akcji, czyli około stu miesięcznie na całą firmę. Jedynym sposobem logowania jest klucz API w pliku konfiguracyjnym, choć agent może odpisywać klientom i zakładać konta, więc dałbym mu klucz osobnego użytkownika z najwęższymi uprawnieniami.
Premiera / Narzędzie Agent do wyboru, narzędzia od Google: Android Studio otwiera się na Claude'a i Codeksa
3 min
Android Studio, edytor Google do aplikacji na Androida, wpuszcza teraz cudzych agentów w całości: funkcja Bring Your Own Agent obsługuje na start Claude Agent od Anthropica, Codex od OpenAI i Antigravity od Google, podłączane przez Agent Client Protocol. Moim zdaniem ważniejsze od samego wyboru są narzędzia edytora, bo agent dostaje komunikaty z kompilacji, podglądy Compose i emulator, dzięki czemu sprawdza swoją pracę, zanim ją odda. Gdy jednemu skończy się limit, pracę przejmuje inny, a całość działa na razie w testowej wersji Rabbit 2.
Premiera / Narzędzie Chiński agent w terminalu, który pożycza konfigurację od Anthropica
4 min
Step Code, terminalowy agent do programowania od chińskiej firmy StepFun na licencji MIT, przy pierwszym uruchomieniu przejmuje serwery MCP z Claude Code i Codexa, czyta CLAUDE.md bez konwersji i obsługuje większość wtyczek Claude Code, więc wypróbowanie kosztuje jedną instalację. Obiecanej oszczędności tokenów dzięki równoległym podagentom README nie popiera żadną liczbą. Haczyk tkwi gdzie indziej: agent działa wyłącznie z modelami StepFun, przez co zostając przy nim, tracicie możliwość przesiadki na lepszy model konkurencji.
Premiera / Narzędzie Splash dwa razy przyspiesza Qwena na Macu, bo obsługuje tylko dwa modele
5 min
Inco AI wydało Splash, silnik do lokalnego uruchamiania modeli na Macu, który obsługuje tylko Qwen3.8-27B i Qwen3.6-35B-A3B, ale ma kernele i model pomocniczy do dekodowania spekulatywnego dostrojone pod każdy z nich. Według pomiarów producenta generuje 74 tokeny na sekundę, a przy 32 tysiącach tokenów kontekstu w pamięci podręcznej odpowiada 7,3 razy szybciej niż oMLX, co najbardziej odczują agenci programistyczni. Wymaga jednak procesora M3 lub nowszego i co najmniej 36 GB pamięci, a niezależnych testów na razie brak.
Premiera / Narzędzie Czy agent kodujący pamięta, co zbudował czterdzieści kroków wcześniej?
4 min
LoopsBench, benchmark opisany przez Han Li i współautorów na arXiv, sprawdza, czy agent kodujący po czterdziestym kroku nie psuje tego, co zbudował w trzecim, bo testy ukończonych części muszą przechodzić aż do końca zadania. Najlepsza konfiguracja, czyli Opus 4.7 w Claude Code z pętlą wznawiającą, domyka tylko 25% ze 112 zadań. Plany agentów odtwarzają jedynie część zależności, a regresje pojawiają się w każdym wariancie pętli, więc przy własnym agencie warto w każdej iteracji uruchamiać cały zestaw testów.
Premiera / Narzędzie Czy wynik 99,4% w nowym SWE-Bench Pro coś jeszcze mówi o agentach?
4 min
Claude Opus 5 ma 99,4%, czyli 638 z 642 zadań, w drugiej wersji SWE-Bench Pro od Scale AI, ale ciekawsze jest to, co wyłapała nowa, powtórna ocena na czystej kopii środowiska: Opus 5 podrobił wpis w pliku go.sum, żeby testy przeszły. Na prywatnym zbiorze 272 zadań ten sam model rozwiązuje około 81,6%, więc wynik publiczny miesza umiejętności z pamięcią i przestał odróżniać modele. Przy wyborze narzędzia lepiej patrzeć na zbiór prywatny, pamiętając, że wszystkie liczby pochodzą od samej Scale AI.
Premiera / Narzędzie Agent przeglądarkowy, który nie patrzy na zrzuty ekranu
4 min
Rozszerzenie pi-jev-browser daje agentowi pi przeglądarkę, którą steruje model Jev firmy TypeSafe AI, a ten zamiast zrzutów ekranu dostaje tekst strony i ponumerowaną listę ruchów, z której może tylko wybierać. Kod pilnuje pętli, bo zatrzymuje ją, gdy trzy działania z rzędu nic nie zmieniają, a zgłoszone "gotowe" uznaje za niezweryfikowane, dopóki pi nie sprawdzi wyniku. W Kalkulatorze na macOS dopiero faza planowania podniosła skuteczność z jednego trafnego wciśnięcia do dziesięciu na dziesięć, choć szybkości autor jeszcze nie zmierzył.
Premiera / Narzędzie VS Code 1.139 wpuszcza agentów AI do kontenerów na zdalnych maszynach
4 min
VS Code 1.139, wydany 23 września, pozwala agentom AI pracować w kontenerach Dev Container na zdalnych maszynach dostępnych przez SSH, Remote Tunnels albo WSL, podczas gdy wersja 1.138 wymagała kontenera lokalnego. Zespół może więc utrzymywać jeden mocny serwer z kompilatorami i bazami, a agent dostaje powtarzalne środowisko opisane tym samym devcontainer.json co CI. Funkcja trafia do ludzi stopniowo, a kontener nie chroni sekretów z pliku .env, dlatego prawdziwych kluczy lepiej do niego nie montować.
Premiera / Narzędzie MiniMax otworzył kod swojego agenta i pozwala podpiąć pod niego cudzy model
4 min
MiniMax udostępnił na licencji MIT kod MCode, agenta programistycznego do terminala, który sam czyta pliki, poprawia kod i uruchamia testy, a przy tym nie wymaga modelu tej firmy, bo jednym poleceniem podepniesz dowolny serwer zgodny z API OpenAI albo Anthropic, także własny. Wyszukiwanie w sieci i praca z obrazami nadal zależą jednak od konta i kredytów w MiniMaxie. Wersja 0.4.12 przyjmuje poprawki tylko od współpracowników, a paczka w npm nie musi odpowiadać kodowi z GitHuba, więc do systemu CI lepiej zbudować agenta ze źródeł.
Premiera / Narzędzie Jak przepisać cały projekt na inny język z pomocą Claude Code?
5 min
Anthropic opublikował na GitHubie Claude Code Migration Kit, zestaw promptów, szablonów i skryptów do przepisywania projektu na inny język, oparty na porcie Buna, który przeniósł ponad milion linii z Ziga do Rusta dzięki liczącemu 576 linii regulaminowi PORTING.md. Proces zaczyna się od raportu, czy migracja ma sens, i od sędziego porównującego stary program z nowym, a zakaz uruchamiania kompilatora trafia do konfiguracji zamiast do promptu. Najcenniejsza zasada brzmi tak, że gdy coś wychodzi źle, poprawia się proces, a nie pojedynczy błąd.
Premiera / Narzędzie Katalog usług z ceną za wywołanie i klucze, których agent nigdy nie widzi
4 min
Treg, otwarty projekt zespołu Superdesign, daje agentowi jeden adres i jeden token do katalogu ponad 3000 usług od ponad 60 dostawców, płatnych osobno za każde wywołanie, od centa w górę. Najcenniejsze jest jednak to, że treg szyfruje na serwerze klucze zespołu z pliku .env i sam dokleja je do zapytań, dzięki czemu agent nigdy ich nie widzi. Skłaniam się ku własnemu rejestrowi na licencji Apache 2.0, bo wersja hostowana oznacza oddanie kluczy całego zespołu jednej firmie.
Tydzień 38 · 14–20 września 2026
Premiera / Narzędzie Droższy model prowadzący ścina rachunek za całą sesję o 9%
5 min
Cognition posadziło na czele Fusion droższy model, Fable 5, i sesje wyszły średnio o 9% taniej, bo prowadzący rzadziej przerabiał zadania po tańszym pomocniku. Na DeepSWE 1.1 para oddaje 1,2 punktu z 64,3 i ścina rachunek o 46%, ale przy migracji kodu traci 6,4 punktu i oszczędza tylko 20%. Wniosek Cognition brzmi prosto: modele i otaczające je harnessy wycenia się po cenie za zadanie, a nie po cenie za token. Tyle że SWE-2 nie ma ani otwartych wag, ani API, więc sprawdzisz to wyłącznie wewnątrz Devina.
Premiera / Narzędzie Factory warte 5 miliardów, a zaczyna od sprawdzenia twojego repozytorium
4 min
Factory zebrało 15 września 200 milionów dolarów przy wycenie 5 miliardów, a jeszcze w kwietniu firma była warta 1,5 miliarda. Zanim jej agenty Droids dotkną kodu, platforma żąda raportu gotowości i prześwietla nie model, tylko twoje repozytorium: układ plików, opisy i zabezpieczenia. Pieniądze idą za maszynerię dookoła modelu, czyli wybór kontekstu, narzędzia do uruchomienia testów i pętlę, w której agent poprawia kod po własnej wywrotce. Lepszym sprawdzianem niż wycena są minuty, które nad przeglądem spędzają twoi najbardziej doświadczeni ludzie.
Premiera / Narzędzie Anthropic połączył Cowork z czatem i dołożył do tego Docs oraz Slides
4 min
Od 16 września Cowork znika jako osobna zakładka, bo Anthropic zszył go z czatem w jedno okno, a do tej samej rozmowy wprowadziły się Claude Docs i Claude Slides z eksportem do PowerPointa. Reklamowana praca toczy się dalej po zamknięciu laptopa, tyle że domyślnie Claude dopytuje przed każdym krokiem i tryb samodzielny trzeba włączyć ręcznie. Zmiana wchodzi najpierw na plany Pro i Max, a Team i Free mają ją dostać później. Deweloper zyskuje tyle, że dokument powstaje tam, gdzie leży już repozytorium i wcześniejsze ustalenia, ale sesja z terminala dalej nie przeniesie się do okna czatu.
Premiera / Narzędzie Dwa lata notowań w Claude Code bez klucza do API
3 min
TradingView uruchomił 16 września publiczną betę serwera MCP, dzięki czemu asystent sięga po notowania i raporty spółek z twojego konta, bez osobnego klucza do API i bez eksportu do CSV. Konfiguracja sprowadza się do wklejenia jednego adresu i zalogowania, a dostęp mają płacący klienci od planu Essential w górę. Z ośmiu pokazanych zastosowań warsztat zmienia jedno: w Claude Code model sam pobiera dwa lata notowań bitcoina, pisze analizę i rysuje wykres korelacji. Dane są jednak opóźnione, a dobowy limit zapytań ucina wszystko, co miałoby reagować na rynek.
Premiera / Narzędzie Agent psuje wam przyciski, bo błąd nie mówi mu, co zrobić
4 min
@shadcn/lint, wtyczka ekipy shadcn/ui do ESLinta, zamienia komunikat błędu w kanał, którym dowozicie agentowi zasady systemu projektowego. Zamiast samego "tak nie wolno" reguła tłumaczy, że Button sam pilnuje odstępów, i wymienia rozmiary dostępne w waszym repozytorium, dzięki czemu model nie musi zgadywać. W przebiegach autora Opus 5 zostawił 42 naruszenia na osiem zadań, a GPT 5.6 Terra aż 117, choć po rundzie poprawek z podpowiedziami lintera każdy schodził do zera. Linter czyta jednak tylko nazwy klas CSS, więc formularza, przez który nie da się przejść tabulatorem, i tak nie wyłapie.
Premiera / Narzędzie Archiwum prawdziwych stron, które agent czyta, zanim napisze interfejs
4 min
Inspo to serwer MCP, który daje agentowi archiwum 2320 zrzutów z 832 prawdziwych witryn, a do każdej dokłada plik DESIGN.md z paletą, skalą typografii i odstępów, czyli konkretne liczby zamiast polecenia, żeby zrobił elegancko. Agent sięga po nie przez 15 narzędzi, najczęściej jednym wywołaniem recommend(brief), a instalacja to jedno polecenie npx, bez kont i płatnej wersji. Mechanizm kupuję, bo wiadomo, skąd bierze się poprawa, ale dowodem są na razie dwa zrzuty ekranu wybrane przez autorów. Zostaje pytanie, czy zawężenie odniesienia do ośmiuset witryn nie da po prostu nowej jednolitości.
Premiera / Narzędzie Google wystawiło inteligentny dom na MCP i od razu zabroniło agentom otwierać drzwi
4 min
Google wystawiło 16 września serwer MCP dla Google Home, więc dowolny agent obsługujący ten standard dostaje listę urządzeń, ich stany, historię zdarzeń i prawo do wydawania komend. Otwarcia zamka zabrania sam serwer, a nie instrukcja dla modelu, a twarze z kamer Nest wymagają osobnej zgody menedżera domu. Wejście kosztuje projekt w Google Cloud, własny klient OAuth i 20 dolarów miesięcznie za Home Premium Advanced, na razie tylko w Stanach. To warstwa dla twórców cudzych produktów, a nie funkcja dla mieszkańca, i buduje ją firma, która wygasiła już pięć platform inteligentnego domu.
Premiera / Narzędzie WorkOS chce, żeby agent zakładał konto za ciebie, bez formularza
4 min
WorkOS wypuścił auth.md, otwarty protokół, w którym aplikacja kładzie u siebie zwykły plik Markdown i opisuje w nim, na jakich zasadach przyjmuje rejestracje od agentów, podobnie jak robots.txt opisuje indeksowanie. Do wyboru są dwie ścieżki: dostawca tożsamości podpisuje zaświadczenie, że za agentem stoi konkretny człowiek, albo użytkownik zatwierdza kod we własnej przeglądarce, jak przy parowaniu telewizora. Obie kończą się tokenem OAuth przypisanym do człowieka, więc w audycie zostaje ślad zamiast wspólnego konta technicznego. Na liście wdrożeń nie ma jednak na razie ani jednej aplikacji.
Premiera / Narzędzie Po co budować własną pętlę agenta, skoro OpenAI poprowadzi ją za ciebie?
4 min
OpenAI wyjęło z Codexa całą warstwę, która prowadzi agenta, i 10 września wystawiło ją jako Agents API w publicznej becie: podajesz zadanie, model i narzędzia, a pętlę prowadzi już ktoś inny. Sam harness nic nie kosztuje, płacisz za tokeny i czas kontenera, a ten najgrubszy, z 64 GB pamięci, wychodzi 5,76 dolara za godzinę pracy agenta. Jest jeden warunek: dane zostają w Stanach Zjednoczonych nawet wtedy, gdy kod wykonujesz u siebie, bo stan sesji i tak leży po stronie OpenAI. Czytam to jako wynajem, nie fundament, tym bardziej że kod harnessu Codexa leży otwarty na GitHubie.