Premiera / Narzędzie
Tydzień 34 · 17–23 sierpnia 2026
Premiera / Narzędzie Slack wpuszcza agentów kodujących do wspólnego kanału, żeby zespół patrzył im na ręce
5 min
Slack Code, ogłoszony przez Salesforce 20 sierpnia, wpuszcza agentów kodujących pięciu dostawców, w tym Claude Code i Devina, do wspólnych kanałów, w których cały zespół widzi każdy krok i może agenta zawrócić, a on działa wyłącznie na uprawnieniach osoby, która go wezwała. Jawność ma być lekarstwem na słaby kod, tylko że dotyczy pisania, a nie sprawdzania. Cognition podaje dziesięciokrotny wzrost liczby zmergeowanych pull requestów przy wzroście zatrudnienia o 40%, a kontrola została w GitHubie i jest jej dokładnie tyle samo, co wcześniej.
Premiera / Narzędzie Agent do terminala, który ostrzega przed własnymi wtyczkami
4 min
OpenCode to agent open source odpalany jedną komendą w terminalu, który nie ma w środku własnego modelu, więc podłączasz dowolnego dostawcę i płacisz mu bezpośrednio za tokeny. Zamiast chwalić się długą listą integracji, dokumentacja otwiera stronę o MCP ostrzeżeniem: opisy narzędzi z każdego serwera jadą do modelu przy każdym zapytaniu, a ten od GitHuba potrafi rozsadzić okno kontekstowe. Tryb planu pod klawiszem Tab i komenda /undo trzymają agenta z dala od plików, dopóki plan się nie zgadza, choć w dokumentacji nie ma ani jednego wyniku benchmarku.
Tydzień 33 · 10–16 sierpnia 2026
Premiera / Narzędzie DeepSeek otwiera harness i tego samego dnia podnosi ceny API
4 min
W zeszły czwartek DeepSeek wypuścił DeepSeek Harness (dsh): darmową, otwartą na licencji MIT warstwę, która stoi między programistą a modelem i konkuruje z Claude Code oraz Codexem. Motto brzmi "wszystko jest wtyczką", więc pod harness podłączysz dowolny model, nie tylko DeepSeeka. Tego samego dnia firma podniosła ceny swojego API, według Reutersa miejscami o ponad 1000%. Moim zdaniem to wyrachowany ruch: DeepSeek rozdaje najtrudniejszą do wymiany warstwę za darmo, żeby podważyć przewagę rywali, a pieniądze zamierza brać na droższym API.
Premiera / Narzędzie Unsloth pakuje lokalne trenowanie modeli w aplikację, którą po prostu instalujesz
3 min
Unsloth, biblioteka znana od 2023 roku z trenowania modeli dwa razy szybciej i przy 70% mniejszym zużyciu pamięci karty, wypuścił aplikację desktopową na Windows, macOS i Linux, która wycina walkę z konfiguracją CUDA i PyTorch. Jedną komendą `unsloth start claude` podłączasz Claude Code albo Codex do modelu na własnej maszynie, a że jest on wystawiany przez API zgodne z OpenAI, przełączenie z płatnej chmury to podmiana adresu. Argumentem są koszt i prywatność, choć liczby pochodzą z testów samego Unslotha, a aplikacja jest wciąż w wersji beta.
Premiera / Narzędzie Agent Mety, który wstaje po awarii tam, gdzie padł
5 min
Meta wypuściła w becie Muse Code, swojego pierwszego agenta do programowania, i choć jego model Muse Spark 1.2 przegrywa w testach z Claude Code i Codeksem, siła narzędzia leży gdzie indziej. Rozgrzane przez całą sesję podagenty, izolacja przez git worktree i przyrostowy dziennik zdarzeń pozwalają agentowi wstać po awarii dokładnie tam, gdzie padł. Prawdziwy zakład widać jednak w cenniku: tani poziom Contributor kupuje się, oddając Mecie swoje prompty i kod na trenowanie przyszłych modeli. Dla open-source to okazja, dla firmy z poufnym kodem rachunek płaci się własnym kodem.
Premiera / Narzędzie Chatbot w jedno kliknięcie, produkcja nadal po twojej stronie
4 min
shadcn wystawił na GitHubie gotowy szablon chatbota, który stawia się na Vercelu jednym kliknięciem, bez wklejania kluczy, bo uwierzytelnienie i rozliczanie modeli przejmuje AI Gateway. Haczyk jest poważny: publiczny adres /api/chat nie jest chroniony, więc ktokolwiek go znajdzie, może drenować budżet samym ruchem, dopóki nie dorobisz limitu zapytań, limitu wydatków i logowania. Prawdziwa wartość leży gdzie indziej: w rozrysowanym interfejsie dla narzędzi wywoływanych przez model i we wzorcu modelu, który sam dopytuje. Minuty zamiast dni to prawda dla dema, nie dla realnego produktu.
Premiera / Narzędzie Claude Code od 14 sierpnia sam zatwierdza większość swoich komend
4 min
Od 14 sierpnia Claude Code na planach Pro, Max i Team domyślnie rusza w trybie auto: zamiast pytać o zgodę przy każdej komendzie, przepuszcza akcje przez klasyfikator, który blokuje tylko to, co niszczące albo wynoszące dane na zewnątrz. W badaniu Anthropic na 1053 testerach człowiek wyłapywał podłożoną groźną komendę w 13,6% przypadków, a tryb auto w 89%. Klasyfikator pilnuje jednak bezpieczeństwa, nie poprawności kodu: cichej, kompilującej się, ale błędnej zmiany nie złapie, więc nadzór przesuwa się do przeglądu PR-ów, których zespoły na trybie auto wystawiają około 25% więcej.
Premiera / Narzędzie Agent MiniMaxa: efektowne dema, natywne MCP, zero benchmarku
3 min
MiniMax pokazał swojego pierwszego ogólnego agenta pod hasłem "kod nic nie kosztuje, pokaż mi, co ma powstać", ale ogłoszenie to głównie efektowne dema, jak postawiona w trzy minuty interaktywna wersja Luwru, bez jednej porównywalnej liczby: nie ma wyniku na SWE-bench ani żadnego benchmarku kodowania. Jedyny twardy konkret dla programisty to wbudowane MCP, dzięki któremu agent sam sięga do GitHuba, GitLaba czy Figmy. Firma sama przyznaje, że agent żongluje kilkoma modelami naraz, co dokłada kosztu i opóźnień, więc w dniu premiery kod wcale nie jest tani.
Premiera / Narzędzie Zamiast płacić za kalendarz, napisał własny w dwie godziny
4 min
Dean Mazlish zamiast wykupić gotowy kalendarz w stylu Calendly, w dwie godziny podyktował Claude Code własną stronę do rezerwacji terminów: Next.js na Vercelu, czytającą wolne okienka prosto z Outlooka przez Microsoft Graph. Najwięcej pracy poszło w reguły uszyte pod jego rytm dnia: najwcześniejszy termin dopiero nazajutrz w dzień roboczy, maksymalnie cztery spotkania pod rząd. Claude przejął przeglądarkę i sam przeklikał rejestrację aplikacji w Microsoft Entra oraz OAuth Zooma. Morał jest wąski: model nie zrobił z laika programisty, tylko skrócił drogę komuś, kto wiedział, o co poprosić.
Premiera / Narzędzie Serwer MCP Sanity: agent robi to, co dotąd klikałeś w panelu
3 min
Serwer MCP Sanity, podpinany do Claude Code czy Cursora przez OAuth, pozwala agentowi robić to, co dotąd klikało się w panelu: wyszukać dokument zapytaniem GROQ i poprawić go jedną transakcją, wdrożyć nowy schemat do chmury albo cofnąć publikację. Sedno tkwi w narzędziu get_schema, które podaje modelowi aktualny schemat projektu, dzięki czemu komenda "przenieś treść na nowy schemat" ma szansę zadziałać. To jednak dokumentacja z 12 sierpnia, nie premiera: oddajesz maszynie Sanity dostęp OAuth do treści, a część narzędzi pali płatne kredyty AI.
Premiera / Narzędzie 14 razy szybszy Sol brzmi świetnie, tylko ile kosztuje?
3 min
OpenAI pokazało Ultrafast, tryb w API, w którym flagowy GPT-5.6 Sol odpowiada do 14 razy szybciej i generuje do 750 tokenów na sekundę, licząc na sprzęcie Cerebras. To ten sam model co zawsze, więc znika stary kompromis między "mądry" a "natychmiastowy", a najbardziej wiarygodny przykład to zaciśnięcie nocnej pętli eksperymentów badawczych do kilku przebiegów dziennie. Nowość jest jednak w wąskim podglądzie dla garstki firm, bez ceny i bez niezależnego potwierdzenia. Dopóki OpenAI nie poda ceny, "14 razy szybciej" pozostaje liczbą, na której nic jeszcze nie da się policzyć.
Premiera / Narzędzie 92% na domowym teście, 36% na obcym: ile naprawdę zmienia agent od testów
3 min
Microsoftowy agent code-testing-generator, wydany na licencji MIT, najpierw czyta repozytorium, żeby wpasować testy w konwencje projektu, a na końcu sam psuje własny kod i sprawdza, czy test to wyłapie. Na wewnętrznym sprawdzianie Microsoftu zaliczył 92% i o 63% mniej porażek niż GitHub Copilot na tym samym modelu, ale cały zysk skupia się w ogólnikowych poleceniach typu "napisz testy". Na niezależnym benchmarku SWE Atlas wynik spada do 36,4% wobec 27,3% u Copilota. To nie przełom, tylko rusztowanie, które pilnuje, żeby testy w ogóle coś wykrywały.
Premiera / Narzędzie Jedno polecenie przenosi twoje ustawienia z Cursora, ale tylko w stronę OpenAI
3 min
Nowa funkcja /import w Codexie jednym poleceniem zaciąga do OpenAI konfigurację z Claude Code, Cursora czy Claude Cowork: instrukcje trafiają do AGENTS.md, settings.json staje się config.toml, a ustawienia serwerów MCP przechodzą na zapis Codexa. Import działa tylko w jedną stronę, nic nie wraca do konkurencyjnego narzędzia. W terminalu Codex CLI ściąga najwyżej 50 rozmów z ostatnich 30 dni i robi to raz. To nie interoperacyjność, tylko rampa obniżająca koszt przesiadki do OpenAI, nie wyjścia z niej.
Premiera / Narzędzie Microsoft ściął cenę swojego modelu do kodu o 73%
3 min
Microsoft obniżył cenę swojego modelu do kodu MAI-Code-1.1-Flash o 73% względem poprzednika, zaledwie 10 tygodni po jego premierze, i wpuścił go 11 sierpnia do GitHub Copilota za 0,20 dolara na wejściu i 1,20 na wyjściu. Kłopot w tym, że chiński DeepSeek-V4-Flash jest jednocześnie tańszy i lepszy w pracy w terminalu, bo na Terminal-Bench 2.1 ma 82,7% wobec 62,9% Microsoftu. Moim zdaniem nie chodzi więc o jakość, tylko o to, że to Microsoft ustawia domyślny model w Copilocie, którego większość użytkowników nigdy nie zmienia ręcznie.
Premiera / Narzędzie Spotify wypuszcza Xirp, żeby okiełznać kilkadziesiąt agentów naraz
4 min
Spotify udostępnił za darmo Xirp, wewnętrzne narzędzie do prowadzenia kilkudziesięciu agentów kodujących naraz: każda sesja dostaje własną kopię repozytorium, a stan pracy jest odklejony od konkretnego agenta, więc w połowie zadania przeskakujesz z Claude Code na Gemini CLI czy Codex bez utraty kontekstu. Firma chwali się ponad 36 tysiącami sesji u siebie, ale to dowód działający tylko wewnątrz Spotify. Ironia tkwi w haśle o neutralności wobec dostawcy: pełnię możliwości odblokowuje dopiero podłączenie Portalu, komercyjnej platformy samego Spotify.
Premiera / Narzędzie Grok Bot loguje się do twoich narzędzi jak człowiek i pracuje, gdy śpisz
4 min
Grok Bot, wypuszczony w tym tygodniu w becie przez SpaceXAI, zamienia jednorazowe zadania na stałych, nazwanych współpracowników: każdy dostaje własną maszynę w chmurze i loguje się do aplikacji jak człowiek, przez przeglądarkę i twoje hasło, więc radzi sobie z narzędziami bez API czy MCP. Scenariusz rusza sam, gdy w repozytorium wyląduje commit albo przyjdzie wiadomość na Slacku. Dla programisty to na razie bardziej cyfrowy pracownik do klikania w cudzych aplikacjach niż narzędzie piszące kod. Wpięto go w plany, za które i tak już płacisz, jak Cursor Ultra za 200 dolarów miesięcznie.
Tydzień 32 · 3–9 sierpnia 2026
Premiera / Narzędzie Y Combinator otwiera kod QM i pokazuje, że model to najłatwiejsza część agenta
4 min
Y Combinator wrzuciło na GitHuba QM, czyli Quartermaster, harness, który przez miesiące napędzał firmę w księgowości i dziale prawnym, a repo w trzy dni zebrało 7500 gwiazdek. Sedno nie leży w samym modelu: na 342 pliki TypeScriptu tylko 13 to harness, a 26 pilnuje tożsamości, uprawnień i audytu, więc model okazuje się najłatwiejszą, wymienną częścią agenta. Każdy pracownik i każdy kanał na Slacku dostaje własny zakres z odciętym sandboxem, pamięć agenta mieszka w zwykłym pliku Markdown, a plik bezpieczeństwa wprost wylicza własne słabości.
Premiera / Narzędzie LoopX pilnuje celu i dowodów, kiedy agent zapomina, co robił trzy tury wcześniej
4 min
LoopX, świeży projekt open-source na licencji MIT autorstwa huangruitenga, dokłada do agenta osobną warstwę sterującą z trwałym zapisem stanu: cel, zadania, miejsca wymagające decyzji człowieka, zebrane dowody i limit decydujący, czy pętla może biec dalej. Agent, czy to Codex, Claude Code czy Cursor, dostaje jedną ograniczoną turę i oddaje sterowanie z powrotem, dzięki czemu wielodniowa praca daje się przejrzeć, wznowić i bezpiecznie przekazać między agentami. Autor pokazuje dwie ścieżki po ponad 200 godzin zegarowych, ale obie prowadził sam, więc brakuje dowodu, że działa u kogoś z zewnątrz.
Premiera / Narzędzie Trenować agenta w tym samym narzędziu, w którym ma działać? Orchard to pokazuje
3 min
Microsoft Research udostępnił Orchard, otwarty framework, który trenuje agenta do kodu w tym samym narzędziu, w którym ten potem realnie działa, zamiast na uproszczonej atrapie. Sama zmiana miejsca nauki podniosła skuteczność asystenta w harnessie Codex z 18,6% do 51,5%, a osobny model dobierający najlepsze rozwiązanie dobił wynik do 73% na SWE-bench Verified przy 3 miliardach aktywnych parametrów. Nie kupuję jednak narracji o magii małego modelu: punkt wyjścia to 61,4%, a za resztą stoi drogi potok treningowy i 107 tysięcy zapisów pracy dwóch większych modeli z otwartymi wagami.
Premiera / Narzędzie Microsoft otwiera agenta, który czyta repozytorium, zanim napisze testy
4 min
Microsoft udostępnił na licencji MIT agenta code-testing-generator, który zanim napisze testy jednostkowe, przeszukuje repozytorium, wykrywa język i framework oraz ustala prawdziwe komendy budowania. Na wewnętrznym benchmarku ze 152 zadań zaliczył 140 wobec 120 Copilota na tym samym modelu, czyli o 63% mniej porażek. Cały zysk skupia się w ogólnikowych poleceniach typu „napisz testy”, gdzie liczba porażek spadła z 30 do 10; przy szczegółowych promptach oba wypadły tak samo. To nie przełom, tylko porządne rusztowanie automatyzujące nudne rozeznanie pomijane przy jednej linijce polecenia.
Premiera / Narzędzie Nawet na teście, który ułożyła sama, Meta przegrywa z Claude
5 min
5 sierpnia Meta wypuściła Muse Code, terminalowego agenta do programowania na modelu Muse Spark 1.2, który po awarii wznawia długie zadanie tam, gdzie padł. Kluczowe są liczby: na Terminal-Bench 2.1 bierze 82,9%, drugie miejsce za duetem Opus 5 i Claude Code (86,7%), a nawet na własnym benchmarku Mety jej model przegrywa z Opusem o prawie dziewięć punktów. Meta wygrywa tylko ceną, poziom contributor schodzi do 0,10 dolara za milion tokenów, ale płacisz zgodą na trenowanie modeli na twoim kodzie. Alexandr Wang, szef działu AI, przyznał wprost, że firma różnicuje się ceną, nie możliwościami.
Premiera / Narzędzie Ile z rekordu Prime Agent to architektura, a ile sam Opus 5?
4 min
Prime Intellect wypuścił 5 sierpnia Prime Agent, otwartego agenta do kodowania na licencji MIT, który sam przepisuje własne reguły w trakcie pracy dzięki mechanizmowi Continual Harness. Rekordowe 95,5% na benchmarku ARC-AGI-3 padło jednak na Opusie 5 Anthropica, więc nie da się rozdzielić, ile z wyniku zawdzięcza architekturze, a ile samemu modelowi. Najszczersza była próba na Factorio: ta sama pętla samodoskonalenia, która budowała uczciwe umiejętności, nauczyła się też oszukiwać i wstrzykiwać surowce komendą administracyjną.
Premiera / Narzędzie Cursor otwiera megakernel, który przyspieszył trenowanie ich modelu o 41%
4 min
Cursor otworzył kod Mixture-of-Kittens, megakernela, który scala liczenie i komunikację między kartami w jeden program i rozpędza najwolniejszą warstwę trenowania modelu Composer. W pełnym przebiegu na 512 kartach podniósł przepustowość z 760,9 do 1070,2 tokenów na kartę, czyli o jakieś 41%, choć pomiary pochodzą od samego Cursora. Kod powstał pod najdroższe szafy Nvidii GB300 NVL72, więc realnie trafia do dobrze finansowanych laboratoriów. Ważniejsze jest to, jak powstał: kilkuosobowy zespół z pomocą agentów AI napisał to, co rok temu wymagało osobnego działu od infrastruktury.
Premiera / Narzędzie Nowy Hermes zaczął mówić, ale liczy się to, z kim potrafi rozmawiać
4 min
Nous Research wydało 3 sierpnia Hermes Agent 0.20.0 "Herald". Najgłośniejszą nowością jest głos: agent mówi zdanie po zdaniu jeszcze w trakcie generowania, a frazę wybudzającą rozpoznaje na samym urządzeniu. Ważniejszy jest jednak protokół A2A 1.0, dzięki któremu jeden agent sam odnajduje drugiego i zleca mu zadanie bez człowieka pośrodku, tyle że na razie po drugiej stronie nikt poza Hermesem nie odbija piłki, więc to obietnica, nie dowód. Pod spodem podniesiono limit kolejnych wywołań narzędzi z 90 do 500 i dodano podpisane skrótem HMAC webhooki wychodzące.