SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Tydzień 36 · 31 sierpnia – 6 września 2026

Antigravity rozdziela pisanie kodu od jego sprawdzania Premiera / Narzędzie

Antigravity rozdziela pisanie kodu od jego sprawdzania

4 min

Google dodaje do Antigravity komendę /boost, w której orkiestrator sam nie tyka plików, tylko rozbija zadanie na kawałki i rozsyła je agentom pracującym na własnych, kasowanych potem kopiach drzewa roboczego, a rundę zamyka wynik pełnych testów, a nie zapewnienie agenta, że powinno działać. Liczy się tu bardziej rozdzielenie ról niż zrównoleglenie, bo kod ocenia wreszcie ktoś inny niż jego autor. Tyle że dokumentacja nie podaje ani jednego pomiaru, ani porównania ze zwykłą pętlą, ani kosztu, a czas przebiegu zbywa widełkami od sekund do godzin, choć /boost działa tylko w płatnych planach.

OpenAI rezygnuje z miliarda dolarów rocznie, żeby nie sprzedawać modeli Muskowi Premiera / Narzędzie

OpenAI rezygnuje z miliarda dolarów rocznie, żeby nie sprzedawać modeli Muskowi

4 min

OpenAI wypowiedziało SpaceX umowę na dostarczanie modeli do Cursora z datą odcięcia 12 listopada i odpuściło klienta wartego ponad miliard dolarów rocznie, byle nie robić interesów z Muskiem. Anthropic w identycznej sytuacji zapowiedział, że zwiększy moc obliczeniową pod Claude'a w edytorze, co brzmi mniej szlachetnie, gdy się wie, że płaci SpaceX 1,25 miliarda dolarów miesięcznie za karty w Colossusie. Modele OpenAI to jakieś 5% ruchu w Cursorze, więc sedno nie leży w tej jednej pozycji w menu, tylko w tym, że kupujesz cudzy kontrakt, a nie narzędzie.

Edytor wideo, w którym każde cięcie jest linijką kodu Premiera / Narzędzie

Edytor wideo, w którym każde cięcie jest linijką kodu

5 min

Diffusion Studio, otwarty edytor wideo na licencji MPL-2.0 od firmy z Y Combinatora, zamienia projekt filmu w katalog plików JSX, dzięki czemu montaż da się obejrzeć jako diff i poprawić ręcznie tam, gdzie agent skończył. Model dogaduje się z nagraniem przez narzędzie dapi: komenda media transcribe zwraca transkrypcję z czasem każdego słowa, a dapi check wyłapuje czarne klatki i niewidoczne elementy. Dowodem są na razie dwa filmy firmy o sobie samej, a prawdziwy zysk widzę tam, gdzie ten sam montaż powtarza się co tydzień na nowym materiale.

Android Studio dokłada agentowi 23 ściągi, bo model nie nadąża za API Premiera / Narzędzie

Android Studio dokłada agentowi 23 ściągi, bo model nie nadąża za API

4 min

Android Studio Quail 4 wbudowuje 23 zestawy instrukcji, które prowadzą agenta przez typowe roboty w Androidzie, bo modele wciąż piszą kod pod zalecenia sprzed roku. Zestawy trzymają się otwartej specyfikacji agentskills.io, więc każdy zespół może dopisać własne. Drugą nowością jest Gemma 4, która działa w IDE bez limitu tokenów i bez wysyłania kodu na zewnątrz, choć najmniejsze warianty potrzebują 12 GB RAM, a wygodnie pracuje się dopiero od 32 GB. Google nie pokazuje ani jednego benchmarku, a mały lokalny model myli się częściej, więc podręcznika potrzebuje bardziej niż Gemini.

Co się zmienia, kiedy agentowi można wejść w słowo w połowie zadania Premiera / Narzędzie

Co się zmienia, kiedy agentowi można wejść w słowo w połowie zadania

3 min

Hermes od Nous Research w wydaniu 0.21.0 z 31 sierpnia pozwala wreszcie zajrzeć w środek zleconego zadania: widać, które podległe agenty jeszcze pracują, można jednemu wejść w słowo i skorygować kierunek albo zatrzymać go, zachowując to, co zdążył zrobić. Odpowiedź agenta da się opisać schematem JSON, a limit podniesiono do 250 kroków, więc jedno zlecenie obejmuje drogę od przeczytania kodu po poprawione testy. Nous Research reklamuje Pantheon awatarami i wspólnym pokojem rozmów, ale pracę zmienia sterowanie w locie, a nie twarze botów.

Terminal-Bench 4.0 stawia rachunek obok wyniku Premiera / Narzędzie

Terminal-Bench 4.0 stawia rachunek obok wyniku

3 min

Terminal-Bench 4.0 dokłada do tabeli wyników kolumnę z liczbą zużytych tokenów i dopiero dzięki niej widać, że Sonnet 5 potrzebował na ten sam zestaw zadań 21,6 miliarda tokenów, a Opus 5 zaledwie 6,5 miliarda. Nowa wersja kalibruje zasoby przydzielone każdemu zadaniu i wprowadza jeden ośmiogodzinny limit czasu, więc przerwanych przebiegów jest mniej niż w 3.0. Najbardziej praktyczna zmiana to jednak wersjonowanie semantyczne: numer wydania mówi wprost, czy stare wyniki trzeba puścić od nowa, przeliczyć, czy zostawić w spokoju.

Repozytorium z 286 umiejętnościami radzi włączyć tylko garstkę Premiera / Narzędzie

Repozytorium z 286 umiejętnościami radzi włączyć tylko garstkę

5 min

Repozytorium ECC wystawia na licencji MIT 286 gotowych umiejętności dla agenta, ale jego własny README radzi trzymać się poniżej 10 serwerów MCP i 80 narzędzi, bo po włączeniu wszystkiego z okna na 200 tysięcy tokenów zostaje około 70 tysięcy na kod i rozmowę. Do tego lutowy audyt blisko 4 tysięcy publicznych umiejętności znalazł lukę w 36% z nich, część ze wstrzykniętymi instrukcjami dla modelu. Więcej daje więc własny zestaw testów, jak ten z bloga Agentailor za 0,42 dolara za przebieg, który po każdej zmianie mówi, czy agent nadal zatrzymuje się przed nieodwracalną akcją.

Agent przestaje zgadywać ze zrzutu ekranu i sam zagląda do konsoli w Chrome Premiera / Narzędzie

Agent przestaje zgadywać ze zrzutu ekranu i sam zagląda do konsoli w Chrome

4 min

Zespół Chrome wypuścił chrome-devtools-mcp, serwer, który podłącza agenta wprost do działającej przeglądarki, dzięki czemu sam czyta błąd z konsoli, sprawdza żądania sieciowe i nagrywa wydajność, zamiast czekać na twój zrzut ekranu. Katalog ma 57 narzędzi, ale przełącznik --slim zostawia trzy: wejście na stronę, uruchomienie skryptu i zrzut ekranu, bo reszta zjada okno kontekstowe. Haczyk siedzi w ustawieniach, bo --redactNetworkHeaders domyślnie stoi na false, więc razem z listą żądań wracają do modelu tokeny i ciasteczka sesji.

Strona za 400 tysięcy tokenów mieści się w 456 Premiera / Narzędzie

Strona za 400 tysięcy tokenów mieści się w 456

4 min

Strona z notowaniami Yahoo Finance waży 399 881 tokenów surowego HTML, a przez oc, narzędzie linii poleceń na licencji MIT, schodzi do 456, bo agent dostaje ponumerowany spis tego, co na stronie faktycznie jest, i porusza się po tych numerach. W sierpniowych pomiarach 15 realnych stron zmieściło się przez oc w niecałych 11 tysiącach tokenów i tylko on wrócił z treścią ze wszystkich piętnastu. Połowa tej przewagi stoi jednak na podszywaniu się pod Chrome, czyli na wyścigu zbrojeń, więc kupuję zwijanie strony do ponumerowanej listy, a nie przebranie.

Sto zadań z bezpieczeństwa, żaden model powyżej połowy Premiera / Narzędzie

Sto zadań z bezpieczeństwa, żaden model powyżej połowy

5 min

Collinear AI pokazało 2 września CWE-bench: sto zadań, w których agent ma załatać prawdziwą podatność w cudzym kodzie, a najlepszy wynik to 47% dla Claude Fable 5, przy 18 zadaniach, których nie rozwiązał żaden model. Punkt jest tylko za pełne załatanie, więc agent, który zamknął dwie ścieżki z trzech, dostaje zero. Same błędy modele znajdują sprawnie, sypią się dopiero na poprawce: ufają zabezpieczeniu, które sprawdza plik odciskiem z tego samego serwera, zatrzymują się krok przed miejscem, w którym token powstaje, albo łatają tak szeroko, że psują zwykłą funkcję.

Skąd wiesz, czego agent spróbował i czego mu nie pozwolono? Premiera / Narzędzie

Skąd wiesz, czego agent spróbował i czego mu nie pozwolono?

5 min

CopilotKit wypuściło OpenBota, platformę agentową na licencji MIT, którą stawiasz na własnej infrastrukturze z własnym kluczem do modelu. Każde sięgnięcie bota po przeglądarkę, plik czy serwer MCP idzie przez jedną bramkę, która zapisuje wiersz w rejestrze, zanim cokolwiek się wykona, a reguły pisane w CEL odmawiają, podając nazwę blokującej reguły, więc w zapisie zostaje ślad także po tym, czego botowi nie pozwolono. Podłączysz tu każdego agenta mówiącego protokołem AG-UI, tyle że serwer nie wystartuje bez tokenu licencyjnego CopilotKit i konta w ich usłudze Intelligence.

Co się dzieje z uwagami, które wpisujesz agentowi tuż przed końcem sesji? Premiera / Narzędzie

Co się dzieje z uwagami, które wpisujesz agentowi tuż przed końcem sesji?

5 min

Warp opisał u Anthropica układ dwóch umiejętności: bazowa trzyma zasady przeglądu kodu, a druga rusza z harmonogramu, zbiera uwagi ludzi i proponuje jedną małą poprawkę do pliku bazowego, która wchodzi zwykłym pull requestem. Publiczne demo z agentem porządkującym zgłoszenia pokazuje całą pętlę, a komenda Skill Doctor ocenia wcześniejsze rozmowy agenta i podsuwa gotowy diff. Kupuję ten wzorzec z jednym zastrzeżeniem: uwagi ludzi prawie zawsze mówią, czego agentowi zabrakło, więc plik SKILL.md tylko puchnie, a im dłuższy, tym gorzej agent trafia do właściwej wiedzy.

Tydzień 35 · 24–30 sierpnia 2026

Konektory MCP wchodzą do firmy jednym kliknięciem administratora Premiera / Narzędzie

Konektory MCP wchodzą do firmy jednym kliknięciem administratora

5 min

Anthropic wypuścił Enterprise Managed Auth, dzięki czemu administrator włącza konektor MCP raz dla całej organizacji, a pracownik dostaje Lineara czy Notion przy pierwszym logowaniu, bez ekranu zgody i bez wklejania kluczy. Pod spodem działa opisana w RFC 7523 wymiana podpisanego poświadczenia tożsamości na token dostępu, na razie wyłącznie dla firm logujących pracowników przez Oktę i dla 10 konektorów. Uprawnienia przez to nie rosną, ale decyzja o tym, co model widzi, przenosi się do grup i ról u dostawcy tożsamości, więc firma z bałaganem w grupach rozda dostępy szerzej, niż zamierzała.

Anthropic zrobił z pamięci Claude'a listę plików, którą sami poprawiacie Premiera / Narzędzie

Anthropic zrobił z pamięci Claude'a listę plików, którą sami poprawiacie

4 min

Anthropic ogłosił 25 sierpnia, że pamięć Claude'a przestała być przywiązana do czatu i obejmuje też Cowork, dzięki czemu agent zaczyna zlecenie z kontekstem zbudowanym przez miesiące rozmów. Ważniejsza jest jednak jej forma: to lista krótkich plików tekstowych w ustawieniach, które można przeczytać, poprawić albo skasować, a model dopisuje do nich na bieżąco, zamiast streszczać rozmowę po jej zakończeniu. Tematy wrażliwe, jak zdrowie czy poglądy, są domyślnie wyłączone. Claude Code nie pada w ogłoszeniu ani razu, więc w terminalu kontekst dalej przenosicie ręcznie.

Slack Code oddaje przegląd kodu ludziom, którzy nie otwierają terminala Premiera / Narzędzie

Slack Code oddaje przegląd kodu ludziom, którzy nie otwierają terminala

4 min

Slack Code ruszył 20 sierpnia i zakłada pod każde zadanie osobny kanał, w którym obok siebie leżą różnica w kodzie, podgląd interfejsu i opis zmiany prostym językiem, a na produkcję nic nie trafia bez zgody człowieka. Podpięci są agenci pięciu dostawców, wśród nich Claude od Anthropica i Devin od Cognition, a Salesforce sprzedaje to scenariuszem, w którym poprawkę zamawia menedżer produktu, nie inżynier. Bramkę przed produkcją kupuję, tylko że dla kogoś, kto nie czyta różnicy w kodzie, ta zgoda jest warta tyle, ile akapit napisany przez tego samego agenta, który napisał kod.

Anthropic dołożył do przykładów warstwę, którą każdy dopisywał sam Premiera / Narzędzie

Anthropic dołożył do przykładów warstwę, którą każdy dopisywał sam

5 min

Anthropic dorzucił do repozytorium claude-quickstarts trzy przykłady, w których przebieg rozmowy z agentem pamięta serwer, a nie twoja aplikacja. Knowledge Wiki mieli komplet dokumentów raz i zamyka wynik w wersjonowanej notatce, do której agent wraca przy każdym pytaniu, tyle że o kosztach nie pada ani jedna liczba. Osobny przykład pokazuje, jak ściąć rachunek za zrzuty ekranu agenta, który po każdym ruchu wysyła obraz do modelu. Obietnicę, że przeniesienie asystenta na Slacka czy Teamsy to podmiana adaptera, czytam ostrożnie, bo adapter załatwia najłatwiejszą część roboty.

Agent w końcu widzi aplikację, którą sam napisał Premiera / Narzędzie

Agent w końcu widzi aplikację, którą sam napisał

3 min

Callstack wypuścił agent-device, narzędzie na licencji MIT, dzięki któremu agent sam uruchamia aplikację mobilną na symulatorze albo podpiętym telefonie, klika w niej i zostawia zrzuty ekranu oraz logi, czyli domyka pętlę, której dotąd brakowało. Ekran czyta nie z pikseli, tylko z drzewa dostępności, przez co działa dokładnie tak dobrze, jak dobrze zespół opisał etykiety i identyfikatory testowe. Udany przebieg zapisuje się jako skrypt .ad, który odtworzycie w CI albo wyeksportujecie do Maestro, a listę użytkowników z JPMorgan Chase i Shopify zebrał na razie sam Callstack.

Agent Lightning przepisze prompt, narzędzia i model twojego agenta, jeśli masz na czym to zmierzyć Premiera / Narzędzie

Agent Lightning przepisze prompt, narzędzia i model twojego agenta, jeśli masz na czym to zmierzyć

4 min

Agent Lightning, skill Microsoftu wydany 24 sierpnia w wersji v1.0.1, instaluje się jedną komendą w Claude Code, Codex czy GitHub Copilot i bierze na siebie strojenie innego agenta: przepisuje prompt, dokłada albo zabiera narzędzia, schodzi na tańszy model. Warunek jest twardy, bo potrzebuje agenta, którego pliki da się podmienić, i benchmarku z punktacją, czyli tej roboty, której nikt nie chce robić. W nocie wydania nie ma za to ani jednej liczby mówiącej, o ile wynik jakiegokolwiek agenta faktycznie urósł, a 17,8 tysiąca gwiazdek mierzy ciekawość, nie skuteczność.

Z 30% do 95,5% na tym samym benchmarku, bez ruszania wag modelu Premiera / Narzędzie

Z 30% do 95,5% na tym samym benchmarku, bez ruszania wag modelu

4 min

Prime Intellect opublikował 24 sierpnia raport, z którego wynika, że wymiana samego harnessu podnosi wynik na ARC-AGI-3 z 30% do 95,5%, przy nietkniętych wagach modelu. Prime Agent trzyma przez cały bieg jedną sesję IPythona, więc model filtruje własny dziennik pracy kodem zamiast przepychać go przez okno kontekstowe, a zapisane notatki i umiejętności przechodzą do następnego uruchomienia. Skłaniam się ku tezie autorów, że wcześniejsze pomiary mówiły głównie o cudzych harnessach, ale liczba jest ich własna i nikt jej niezależnie nie powtórzył.

Prezes Shopify odtworzył fundament Origin przez jeden weekend Premiera / Narzędzie

Prezes Shopify odtworzył fundament Origin przez jeden weekend

4 min

Tobi Lütke, prezes Shopify, przeczytał opis architektury Origin od Cursora i przez jeden weekend napisał w języku Rust własną implementację warstwy przechowywania kodu, udostępnioną 24 sierpnia jako walgit. Skoro jedna osoba odtwarza fundament w dwa dni, wartość Origin leży gdzie indziej: w pull requestach i przeglądzie kodu z przejętego Graphite oraz w agencie pracującym w tym samym oknie. Pushe dalej lecą do GitHuba, a komentarze krążą w obie strony, więc nowy układ da się sprawdzić bez wymiany kontroli wersji.

Google wypuścił model, który wycina z dyktowania każde "eee" Premiera / Narzędzie

Google wypuścił model, który wycina z dyktowania każde "eee"

3 min

Gemini 3.5 Transcribe, pokazany przez Google 26 sierpnia i dostępny w publicznym podglądzie w Gemini API, sam wycina z dyktowania wahania i poprawki, więc warstwy czyszczenia tekstu drugim wywołaniem modelu nie trzeba już dopisywać samemu. Google chwali się średnim WER 2,6% dla nagrań i 4,0% na żywo, ale na zestawie FLEURS ten sam model schodzi do 5,04% i 5,50%, a rozbicia na poszczególne języki nie publikuje, więc gdzie w tym wypada polski, trzeba zmierzyć samemu. Model przyjmuje własny słownik nazw i skrótów oraz rozdziela głosy do trzech mówców, tylko cennika w ogłoszeniu nie ma.

Wiedza AMD o własnych kartach trafia wprost do Claude Code i Cursora Premiera / Narzędzie

Wiedza AMD o własnych kartach trafia wprost do Claude Code i Cursora

5 min

AMD wpuściło wiedzę o swoich kartach prosto do narzędzi, w których programiści spędzają dzień: razem z ROCm 10 pakiet AMD Skills trafił do katalogów Claude Code, Cursora i Codex, więc asystent nie zgaduje, jak sprofilować aplikację na kartach Instinct. Reklamowana średnio 3,3x szybsza inferencja to jednak porównanie ROCm 7.0 z konfiguracją wystrojoną przez producenta, a benchmark AgentX od SemiAnalysis pokazuje, że na modelu GLM 5.3 ten sam token bywa u NVIDII nawet 5x tańszy. Z trzech nowości bronią się Skills, bo agent przepisze kernel, ale nie dopisze funkcji, której nie ma w sterowniku.

Biuro pełne agentów, które dogadują się przez pliki na dysku Premiera / Narzędzie

Biuro pełne agentów, które dogadują się przez pliki na dysku

4 min

Munder Difflin sadza agentowe narzędzia CLI przy biurkach jednego piętra i każe im dogadywać się przez zwykłe pliki: każdy pisze tylko do swojego katalogu, a commity robi jedna aplikacja, bo dwa procesy potrafią zakleszczyć repozytorium. Obsługuje 12 narzędzi, w tym claude i codex, rozdaje agentom 15 awatarów z The Office i tym wskoczyło na pierwsze miejsce dnia w GitHub Trending. Projekt jest jednak przedpremierowy, w wydaniu 0.3.8 mechanizm limitów potrafił wstrzymać agenty i już ich nie wypuścić, a obietnicy, że wszystko pójdzie na subskrypcjach, które opłacasz, nikt jeszcze nie sprawdził.

Maka zapisuje, kto pozwolił agentowi wyjść poza piaskownicę Premiera / Narzędzie

Maka zapisuje, kto pozwolił agentowi wyjść poza piaskownicę

3 min

Apache Software Foundation przyjęła do inkubatora Makę, pulpit agentowy, który trzyma całą sesję na dysku i zapisuje w dzienniku to, co zwykle przepada: twoje zgody na wyjście agenta poza piaskownicę i sposób zakończenia tury. Do dziennika można tylko dopisywać, więc skrócenie kontekstu nie kasuje historii, ale klucze API leżą w zwykłym pliku credential-vault.json, fundacja nie zatwierdziła jeszcze żadnego wydania, a pulpit działa tylko na Apple Silicon. Pomysł, żeby zgoda użytkownika była danymi, a nie czymś, co ginie w oknie czatu, wart jest podkradzenia, samo narzędzie na razie nie.