Premiera / Narzędzie
Tydzień 27 · 29 czerwca – 5 lipca 2026
Tydzień 26 · 22–28 czerwca 2026
Premiera / Narzędzie Microsoft trenuje prompty agentów tak, jak trenuje się sieci neuronowe
4 min
Microsoft Research wypuścił SkillOpt, narzędzie, które zamiast dotrenowywać model, trenuje sam plik z instrukcją dla agenta. Osobny optymalizator proponuje zmiany w dokumencie i zachowuje tylko te, które realnie podnoszą wynik na odłożonym zbiorze zadań walidacyjnych. Na sześciu benchmarkach i siedmiu modelach SkillOpt wypada najlepiej lub na równi we wszystkich 52 przypadkach, a na GPT-5.5 dorzuca średnio ponad 23 punkty skuteczności. Efektem jest jeden plik best_skill.md, bez dodatkowych kosztów w trakcie pracy. Wyniki pochodzą jednak od autorów metody.
Premiera / Narzędzie Claude Code generuje stronę z sesji, ale celowo nie potrafi wyjść do internetu
6 min
Anthropic 18 czerwca wypuścił w becie Claude Code Artifacts: po sesji prosisz o stronę, a Claude Code buduje z realnego repozytorium, narzędzi MCP i samej rozmowy żywą stronę HTML pod prywatnym adresem na claude.ai. Strona jest celowo zamknięta, bez serwera, bazy i połączeń na zewnątrz, czyli płótno do recenzji, a nie hosting, dokładne przeciwieństwo OpenAI Codex Sites. Działa tylko w planach Team i Enterprise i wymaga bezpośredniego uwierzytelnienia w Anthropic. Mitch Ashley z The Futurum Group ostrzega, że wypolerowana strona wciąż musi zasłużyć na zaufanie recenzją.
Premiera / Narzędzie Astryx: agent czyta jeden plik JSON i zna całe API, zamiast je zmyślać
5 min
Meta udostępniła na licencji MIT Astryx, system komponentów Reacta, który przez osiem lat napędzał ponad 13 tysięcy wewnętrznych aplikacji firmy. Najważniejszy jest tu jeden plik JSON, manifest, który daje agentom AI maszynowo czytelny opis całego narzędzia, dzięki czemu nie muszą zgadywać API ani zmyślać nieistniejących właściwości. Pod spodem działa sprawdzony silnik StyleX, używany też przez Figmę i Snowflake, a dostęp prowadzi również przez serwer MCP. W dniu premiery repozytorium miało jednak 18 gwiazdek i status bety, więc poza Metą nie ma jeszcze społeczności ani pełnej dokumentacji.
Premiera / Narzędzie Trzy frameworki, które każą maszynie pisać własne prompty i skille
5 min
Trzy czerwcowe projekty open-source, GEPA, EvoSkill i Self-Harness, oddają maszynie to, co dotąd pisał inżynier: prompt, umiejętności agenta i reguły jego działania. Pętla ewolucyjna sama generuje warianty, ocenia je i zachowuje najlepsze, obiecując kilkudziesięcioprocentowy skok skuteczności bez dotykania wag modelu; GEPA podbił GPT-4.1 Mini na zadaniach AIME z 46,6% do 56,6% przy 100 do 500 prób zamiast tysięcy. Działa to jednak tylko tam, gdzie wynik da się tanio i jednoznacznie zmierzyć, więc nowa rola człowieka to napisać dobrą miarę, a nie cyzelować pojedyncze zdanie.
Premiera / Narzędzie Codex podgląda twój ekran i sam pisze instrukcję, jak coś zrobić
5 min
Dwie czerwcowe zmiany przesuwają Codeksa z asystenta do pisania kodu w stronę agenta uczącego się przez obserwację. Tryb dewelopera z 11 czerwca daje mu wgląd w narzędzia deweloperskie Chrome, dzięki czemu zamiast zgadywać z kodu, widzi w konsoli, że żądanie wraca z błędem 500 albo która funkcja zjada najwięcej czasu. Record and Replay z 17 czerwca pozwala raz pokazać czynność na Macu, a agent zapisuje ją jako czytelny plik SKILL.md gotowy do powtórzenia. Funkcja działa jednak wyłącznie na macOS, wymaga zgody Computer Use i jest niedostępna w Unii, a pytanie o niezawodność zostaje otwarte.
Premiera / Narzędzie Claude Code w pudełku za 40 dolarów, czyli Siri, które naprawdę działa
6 min
Leon Furze przez kilka wieczorów zamienił kieszonkowy komputerek M5Stack Cardputer za czterdzieści dolarów w głosowego asystenta: przytrzymujesz klawisz, mówisz, a stojący w domu Mac mini rozpoznaje mowę, przepuszcza ją przez agenta Claude Code i odpowiada na głos, działając nawet przez hotspot z drugiego końca kraju dzięki tunelowi Tailscale Funnel. To Siri, które naprawdę wykonuje zadania na komputerze, ale całość trzyma agent z celowo rozluźnionymi zabezpieczeniami i miękka, głosowa bramka potwierdzeń, więc sam autor traktuje to jako działający dowód koncepcji, nie wzorzec do powielania.
Premiera / Narzędzie Tani model rozmawia, drogi model pisze: wzorzec STORM ze Stanfordu
4 min
STORM ze Stanfordu bierze dowolny temat, sam przeszukuje sieć i składa z tego raport z przypisami w stylu Wikipedii, ale najciekawsza jest tu inżynieria, nie efekt. Research rozbito na symulowaną rozmowę autora z ekspertem, dzięki czemu rodzą się pytania głębsze niż te, które model wymyśli na zawołanie. Najpraktyczniejsza lekcja siedzi w konfiguracji: tańszy model prowadzi rozmowę i rozbija zapytania, a mocniejszy pisze finalny tekst z cytatami, gdzie liczy się wierność źródłom. To wzorzec do przeniesienia do własnego projektu, nawet jeśli STORM nie produkuje tekstów gotowych do publikacji.
Premiera / Narzędzie Bezpieczna piaskownica jako główny argument nowego agenta WordPressa
4 min
WordPress.com przeniósł agenta Studio Code z terminala do okienkowej aplikacji na macOS, Windows i Linux, zastępując dotychczasowego asystenta AI i udostępniając go za darmo na czas testów. Mówisz mu po ludzku, czego chcesz, a on sam rozkłada to na kroki: stawia stronę, instaluje wtyczki, robi audyt wydajności. Najważniejsze nie jest jednak na liście funkcji, tylko w tym, że agent pracuje na lokalnej kopii, a produkcja nie zmienia się o znak, dopóki sam świadomie nie zsynchronizujesz zmian, dzięki czemu pomyłka agenta jest tania, a nie groźna.
Premiera / Narzędzie Envoy AI Gateway 1.0: jeden adres dla wszystkich modeli i pierwsza brama dla MCP
4 min
Tetrate wydał wersję 1.0 Envoy AI Gateway, otwartej bramy stojącej na sprawdzonym serwerze Envoy z Lyfta, która chowa OpenAI, Anthropic, Gemini czy Mistral za jednym interfejsem zgodnym z formatem OpenAI, więc przerzucenie ruchu na tańszego dostawcę staje się zmianą wpisu w konfiguracji. Nowością jest wbudowana obsługa MCP, czyli wspólny punkt, w którym administrator filtruje, z jakich narzędzi może korzystać dany agent. Współzałożyciel Varun Talwar zapewnia, że publiczny kod chodzi na produkcji w Bloombergu, ale poza współtwórcami projektu wiarygodnych referencji wciąż brakuje.
Premiera / Narzędzie Google wbudował sterowanie komputerem w model, który i tak już odpalasz
5 min
Google przeniósł sterowanie komputerem do Gemini 3.5 Flash, czyli szybkiego i taniego modelu, który deweloperzy i tak już mają podpięty pod aplikacje. Zamiast osobnego modelu jeden agent widzi ekran i klika jak człowiek, dzięki czemu wchodzi tam, gdzie nie ma API, choćby w stary firmowy system. Google podaje wynik 78,4% na OSWorld-Verified, ale to deklaracja producenta, nie dowód. Kluczowe zabezpieczenia, czyli potwierdzanie wrażliwych działań i blokada wstrzykniętych instrukcji, są opcjonalne, więc ryzyko spada na deweloperów.
Premiera / Narzędzie Bitbucket chce być centralą dla agentów w CI/CD. Codex to dopiero druga wtyczka
3 min
Atlassian dodał do Bitbucket Pipelines obsługę agenta Codex od OpenAI, który dochodzi jako trzeci wybieralny agent po własnym Rovo Dev i po Claude od Anthropica. Wystarczy jedna linijka w pliku konfiguracyjnym (provider: codex), żeby podmienić agenta bez przebudowywania procesu, bo reszta pipeline'u, dostęp do kodu, sekretów i serwerów MCP, zostaje na miejscu. Atlassian sprzedaje to jako neutralną centralę dyrygującą agentami w CI/CD. Haczyk: to open beta z wyborem z zaledwie trzech agentów, a korzystanie z Codeksa oznacza, że kod, prompty i logi trafiają do OpenAI.
Premiera / Narzędzie Testy pisze już AI. TypeMock chce sprawdzać, które z nich mają sens
4 min
Skoro asystenci AI generują testy jednostkowe szybciej, niż ktokolwiek zdąży je przejrzeć, TypeMock ogłosił 22 czerwca narzędzie Test Review, które ma wskazywać, które z nich warto trzymać. Zamiast czytać sam kod, obserwuje testy w trakcie wykonania: ile kodu realnie dotykają i czy nie ukrywają zależności od plików czy sieci, które stoją za migającymi testami. Założyciel Eli Lopian ujmuje to wprost: przechodzący test nie jest automatycznie przydatny. Diagnoza jest trafna, ale to wciąż zapowiedź producenta, którą trzeba sprawdzić na własnym kodzie.
Premiera / Narzędzie Co naprawdę dostaje deweloper od NVIDIA Agent Toolkit, gdy odłożyć marketing zaufania na bok
4 min
NVIDIA ogłosiła 23 czerwca Agent Toolkit, ale jedyną rzeczą, którą deweloper może dziś naprawdę dotknąć, jest instrukcja postawienia agenta badawczego AI-Q 2.0 na Oracle Cloud Infrastructure. Dostajesz trzy warstwy w jednym pudełku: modele Nemotron jako rozumowanie, gotowe reguły bezpieczeństwa i piaskownicę odcinającą kod agenta od reszty. Terraform stawia infrastrukturę, Helm wgrywa backend, interfejs i bazę, a całość rusza w jakieś pół godziny. Cena za wygodę to przywiązanie do chmury, modeli i klucza NVIDIA, a reszta komunikatów to na razie deklaracje producenta, nie zweryfikowane wyniki.
Premiera / Narzędzie Jeden model, który dzwoni po inne. I nie mówi, do których
4 min
Tokijska Sakana AI wypuściła 22 czerwca 2026 Fugu, system wielu agentów udający jeden model: wysyłasz zapytanie pod jeden adres zgodny z API OpenAI, a orkiestrator sam rozdziela pracę między wyspecjalizowane modele i skleja odpowiedź. Sakana sprzedaje go jako poduszkę na ryzyko kontroli eksportu i chwali się wynikiem 73,7 na SWE-Bench Pro, o ponad cztery punkty wyżej niż Opus 4.8. Skłaniam się ku temu, że to zamiana jednej zależności na inną, gorzej widoczną: routing jest zamknięty, nie wiesz, który model odpowiedział ani ile to kosztuje.
Premiera / Narzędzie Git wymyślono, żeby nikt nie kontrolował repozytorium. Origin to odwraca
5 min
Na konferencji Compile Cursor pokazał plan przejęcia całego stosu: nowy model trenowany od zera (1,5 biliona parametrów, ponad 100 tysięcy GPU), karmiony prawdziwymi sesjami pracy programistów, oraz Origin, własny hosting git zaprojektowany pod tysiące agentów piszących naraz, z automatycznym rozwiązywaniem konfliktów scalania. Po przejęciu przez SpaceX cały strumień danych z Cursora trafi do firmy, która sama trenuje modele, co odwraca rozproszoną kontrolę, dla której wymyślono git. Domknięcie planowane na trzeci kwartał 2026 to moment, by sprawdzić warunki użycia kodu do trenowania.
Premiera / Narzędzie Apple daje wybór asystenta w Xcode. Pytanie, czy ktoś go realnie używa
3 min
Xcode 26.6, wydany 25 czerwca, dorzuca Google Gemini jako trzeciego asystenta kodowania obok Claude'a i Codeksa, choć w becie Xcode 27 opcja ta była już od 10 czerwca, więc premiera tylko przenosi ją do wersji stabilnej. Naprawdę istotny jest jednak Agent Client Protocol, czyli wspólny format, dzięki któremu do edytora można wpiąć dowolnego zgodnego agenta bez zgody Apple. Sam wybór trzech modeli bywa też kosztem, bo każdy myli się inaczej i trzeba poznać trzy maszyny zamiast jednej. To sygnał kierunku i nietypowy gest otwartości, a nie jeszcze zmiana na biurku programisty.
Premiera / Narzędzie AI doradza poprawnie, ale nikt nie każe sprawdzić, czy łatka jeszcze działa
5 min
Kiedy asystent AI podpowiada, jak załatać podatną zależność wpisem typu override w package.json, rada jest poprawna, ale nikt nie każe wrócić i sprawdzić, czy to przypięcie wciąż cokolwiek robi. Sonu Kapoor, twórca CVE Lite CLI, przeskanował cztery znane projekty i w trzech znalazł martwe zabezpieczenia: Cal.com miał 90 wpisów, z czego 11 nie chroniło przed niczym, a tylko Next.js wyszedł czysto. Override cicho umiera najczęściej przy migracji między menedżerami paczek, bo npm, pnpm i Yarn trzymają go w innym polu, więc weryfikacja należy do ciebie, najlepiej jako stały krok przed wydaniem.
Premiera / Narzędzie Amazon Q wykonywał kod ze sklonowanego repo, a nowa wersja MCP zrzuca bezpieczeństwo na ciebie
5 min
Wystarczyło sklonować repozytorium i otworzyć je w edytorze, by ktoś obcy przejął aktywną sesję chmurową dewelopera. Tak działała dziura CVE-2026-12957 w Amazon Q Developer: wtyczka odpalała serwery MCP opisane w pliku z repo bez pytania o zgodę, a procesy dziedziczyły klucze AWS i tokeny ofiary. Amazon załatał problem w wersji 1.69.0, ale ten sam wzorzec wcześniej trafił Claude Code, Cursora i Windsurfa. Zaplanowana na 28 lipca 2026 przebudowa MCP kasuje starą klasę ryzyk, lecz przenosi obowiązek pilnowania granic zaufania na piszącego serwer.
Tydzień 25 · 15–21 czerwca 2026
Premiera / Narzędzie AgentDeck: jeden terminal do całej floty agentów i osobny agent, który ich pilnuje
4 min
AgentDeck to otwartoźródłowe narzędzie w Go, które zbiera całą flotę agentów kodujących w jednym terminalu: każda sesja dostaje kolorową kropkę stanu, fork dziedziczący rozmowę i własny worktree gita, a klawisz "$" pokazuje koszty czternastu modeli. Najciekawszy jest jednak dyrygent, osobny agent stale pilnujący reszty, który sam odpowiada na rutynowe pytania, a ważniejsze przerzuca na Telegram albo Slack. To kuszący wzorzec, ale projekt jednej osoby, a wiedza pochodzi z README, nie z produkcji, więc kluczowe pytanie, co dzieje się, gdy dyrygent się myli, pozostaje bez odpowiedzi.
Premiera / Narzędzie Datalab otwiera Lift: model 9B, który wyciąga JSON z PDF-ów lokalnie
4 min
Datalab udostępnił na open source Lift, wizyjny model o dziewięciu miliardach parametrów, który z PDF-a i podanego schematu zwraca gotowy obiekt JSON, działając lokalnie na jednej karcie graficznej. Dzięki dekodowaniu ograniczonemu schematem wynik nie potrafi wyłamać się z formatu, a na zestawie 225 dokumentów model trafia w 90,2 procent pól w 9,5 sekundy, bijąc Azure Content Understanding (83,4 procent, 73,7 sekundy). Haczyk to inna liczba: bezbłędnie domyka tylko 20,9 procent całych dokumentów, więc świetnie nadaje się do pracy z człowiekiem w pętli, ale nie do pełnej automatyzacji.
Premiera / Narzędzie Cursor wpada w ręce SpaceX. Pytanie nie brzmi za ile, tylko jaki model będzie domyślny
3 min
SpaceX kupuje Anysphere, twórcę edytora Cursor, za 60 miliardów dolarów w akcjach, cztery dni po debiucie giełdowym za 75 miliardów. Dla piszących kod liczy się jednak nie kwota, tylko to, czy Cursor zachowa neutralność wobec dostawcy modelu, skoro SpaceX wchłonął już xAI i zapowiada własny model oraz agenta Grok Build. Pokusa, by ustawić Groka domyślnie, jest oczywista, bo dział tracił w 2025 roku 6,35 miliarda dolarów. Po stronie plusów stoi superkomputer Colossus, który może przyspieszyć trenowanie modeli pod Cursora. Domknięcie planowane na trzeci kwartał 2026 roku.
Premiera / Narzędzie Wąskie gardło przesunęło się z pisania kodu na jego wypuszczanie
5 min
Gdy agent generuje kod szybciej, niż recenzenci zdążą go sprawdzić, wąskie gardło przenosi się z pisania na recenzję, testy i samo wydanie. AWS odpowiada podglądem nowych funkcji w DevOps Agent: przegląd gotowości prześwietla każdą zmianę przed scaleniem, uruchamia kod w izolowanym środowisku i wydaje jedną z trzech ocen, od zablokowania po bezpieczne wydanie. Druga funkcja sama układa testy skrojone pod konkretną zmianę, a integracja z edytorem Kiro przez protokół MCP pozwala przejść od alarmu do gotowej poprawki bez wychodzenia z edytora. To jednak dopiero podgląd w regionie US East.
Premiera / Narzędzie Ile agentów kodujących utrzyma jeden megawat? Wreszcie jest na to pomiar
4 min
Artificial Analysis uruchomiło AA-AgentPerf, pierwszy benchmark sprzętowy mierzący nie pojedyncze zapytanie do modelu, lecz pracę agenta kodującego rozłożoną na nawet 200 tur i ponad 100 tysięcy tokenów kontekstu. Kluczowa miara to liczba agentów na megawat, bo to pobór prądu, nie same karty, ogranicza dziś rozbudowę. NVIDIA chwali się, że rackowy GB300 NVL72 utrzymuje do 20 razy więcej agentów na megawat niż H200, ale tę liczbę warto czytać z gwiazdką: zwycięskie konfiguracje stroił producent, a punkt odniesienia składał zespół benchmarku z zapasem wydajności.