SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Tydzień 27 · 29 czerwca – 5 lipca 2026

Tydzień 26 · 22–28 czerwca 2026

Microsoft trenuje prompty agentów tak, jak trenuje się sieci neuronowe Premiera / Narzędzie

Microsoft trenuje prompty agentów tak, jak trenuje się sieci neuronowe

4 min

Microsoft Research wypuścił SkillOpt, narzędzie, które zamiast dotrenowywać model, trenuje sam plik z instrukcją dla agenta. Osobny optymalizator proponuje zmiany w dokumencie i zachowuje tylko te, które realnie podnoszą wynik na odłożonym zbiorze zadań walidacyjnych. Na sześciu benchmarkach i siedmiu modelach SkillOpt wypada najlepiej lub na równi we wszystkich 52 przypadkach, a na GPT-5.5 dorzuca średnio ponad 23 punkty skuteczności. Efektem jest jeden plik best_skill.md, bez dodatkowych kosztów w trakcie pracy. Wyniki pochodzą jednak od autorów metody.

Claude Code generuje stronę z sesji, ale celowo nie potrafi wyjść do internetu Premiera / Narzędzie

Claude Code generuje stronę z sesji, ale celowo nie potrafi wyjść do internetu

6 min

Anthropic 18 czerwca wypuścił w becie Claude Code Artifacts: po sesji prosisz o stronę, a Claude Code buduje z realnego repozytorium, narzędzi MCP i samej rozmowy żywą stronę HTML pod prywatnym adresem na claude.ai. Strona jest celowo zamknięta, bez serwera, bazy i połączeń na zewnątrz, czyli płótno do recenzji, a nie hosting, dokładne przeciwieństwo OpenAI Codex Sites. Działa tylko w planach Team i Enterprise i wymaga bezpośredniego uwierzytelnienia w Anthropic. Mitch Ashley z The Futurum Group ostrzega, że wypolerowana strona wciąż musi zasłużyć na zaufanie recenzją.

Astryx: agent czyta jeden plik JSON i zna całe API, zamiast je zmyślać Premiera / Narzędzie

Astryx: agent czyta jeden plik JSON i zna całe API, zamiast je zmyślać

5 min

Meta udostępniła na licencji MIT Astryx, system komponentów Reacta, który przez osiem lat napędzał ponad 13 tysięcy wewnętrznych aplikacji firmy. Najważniejszy jest tu jeden plik JSON, manifest, który daje agentom AI maszynowo czytelny opis całego narzędzia, dzięki czemu nie muszą zgadywać API ani zmyślać nieistniejących właściwości. Pod spodem działa sprawdzony silnik StyleX, używany też przez Figmę i Snowflake, a dostęp prowadzi również przez serwer MCP. W dniu premiery repozytorium miało jednak 18 gwiazdek i status bety, więc poza Metą nie ma jeszcze społeczności ani pełnej dokumentacji.

Trzy frameworki, które każą maszynie pisać własne prompty i skille Premiera / Narzędzie

Trzy frameworki, które każą maszynie pisać własne prompty i skille

5 min

Trzy czerwcowe projekty open-source, GEPA, EvoSkill i Self-Harness, oddają maszynie to, co dotąd pisał inżynier: prompt, umiejętności agenta i reguły jego działania. Pętla ewolucyjna sama generuje warianty, ocenia je i zachowuje najlepsze, obiecując kilkudziesięcioprocentowy skok skuteczności bez dotykania wag modelu; GEPA podbił GPT-4.1 Mini na zadaniach AIME z 46,6% do 56,6% przy 100 do 500 prób zamiast tysięcy. Działa to jednak tylko tam, gdzie wynik da się tanio i jednoznacznie zmierzyć, więc nowa rola człowieka to napisać dobrą miarę, a nie cyzelować pojedyncze zdanie.

Codex podgląda twój ekran i sam pisze instrukcję, jak coś zrobić Premiera / Narzędzie

Codex podgląda twój ekran i sam pisze instrukcję, jak coś zrobić

5 min

Dwie czerwcowe zmiany przesuwają Codeksa z asystenta do pisania kodu w stronę agenta uczącego się przez obserwację. Tryb dewelopera z 11 czerwca daje mu wgląd w narzędzia deweloperskie Chrome, dzięki czemu zamiast zgadywać z kodu, widzi w konsoli, że żądanie wraca z błędem 500 albo która funkcja zjada najwięcej czasu. Record and Replay z 17 czerwca pozwala raz pokazać czynność na Macu, a agent zapisuje ją jako czytelny plik SKILL.md gotowy do powtórzenia. Funkcja działa jednak wyłącznie na macOS, wymaga zgody Computer Use i jest niedostępna w Unii, a pytanie o niezawodność zostaje otwarte.

Claude Code w pudełku za 40 dolarów, czyli Siri, które naprawdę działa Premiera / Narzędzie

Claude Code w pudełku za 40 dolarów, czyli Siri, które naprawdę działa

6 min

Leon Furze przez kilka wieczorów zamienił kieszonkowy komputerek M5Stack Cardputer za czterdzieści dolarów w głosowego asystenta: przytrzymujesz klawisz, mówisz, a stojący w domu Mac mini rozpoznaje mowę, przepuszcza ją przez agenta Claude Code i odpowiada na głos, działając nawet przez hotspot z drugiego końca kraju dzięki tunelowi Tailscale Funnel. To Siri, które naprawdę wykonuje zadania na komputerze, ale całość trzyma agent z celowo rozluźnionymi zabezpieczeniami i miękka, głosowa bramka potwierdzeń, więc sam autor traktuje to jako działający dowód koncepcji, nie wzorzec do powielania.

Tani model rozmawia, drogi model pisze: wzorzec STORM ze Stanfordu Premiera / Narzędzie

Tani model rozmawia, drogi model pisze: wzorzec STORM ze Stanfordu

4 min

STORM ze Stanfordu bierze dowolny temat, sam przeszukuje sieć i składa z tego raport z przypisami w stylu Wikipedii, ale najciekawsza jest tu inżynieria, nie efekt. Research rozbito na symulowaną rozmowę autora z ekspertem, dzięki czemu rodzą się pytania głębsze niż te, które model wymyśli na zawołanie. Najpraktyczniejsza lekcja siedzi w konfiguracji: tańszy model prowadzi rozmowę i rozbija zapytania, a mocniejszy pisze finalny tekst z cytatami, gdzie liczy się wierność źródłom. To wzorzec do przeniesienia do własnego projektu, nawet jeśli STORM nie produkuje tekstów gotowych do publikacji.

Bezpieczna piaskownica jako główny argument nowego agenta WordPressa Premiera / Narzędzie

Bezpieczna piaskownica jako główny argument nowego agenta WordPressa

4 min

WordPress.com przeniósł agenta Studio Code z terminala do okienkowej aplikacji na macOS, Windows i Linux, zastępując dotychczasowego asystenta AI i udostępniając go za darmo na czas testów. Mówisz mu po ludzku, czego chcesz, a on sam rozkłada to na kroki: stawia stronę, instaluje wtyczki, robi audyt wydajności. Najważniejsze nie jest jednak na liście funkcji, tylko w tym, że agent pracuje na lokalnej kopii, a produkcja nie zmienia się o znak, dopóki sam świadomie nie zsynchronizujesz zmian, dzięki czemu pomyłka agenta jest tania, a nie groźna.

Envoy AI Gateway 1.0: jeden adres dla wszystkich modeli i pierwsza brama dla MCP Premiera / Narzędzie

Envoy AI Gateway 1.0: jeden adres dla wszystkich modeli i pierwsza brama dla MCP

4 min

Tetrate wydał wersję 1.0 Envoy AI Gateway, otwartej bramy stojącej na sprawdzonym serwerze Envoy z Lyfta, która chowa OpenAI, Anthropic, Gemini czy Mistral za jednym interfejsem zgodnym z formatem OpenAI, więc przerzucenie ruchu na tańszego dostawcę staje się zmianą wpisu w konfiguracji. Nowością jest wbudowana obsługa MCP, czyli wspólny punkt, w którym administrator filtruje, z jakich narzędzi może korzystać dany agent. Współzałożyciel Varun Talwar zapewnia, że publiczny kod chodzi na produkcji w Bloombergu, ale poza współtwórcami projektu wiarygodnych referencji wciąż brakuje.

Google wbudował sterowanie komputerem w model, który i tak już odpalasz Premiera / Narzędzie

Google wbudował sterowanie komputerem w model, który i tak już odpalasz

5 min

Google przeniósł sterowanie komputerem do Gemini 3.5 Flash, czyli szybkiego i taniego modelu, który deweloperzy i tak już mają podpięty pod aplikacje. Zamiast osobnego modelu jeden agent widzi ekran i klika jak człowiek, dzięki czemu wchodzi tam, gdzie nie ma API, choćby w stary firmowy system. Google podaje wynik 78,4% na OSWorld-Verified, ale to deklaracja producenta, nie dowód. Kluczowe zabezpieczenia, czyli potwierdzanie wrażliwych działań i blokada wstrzykniętych instrukcji, są opcjonalne, więc ryzyko spada na deweloperów.

Bitbucket chce być centralą dla agentów w CI/CD. Codex to dopiero druga wtyczka Premiera / Narzędzie

Bitbucket chce być centralą dla agentów w CI/CD. Codex to dopiero druga wtyczka

3 min

Atlassian dodał do Bitbucket Pipelines obsługę agenta Codex od OpenAI, który dochodzi jako trzeci wybieralny agent po własnym Rovo Dev i po Claude od Anthropica. Wystarczy jedna linijka w pliku konfiguracyjnym (provider: codex), żeby podmienić agenta bez przebudowywania procesu, bo reszta pipeline'u, dostęp do kodu, sekretów i serwerów MCP, zostaje na miejscu. Atlassian sprzedaje to jako neutralną centralę dyrygującą agentami w CI/CD. Haczyk: to open beta z wyborem z zaledwie trzech agentów, a korzystanie z Codeksa oznacza, że kod, prompty i logi trafiają do OpenAI.

Testy pisze już AI. TypeMock chce sprawdzać, które z nich mają sens Premiera / Narzędzie

Testy pisze już AI. TypeMock chce sprawdzać, które z nich mają sens

4 min

Skoro asystenci AI generują testy jednostkowe szybciej, niż ktokolwiek zdąży je przejrzeć, TypeMock ogłosił 22 czerwca narzędzie Test Review, które ma wskazywać, które z nich warto trzymać. Zamiast czytać sam kod, obserwuje testy w trakcie wykonania: ile kodu realnie dotykają i czy nie ukrywają zależności od plików czy sieci, które stoją za migającymi testami. Założyciel Eli Lopian ujmuje to wprost: przechodzący test nie jest automatycznie przydatny. Diagnoza jest trafna, ale to wciąż zapowiedź producenta, którą trzeba sprawdzić na własnym kodzie.

Co naprawdę dostaje deweloper od NVIDIA Agent Toolkit, gdy odłożyć marketing zaufania na bok Premiera / Narzędzie

Co naprawdę dostaje deweloper od NVIDIA Agent Toolkit, gdy odłożyć marketing zaufania na bok

4 min

NVIDIA ogłosiła 23 czerwca Agent Toolkit, ale jedyną rzeczą, którą deweloper może dziś naprawdę dotknąć, jest instrukcja postawienia agenta badawczego AI-Q 2.0 na Oracle Cloud Infrastructure. Dostajesz trzy warstwy w jednym pudełku: modele Nemotron jako rozumowanie, gotowe reguły bezpieczeństwa i piaskownicę odcinającą kod agenta od reszty. Terraform stawia infrastrukturę, Helm wgrywa backend, interfejs i bazę, a całość rusza w jakieś pół godziny. Cena za wygodę to przywiązanie do chmury, modeli i klucza NVIDIA, a reszta komunikatów to na razie deklaracje producenta, nie zweryfikowane wyniki.

Jeden model, który dzwoni po inne. I nie mówi, do których Premiera / Narzędzie

Jeden model, który dzwoni po inne. I nie mówi, do których

4 min

Tokijska Sakana AI wypuściła 22 czerwca 2026 Fugu, system wielu agentów udający jeden model: wysyłasz zapytanie pod jeden adres zgodny z API OpenAI, a orkiestrator sam rozdziela pracę między wyspecjalizowane modele i skleja odpowiedź. Sakana sprzedaje go jako poduszkę na ryzyko kontroli eksportu i chwali się wynikiem 73,7 na SWE-Bench Pro, o ponad cztery punkty wyżej niż Opus 4.8. Skłaniam się ku temu, że to zamiana jednej zależności na inną, gorzej widoczną: routing jest zamknięty, nie wiesz, który model odpowiedział ani ile to kosztuje.

Git wymyślono, żeby nikt nie kontrolował repozytorium. Origin to odwraca Premiera / Narzędzie

Git wymyślono, żeby nikt nie kontrolował repozytorium. Origin to odwraca

5 min

Na konferencji Compile Cursor pokazał plan przejęcia całego stosu: nowy model trenowany od zera (1,5 biliona parametrów, ponad 100 tysięcy GPU), karmiony prawdziwymi sesjami pracy programistów, oraz Origin, własny hosting git zaprojektowany pod tysiące agentów piszących naraz, z automatycznym rozwiązywaniem konfliktów scalania. Po przejęciu przez SpaceX cały strumień danych z Cursora trafi do firmy, która sama trenuje modele, co odwraca rozproszoną kontrolę, dla której wymyślono git. Domknięcie planowane na trzeci kwartał 2026 to moment, by sprawdzić warunki użycia kodu do trenowania.

Apple daje wybór asystenta w Xcode. Pytanie, czy ktoś go realnie używa Premiera / Narzędzie

Apple daje wybór asystenta w Xcode. Pytanie, czy ktoś go realnie używa

3 min

Xcode 26.6, wydany 25 czerwca, dorzuca Google Gemini jako trzeciego asystenta kodowania obok Claude'a i Codeksa, choć w becie Xcode 27 opcja ta była już od 10 czerwca, więc premiera tylko przenosi ją do wersji stabilnej. Naprawdę istotny jest jednak Agent Client Protocol, czyli wspólny format, dzięki któremu do edytora można wpiąć dowolnego zgodnego agenta bez zgody Apple. Sam wybór trzech modeli bywa też kosztem, bo każdy myli się inaczej i trzeba poznać trzy maszyny zamiast jednej. To sygnał kierunku i nietypowy gest otwartości, a nie jeszcze zmiana na biurku programisty.

AI doradza poprawnie, ale nikt nie każe sprawdzić, czy łatka jeszcze działa Premiera / Narzędzie

AI doradza poprawnie, ale nikt nie każe sprawdzić, czy łatka jeszcze działa

5 min

Kiedy asystent AI podpowiada, jak załatać podatną zależność wpisem typu override w package.json, rada jest poprawna, ale nikt nie każe wrócić i sprawdzić, czy to przypięcie wciąż cokolwiek robi. Sonu Kapoor, twórca CVE Lite CLI, przeskanował cztery znane projekty i w trzech znalazł martwe zabezpieczenia: Cal.com miał 90 wpisów, z czego 11 nie chroniło przed niczym, a tylko Next.js wyszedł czysto. Override cicho umiera najczęściej przy migracji między menedżerami paczek, bo npm, pnpm i Yarn trzymają go w innym polu, więc weryfikacja należy do ciebie, najlepiej jako stały krok przed wydaniem.

Amazon Q wykonywał kod ze sklonowanego repo, a nowa wersja MCP zrzuca bezpieczeństwo na ciebie Premiera / Narzędzie

Amazon Q wykonywał kod ze sklonowanego repo, a nowa wersja MCP zrzuca bezpieczeństwo na ciebie

5 min

Wystarczyło sklonować repozytorium i otworzyć je w edytorze, by ktoś obcy przejął aktywną sesję chmurową dewelopera. Tak działała dziura CVE-2026-12957 w Amazon Q Developer: wtyczka odpalała serwery MCP opisane w pliku z repo bez pytania o zgodę, a procesy dziedziczyły klucze AWS i tokeny ofiary. Amazon załatał problem w wersji 1.69.0, ale ten sam wzorzec wcześniej trafił Claude Code, Cursora i Windsurfa. Zaplanowana na 28 lipca 2026 przebudowa MCP kasuje starą klasę ryzyk, lecz przenosi obowiązek pilnowania granic zaufania na piszącego serwer.

Tydzień 25 · 15–21 czerwca 2026

AgentDeck: jeden terminal do całej floty agentów i osobny agent, który ich pilnuje Premiera / Narzędzie

AgentDeck: jeden terminal do całej floty agentów i osobny agent, który ich pilnuje

4 min

AgentDeck to otwartoźródłowe narzędzie w Go, które zbiera całą flotę agentów kodujących w jednym terminalu: każda sesja dostaje kolorową kropkę stanu, fork dziedziczący rozmowę i własny worktree gita, a klawisz "$" pokazuje koszty czternastu modeli. Najciekawszy jest jednak dyrygent, osobny agent stale pilnujący reszty, który sam odpowiada na rutynowe pytania, a ważniejsze przerzuca na Telegram albo Slack. To kuszący wzorzec, ale projekt jednej osoby, a wiedza pochodzi z README, nie z produkcji, więc kluczowe pytanie, co dzieje się, gdy dyrygent się myli, pozostaje bez odpowiedzi.

Datalab otwiera Lift: model 9B, który wyciąga JSON z PDF-ów lokalnie Premiera / Narzędzie

Datalab otwiera Lift: model 9B, który wyciąga JSON z PDF-ów lokalnie

4 min

Datalab udostępnił na open source Lift, wizyjny model o dziewięciu miliardach parametrów, który z PDF-a i podanego schematu zwraca gotowy obiekt JSON, działając lokalnie na jednej karcie graficznej. Dzięki dekodowaniu ograniczonemu schematem wynik nie potrafi wyłamać się z formatu, a na zestawie 225 dokumentów model trafia w 90,2 procent pól w 9,5 sekundy, bijąc Azure Content Understanding (83,4 procent, 73,7 sekundy). Haczyk to inna liczba: bezbłędnie domyka tylko 20,9 procent całych dokumentów, więc świetnie nadaje się do pracy z człowiekiem w pętli, ale nie do pełnej automatyzacji.

Cursor wpada w ręce SpaceX. Pytanie nie brzmi za ile, tylko jaki model będzie domyślny Premiera / Narzędzie

Cursor wpada w ręce SpaceX. Pytanie nie brzmi za ile, tylko jaki model będzie domyślny

3 min

SpaceX kupuje Anysphere, twórcę edytora Cursor, za 60 miliardów dolarów w akcjach, cztery dni po debiucie giełdowym za 75 miliardów. Dla piszących kod liczy się jednak nie kwota, tylko to, czy Cursor zachowa neutralność wobec dostawcy modelu, skoro SpaceX wchłonął już xAI i zapowiada własny model oraz agenta Grok Build. Pokusa, by ustawić Groka domyślnie, jest oczywista, bo dział tracił w 2025 roku 6,35 miliarda dolarów. Po stronie plusów stoi superkomputer Colossus, który może przyspieszyć trenowanie modeli pod Cursora. Domknięcie planowane na trzeci kwartał 2026 roku.

Wąskie gardło przesunęło się z pisania kodu na jego wypuszczanie Premiera / Narzędzie

Wąskie gardło przesunęło się z pisania kodu na jego wypuszczanie

5 min

Gdy agent generuje kod szybciej, niż recenzenci zdążą go sprawdzić, wąskie gardło przenosi się z pisania na recenzję, testy i samo wydanie. AWS odpowiada podglądem nowych funkcji w DevOps Agent: przegląd gotowości prześwietla każdą zmianę przed scaleniem, uruchamia kod w izolowanym środowisku i wydaje jedną z trzech ocen, od zablokowania po bezpieczne wydanie. Druga funkcja sama układa testy skrojone pod konkretną zmianę, a integracja z edytorem Kiro przez protokół MCP pozwala przejść od alarmu do gotowej poprawki bez wychodzenia z edytora. To jednak dopiero podgląd w regionie US East.

Ile agentów kodujących utrzyma jeden megawat? Wreszcie jest na to pomiar Premiera / Narzędzie

Ile agentów kodujących utrzyma jeden megawat? Wreszcie jest na to pomiar

4 min

Artificial Analysis uruchomiło AA-AgentPerf, pierwszy benchmark sprzętowy mierzący nie pojedyncze zapytanie do modelu, lecz pracę agenta kodującego rozłożoną na nawet 200 tur i ponad 100 tysięcy tokenów kontekstu. Kluczowa miara to liczba agentów na megawat, bo to pobór prądu, nie same karty, ogranicza dziś rozbudowę. NVIDIA chwali się, że rackowy GB300 NVL72 utrzymuje do 20 razy więcej agentów na megawat niż H200, ale tę liczbę warto czytać z gwiazdką: zwycięskie konfiguracje stroił producent, a punkt odniesienia składał zespół benchmarku z zapasem wydajności.