SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Z 6% na 75% bez dotykania modelu: co AMD zmieniło w swoich agentach

AMD puściło agenty na zgłoszenia błędów z panelu sterowników Radeona w październiku 2025, domykały wtedy 6% z nich, a w czerwcu 2026 już ponad 75%, choć nikt po drodze nie tknął modelu. Zamiast dotrenowywać, zespół przestał tłumaczyć agentom, jak naprawić usterkę, i zaczął stawiać warunek końcowy, do którego drogę wybierają same, z prawem do kilku podejść i z pętlą wracających wniosków z nieudanych prób. Zgłoszenia z RSX są wąskie i powtarzalne, więc te 75% nic nie mówi o twoim repozytorium, ale sam mechanizm działa wszędzie tam, gdzie da się jasno zdefiniować kryterium sukcesu.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Z 6% na 75% bez dotykania modelu: co AMD zmieniło w swoich agentach
Ilustrację przygotowała AI.

W październiku 2025 AMD puściło gotowe agenty na zgłoszenia błędów z panelu, w którym użytkownik karty Radeon ustawia sterownik i sprawdza, co ten wyprawia. Panel nazywa się Radeon Software eXperience, w firmie po prostu RSX. Agenty zamknęły wtedy 6% zgłoszeń. W czerwcu 2026 ten sam proces domykał już ponad 75%, a po drodze nikt nie tknął modelu.

Ta druga liczba robi wrażenie, ale mnie bardziej interesuje droga między nimi. Zamiast dotrenowywać model, zespół przepisał agentom cele: przestał im tłumaczyć, jak naprawić usterkę, a zaczął stawiać warunek końcowy. AMD nie opisuje, jak dokładnie ten warunek brzmi, poza tym, że agent sprawdza każde podejście pod kątem zdefiniowanego kryterium sukcesu. Drogę do tego celu ustala sam i wolno mu próbować kilka razy pod rząd.

Doszła do tego pętla, na początku w dużej mierze ręczna, w której ludzie rozkładali nieudane próby na czynniki, a wnioski wracały do kolejnych uruchomień. Andrej Zdravkovic, starszy wiceprezes w AMD i autor tego opisu, uczciwie dodaje, że część wzrostu wzięła się po prostu z lepszych modeli i lepszych warstw, które je obudowują.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Wiedza AMD o własnych kartach trafia wprost do Claude Code i Cursora Premiera / Narzędzie

Wiedza AMD o własnych kartach trafia wprost do Claude Code i Cursora

5 min

AMD wpuściło wiedzę o swoich kartach prosto do narzędzi, w których programiści spędzają dzień: razem z ROCm 10 pakiet AMD Skills trafił do katalogów Claude Code, Cursora i Codex, więc asystent nie zgaduje, jak sprofilować aplikację na kartach Instinct. Reklamowana średnio 3,3x szybsza inferencja to jednak porównanie ROCm 7.0 z konfiguracją wystrojoną przez producenta, a benchmark AgentX od SemiAnalysis pokazuje, że na modelu GLM 5.3 ten sam token bywa u NVIDII nawet 5x tańszy. Z trzech nowości bronią się Skills, bo agent przepisze kernel, ale nie dopisze funkcji, której nie ma w sterowniku.

Ponad 20% drożej i ani jednego zadania więcej Analiza / Opinia

Ponad 20% drożej i ani jednego zadania więcej

3 min

Zespół z laboratorium SRI na ETH w Zurychu sprawdził, czy pliki kontekstowe w repozytorium, jak AGENTS.md, realnie pomagają agentom do programowania, i wyszło, że nie: skuteczność mierzona odsetkiem ukończonych zadań ani drgnęła, a rachunek za pracę agenta urósł o ponad 20%. Wynik trzyma się także wtedy, gdy kontekst pisali ręcznie sami deweloperzy, nie tylko model. Pliki zmieniają zachowanie agenta: więcej testuje i dokładniej przegląda repozytorium, co spala tokeny, ale nie zamyka więcej zgłoszeń. Autorzy nie każą wyrzucać AGENTS.md, tylko skrócić go do rzeczy, których agent sam nie zgadnie.

Agenty gubią się w cudzym systemie, nie w składni Analiza / Opinia

Agenty gubią się w cudzym systemie, nie w składni

4 min

Real-SWE mierzy agenty na produkcyjnym kodzie licencjonowanym od prawdziwych firm, którego nie było w danych treningowych, i wyszło z tego 640 przebiegów ze średnią 26,9%, przy najlepszym wyniku 38,8% dla Fable 5.1 w Claude Code. Z 468 porażek tylko 5,1% to zepsuty kod, a 40,6% to pominięty wymóg, czyli instrukcja, której agent nie doczytał do końca. Kolejność w tabeli i tak niewiele znaczy, bo przedziały ufności czołówki nachodzą na siebie, a każdy model biegł w harnessie swojego producenta. Jedyna liczba, która cokolwiek rozstrzyga, to ta zmierzona na twoim repozytorium.