SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Microsoft trenuje prompty agentów tak, jak trenuje się sieci neuronowe

Microsoft Research wypuścił SkillOpt, narzędzie, które zamiast dotrenowywać model, trenuje sam plik z instrukcją dla agenta. Osobny optymalizator proponuje zmiany w dokumencie i zachowuje tylko te, które realnie podnoszą wynik na odłożonym zbiorze zadań walidacyjnych. Na sześciu benchmarkach i siedmiu modelach SkillOpt wypada najlepiej lub na równi we wszystkich 52 przypadkach, a na GPT-5.5 dorzuca średnio ponad 23 punkty skuteczności. Efektem jest jeden plik best_skill.md, bez dodatkowych kosztów w trakcie pracy. Wyniki pochodzą jednak od autorów metody.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Microsoft trenuje prompty agentów tak, jak trenuje się sieci neuronowe
Ilustrację przygotowała AI.

Kiedy agent AI pisze kod gorzej, niż byśmy chcieli, klasyczna odpowiedź brzmi: dotrenuj model. Zbierz dane, wynajmij maszyny i przelicz wagi sieci neuronowej, te miliardy liczb, od których zależy, co model odpowie. Microsoft Research proponuje coś innego. Zamiast ruszać model, SkillOpt trenuje sam dokument z instrukcjami, zwykły plik tekstowy, który mówi agentowi, jak ma podejść do zadania. Model zostaje zamrożony, nietknięty. Zmienia się tylko tekst, który dostaje na wejściu.

To jest ta jedna rzecz, która mnie tu przekonuje. Większość "umiejętności" dla agentów powstaje dziś ręcznie albo modelowi każe się napisać sobie instrukcję jednym strzałem, albo pozwala się jej ewoluować w luźno kontrolowanej pętli samopoprawek. Żadne z tych podejść nie zachowuje się jak prawdziwy optymalizator i żadne nie gwarantuje, że końcowa wersja będzie lepsza od startowej. SkillOpt traktuje plik z instrukcją jak parametr, który się trenuje, i pożycza całą dyscyplinę znaną z uczenia sieci: epoki, wielkość paczki danych, coś w rodzaju współczynnika uczenia, no i bramki walidacyjne.

Pętla, która edytuje tekst i odrzuca to, co nie pomaga

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Microsoft wypuszcza SkillOpt, narzędzie do trenowania promptów bez ruszania modelu Premiera / Narzędzie

Microsoft wypuszcza SkillOpt, narzędzie do trenowania promptów bez ruszania modelu

3 min

Microsoft wypuścił na GitHubie SkillOpt, narzędzie na licencji MIT, które nie dotyka modelu, tylko po kolei poprawia plik z instrukcjami wczytywany przez agenta na starcie zadania. Zmiany proponuje osobny model-optymalizator, ale żadna nie wchodzi do pliku, dopóki nie udowodni na odłożonym zbiorze zadań, że realnie podnosi wynik. Repozytorium chwali się rezultatem najlepszym lub na równi w 52 z 52 układów i ponad 23 punktami skuteczności na GPT-5.5. Wydanie 0.2.0 dokłada nocny silnik SkillOpt-Sleep, ale to część eksperymentalna, a liczb nikt spoza Microsoftu jeszcze nie potwierdził.

Microsoft otwiera agenta, który czyta repozytorium, zanim napisze testy Premiera / Narzędzie

Microsoft otwiera agenta, który czyta repozytorium, zanim napisze testy

4 min

Microsoft udostępnił na licencji MIT agenta code-testing-generator, który zanim napisze testy jednostkowe, przeszukuje repozytorium, wykrywa język i framework oraz ustala prawdziwe komendy budowania. Na wewnętrznym benchmarku ze 152 zadań zaliczył 140 wobec 120 Copilota na tym samym modelu, czyli o 63% mniej porażek. Cały zysk skupia się w ogólnikowych poleceniach typu „napisz testy”, gdzie liczba porażek spadła z 30 do 10; przy szczegółowych promptach oba wypadły tak samo. To nie przełom, tylko porządne rusztowanie automatyzujące nudne rozeznanie pomijane przy jednej linijce polecenia.

Plik SKILL.md nie uczy agenta faktów, tylko pilnuje kolejności kroków Analiza / Opinia

Plik SKILL.md nie uczy agenta faktów, tylko pilnuje kolejności kroków

4 min

Zhiyuan Jiang i jego zespół zebrali 8135 kontrolowanych prób i ręcznie opisali 240 przebiegów, żeby sprawdzić, dlaczego pliki SKILL.md podnoszą skuteczność agentów: w 65,7% przypadków umiejętność działa jako kotwica proceduralna, a podanie faktu, którego model nie znał, tłumaczy raptem 4,5%. Trafność sięgnięcia po właściwy plik leci z 29,6% przy pięciu umiejętnościach do 3,3% przy stu, choć skuteczność w zadaniach zostaje stabilna, bo agentowi wystarcza sąsiedni plan. Wniosek jest taki, że robotę robi ponumerowana lista kroków, a nie opis kontekstu projektu.