Premiera / Narzędzie
Microsoft trenuje prompty agentów tak, jak trenuje się sieci neuronowe
Microsoft Research wypuścił SkillOpt, narzędzie, które zamiast dotrenowywać model, trenuje sam plik z instrukcją dla agenta. Osobny optymalizator proponuje zmiany w dokumencie i zachowuje tylko te, które realnie podnoszą wynik na odłożonym zbiorze zadań walidacyjnych. Na sześciu benchmarkach i siedmiu modelach SkillOpt wypada najlepiej lub na równi we wszystkich 52 przypadkach, a na GPT-5.5 dorzuca średnio ponad 23 punkty skuteczności. Efektem jest jeden plik best_skill.md, bez dodatkowych kosztów w trakcie pracy. Wyniki pochodzą jednak od autorów metody.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 4 min ·
Kiedy agent AI pisze kod gorzej, niż byśmy chcieli, klasyczna odpowiedź brzmi: dotrenuj model. Zbierz dane, wynajmij maszyny i przelicz wagi sieci neuronowej, te miliardy liczb, od których zależy, co model odpowie. Microsoft Research proponuje coś innego. Zamiast ruszać model, SkillOpt trenuje sam dokument z instrukcjami, zwykły plik tekstowy, który mówi agentowi, jak ma podejść do zadania. Model zostaje zamrożony, nietknięty. Zmienia się tylko tekst, który dostaje na wejściu.
To jest ta jedna rzecz, która mnie tu przekonuje. Większość "umiejętności" dla agentów powstaje dziś ręcznie albo modelowi każe się napisać sobie instrukcję jednym strzałem, albo pozwala się jej ewoluować w luźno kontrolowanej pętli samopoprawek. Żadne z tych podejść nie zachowuje się jak prawdziwy optymalizator i żadne nie gwarantuje, że końcowa wersja będzie lepsza od startowej. SkillOpt traktuje plik z instrukcją jak parametr, który się trenuje, i pożycza całą dyscyplinę znaną z uczenia sieci: epoki, wielkość paczki danych, coś w rodzaju współczynnika uczenia, no i bramki walidacyjne.
Pętla, która edytuje tekst i odrzuca to, co nie pomaga
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.