SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Trzy frameworki, które każą maszynie pisać własne prompty i skille

Trzy czerwcowe projekty open-source, GEPA, EvoSkill i Self-Harness, oddają maszynie to, co dotąd pisał inżynier: prompt, umiejętności agenta i reguły jego działania. Pętla ewolucyjna sama generuje warianty, ocenia je i zachowuje najlepsze, obiecując kilkudziesięcioprocentowy skok skuteczności bez dotykania wag modelu; GEPA podbił GPT-4.1 Mini na zadaniach AIME z 46,6% do 56,6% przy 100 do 500 prób zamiast tysięcy. Działa to jednak tylko tam, gdzie wynik da się tanio i jednoznacznie zmierzyć, więc nowa rola człowieka to napisać dobrą miarę, a nie cyzelować pojedyncze zdanie.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  5 min  · 

Trzy frameworki, które każą maszynie pisać własne prompty i skille
Ilustrację przygotowała AI.

Przez ostatni rok prompt do agenta poprawiał się tak samo, jak debuguje się każdy uparcie psujący się kod: patrzysz, gdzie pada, zmieniasz jedno zdanie w instrukcji, odpalasz jeszcze raz i masz nadzieję, że tym razem przejdzie. To robota na czucie, oparta na kilku zauważonych wpadkach. W czerwcu wyszły trzy projekty open-source, które tę robotę próbują oddać samej maszynie: GEPA, EvoSkill i Self-Harness. Każdy z nich bierze pętlę ewolucyjną, w której wariant się zmienia, dostaje ocenę i przeżywa albo ginie, i puszcza ją na to, co dotąd pisał człowiek: na prompt, na zestaw umiejętności agenta, na same reguły, według których agent działa. Wszystkie trzy obiecują kilkudziesięcioprocentowy skok skuteczności bez dotykania wag modelu. I wszystkie trzy działają naprawdę dobrze tylko tam, gdzie umiesz tanio i jednoznacznie zmierzyć, czy agent zrobił zadanie dobrze. Tam, gdzie tej miary nie ma, pętla nie ma czego optymalizować, i to jest linia, po której będę je oceniał.

Zacznę od GEPA, bo to on wyznacza wzorzec. Klasyczny optymalizator promptów wie, że dany wariant zawiódł, ale nie wie dlaczego, więc próbuje na ślepo kolejnych wersji. GEPA odwraca to: po każdej próbie zapisuje pełny ślad wykonania, czyli komunikaty błędów, logi rozumowania, wyjście profilera, a potem oddaje ten ślad drugiemu modelowi, żeby przeczytał go jak diagnosta i wprost opisał, co poszło nie tak. Dopiero z tej diagnozy powstaje nowa wersja promptu. Twórcy nazywają tę zwrotną informację z ewaluatora odpowiednikiem gradientu, tyle że zapisanym słowami zamiast liczbami, i to jest sedno pomysłu: model dostaje konkretny trop, na którym ma się poprawić, bo uczy się na zdaniu "zgubiłeś warunek z treści zadania", a nie na samym sygnale "źle". Wyniki, które GEPA pokazuje, robią wrażenie głównie dlatego, że dochodzi do nich za grosze: według dokumentacji projektu potrzebuje 100 do 500 prób tam, gdzie uczenie ze wzmocnieniem zżera ich od kilku do kilkudziesięciu tysięcy. Sam efekt też widać, bo na konkursowym zbiorze zadań matematycznych AIME GPT-4.1 Mini podbił z 46,6% do 56,6% bez tknięcia wag modelu. Tobi Lutke, prezes Shopify, napisał wprost, że GEPA jest "mocno niedoceniany" w świecie inżynierii kontekstu, a sam projekt chwali się ponad pięćdziesięcioma wdrożeniami produkcyjnymi.

EvoSkill, zbudowany przez Sentient Labs, bierze ten sam mechanizm i rozciąga go z jednego promptu na całego agenta. Zamiast poprawiać jedną instrukcję w miejscu, proponuje naraz kilka nowych umiejętności i zmian w prompcie, sprawdza każdy wariant na odłożonych danych i z każdej iteracji robi osobny, kompletny program agenta. Najciekawszy jest sposób, w jaki je przechowuje: każdy wariant ląduje na własnym branchu gita, program/iter-skill-2 obok program/iter-skill-3, a do następnej rundy przechodzą tylko te najlepsze, których nie da się poprawić na jednym froncie bez psucia wyniku na innym. Człowiek patrzy w trakcie na żywą tabelkę, gdzie skuteczność rośnie z 42% do 51,3% i wariant dostaje gwiazdkę "nowy najlepszy" albo etykietę "odrzucony". Wypracowane umiejętności to zwykłe foldery z instrukcją i skryptami pomocniczymi, które wchodzą do Claude Code, Codex, Goose czy OpenHands. Pisałem w kwietniu o Agent Skills Addy'ego Osmaniego z Google'a, gdzie te foldery z procesami i z opisem typowych wpadek agenta pisał ręcznie żywy inżynier; EvoSkill to ta sama półka z umiejętnościami, tyle że zapełniana przez maszynę z analizy własnych porażek.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Microsoft wypuszcza SkillOpt, narzędzie do trenowania promptów bez ruszania modelu Premiera / Narzędzie

Microsoft wypuszcza SkillOpt, narzędzie do trenowania promptów bez ruszania modelu

3 min

Microsoft wypuścił na GitHubie SkillOpt, narzędzie na licencji MIT, które nie dotyka modelu, tylko po kolei poprawia plik z instrukcjami wczytywany przez agenta na starcie zadania. Zmiany proponuje osobny model-optymalizator, ale żadna nie wchodzi do pliku, dopóki nie udowodni na odłożonym zbiorze zadań, że realnie podnosi wynik. Repozytorium chwali się rezultatem najlepszym lub na równi w 52 z 52 układów i ponad 23 punktami skuteczności na GPT-5.5. Wydanie 0.2.0 dokłada nocny silnik SkillOpt-Sleep, ale to część eksperymentalna, a liczb nikt spoza Microsoftu jeszcze nie potwierdził.

Microsoft trenuje prompty agentów tak, jak trenuje się sieci neuronowe Premiera / Narzędzie

Microsoft trenuje prompty agentów tak, jak trenuje się sieci neuronowe

4 min

Microsoft Research wypuścił SkillOpt, narzędzie, które zamiast dotrenowywać model, trenuje sam plik z instrukcją dla agenta. Osobny optymalizator proponuje zmiany w dokumencie i zachowuje tylko te, które realnie podnoszą wynik na odłożonym zbiorze zadań walidacyjnych. Na sześciu benchmarkach i siedmiu modelach SkillOpt wypada najlepiej lub na równi we wszystkich 52 przypadkach, a na GPT-5.5 dorzuca średnio ponad 23 punkty skuteczności. Efektem jest jeden plik best_skill.md, bez dodatkowych kosztów w trakcie pracy. Wyniki pochodzą jednak od autorów metody.

Microsoft otwiera agenta, który czyta repozytorium, zanim napisze testy Premiera / Narzędzie

Microsoft otwiera agenta, który czyta repozytorium, zanim napisze testy

4 min

Microsoft udostępnił na licencji MIT agenta code-testing-generator, który zanim napisze testy jednostkowe, przeszukuje repozytorium, wykrywa język i framework oraz ustala prawdziwe komendy budowania. Na wewnętrznym benchmarku ze 152 zadań zaliczył 140 wobec 120 Copilota na tym samym modelu, czyli o 63% mniej porażek. Cały zysk skupia się w ogólnikowych poleceniach typu „napisz testy”, gdzie liczba porażek spadła z 30 do 10; przy szczegółowych promptach oba wypadły tak samo. To nie przełom, tylko porządne rusztowanie automatyzujące nudne rozeznanie pomijane przy jednej linijce polecenia.