SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Trenować agenta w tym samym narzędziu, w którym ma działać? Orchard to pokazuje

Microsoft Research udostępnił Orchard, otwarty framework, który trenuje agenta do kodu w tym samym narzędziu, w którym ten potem realnie działa, zamiast na uproszczonej atrapie. Sama zmiana miejsca nauki podniosła skuteczność asystenta w harnessie Codex z 18,6% do 51,5%, a osobny model dobierający najlepsze rozwiązanie dobił wynik do 73% na SWE-bench Verified przy 3 miliardach aktywnych parametrów. Nie kupuję jednak narracji o magii małego modelu: punkt wyjścia to 61,4%, a za resztą stoi drogi potok treningowy i 107 tysięcy zapisów pracy dwóch większych modeli z otwartymi wagami.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  3 min  · 

Trenować agenta w tym samym narzędziu, w którym ma działać? Orchard to pokazuje
Ilustrację przygotowała AI.

Agenta do pisania kodu trenuje się zwykle w uproszczonym środowisku: model dostaje zadanie, coś generuje i na końcu słyszy tylko, czy testy przeszły, czy nie. Potem trafia do prawdziwego narzędzia, takiego jak Codex, które prowadzi go przez wiele tur rozmowy, wywołania narzędzi i stan całej sesji. I zaczyna się zachowywać inaczej, bo uczył się w innym świecie niż ten, w którym ma pracować. Microsoft Research nazywa tę lukę rozjazdem między trenowaniem a wdrożeniem i udostępnił otwarty framework, który ma ją zasypać. Nazywa się Orchard, a pomysł, który za nim stoi, nie dotyczy wielkości modelu, tylko tego, gdzie agent się uczy.

Trenowanie w tym samym narzędziu, w którym agent potem pracuje

Wokół modelu prawie zawsze narasta warstwa, którą w branży nazywa się harness: to ona pilnuje kolejnych tur rozmowy, decyduje, z jakich narzędzi agent może skorzystać, i trzyma stan jego pracy. Otwarte narzędzia do trenowania zwykle nie radzą sobie z taką warstwą, więc badacze uczyli model na uproszczonej atrapie, a wdrażali w prawdziwej. Orchard wpina się prosto w harness: lekki pośrednik zapisuje wywołania modelu, które robi samo narzędzie, jako dane treningowe, a każdy przebieg dzieje się w osobnym kontenerze. Dzięki temu agenta można wytrenować od początku do końca w tym samym Codeksie czy innym narzędziu, w którym potem realnie działa.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Co, jeśli lepszy agent nie potrzebuje większego modelu, tylko lepszego harnessu? Premiera / Narzędzie

Co, jeśli lepszy agent nie potrzebuje większego modelu, tylko lepszego harnessu?

3 min

HarnessX, otwarty framework Darwin Agent na licencji MIT, traktuje harness — warstwę wokół modelu, która decyduje o narzędziach, pamięci i kontekście — jako wymienny klocek, ulepszany osobno od samych wag. Na Qwenie 3.5 9B sama przebudowa harnessu podnosi wynik na GAIA z 33,97% do 41,67%, a douczenie modelu RL-em dociąga go do 55,77%; ten sam schemat na GPT-5 idzie z 62% do 84%. Skłaniam się ku tezie, że architektura agenta to dźwignia, po którą sięga się za rzadko, ale liczby podał sam autor na jednym benchmarku, w wersji 0.1.0 beta, i wciąż czekają na niezależne powtórzenie.

Zamiast pompować parametry, wydłużyli horyzont treningu agenta Model / Badania

Zamiast pompować parametry, wydłużyli horyzont treningu agenta

3 min

InternScience pokazuje Agents-A1 — otwarty model o 35 miliardach parametrów, który na kilku benchmarkach dorównuje gigantom z bilionem parametrów, jak Kimi-K2.6 czy DeepSeek-V4-pro. Zamiast powiększać model, autorzy wydłużyli horyzont treningu, ucząc go na bardzo długich przebiegach i przelewając wiedzę sześciu wyspecjalizowanych nauczycieli do jednego ucznia. Przewaga leży jednak głównie w zadaniach naukowych, a nie w kodowaniu, a wszystkie liczby pochodzą od samych autorów i czekają na niezależne powtórzenie.

Microsoft trenuje prompty agentów tak, jak trenuje się sieci neuronowe Premiera / Narzędzie

Microsoft trenuje prompty agentów tak, jak trenuje się sieci neuronowe

4 min

Microsoft Research wypuścił SkillOpt, narzędzie, które zamiast dotrenowywać model, trenuje sam plik z instrukcją dla agenta. Osobny optymalizator proponuje zmiany w dokumencie i zachowuje tylko te, które realnie podnoszą wynik na odłożonym zbiorze zadań walidacyjnych. Na sześciu benchmarkach i siedmiu modelach SkillOpt wypada najlepiej lub na równi we wszystkich 52 przypadkach, a na GPT-5.5 dorzuca średnio ponad 23 punkty skuteczności. Efektem jest jeden plik best_skill.md, bez dodatkowych kosztów w trakcie pracy. Wyniki pochodzą jednak od autorów metody.