SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Zamiast pompować parametry, wydłużyli horyzont treningu agenta

InternScience pokazuje Agents-A1 — otwarty model o 35 miliardach parametrów, który na kilku benchmarkach dorównuje gigantom z bilionem parametrów, jak Kimi-K2.6 czy DeepSeek-V4-pro. Zamiast powiększać model, autorzy wydłużyli horyzont treningu, ucząc go na bardzo długich przebiegach i przelewając wiedzę sześciu wyspecjalizowanych nauczycieli do jednego ucznia. Przewaga leży jednak głównie w zadaniach naukowych, a nie w kodowaniu, a wszystkie liczby pochodzą od samych autorów i czekają na niezależne powtórzenie.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  3 min  · 

Zamiast pompować parametry, wydłużyli horyzont treningu agenta
Ilustrację przygotowała AI.

Przez ostatnie dwa lata w modelach agentowych obowiązywała prosta zasada: jeśli chcesz, żeby model dłużej i sensowniej prowadził wieloetapowe zadanie, dokładasz parametry. Najmocniejsze modele do pracy agentowej mają dziś bilion parametrów i więcej. Zespół InternScience proponuje w świeżej pracy na arXiv inną drogę. Ich model, Agents-A1, ma 35 miliardów parametrów, jest otwarty, a mimo to na kilku benchmarkach dorównuje modelom z bilionem parametrów, takim jak Kimi-K2.6 czy DeepSeek-V4-pro. Zamiast powiększać model, autorzy rozciągnęli to, co nazywają horyzontem agenta.

Zacznę od tego, co da się realnie sprawdzić, bo to najmocniejsza część tej historii. Wagi modelu i kod do testów leżą na HuggingFace i na GitHubie, więc każdy może je pobrać i uruchomić u siebie. To rzadkość przy takich zapowiedziach i właśnie to odróżnia tę pracę od kolejnego efektownego wykresu w prezentacji.

Co znaczy "rozciąganie horyzontu"

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Trenować agenta w tym samym narzędziu, w którym ma działać? Orchard to pokazuje Premiera / Narzędzie

Trenować agenta w tym samym narzędziu, w którym ma działać? Orchard to pokazuje

3 min

Microsoft Research udostępnił Orchard, otwarty framework, który trenuje agenta do kodu w tym samym narzędziu, w którym ten potem realnie działa, zamiast na uproszczonej atrapie. Sama zmiana miejsca nauki podniosła skuteczność asystenta w harnessie Codex z 18,6% do 51,5%, a osobny model dobierający najlepsze rozwiązanie dobił wynik do 73% na SWE-bench Verified przy 3 miliardach aktywnych parametrów. Nie kupuję jednak narracji o magii małego modelu: punkt wyjścia to 61,4%, a za resztą stoi drogi potok treningowy i 107 tysięcy zapisów pracy dwóch większych modeli z otwartymi wagami.

Stare logi agenta jako poligon dla nowej strategii szukania Premiera / Narzędzie

Stare logi agenta jako poligon dla nowej strategii szukania

4 min

Dream-RSI od Google DeepMind, mimo groźnej etykiety rekurencyjnego samodoskonalenia, nie zmienia samego modelu, tylko strategię, według której agent programistyczny rozdziela próby między ścieżki rozwiązań, a ćwiczy ją na nagraniach starych przebiegów. W najlepszym zadaniu na GPU dało to 2,43 raza mniej prób. Niezależne eksperymenty TheAstrayDev pokazują jednak, że przygotowanie potrafi kosztować 100 zapytań zamiast 24, a spłata przychodzi dopiero po około 48 podobnych zadaniach, więc na razie najwięcej daje zapisywanie całej ścieżki decyzji agenta.

Agent robi 2,4 razy więcej, kiedy wie, czego chcesz Analiza / Opinia

Agent robi 2,4 razy więcej, kiedy wie, czego chcesz

5 min

Anthropic prześwietlił około 400 tysięcy sesji Claude Code i odkrył, że na ten sam prompt agent wykonuje ekspertowi 2,4 raza więcej działań niż nowicjuszowi. O wyniku decyduje nie znajomość składni, tylko wiedza o dziedzinie: prawnik czy księgowy, który wie, jak ma wyglądać poprawny wynik, wypada równie dobrze co programista. Przewaga otwiera się najszerzej wtedy, gdy sesja się sypie, bo doświadczony użytkownik wychodzi z błędów, zamiast porzucić terminal. Sama firma przyznaje, że nie wie, czy ten kod trafia do użytku, a dane pomijają konkurencyjne narzędzia.