Analiza / Opinia
Praca z arXiv obiecuje tańszą pamięć agentów bez spadku dokładności
Nowa praca na arXiv, zgłoszona 23 lipca przez Gaurava Dadhicha z zespołu Maximem AI, przekonuje, że produkcyjne agenty zawodzą nie przez słabe rozumowanie, lecz przez brak panowania nad kontekstem: historią rozmowy, rozdętymi promptami i wynikami narzędzi. Najcenniejsza jest tu diagnoza kosztu: naiwne doklejanie historii rośnie kwadratowo, streszczanie na skróty tnie liniowo, ale ma swoje urwisko dokładności, a rozsądnym wyjściem jest kompresja z walidacją. Wyniki 92% na LongMemEval i 93,2% na LoCoMo firma zmierzyła jednak sama, na własnym produkcie Maximem Synap i bez punktu odniesienia.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Analiza / Opinia · 4 min ·
Agent, który pracuje dłużej niż kilka minut, wpada zwykle w tę samą pułapkę. Z każdą turą dokłada do kontekstu kolejny kawałek rozmowy, wynik wywołanego narzędzia potrafi wrócić jako wielki blok tekstu i zostać tam już na stałe, a całą tę rosnącą stertę agent wysyła do modelu od nowa, płacąc za każdy token jeszcze raz. Mimo to gubi coś, co sam ustalił dziesięć kroków wcześniej. Im dłużej działa, tym jest droższy i tym bardziej roztargniony.
Nowa praca na arXiv, zgłoszona 23 lipca przez Gaurava Dadhicha z zespołu Maximem AI, stawia tezę, że produkcyjne agenty zawodzą nie dlatego, że kiepsko rozumują, tylko dlatego, że nie panują nad tym, co mają akurat w głowie: historią rozmowy, rozdętymi promptami, definicjami narzędzi i puchnącymi wynikami tych narzędzi. Dominujące podejście traktuje to jak problem magazynowania i wyszukiwania, czyli gdzieś zapisać i w porę wyciągnąć. Autorzy uważają, że to za wąsko, bo panowanie nad pamięcią agenta jest procesem o wielu etapach, a nie tylko szufladą, z której się coś wyjmuje.
Rachunek, który rośnie kwadratowo
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.