Premiera / Narzędzie
Harness decyduje o rachunku za agenta bardziej niż sam model
TrueFoundry wypuściło 19 sierpnia TrueForge, otwarty harness agentowy na licencji MIT, obiecując o połowę niższe koszty, choć takiej liczby nie ma w benchmarku opublikowanym razem z kodem. Na 14 zadaniach z Enterprise-Bench przy tym samym Opusie 4.8 TrueForge dorównał skutecznością Claude Managed Agents za 8,5 dolara na uruchomienie zamiast 11,8, bo przycina kontekst i zużył 4 miliony tokenów zamiast 10. Drugą oszczędność, do 2,9 dolara, zrobiła podmiana modelu na otwarty GLM-5.2, a nie sam harness, a obiecana kontrola kosztów i uprawnień działa dopiero przez komercyjny AI Gateway.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 5 min ·
TrueFoundry wypuściło 19 sierpnia TrueForge, otwarty harness agentowy na licencji MIT, i od razu ustawiło go naprzeciwko Claude Managed Agents, hostowanej usługi Anthropica do prowadzenia agentów w produkcji. W nagłówku komunikatu prasowego stoi obietnica cięcia kosztów o połowę, ale to tylko hasło, a nie wynik testu: w benchmarku opublikowanym razem z kodem liczby 50% nie ma. Są za to dwie inne, zmierzone osobno, i to one, a nie nagłówek, pokazują, gdzie naprawdę robi się oszczędność.
Całą brudną robotę wokół modelu robi harness, program, który steruje jego pracą od pierwszego polecenia do ostatniego wywołania narzędzia. Rozpisuje polecenie na plan, pamięta przebieg sesji, przycina rozmowę, gdy przestaje się mieścić w oknie kontekstowym, odpala kod w izolowanym sandboksie i zatrzymuje się, żeby zapytać człowieka, zanim zrobi coś nieodwracalnego. Brzmi jak hydraulika i w kodzie tak właśnie wygląda, tyle że to ona ustala rachunek: przy każdym wywołaniu narzędzia cała narosła do tej pory rozmowa leci do modelu jeszcze raz, od początku, więc o cenie odpowiedzi agenta decyduje warstwa sterująca, a nie sam model.
Dwie oszczędności sklejone w jedną liczbę
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.