SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Harness decyduje o rachunku za agenta bardziej niż sam model

TrueFoundry wypuściło 19 sierpnia TrueForge, otwarty harness agentowy na licencji MIT, obiecując o połowę niższe koszty, choć takiej liczby nie ma w benchmarku opublikowanym razem z kodem. Na 14 zadaniach z Enterprise-Bench przy tym samym Opusie 4.8 TrueForge dorównał skutecznością Claude Managed Agents za 8,5 dolara na uruchomienie zamiast 11,8, bo przycina kontekst i zużył 4 miliony tokenów zamiast 10. Drugą oszczędność, do 2,9 dolara, zrobiła podmiana modelu na otwarty GLM-5.2, a nie sam harness, a obiecana kontrola kosztów i uprawnień działa dopiero przez komercyjny AI Gateway.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  5 min  · 

Harness decyduje o rachunku za agenta bardziej niż sam model
Ilustrację przygotowała AI.

TrueFoundry wypuściło 19 sierpnia TrueForge, otwarty harness agentowy na licencji MIT, i od razu ustawiło go naprzeciwko Claude Managed Agents, hostowanej usługi Anthropica do prowadzenia agentów w produkcji. W nagłówku komunikatu prasowego stoi obietnica cięcia kosztów o połowę, ale to tylko hasło, a nie wynik testu: w benchmarku opublikowanym razem z kodem liczby 50% nie ma. Są za to dwie inne, zmierzone osobno, i to one, a nie nagłówek, pokazują, gdzie naprawdę robi się oszczędność.

Całą brudną robotę wokół modelu robi harness, program, który steruje jego pracą od pierwszego polecenia do ostatniego wywołania narzędzia. Rozpisuje polecenie na plan, pamięta przebieg sesji, przycina rozmowę, gdy przestaje się mieścić w oknie kontekstowym, odpala kod w izolowanym sandboksie i zatrzymuje się, żeby zapytać człowieka, zanim zrobi coś nieodwracalnego. Brzmi jak hydraulika i w kodzie tak właśnie wygląda, tyle że to ona ustala rachunek: przy każdym wywołaniu narzędzia cała narosła do tej pory rozmowa leci do modelu jeszcze raz, od początku, więc o cenie odpowiedzi agenta decyduje warstwa sterująca, a nie sam model.

Dwie oszczędności sklejone w jedną liczbę

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Co, jeśli lepszy agent nie potrzebuje większego modelu, tylko lepszego harnessu? Premiera / Narzędzie

Co, jeśli lepszy agent nie potrzebuje większego modelu, tylko lepszego harnessu?

3 min

HarnessX, otwarty framework Darwin Agent na licencji MIT, traktuje harness — warstwę wokół modelu, która decyduje o narzędziach, pamięci i kontekście — jako wymienny klocek, ulepszany osobno od samych wag. Na Qwenie 3.5 9B sama przebudowa harnessu podnosi wynik na GAIA z 33,97% do 41,67%, a douczenie modelu RL-em dociąga go do 55,77%; ten sam schemat na GPT-5 idzie z 62% do 84%. Skłaniam się ku tezie, że architektura agenta to dźwignia, po którą sięga się za rzadko, ale liczby podał sam autor na jednym benchmarku, w wersji 0.1.0 beta, i wciąż czekają na niezależne powtórzenie.

139 razy różnicy w koszcie jednego zadania, przy niezmienionym modelu Analiza / Opinia

139 razy różnicy w koszcie jednego zadania, przy niezmienionym modelu

4 min

Marc Alier z Universitat Politècnica de Catalunya puścił jedno zadanie na gicie przez siedem harnessów i pięć modeli, sprawdzając w repozytorium, czy praca faktycznie została wykonana, i najdroższe uruchomienie wyszło 139 razy drożej niż najtańsze. Dwa harnessy, które w ogóle nie obsługują MCP, kosztowały od 5 do 28 razy mniej, a różnicę między MCP a terminalem widać najwyraźniej na porażkach: 12,9% wydanych pieniędzy nie kupiło tam żadnej skończonej pracy wobec 2,2% na terminalu. O rachunku decyduje obudowa, w której uruchamiasz agenta, a nie to, czym podłączasz mu narzędzia.

Osiemnaście punktów różnicy bez ruszania wag modelu Analiza / Opinia

Osiemnaście punktów różnicy bez ruszania wag modelu

5 min

Ten sam Claude Opus 4.6 zalicza 58% zadań w TerminalBench-2 pod Claude Code i 81,8% w prowadzącym ForgeCode, choć wagi w obu są identyczne. Różnicę robi harness, czyli warstwa decydująca, co model widzi, czym może ruszyć i ile razy dostaje szansę na poprawkę. ClickHouse zamroził tę warstwę, przepuścił przez nią 28 modeli i policzył, że od 53 do 82% błędów bierze się ze złego planu, a nie ze złego SQL-a, więc proponuje, żeby plan pisał model najdroższy, a wykonywał najtańszy. Kupując gotowego agenta, kupujecie parę, której druga połowa nie ma żadnej dokumentacji.