SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Sprzątanie miliona linii kodu za 19 300 dolarów. Regresje wyłapali ludzie.

Nous Research puściło 1393 wykonawców swojego agenta Hermes na milion linii Pythona i w 19 godzin, za jakieś 19 300 dolarów w tokenach, skróciło kod o 34,4%. Kontrole oparto na tym, co maszyna porówna sama: niezmieniony schemat JSON narzędzi, wynik polecenia z flagą help bajt w bajt i zamrożoną listę testów, które sypały się już wcześniej. Dwóch regresji to nie złapało, bo agenty wycięły publiczne nazwy potrzebne wtyczkom i w około 65 miejscach zmieniły obsługę błędów, a wyłapały je dopiero dwie rundy przeglądu przez społeczność open-source.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Sprzątanie miliona linii kodu za 19 300 dolarów. Regresje wyłapali ludzie.
Ilustrację przygotowała AI.

Plik gateway/run.py w repozytorium Hermesa, agenta do programowania z otwartym kodem od Nous Research, rozrósł się do 34 847 linii, a cały projekt, po odjęciu testów, przekroczył milion linii Pythona. Nous Research odkładało porządki miesiącami, bo każdy tydzień przeznaczony na sprzątanie to tydzień bez nowych funkcji dla użytkowników. Drugiego września Teknium zlecił tę robotę temu samemu agentowi, którego na co dzień rozwija, i dostał gotowego pull requesta od 1393 wykonawców, z których każdy był osobnym uruchomieniem tego samego modelu, z własnym zadaniem i własnym kawałkiem repozytorium do przerobienia. W szczycie pracowało ich 218 naraz, a cały bieg zajął jakieś 19 godzin.

Nagłówkiem tej historii jest rachunek: około 19 300 dolarów za tokeny wobec szacowanych przez firmę 150 tysięcy do 1,8 miliona dolarów za te same porządki robione ręcznie. Drugi przedział rozciąga się dwunastokrotnie, więc nie jest pomiarem, tylko ramą pod komunikat o stukrotnej oszczędności. Zostawiam go i biorę z tego raportu to, co da się przenieść do własnego repozytorium: opis, jak utrzymać w ryzach 200 agentów grzebiących równolegle w jednym projekcie.

Agent nadrzędny, który nie tknął ani jednej linii kodu

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Codex wypalał tygodniowy limit w dwa dni, a OpenAI zrzucił winę na wykrywanie oszustw Premiera / Narzędzie

Codex wypalał tygodniowy limit w dwa dni, a OpenAI zrzucił winę na wykrywanie oszustw

3 min

Programiści z planem Pro Codexa, agenta OpenAI do pisania kodu za 200 dolarów miesięcznie, wyczerpywali tygodniowy przydział w dwa dni zwykłą refaktoryzacją. Thibault Sottiaux, szef zespołu inżynierskiego Codexa, zrzucił winę na mechanizmy wykrywania nadużyć, które brały intensywną pracę za oszustwo, i wyzerował wszystkim liczniki, a 18 czerwca dorzucił podwójny reset. To łaty, nie naprawa: prawdziwy problem to cennik, który nie nadążył za tym, jak mocno ludzie realnie korzystają z agentów do kodu.

Agenci zainstalowali w firmach kod z paczek, których nikt nie zarejestrował Bezpieczeństwo

Agenci zainstalowali w firmach kod z paczek, których nikt nie zarejestrował

5 min

Alon Hertz zarejestrował kilka niezajętych nazw paczek wypisanych w plikach llms.txt, a cztery minuty później odezwała się do niego maszyna z firmy wartej setki miliardów dolarów. Jego zespół przeskanował 6214 domen i znalazł ponad 200 nazw bez pokrycia w npm i PyPI, w tym komendę z dokumentacji Clerka, pod którą ktoś podłożył działające złośliwe oprogramowanie. Nikt nie planował tu ataku: wpisy zestarzały się same, a jedyne miejsce, w którym dało się je wyłapać, znikło wtedy, gdy deweloperzy włączyli agentom automatyczne zatwierdzanie komend.

GitHub skrócił wyjście z terminala i zapłacił za to więcej Analiza / Opinia

GitHub skrócił wyjście z terminala i zapłacił za to więcej

5 min

GitHub podpiął do Copilota RTK, narzędzie skracające wyjście z powłoki, i na własnych benchmarkach agentowych zadanie wyszło średnio drożej, bo model wracał po wycięty fragment i tracił kolejne tury. Cztery poprawki, które trafiły do Copilot CLI, łączy to, że żadna nie wyrzuca informacji bezpowrotnie: wycięcie numerów linii z odczytu plików zbiło koszt inferencji o około 5% na benchmarkach i 3% dziennie u użytkowników, a dwukrotne skrócenie promptu dało 2,9% taniej, ale po cichu zamieniło sugestię o równoległości w regułę kolejkowania i regresję wyłapali dopiero użytkownicy.