Analiza / Opinia
Nvidia uruchomiła prawdziwy serwer i odsiała 147 łatek, które przeszły testy
Nvidia razem z zespołem SGLang zbudowała benchmark SWE-Serve, który sprawdza łatki agentów kodujących nie tylko testami, ale też na uruchomionym serwerze z prawdziwym modelem. Z 627 łatek aż 147, które przeszły wszystko inne, padło dopiero na żywym serwerze, przez co skuteczność spadła z 69,4% do 45,9%. Prowadzą Claude Opus 5 i GPT-5.6 Sol z wynikiem 75,5%, a w Claude Code i Codeksie wypadli gorzej. Jeśli agent zmienia kod, który widać dopiero po starcie systemu, zielone testy nie wystarczą i trzeba dołożyć krok uruchamiający prawdziwą usługę.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Analiza / Opinia · 5 min ·
Nvidia zbudowała 53 zadania z 83 prawdziwych zmian scalonych w repozytorium SGLang, kazała agentom kodującym napisać je od nowa i sprawdziła wynik dwa razy: raz zwykłymi testami, a raz na uruchomionym serwerze z prawdziwym modelem. Różnica między tymi dwoma pomiarami mówi mi więcej niż cały ranking modeli, bo pokazuje, że zielony wynik "testy przechodzą", na którym agenty kończą dziś większość pracy, wcale nie oznacza jeszcze, że kod działa.
SGLang to otwarty silnik, który ładuje duży model językowy na kartę graficzną, przyjmuje zapytania przez API zgodne z OpenAI i odsyła odpowiedzi. Łatka w takim kodzie może wyglądać poprawnie i przejść testy jednostkowe, a mimo to wyłożyć się w chwili, gdy serwer wczyta wagi i dostanie pierwsze żądanie. Właśnie tę lukę mierzy SWE-Serve, benchmark, który Nvidia zbudowała razem z zespołem SGLang. "Czy agenty AI potrafią rozwijać silnik inferencji i sprawić, żeby serwował prawdziwe modele?", pytał w zapowiedzi na X Jiantao Jiao z Nvidii.
Co trzecia zielona łatka pada na serwerze
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.