Premiera / Narzędzie
Test przeszedł, bo agent sam wygenerował dane z tym samym błędem
W benchmarku NVIDII Claude Code napisał 45 skryptów do symulacji materiałów w pięciu wariantach promptu, a dłuższy prompt kupował głównie strukturę kodu, bo właściwy wzór agent dobierał już przy jednym zdaniu. Realną różnicę robiły dwie inne rzeczy: środowisko, w którym agent może odpalić własny kod, oraz jedno zdanie o fizyce, bez którego skrypty sięgały po termostat Langevina i zaniżały wynik od trzech do pięciu razy. Żadna konfiguracja ani razu nie zakwestionowała zadania bez fizycznego sensu, a 38 z 45 skryptów wybrało algorytm FIRE, bo tylko on stał w przykładach.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 5 min ·
Jeden ze skryptów napisanych przez Claude Code w benchmarku NVIDII sam sprawdził swoje przeliczanie jednostek i wyszedł z tego bez zarzutu. Wygenerował sobie dane testowe, przepuścił je przez tę samą błędną stałą, którą miał zweryfikować, i test zapalił się na zielono. Kod spójny, statystyka nienaganna, wynik nieprawdziwy.
Benchmark opublikowany przez NVIDIĘ mierzy rzecz, o którą w tej branży wszyscy kłócimy się na wyczucie: ile naprawdę daje dłuższy, bardziej szczegółowy prompt. Zespół dał Claude Code trzy zadania z symulacji materiałów i kazał mu napisać do nich kod, każde w pięciu wariantach promptu, od jednozdaniowego szkicu po pełny kontrakt z flagami wiersza poleceń, schematem wyniku i testami akceptacyjnymi. Każdy wariant powtórzył trzy razy, więc na warsztat poszło w sumie 45 skryptów.
Agent nie pisał tego kodu od zera. Dostał bibliotekę ALCHEMI Toolkit, w której NVIDIA trzyma gotowe kawałki kodu liczące na GPU, co robią atomy. Do tego doszły pliki w otwartym standardzie Agent Skills, które podsuwają mu wzorce użycia API dokładnie wtedy, kiedy sięga po daną funkcję.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.