Analiza / Opinia
Największy skok w niszowym języku nie wziął się z nowszego modelu
Rok temu czołowe modele wykładały się na q, języku bazy kdb+, na której banki liczą na żywo strumienie notowań. Dziś agenty kodujące rozwiązują ponad 85% zadań z otwartego benchmarku QEval firmy KX, a Claude Fable 5 przekracza 95%. Największy skok nie wziął się jednak z nowszego modelu, tylko z pętli, w której agent odpala kod, ogląda błąd i poprawia się przez kilka tur, co podniosło skuteczność z około 50% do ponad 80%. Domenowe wskazówki dobiły resztę u słabszych modeli, najsilniejszym nie dały nic, a ostatnie kilkanaście procent, od architektury, wciąż broni się samo.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Analiza / Opinia · 4 min ·
q łamie nawyki, z jakimi model przychodzi z innych języków. Sam język stoi za bazą kdb+, kolumnową bazą do szeregów czasowych, na której banki i fundusze liczą na żywo strumienie notowań. Rok temu czołowe modele językowe wykładały się na nim regularnie. Dziś, sprzęgnięte z agentami kodującymi, rozwiązują ponad 85% zadań z QEval, otwartego benchmarku firmy KX, a Claude Fable 5, jeden z najsilniejszych modeli, przekracza 95%. Samo 95% mówi jednak mało. Ważniejsze jest to, skąd ta poprawa się wzięła, bo odpowiedź jest bardziej pouczająca niż nagłówek.
Jedno uczciwe zastrzeżenie na starcie. QEval to benchmark KX, a KX sprzedaje kdb+ i q, więc ma oczywisty interes w tym, żebyś uwierzył, że sztuczna inteligencja radzi sobie już z jego językiem. Tyle że benchmark jest otwarty, leży na GitHubie, a jego wnioski wskazują też miejsca, w których modele przegrywają. Jak na materiał producenta, to rzadka szczerość.
Dlaczego q jest trudne dla modeli
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.