SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Analiza / Opinia

Największy skok w niszowym języku nie wziął się z nowszego modelu

Rok temu czołowe modele wykładały się na q, języku bazy kdb+, na której banki liczą na żywo strumienie notowań. Dziś agenty kodujące rozwiązują ponad 85% zadań z otwartego benchmarku QEval firmy KX, a Claude Fable 5 przekracza 95%. Największy skok nie wziął się jednak z nowszego modelu, tylko z pętli, w której agent odpala kod, ogląda błąd i poprawia się przez kilka tur, co podniosło skuteczność z około 50% do ponad 80%. Domenowe wskazówki dobiły resztę u słabszych modeli, najsilniejszym nie dały nic, a ostatnie kilkanaście procent, od architektury, wciąż broni się samo.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Analiza / Opinia  ·  4 min  · 

Największy skok w niszowym języku nie wziął się z nowszego modelu
Ilustrację przygotowała AI.

q łamie nawyki, z jakimi model przychodzi z innych języków. Sam język stoi za bazą kdb+, kolumnową bazą do szeregów czasowych, na której banki i fundusze liczą na żywo strumienie notowań. Rok temu czołowe modele językowe wykładały się na nim regularnie. Dziś, sprzęgnięte z agentami kodującymi, rozwiązują ponad 85% zadań z QEval, otwartego benchmarku firmy KX, a Claude Fable 5, jeden z najsilniejszych modeli, przekracza 95%. Samo 95% mówi jednak mało. Ważniejsze jest to, skąd ta poprawa się wzięła, bo odpowiedź jest bardziej pouczająca niż nagłówek.

Jedno uczciwe zastrzeżenie na starcie. QEval to benchmark KX, a KX sprzedaje kdb+ i q, więc ma oczywisty interes w tym, żebyś uwierzył, że sztuczna inteligencja radzi sobie już z jego językiem. Tyle że benchmark jest otwarty, leży na GitHubie, a jego wnioski wskazują też miejsca, w których modele przegrywają. Jak na materiał producenta, to rzadka szczerość.

Dlaczego q jest trudne dla modeli

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Agenty lepiej łatają cudzy kod, niż dopisują brakującą funkcję Analiza / Opinia

Agenty lepiej łatają cudzy kod, niż dopisują brakującą funkcję

3 min

Claude Opus 4.5 zamyka 74,4% zadań na SWE-bench, a na nowym benchmarku FeatureBench dowozi 11%, choć model jest ten sam i zmieniło się tylko to, o co go poproszono. Qixing Zhou i współautorzy, w pracy zgłoszonej na ICLR 2026, wycięli z 24 repozytoriów open-source kod stojący za wybranymi testami, tak że agent ma odtworzyć brakującą funkcję bez wskazanego miejsca i bez gotowych granic zmiany. Agenty domykają pętlę, którą ktoś już otworzył i opisał, a dużo gorzej radzą sobie z wykrojeniem zadania od zera. Ostrożnie z tą liczbą, bo trudność dziur ustawia sam twórca benchmarku.

Po co model ponad trzy razy większy, skoro mniejszy programuje lepiej? Model / Badania

Po co model ponad trzy razy większy, skoro mniejszy programuje lepiej?

3 min

Thinking Machines Lab wypuściło Inkling-Small, model z otwartymi wagami, który przy każdym tokenie uruchamia tylko 12 miliardów z 276 miliardów parametrów, a mimo to dorównuje ponad trzy razy większemu Inklingowi i wyprzedza go na kodzie, 80,2% wobec 77,6% na SWEBench Verified. Przewagę dało nie skalowanie, tylko dwa dodatkowe tygodnie treningu pod agentowe programowanie. Cena jest jedna: na wiedzy o świecie mniejszy model wyraźnie odstaje, 20,6% do 43,9% na SimpleQA. Mniej aktywnych parametrów oznacza też niższy rachunek za każdą odpowiedź.

Lokalny agent do kodu, który celowo mniej myśli Model / Badania

Lokalny agent do kodu, który celowo mniej myśli

3 min

Jackrong wypuścił Qwopus-3.6-35B-A3B-Coder, model do kodu oparty na Qwen3.6, w którym rozumowanie jest domyślnie wyłączone. To mieszanka ekspertów z 35 miliardami wag, z których przy każdym tokenie pracuje tylko około 3 miliardów, więc działa lokalnie i zebrał 45 tysięcy pobrań miesięcznie. Autorzy chwalą się wynikiem 62,4% na SWE-bench, ale to przebieg policzony przez sam zespół na 300 zadaniach, bez potwierdzenia. Bez rozumowania model pewniej trzyma się poleceń i stabilniej ciągnie stan przez tury, za to w kompetencji inżynierskiej przegrywa z rywalem tej samej wielkości, 81 do 94.