SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Cursor otwiera megakernel, który przyspieszył trenowanie ich modelu o 41%

Cursor otworzył kod Mixture-of-Kittens, megakernela, który scala liczenie i komunikację między kartami w jeden program i rozpędza najwolniejszą warstwę trenowania modelu Composer. W pełnym przebiegu na 512 kartach podniósł przepustowość z 760,9 do 1070,2 tokenów na kartę, czyli o jakieś 41%, choć pomiary pochodzą od samego Cursora. Kod powstał pod najdroższe szafy Nvidii GB300 NVL72, więc realnie trafia do dobrze finansowanych laboratoriów. Ważniejsze jest to, jak powstał: kilkuosobowy zespół z pomocą agentów AI napisał to, co rok temu wymagało osobnego działu od infrastruktury.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Cursor otwiera megakernel, który przyspieszył trenowanie ich modelu o 41%
Ilustrację przygotowała AI.

Warstwa mieszanki ekspertów była u Cursora głównym wąskim gardłem trenowania i zależnie od obciążenia potrafiła zjadać ponad połowę całego czasu. To było główne wąskie gardło całego procesu, przez które Composer, jego model do pisania kodu, uczył się wolniej, niż pozwalał na to sprzęt. Cursor właśnie otworzył kod rozwiązania, nad którym pracował przez rok: to Mixture-of-Kittens, w skrócie MoK, pojedynczy program na karty graficzne, który tę warstwę rozpędza i napędza dziś trenowanie Composera na dziesiątkach tysięcy GPU.

Dzięki mieszance ekspertów, po angielsku mixture of experts, model kieruje każde słowo tylko do kilku wyspecjalizowanych podsieci, zwanych ekspertami, zamiast liczyć je przez całą swoją sieć. Za każdym razem pracuje więc tylko ułamek modelu i całość jest tańsza. Problem pojawia się przy trenowaniu na wielu kartach naraz: eksperci są rozrzuceni po różnych GPU, więc każdy token trzeba najpierw przerzucić na właściwą kartę, a potem ściągnąć wynik z powrotem. To przerzucanie potrafi trwać tyle samo, co samo liczenie, i właśnie ono stało się hamulcem.

Zwykle każdy z tych kroków, liczenie i komunikacja między kartami, to osobny program zlecany GPU. MoK scala je wszystkie w jeden megakernel, tak że karty nie tracą czasu między kolejnymi uruchomieniami, a przesyłanie tokenów dzieje się w tym samym momencie co obliczenia, nie po nich. Cały kernel jest przy tym w pełni deterministyczny, czyli te same dane na wejściu dają co do bitu ten sam wynik, co bardzo się przydaje przy powtarzalnych eksperymentach i przy uczeniu ze wzmocnieniem.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

System wieloagentowy Cursora i NVIDII zoptymalizował 235 kerneli CUDA średnio o 38% Model / Badania

System wieloagentowy Cursora i NVIDII zoptymalizował 235 kerneli CUDA średnio o 38%

4 min

Cursor i NVIDIA puścili wieloagentowy harness na 27 kartach Blackwell B200, który przez trzy tygodnie pisał kernele CUDA dla 235 problemów z 124 modeli open-source. Czołówka mówi o 38% średniego przyspieszenia, ale punktem odniesienia jest PyTorch zoptymalizowany pojedynczym agentem, nie cuBLAS, a mediana wskaźnika SOL wyniosła 0,56. Na mnożeniu macierzy BF16 agent dotarł do 86% wydajności cuBLAS, na attention dla Llamy 3.1 8B przebił FlashInfer o 84%. Ciekawszy test w CuTe DSL pozostał bez liczb.

RadixArk otwiera kod maszynerii, która dotrenowuje największe modele Premiera / Narzędzie

RadixArk otwiera kod maszynerii, która dotrenowuje największe modele

4 min

RadixArk otworzył kod Miles v0.1, maszynerii do uczenia ze wzmocnieniem na modelach z najwyższej półki, i opisał ją w raporcie technicznym, który trafił na arXiv 8 września. Przykładowy przebieg ciągnął model GLM-5.2 o 744 miliardach parametrów na 64 kartach NVIDIA GB300, z medianą kroku 263 sekundy, więc otwarty kod barierę sprzętową raczej przesuwa, niż znosi. Zwykłemu zespołowi więcej dadzą boczne ścieżki, przede wszystkim uczenie ze wzmocnieniem na adapterach LoRA, bo mieści się w ułamku pamięci potrzebnej na pełny przebieg.

NVIDIA rozbija model na dwie części, żeby pisał tekst 2,42 raza szybciej Model / Badania

NVIDIA rozbija model na dwie części, żeby pisał tekst 2,42 raza szybciej

4 min

NVIDIA pokazała Nemotron-Labs-TwoTower, model, który generuje tekst całymi blokami po 16 słów naraz zamiast token po tokenie, dzięki czemu pisze 2,42 raza szybciej przy zachowaniu 98,7% jakości modelu bazowego. Sztuczka polega na rozbiciu sieci na dwie wieże: zamrożoną kontekstową i odszumiającą, która równolegle wypełnia puste miejsca. Płaci się za to drugą kartą GPU i spadkiem jakości tam, gdzie liczy się precyzja, bo na HumanEval wynik spada z 79,27 do 75,58. Prawdziwa wartość to nie sam model, ale recepta na przyspieszenie gotowych modeli autoregresyjnych bez trenowania od zera.