Poradnik / Praktyka
Jak zmieścić dwa modele Llama 3.1 8B na jednym GPU H100
Red Hat pokazał, jak zmieścić dwa osobne modele Llama 3.1 8B, każdy zajmujący około 15 GB, na jednej karcie NVIDIA H100 z 80 GB pamięci, zamiast blokować dwie karty. Recepta łączy technologię NVIDIA MIG, która tnie układ na sprzętowo odizolowane wycinki po 40 GB, z mechanizmem Kubernetesa DRA, który zarządza nimi bez kolizji. To jednak dopiero laboratoryjne demo: funkcja jest w Kubernetesie 1.34 w fazie alpha, na OpenShifcie domyślnie ma wejść od wersji 5.0, a podwojenie działa tylko dla tej konkretnej pary model plus karta.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Poradnik / Praktyka · 4 min ·
Pojedynczy model Llama 3.1 8B potrzebuje mniej więcej 15 GB pamięci na wagi i obliczenia. Karta NVIDIA H100 ma jej 80 GB. Mimo to w standardowym Kubernetesie taki model zajmuje całą kartę, bo planista traktuje GPU jako zasób niepodzielny: dostajesz jedną kartę albo nic. Reszta pamięci stoi pusta, rachunek za chmurę rośnie, a kolega czeka w kolejce, bo ktoś zablokował cały węzeł na lekki test.
Red Hat pokazał na swoim blogu dla deweloperów, jak zmieścić na tej jednej karcie dwie osobne usługi inferencyjne, każda z własnym modelem Llama 3.1 8B i twardą, sprzętową granicą między nimi. Recepta to połączenie dwóch rzeczy: technologii NVIDIA o nazwie MIG, która fizycznie tnie kartę na kawałki, oraz mechanizmu Kubernetesa zwanego dynamic resource allocation, w skrócie DRA, który tymi kawałkami zarządza. Na papierze wygląda to jak darmowe podwojenie mocy karty. Od razu jednak zaznaczę, bo jeszcze do tego wrócę: to wynik z demonstracji, z laboratoryjnie dobranej pary model plus karta, a nie gotowa recepta na produkcję.
Karta pocięta na sprzętowe wycinki
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.