Model / Badania
Model bezpieczeństwa Mistrala dorównuje rywalom prawie siedem razy większym
Mistral wypuścił Shieldstral, model do moderacji treści o 3 miliardach parametrów, który mieści się w 16 GB pamięci karty i działa na jednym GPU na licencji Apache 2.0. Kryterium filtrowania podaje się jako zwykłe pytanie po angielsku, więc politykę zmienia się jednym zdaniem, bez trenowania od nowa. Według raportu samego producenta dostał 99,4% na HarmBench, przed 94,5% dwudziestomiliardowego GPT-OSS-Safeguard, będąc prawie siedem razy mniejszym od rywali. Przy wejściu spreparowanym pod obejście filtra skuteczność jednak spada.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 3 min ·
Jeśli budujesz aplikację na LLM, masz problem, o którym rzadko mówi się na konferencjach: ktoś musi sprawdzać, co użytkownik wysyła do modelu i co model odsyła z powrotem. Prośbę o instrukcję, jak kogoś skrzywdzić, trzeba wyłapać, zanim dojedzie do modelu. Odpowiedź, która przeszła przez filtr wejściowy, a mimo to wyszła toksyczna, trzeba zatrzymać, zanim zobaczy ją użytkownik. Narzędzia do tego były do tej pory duże. LlamaGuard od Mety, ShieldGemma od Google i GPT-OSS-Safeguard mają od 9 do 20 miliardów parametrów. W praktyce znaczy to, że obok swojego głównego modelu utrzymujesz drugi, prawie tak samo kosztowny, tylko po to, żeby pilnował bezpieczeństwa.
Mistral wypuścił Shieldstral, model, który robi tę samą robotę, mając 3 miliardy parametrów. Mieści się w 16 GB pamięci karty graficznej, uruchamia się na jednym GPU i wychodzi na licencji Apache 2.0, więc możesz postawić go u siebie i używać komercyjnie, nie pytając nikogo o zgodę. To model, przy którym samodzielne postawienie takiej bramki przestaje być kosztowną fanaberią.
Politykę zmieniasz jednym zdaniem
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.