SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Bezpieczeństwo

Klucze i dane logowania wyciekają z zaszyfrowanych bloków rozumowania

Zaszyfrowane bloki rozumowania, które modele Anthropic, OpenAI i Google odsyłają przez API, chronią własność dostawcy przed tobą, a nie twoje dane przed kimkolwiek innym. Praca z 10 sierpnia na arXiv pokazuje, że są w pełni wymienne między sesjami i modelami jednego dostawcy, więc słabszy model tej samej firmy odczyta podsunięty blok czystym tekstem, bez łamania szyfru. Z publicznych repozytoriów badacze wydobyli tą metodą 367 fragmentów danych osobowych i 182 komplety danych logowania. Wniosek: zaszyfrowany zapis sesji trzeba traktować jak zwykły tekst jawny i nie wrzucać go na GitHuba.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Bezpieczeństwo  ·  4 min  · 

Klucze i dane logowania wyciekają z zaszyfrowanych bloków rozumowania
Ilustrację przygotowała AI.

Dostawcy dużych modeli, czyli Anthropic, OpenAI i Google, od pewnego czasu ukrywają to, jak ich modele myślą. Rozumowanie krok po kroku, ten wewnętrzny monolog, w którym model rozkłada zadanie na części, jest dla nich cenną własnością, więc nie pokazują go wprost. Zamiast trzymać ten zapis u siebie na serwerze, odsyłają ci go jako zaszyfrowany blok tekstu, a przy każdym kolejnym pytaniu ty odsyłasz ten sam blok z powrotem, żeby model mógł podłączyć się pod swoje wcześniejsze rozumowanie. Wygląda to na bezpieczny mechanizm. Praca opublikowana 10 sierpnia na arXiv pokazuje, że dla ciebie, dewelopera, to szyfrowanie znaczy o wiele mniej, niż się wydaje.

Sedno odkrycia jest takie: te zaszyfrowane bloki są w pełni wymienne między sesjami, użytkownikami i modelami jednego dostawcy. Zaszyfrowane bloki jednego dostawcy są w pełni wymienne między jego modelami, więc blok wygenerowany przez jeden model można podać innemu, słabszemu modelowi tej samej firmy, a ten odczyta go bez oporu. To nie jest sekret przypisany do ciebie ani do twojej sesji, tylko jeden wspólny klucz, który ma po swojej stronie każdy model dostawcy.

Sam atak jest zaskakująco prosty i nie wymaga łamania szyfru. Słabszy model traktuje podsunięty blok jak swój własny, dekoduje go i wypisuje czystym tekstem, słowo w słowo. Nie trzeba przy tym obchodzić zabezpieczeń tej mocniejszej wersji, bo to nie ona mówi. Mówi jej tańszy odpowiednik, który po prostu odczytuje na głos to, co mu wklejono. Zadziałało u wszystkich trzech dostawców.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Cztery dźwignie niezawodności, które zniknęły w drodze z modelu do API Analiza / Opinia

Cztery dźwignie niezawodności, które zniknęły w drodze z modelu do API

4 min

Anthropic, OpenAI i Google po cichu zabrały cztery dźwignie niezawodności, które w lokalnym modelu z otwartymi wagami masz za darmo: prefill odpowiedzi, logprobs, pełen ślad rozumowania i ograniczone dekodowanie poza JSON-em. Claude stracił prefill wraz z modelami po 4.6, OpenAI odciął logprobs dla GPT-5, a ślad myślenia wszyscy trzej pokazują tylko w streszczeniu. To wybór polityczny podyktowany ryzykiem destylacji, nie ograniczenie inżynierskie; jeśli zamknięte API nie dorobią rozbudowanego endpointu, ruch wymuszą modele otwarte jak DeepSeek R1.

OpenAI szuka nadużyć w waszych sesjach, nie zaglądając do treści Premiera / Narzędzie

OpenAI szuka nadużyć w waszych sesjach, nie zaglądając do treści

4 min

OpenAI ogłosiło 19 sierpnia Private Safety Processing: automat zestawia ze sobą powiązane sesje w API i wysyła do firmy samą etykietę ryzyka, bez ani jednego zdania z treści, więc zerowa retencja zaczyna znaczyć nie tyle "nic nie zostaje", co "nic nie zostaje dla ludzi". Anthropic poszedł w lipcu dokładnie odwrotnie i przy najmocniejszych modelach trzyma sesje przez 30 dni. Brak zapisu zamienia jednak problem dowodowy w problem zaufania, bo po fałszywym alarmie nie macie czym się wytłumaczyć, o ile sami nie prowadzicie własnego rejestru.

Modele znajdują luki, których nie znalazł nikt, i same je zostawiają w kodzie Bezpieczeństwo

Modele znajdują luki, których nie znalazł nikt, i same je zostawiają w kodzie

4 min

Modele wyłapują luki zero-day, których nikt wcześniej nie widział, a przy łataniu i pisaniu kodu potykają się o podstawy: 44% wygenerowanego kodu ma podatność z listy OWASP Top 10, a przez cztery pomiary rozłożone na rok średnia w ogóle nie drgnęła. W ponad 6000 przebiegów Off-By-1 Labs z 1Password tylko 26% łatek zamykało dziurę, nie psując przy tym działania aplikacji. Różnicę robi dopiero warstwa wokół modelu, bo w SIG przebiegi z obowiązkową bramką Sigrid Guardrails dały około 97% mniej poważnych znalezisk skanera.