Analiza / Opinia
Na krótkim teście modele wyglądają świetnie, na długim kontekście padają o 47%
Praca "Cracks in the Foundation" (COLM 2026, arXiv 10 sierpnia) zespołu Amandy Bertsch pokazuje, że cztery pozornie błahe decyzje architektoniczne, każda z osobna niegroźna, kumulują się i obniżają jakość modelu na długim kontekście nawet o 47%. Spadku nie widać ani po stracie treningowej, ani na krótkich benchmarkach, więc model wyglądający zdrowo na standardowych testach zawodzi dopiero na długim wejściu. Zespół udostępnił OlmPool, 26 porównywalnych modeli po 7 mld parametrów, i twierdzi, że kiepską kombinację da się wyłapać już wcześnie w treningu.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Analiza / Opinia · 4 min ·
Wybieracie model do zadania, które wymaga długiego kontekstu, na przykład przeczytania całego repozytorium naraz albo wielostronicowego dokumentu bez pomijania fragmentów. Na standardowych testach wypada świetnie, więc bierzecie go do pracy. Dopiero na naprawdę długim wejściu okazuje się, że gubi wątek, a jakość odpowiedzi potrafi spaść nawet o połowę. Najgorsze jest to, że krótkie benchmarki, na których go sprawdzaliście, nie dały wam żadnego ostrzeżenia.
Dokładnie ten scenariusz bada nowa praca "Cracks in the Foundation", przyjęta na konferencję COLM 2026 i wrzucona na arXiv 10 sierpnia. Zespół, którego pracę firmuje Amanda Bertsch, pokazuje coś, co przez lata traktowano jako drobiazg inżynierski: kilka pozornie błahych decyzji w budowie modelu, każda z osobna prawie bez znaczenia, potrafi się skumulować i położyć działanie na długim kontekście. Moim zdaniem sedno nie leży w samej liczbie, która robi wrażenie, tylko w tym, że winne są zwykłe, nudne decyzje inżynierskie, z których każda wygląda niegroźnie.
Cztery decyzje, które osobno nic nie znaczą
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.