Analiza / Opinia
Tydzień 17 · 20–26 kwietnia 2026
Analiza / Opinia Cztery dźwignie niezawodności, które zniknęły w drodze z modelu do API
4 min
Anthropic, OpenAI i Google po cichu zabrały cztery dźwignie niezawodności, które w lokalnym modelu z otwartymi wagami masz za darmo: prefill odpowiedzi, logprobs, pełen ślad rozumowania i ograniczone dekodowanie poza JSON-em. Claude stracił prefill wraz z modelami po 4.6, OpenAI odciął logprobs dla GPT-5, a ślad myślenia wszyscy trzej pokazują tylko w streszczeniu. To wybór polityczny podyktowany ryzykiem destylacji, nie ograniczenie inżynierskie; jeśli zamknięte API nie dorobią rozbudowanego endpointu, ruch wymuszą modele otwarte jak DeepSeek R1.
Analiza / Opinia Z Linuksa wylatuje 27 tysięcy linii kodu, bo skanery AI zalały opiekunów
3 min
Społeczność jądra Linuksa rozważa wycięcie około 27 tysięcy linii kodu sterowników sieciowych ISA i PCMCIA dla sprzętu firm 3Com czy Xircom, bo skanery AI zalewają listy mailingowe raportami o błędach w kodzie, którego prawie nikt już nie uruchamia. Andrew Lunn, opiekun podsystemu sieciowego, tłumaczy asymetrię kosztu: zgłaszającego raport kosztuje minuty, opiekuna godzinę odtwarzania kontekstu kodu sprzed dwóch dekad. Najprostsza obrona to filtr osiągalności po stronie twórców skanerów, bez niego następne w kolejce są mniejsze projekty open source.
Tydzień 16 · 13–19 kwietnia 2026
Analiza / Opinia Anthropic schował najmocniejszego Claude'a za bramą Project Glasswing
4 min
Anthropic przyznał wprost, że Claude Opus 4.7 z 16 kwietnia ma celowo obniżone zdolności cyberbezpieczeństwa — pełna wersja trafia tylko do ośmiu firm Project Glasswing, w tym AWS-a, Apple'a i JPMorgana. Publiczny model skoczył na SWE-bench Pro z 53,4% do 64,3%, dostał poziom wysiłku xhigh i budżety zadań od 20 tysięcy tokenów. Migracja boli: nowy tokenizer liczy nawet 1,35 raza więcej, a Messages API odcina thinking.budget_tokens i niedomyślne temperature. Na BrowseComp Opus spadł z 83,7% do 79,3%, więc do syntezy z wielu źródeł GPT-5.4 Pro nadal wygrywa.
Analiza / Opinia Jeden nagłówek HTTP w żądaniu do Workers AI zmienia rachunek za agenta
4 min
Cloudflare opisał 16 kwietnia, jak skaluje Kimi K2.5 i Llamę 4 na Workers AI: rozdzielił fazy prefill i decode na osobne klastry GPU, co według ich danych obniżyło p90 czasu między tokenami ze 100 ms do 20–30 ms. Wagi Kimi K2.5 ważą 560 GB i wymagają ośmiu H100, a KV cache trzyma się dzięki Mooncake na NVMe. Dla dewelopera agenta zostaje z tego jedno: nagłówek `x-session-affinity`, który kieruje żądanie tam, gdzie prefiks promptu już siedzi w cache, i pozwala płacić mniej za powtarzane tokeny wejściowe.
Analiza / Opinia Blitzy bije GPT-5.4 o 8,8 punktu na SWE-Bench Pro. Tę różnicę zbudował harness, nie model
4 min
Niezależny audyt Quesmy (Piotr Migdal i Piotr Grabowski) pokazuje, że Blitzy kończy SWE-Bench Pro Public z wynikiem 66,5%, a surowy GPT-5.4 zatrzymuje się na 57,7%. Quesma przejrzała pełne zapisy pracy agentów w poszukiwaniu śladów oszustwa i nic nie znalazła. Różnicę robi harness, nie model: Blitzy najpierw mapuje zależności, potem rozsyła wyspecjalizowane agenty, a na końcu odpala weryfikatorów. Eksperyment StormHuba z Claude Agent SDK potwierdza to od drugiej strony, gdzie agenty zbudowały cargo cult architektury, instalując właściwe paczki i nigdy ich nie wywołując.
Analiza / Opinia Zatrudnienie najmłodszych programistów spadło prawie o 20% od 2022 roku
4 min
Raport AI Index 2026 Stanforda pokazuje, że zatrudnienie programistów w wieku 22-25 lat w USA spadło o niemal 20% względem szczytu z 2022 roku, podczas gdy w starszych grupach wiekowych dalej rośnie. Rozjazd zaczął się w połowie 2024, gdy Claude Code, Cursor i Copilot dotarły do poziomu, na którym starszy programista nie potrzebuje juniora. Ekonomista Alex Imas stawia pytanie o elastyczność popytu: jeśli okaże się sztywna, narzędzia AI nie tworzą miejsc pracy, tylko je likwidują. 73% ekspertów wierzy w poprawę rynku pracy, ale tylko 23% obywateli — największa rozbieżność w historii raportu.