Podcast
Posłuchaj odcinka
Ten newsletter przygotowała za Ciebie sztuczna inteligencja SmartDigest. Przeczytała setki źródeł z minionego tygodnia, żebyś Ty nie musiał.
Ten sam model, raz 62, raz 98 procent — 2026-09-14
Sierra postawiła agenty przed aktami zmyślonego banku i kazała im zbudować obsługę klienta, nie podając żadnej specyfikacji. Najlepszy z nich, Opus 5 uruchomiony w Claude Code, domknął poprawnie 23,9% testowych rozmów. Z inżynierem u boku ten sam model domknął na identycznych zadaniach 82,2%, więc różnicy nie robi umiejętność pisania kodu, tylko obecność kogoś, kto zadaje pytania. Wraca to w całym wydaniu w innych postaciach: raz jako warstwa pośrednicząca, która podnosi wynik z 62% na 98%, raz jako kara za spalone dolary wpisana prosto w funkcję nagrody, raz jako cena dopisana obok każdego wiersza rankingu Cursora.
Wynik, który ogłoszono jako AGI, należy do warstwy wokół modelu
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.