SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Factory warte 5 miliardów, a zaczyna od sprawdzenia twojego repozytorium

Factory zebrało 15 września 200 milionów dolarów przy wycenie 5 miliardów, a jeszcze w kwietniu firma była warta 1,5 miliarda. Zanim jej agenty Droids dotkną kodu, platforma żąda raportu gotowości i prześwietla nie model, tylko twoje repozytorium: układ plików, opisy i zabezpieczenia. Pieniądze idą za maszynerię dookoła modelu, czyli wybór kontekstu, narzędzia do uruchomienia testów i pętlę, w której agent poprawia kod po własnej wywrotce. Lepszym sprawdzianem niż wycena są minuty, które nad przeglądem spędzają twoi najbardziej doświadczeni ludzie.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Factory warte 5 miliardów, a zaczyna od sprawdzenia twojego repozytorium
Ilustrację przygotowała AI.

Zanim agenty Factory dotkną twojego kodu, platforma żąda raportu gotowości. Sprawdza w nim nie model, tylko twoje repozytorium: czy pliki są poukładane, czy ktoś opisał, co one właściwie robią, i czy w projekcie stoją zabezpieczenia, przez które agent nie przepchnie podatności. Pierwszym krokiem jest więc ocena tego, co masz u siebie, a pokaz możliwości sztucznej inteligencji przychodzi dopiero potem. Moim zdaniem to najuczciwsze zdanie w tej historii, bo mówi wprost, gdzie naprawdę stoi wąskie gardło.

Factory, firma z San Francisco budująca agenty dla dużych zespołów inżynierskich, ogłosiła 15 września, że zebrała 200 milionów dolarów przy wycenie 5 miliardów. W kwietniu była warta 1,5 miliarda, więc w pięć miesięcy cena potroiła się z okładem.

Płacisz za wszystko, co stoi dookoła modelu

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Ta sama para modeli, trzy różne rachunki za jedno zadanie Model / Badania

Ta sama para modeli, trzy różne rachunki za jedno zadanie

5 min

Artificial Analysis wylicza, że średnie zadanie agentowe kosztuje 3,26 dolara na GPT-6 Astra i 7,63 na Claude Fable 5.1 przy identycznej skuteczności, ale OpenAI i Cognition zmierzyły tę samą różnicę na 63% i 42%, a Zvi Mowshowitz wskazuje, że Fable puszczono w trybie Max, co te 57% zawyża. Cognition odpowiada układem Fusion w Devinie, w którym droższy model prowadzi, a tańszy grzebie w kodzie: na DeepSWE 1.1 ścina to koszt zadania o 46% bez straty jakości, tyle że z Astrą na Terminal-Bench 4.0 wynik leci w dół o ponad pięć punktów. Cenę za zadanie widać dopiero na własnym repozytorium.

Model przeczytał cały log dwa razy, żeby wyłuskać trzy linijki Premiera / Narzędzie

Model przeczytał cały log dwa razy, żeby wyłuskać trzy linijki

4 min

Tejas Chopra prosił Claude'a o wskazanie awarii w logach, a jedno pytanie zjadło dwa okna kontekstowe i 287 dolarów miesięcznie, bo model raz za razem czytał całe logi, by wyłuskać trzy istotne linijki. Tak powstał Headroom, otwarta warstwa przycinająca kontekst, zanim ten doleci do modelu: wycina zbędne znaki z JSON-a (około 30% oszczędności), a oryginał chowa lokalnie na wypadek, gdyby model potrzebował pełnych danych. Chopra reklamuje 700 tysięcy dolarów oszczędności w pięć miesięcy, ale mocniejsza jest sama diagnoza: większość tego, czym karmimy modele, jest zbędna, a płacimy za wszystko.

Cennik zamiast premiery: co strona z modelami Anthropic naprawdę mówi deweloperowi Model / Badania

Cennik zamiast premiery: co strona z modelami Anthropic naprawdę mówi deweloperowi

4 min

Strona z przeglądem modeli Anthropic to nie zapowiedź, tylko cennik: Claude Fable 5, najmocniejszy szeroko dostępny model, kosztuje 10 dolarów za milion tokenów wejścia i 50 za wyjścia, dwa razy tyle co domyślnie polecany Opus 4.8 przy identycznym oknie miliona tokenów. We Fable znika suwak sterujący długością myślenia, model zawsze sam decyduje, ile czasu poświęcić. Bliźniaczy Mythos 5 ma te same parametry, ale trafia tylko do klientów programu Project Glasswing. Benchmarków brak, więc czy podwójna stawka się zwraca, każdy musi sprawdzić na własnym kodzie.