SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

GPT-6 Sol i Luna: OpenAI tnie ceny o połowę, ale liczyć trzeba koszt zadania

OpenAI wypuściło 22 września modele GPT-6 Sol i Luna o połowę tańsze od poprzedników, ale przy agencie programistycznym liczy się koszt całego zadania, a nie cena tokenu. Sol zdobywa 68,8% na DeepSWE, teście agentów naprawiających prawdziwe repozytoria, czyli niewiele mniej niż Claude Fable 5 przy rachunku niższym o około 80%. Niezależne pomiary studzą jednak entuzjazm, bo Artificial Analysis daje Solowi 48 punktów wobec 58 dla Claude Opus 5.5, a tańszy DeepSeek V4.1 Flash wyprzedza Lunę w programowaniu.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

GPT-6 Sol i Luna: OpenAI tnie ceny o połowę, ale liczyć trzeba koszt zadania
Ilustrację przygotowała AI.

OpenAI wypuściło 22 września dwa tańsze modele z rodziny GPT-6. Sol ma obsługiwać złożone programowanie i pracę agentów, a Luna dużą liczbę prostszych zadań. Nad nimi zostaje flagowa Astra, najmocniejszy i najdroższy model firmy. W API Sol kosztuje teraz 2 dolary za milion tokenów na wejściu i 10 dolarów na wyjściu, a Luna jest od niego dwudziestokrotnie tańsza. Oba cenniki są o połowę niższe od promocyjnych cen poprzedników z serii GPT-5.6. Nagłówki mówią o cenie tokenu, ja patrzę na inną liczbę, bo przy agencie programistycznym płaci się za całe zadanie, a nie za pojedynczy token.

Ile kosztuje zadanie, a nie token

Na DeepSWE v1.1, teście, w którym agent rozwiązuje złożone zadania programistyczne w prawdziwych repozytoriach, Sol ustawiony na maksymalny poziom rozumowania zdobywa 68,8%. To tylko 1,1 punktu procentowego mniej niż najlepszy wynik Claude Fable 5 od Anthropica, a według OpenAI zadanie kosztuje przy tym około 80% mniej niż u Fable 5. Poziom rozumowania to suwak, którym decydujesz, jak długo model się zastanawia przed odpowiedzią: im wyżej, tym lepszy wynik i wyższy rachunek.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Tanie półki GPT-5.6 zmieniają rachunek bardziej niż flagowy Sol Model / Badania

Tanie półki GPT-5.6 zmieniają rachunek bardziej niż flagowy Sol

4 min

OpenAI wypuściło 9 lipca rodzinę GPT-5.6: flagowego Sola, tańszą Terrę i najtańszą Lunę, a najważniejsza liczba to nie "mądrzejszy", tylko "tańszy". Sol wypada o punkt poniżej Fable 5 na indeksie inteligencji, kończy jednak zadania w 61% krótszym czasie i za mniej więcej połowę kosztu, choć na SWE-Bench Pro zbiera tylko 64,6% wobec 80% konkurenta. Prawdziwą różnicę w rachunku robią dwie tanie półki: Terra i Luna biją Fable 5 przy około jednej szesnastej kosztu, a Luna startuje od 1 dolara za milion tokenów na wejściu. To nie przewrót, tylko przesunięcie stołu w stronę taniej.

Ta sama para modeli, trzy różne rachunki za jedno zadanie Model / Badania

Ta sama para modeli, trzy różne rachunki za jedno zadanie

5 min

Artificial Analysis wylicza, że średnie zadanie agentowe kosztuje 3,26 dolara na GPT-6 Astra i 7,63 na Claude Fable 5.1 przy identycznej skuteczności, ale OpenAI i Cognition zmierzyły tę samą różnicę na 63% i 42%, a Zvi Mowshowitz wskazuje, że Fable puszczono w trybie Max, co te 57% zawyża. Cognition odpowiada układem Fusion w Devinie, w którym droższy model prowadzi, a tańszy grzebie w kodzie: na DeepSWE 1.1 ścina to koszt zadania o 46% bez straty jakości, tyle że z Astrą na Terminal-Bench 4.0 wynik leci w dół o ponad pięć punktów. Cenę za zadanie widać dopiero na własnym repozytorium.

OpenAI ścina Lunę o 80% i przesuwa opłacalność na tanią półkę Model / Badania

OpenAI ścina Lunę o 80% i przesuwa opłacalność na tanią półkę

4 min

Od 30 lipca OpenAI ścina cenę modelu Luna o 80%, do 20 centów za milion tokenów na wejściu i 1,20 dolara na wyjściu, a Terra tanieje o 20%. Sol zostaje bez zmian. Oszczędności wzięły się stąd, że pod okiem ludzi Sol przepisał niskopoziomowy kod serwujący model na kartach graficznych i obniżył koszt jego działania o 20%. Przy tej cenie układ, w którym drogi model planuje, a tani wykonuje, przestaje być sztuczką optymalizatorów i staje się domyślny, bo strona wykonawcza kosztuje grosze.