SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Nawet na teście, który ułożyła sama, Meta przegrywa z Claude

5 sierpnia Meta wypuściła Muse Code, terminalowego agenta do programowania na modelu Muse Spark 1.2, który po awarii wznawia długie zadanie tam, gdzie padł. Kluczowe są liczby: na Terminal-Bench 2.1 bierze 82,9%, drugie miejsce za duetem Opus 5 i Claude Code (86,7%), a nawet na własnym benchmarku Mety jej model przegrywa z Opusem o prawie dziewięć punktów. Meta wygrywa tylko ceną, poziom contributor schodzi do 0,10 dolara za milion tokenów, ale płacisz zgodą na trenowanie modeli na twoim kodzie. Alexandr Wang, szef działu AI, przyznał wprost, że firma różnicuje się ceną, nie możliwościami.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  5 min  · 

Nawet na teście, który ułożyła sama, Meta przegrywa z Claude
Ilustrację przygotowała AI.

5 sierpnia Meta wypuściła Muse Code, agenta do programowania działającego w terminalu, a razem z nim Muse Spark 1.2, model, na którym ten agent stoi. Z grubsza robi to samo co Claude Code od Anthropic czy Codex od OpenAI: instalujesz go jedną komendą, opisujesz zadanie po ludzku, a on planuje zmiany, pisze kod i sprawdza wynik wprost w twoim repozytorium. Nowego w samej kategorii jest niewiele, więc od razu powiem, na czym Meta próbuje wygrać. Stawia na cenę i na wytrzymałość: chce być najtańsza i przetrwać najdłuższe zadania, nie padając po drodze.

Pisałem o Muse Spark już w lipcu, gdy Meta pokazała wersję 1.1: agresywny cennik i jedyny wynik pochodzący z wewnętrznego testu, którego nikt z zewnątrz nie widział. Tym razem liczby są publiczne i to one mówią najwięcej, choć żeby je docenić, najpierw warto zobaczyć, jak ten agent jest w środku zbudowany.

Agent, który po awarii wraca dokładnie tam, gdzie stanął

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Agent Mety, który wstaje po awarii tam, gdzie padł Premiera / Narzędzie

Agent Mety, który wstaje po awarii tam, gdzie padł

5 min

Meta wypuściła w becie Muse Code, swojego pierwszego agenta do programowania, i choć jego model Muse Spark 1.2 przegrywa w testach z Claude Code i Codeksem, siła narzędzia leży gdzie indziej. Rozgrzane przez całą sesję podagenty, izolacja przez git worktree i przyrostowy dziennik zdarzeń pozwalają agentowi wstać po awarii dokładnie tam, gdzie padł. Prawdziwy zakład widać jednak w cenniku: tani poziom Contributor kupuje się, oddając Mecie swoje prompty i kod na trenowanie przyszłych modeli. Dla open-source to okazja, dla firmy z poufnym kodem rachunek płaci się własnym kodem.

Publiczne API, agresywna cena i benchmarki, których nikt z zewnątrz nie widział Model / Badania

Publiczne API, agresywna cena i benchmarki, których nikt z zewnątrz nie widział

4 min

W czwartek 9 lipca Meta pokazała Muse Spark 1.1 i otworzyła publiczny podgląd Meta Model API, do którego zapisujesz się na listę oczekujących i budujesz za 1,25 dolara od miliona tokenów wejścia oraz 4,25 dolara od wyjścia, z 20 dolarami darmowych środków na start. Alexander Wang chwali cennik jako agresywny, taniej niż Grok 4.5 i Opus. Problem w tym, że jedyny wynik pochodzi z wewnętrznego Meta Internal Coding Bench, bez żadnej publicznej liczby na SWE-Bench, więc świetne kodowanie trzeba przyjąć na słowo. To na razie model do eksperymentu, nie do produkcji.

Meta oddaje 30-miliardowego agenta za darmo, jeśli masz na czym go uruchomić Model / Badania

Meta oddaje 30-miliardowego agenta za darmo, jeśli masz na czym go uruchomić

5 min

Meta wypuściła 10 sierpnia Muse Glimmer, agentowy model o 30 miliardach parametrów, i oddała jego wagi za darmo na licencji Apache 2.0, dzięki czemu autonomiczny agent może planować zadania, wywoływać narzędzia i pisać kod lokalnie, bez opłat za API. Darmowy jest jednak tylko model, bo po kwantyzacji do 4 bitów potrzebuje maszyny z 24 do 32 GB pamięci, na przykład RTX 4090 albo MacBooka Pro z M4 Max. Na testach agentowych prowadzi, 51,2 na SWE-Bench Pro wobec 36,9 Gemmy i 50,2 Qwena, ale w terminalu przegrywa z Qwenem, a wszystkie liczby pochodzą od samej Mety.