SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Agent Mety, który wstaje po awarii tam, gdzie padł

Meta wypuściła w becie Muse Code, swojego pierwszego agenta do programowania, i choć jego model Muse Spark 1.2 przegrywa w testach z Claude Code i Codeksem, siła narzędzia leży gdzie indziej. Rozgrzane przez całą sesję podagenty, izolacja przez git worktree i przyrostowy dziennik zdarzeń pozwalają agentowi wstać po awarii dokładnie tam, gdzie padł. Prawdziwy zakład widać jednak w cenniku: tani poziom Contributor kupuje się, oddając Mecie swoje prompty i kod na trenowanie przyszłych modeli. Dla open-source to okazja, dla firmy z poufnym kodem rachunek płaci się własnym kodem.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  5 min  · 

Agent Mety, który wstaje po awarii tam, gdzie padł
Ilustrację przygotowała AI.

Muse Code potrafi paść w środku zadania, które chodzi już 20 godzin, i po restarcie wrócić dokładnie tam, gdzie stanął, bez utraty pracy i bez zaczynania od nowa. Dla kogoś, kto puszcza agenta na całą noc, to może znaczyć więcej niż jakikolwiek wynik w teście. I to jest dokładnie ten zakład, który Meta postawiła.

Firma wypuściła Muse Code 5 sierpnia w wersji beta, swojego pierwszego agenta do programowania. Działa w terminalu na macOS i Linux, napędza go nowy model Muse Spark 1.2, a instaluje się jedną komendą. Wchodzi na rynek, który trzymają już Claude Code od Anthropica i Codex od OpenAI, i Meta nawet nie udaje, że jest od nich lepsza.

Pisałem o tym tydzień temu, kiedy padły liczby. Terminal-Bench i DeepSWE to testy, w których agent samodzielnie rozwiązuje prawdziwe zadania programistyczne, krok po kroku. Na Terminal-Bench 2.1 model Mety bierze 82,9%, czyli mniej niż duet Opus 5 i Claude Code na 86,7%, a na trudniejszym DeepSWE przegrywa i z Claude, i z GPT. Wszystkie te wyniki pochodzą z testów samej Mety, a niezależny Vals AI, puszczając model w jednym wspólnym środowisku, ustawił go dopiero na 14. miejscu z 50 pod względem ogólnego programowania. Skoro więc nie modelem, to czym Muse Code ma kogokolwiek przekonać? Odpowiedź nie siedzi w modelu, tylko w tym, co go otacza.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Nawet na teście, który ułożyła sama, Meta przegrywa z Claude Premiera / Narzędzie

Nawet na teście, który ułożyła sama, Meta przegrywa z Claude

5 min

5 sierpnia Meta wypuściła Muse Code, terminalowego agenta do programowania na modelu Muse Spark 1.2, który po awarii wznawia długie zadanie tam, gdzie padł. Kluczowe są liczby: na Terminal-Bench 2.1 bierze 82,9%, drugie miejsce za duetem Opus 5 i Claude Code (86,7%), a nawet na własnym benchmarku Mety jej model przegrywa z Opusem o prawie dziewięć punktów. Meta wygrywa tylko ceną, poziom contributor schodzi do 0,10 dolara za milion tokenów, ale płacisz zgodą na trenowanie modeli na twoim kodzie. Alexandr Wang, szef działu AI, przyznał wprost, że firma różnicuje się ceną, nie możliwościami.

Meta oddaje 30-miliardowego agenta za darmo, jeśli masz na czym go uruchomić Model / Badania

Meta oddaje 30-miliardowego agenta za darmo, jeśli masz na czym go uruchomić

5 min

Meta wypuściła 10 sierpnia Muse Glimmer, agentowy model o 30 miliardach parametrów, i oddała jego wagi za darmo na licencji Apache 2.0, dzięki czemu autonomiczny agent może planować zadania, wywoływać narzędzia i pisać kod lokalnie, bez opłat za API. Darmowy jest jednak tylko model, bo po kwantyzacji do 4 bitów potrzebuje maszyny z 24 do 32 GB pamięci, na przykład RTX 4090 albo MacBooka Pro z M4 Max. Na testach agentowych prowadzi, 51,2 na SWE-Bench Pro wobec 36,9 Gemmy i 50,2 Qwena, ale w terminalu przegrywa z Qwenem, a wszystkie liczby pochodzą od samej Mety.

Wpisujesz prośbę, a Codex sam rozpisuje robotę na kilka agentów Premiera / Narzędzie

Wpisujesz prośbę, a Codex sam rozpisuje robotę na kilka agentów

4 min

Pietro Schirano z OpenAI pokazał 14 czerwca, że nie pisze już sam komendy /goal w Codeksie — prosi agenta, żeby sam ustalił sobie cel, rozbił robotę na kawałki i odpalił równoległe kopie, które złożyły symulację kolejki górskiej w Three.js. Thibault Sottiaux nazwał to uogólnieniem meta-promptingu, ale haczyk jest realny: kiedy agent sam wyznacza cel, sam decyduje, kiedy go spełnił, co otwiera furtkę na reward hacking i kręcenie się w kółko przy mglistych poleceniach. 16 czerwca błędy "model at capacity" odcięły część użytkowników od GPT-5.5, a Claude Code wciąż jest pierwszym wyborem na rynku.