SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

CLM-8B nie pisze ani słowa, tylko wybiera najlepszy ruch agenta

CLM-8B od związanego ze Stanfordem zespołu Contrastive-LM nie generuje tekstu, tylko przypisuje prawdopodobieństwo każdemu możliwemu ruchowi agenta, dzięki czemu jest szybszy od zamkniętego Jev, w grze T-Rex nawet dziewięciokrotnie. Jako sędzia łatek podniósł wynik na DeepSWE z 73,7 do 81,6%, podczas gdy Jev wybierał gorzej niż branie pierwszego rozwiązania z brzegu. Rekord liczono jednak na 38 i 30 zadaniach, więc szybkość broni się lepiej niż jakość, a nakładkę o wadze 75 MB na licencji Apache 2.0 można sprawdzić na własnych zadaniach.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

CLM-8B nie pisze ani słowa, tylko wybiera najlepszy ruch agenta
Ilustrację przygotowała AI.

Kiedy agent programistyczny dostaje to samo zadanie cztery razy i oddaje cztery różne poprawki, ktoś musi wybrać tę jedną, którą warto zmergeować. Zwykle robi to drugi duży model, który czyta wszystkie wersje i wydaje werdykt. Zespół Contrastive-LM, związany ze Stanfordem, wypuścił 23 września CLM-8B, model, który w ogóle nie pisze tekstu: dostaje opis sytuacji i listę możliwych ruchów, a oddaje prawdopodobieństwo dla każdego z nich. Autorzy chwalą się przyspieszeniem nawet dziewięciokrotnym, ale mnie bardziej zatrzymała inna liczba z tej samej publikacji, bo konkurencyjny sędzia wybierał w niej gorzej, niż gdyby po prostu brał pierwsze rozwiązanie z brzegu. Po lekturze skłaniam się ku temu, że szybkość CLM jest realnym zyskiem, a jego rekord jakości na razie obietnicą.

Model, który tylko ocenia

Wszystkie porównania w publikacji autorzy robią względem Jev, zamkniętego modelu firmy TypeSafe AI, który od 15 września działa we wczesnym, ograniczonym dostępie. Twórcy nazywają tę klasę modelami "System One": zamiast rozpisywać rozumowanie w akapitach, odpowiadają liczbą, na przykład szansą, że zdanie jest prawdziwe, wyborem jednej opcji z podanej listy albo oceną na zadanej skali. CLM celuje w dokładnie ten sam sposób zadawania pytań, a jego repozytorium udostępnia API zgodne z TypeSafe, więc zapytanie napisane pod Jev da się przepuścić przez CLM bez przepisywania.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Pięć podejść agenta, jeden sędzia i żadnych testów Premiera / Narzędzie

Pięć podejść agenta, jeden sędzia i żadnych testów

4 min

LLM-as-a-Verifier bierze pulę podejść agenta do jednego zadania i każe modelowi porównywać je parami, licząc przy tym nie samą notę, tylko pewność, z jaką model ją stawia. Na Terminal-Bench 2.1 model deepseek-v4-flash pojedynczym podejściem zaliczał 78,7% zadań, a wybór najlepszego z pięciu podniósł wynik do 88,0%, tyle że płaci się wtedy pięć razy zamiast raz. Ciekawszy jest drugi tryb, który ocenia jedno podejście krok po kroku, dzięki czemu beznadziejne da się przerwać po trzecim ruchu i ten rachunek raczej zbić niż napompować.

Jevgrep szuka kodu za agenta. Ile naprawdę na tym oszczędzasz? Premiera / Narzędzie

Jevgrep szuka kodu za agenta. Ile naprawdę na tym oszczędzasz?

4 min

Jevgrep, narzędzie wiersza poleceń wypuszczone przez Davida Zhanga 26 września, szuka kodu po opisie jego zachowania, a o trafności wyników decyduje osobno płatny model Jev firmy TypeSafe AI. Obiecane 40% oszczędności okupiono gorszym wynikiem na SWE-bench, więc uczciwą liczbą jest 25,8% z powtórki na wersji 0.4.3, liczone razem z opłatami za Jev, choć tylko na dziesięciu zadaniach. Wersja 0.5 przerzuca część pracy z powrotem na agenta, przez co przy rozliczaniu za tokeny wychodzi o 2 do 3% drożej, a fragmenty kodu i tak trafiają do zewnętrznego modelu.

Agent Cognition zabiera się do kodu po 18 krokach zamiast 48 Model / Badania

Agent Cognition zabiera się do kodu po 18 krokach zamiast 48

4 min

SWE-2, nowy model Cognition napędzający Devina, zabiera się do edycji kodu po 18 krokach zamiast 48, a całą drogę przez zadanie skrócił ze 127 kroków do 53, bo koszt wpisano wprost do funkcji nagrody podczas uczenia. Na własnym benchmarku firmy wypada niemal jak Fable 5.1, 50,0% wobec 50,9%, i to o 64% taniej, ale na trudniejszym Terminal-Bench 4 zostaje daleko w tyle z wynikiem 27,3%. Cennika ani osobnego API nie ma, model dostajesz wyłącznie razem z Devinem, więc przewagi kosztowej nikt z zewnątrz na razie nie sprawdzi u siebie.