SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Kev: model decyzyjny w stylu Jev, który postawisz na własnym serwerze

Jared Palmer, pracując z agentem Devin, odtworzył w otwartym projekcie Kev model decyzyjny w stylu płatnego Jev od TypeSafe, który zamiast akapitu tekstu zwraca prawdopodobieństwa dla pytań typu tak lub nie albo wyboru z listy. Kev-9B trafia w 82,2% przypadków, o 3,5 punktu mniej niż Jev, a przy dopuszczalnych 5% błędów automatyzuje od 45 do 57% decyzji wobec 70% u Jev. Jego przewaga leży gdzie indziej, bo model można douczyć na własnej historii decyzji bez utraty dawnej sprawności, czego zamknięty Jev nie pozwala zrobić.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Kev: model decyzyjny w stylu Jev, który postawisz na własnym serwerze
Ilustrację przygotowała AI.

Josh Lehman, jeden z opiekunów otwartego agenta OpenClaw, opisuje kłopot z botem Molty, który na zespołowym Discordzie wtrąca się w rozmowy ludzi, którzy wcale do niego nie mówili. Można przed każdą odpowiedzią pytać drugi model językowy, czy bot powinien się odezwać, ale wtedy przed i tak wolnym wywołaniem stawiasz kolejne, i to przy każdej wiadomości na ruchliwym kanale (OpenClaw). Na takie drobne rozstrzygnięcia od niespełna dwóch tygodni istnieje osobna kategoria narzędzi: modele decyzyjne. Jared Palmer pokazał właśnie, że taki model da się mieć na własnym sprzęcie, i moim zdaniem najciekawsze w jego projekcie nie są wyniki, tylko to, co pozwala zrobić z własnymi danymi.

Liczba zamiast akapitu

Model decyzyjny nie pisze tekstu. Dostaje jeden dokument, na przykład zgłoszenie od klienta, oraz kilka pytań o z góry ustalonym typie: tak lub nie, wybór z listy albo ocena na skali. W jednym przebiegu zwraca rozkład prawdopodobieństwa dla każdego pytania, więc aplikacja dostaje liczbę, na której od razu oprze zwykłego ifa, zamiast akapitu, który trzeba jeszcze sparsować (Hugging Face).

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Otwarty model decyzyjny na Macu, prawie tak celny jak zamknięty Jev Model / Badania

Otwarty model decyzyjny na Macu, prawie tak celny jak zamknięty Jev

4 min

Bespoke Labs wydało Nimble, otwarty model zbudowany na Qwen3.5-9B, który wybiera odpowiedź z listy opcji lokalnie, na Macu albo karcie NVIDIA, więc nie trzeba parsować JSON-a zwróconego przez API. Na 324 przykładach testowych zgodził się z etykietami w 90,1% przypadków, a zamknięty Jev firmy TypeSafe w 93,2%, tyle że etykiety są syntetyczne, a test wąski. Do wstępnej klasyfikacji zgłoszeń to rozsądny wybór, ale przy decyzjach o pieniądzach lepiej najpierw sprawdzić go na własnych danych, bo bywa zbyt pewny siebie.

Pięć podejść agenta, jeden sędzia i żadnych testów Premiera / Narzędzie

Pięć podejść agenta, jeden sędzia i żadnych testów

4 min

LLM-as-a-Verifier bierze pulę podejść agenta do jednego zadania i każe modelowi porównywać je parami, licząc przy tym nie samą notę, tylko pewność, z jaką model ją stawia. Na Terminal-Bench 2.1 model deepseek-v4-flash pojedynczym podejściem zaliczał 78,7% zadań, a wybór najlepszego z pięciu podniósł wynik do 88,0%, tyle że płaci się wtedy pięć razy zamiast raz. Ciekawszy jest drugi tryb, który ocenia jedno podejście krok po kroku, dzięki czemu beznadziejne da się przerwać po trzecim ruchu i ten rachunek raczej zbić niż napompować.

Agent przeglądarkowy, który nie patrzy na zrzuty ekranu Premiera / Narzędzie

Agent przeglądarkowy, który nie patrzy na zrzuty ekranu

4 min

Rozszerzenie pi-jev-browser daje agentowi pi przeglądarkę, którą steruje model Jev firmy TypeSafe AI, a ten zamiast zrzutów ekranu dostaje tekst strony i ponumerowaną listę ruchów, z której może tylko wybierać. Kod pilnuje pętli, bo zatrzymuje ją, gdy trzy działania z rzędu nic nie zmieniają, a zgłoszone "gotowe" uznaje za niezweryfikowane, dopóki pi nie sprawdzi wyniku. W Kalkulatorze na macOS dopiero faza planowania podniosła skuteczność z jednego trafnego wciśnięcia do dziesięciu na dziesięć, choć szybkości autor jeszcze nie zmierzył.