SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

73% trafnych fragmentów zamiast 46%: Jev jako filtr w agencie badawczym

GPT Researcher domyślnie przepuszcza pobrane fragmenty przez Jev od TypeSafe, model, który zamiast pisać tekst zwraca prawdopodobieństwa z góry ustalonych odpowiedzi, i trafnych okazało się 73% zachowanych fragmentów wobec 46% przy embeddingach, przy tym samym koszcie raportu. Całą różnicę robi próg, bo zmuszony do wypełnienia wszystkich dziesięciu miejsc Jev spadł do 50%. Model kosztuje 0,042 dolara za milion tokenów wejściowych, a reklamowe mnożniki 193,6 i 444,6 pochodzą z testów samej firmy, więc traktuję je jako obietnicę, nie pomiar.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

73% trafnych fragmentów zamiast 46%: Jev jako filtr w agencie badawczym
Ilustrację przygotowała AI.

GPT Researcher, otwarty agent, który sam przeszukuje sieć i składa raport na zadane pytanie, przy każdym uruchomieniu ściąga kilkadziesiąt stron, a większość ich treści do niczego się nie przydaje. Zanim model piszący raport cokolwiek przeczyta, filtr decyduje, które fragmenty w ogóle do niego trafią. Dotąd robiły to embeddingi, czyli porównanie, jak bardzo fragment tekstu przypomina pytanie. Teraz domyślnie robi to Jev od TypeSafe, model, który zamiast pisać tekst, odpowiada prawdopodobieństwem. W pomiarach zespołu GPT Researchera trafnych okazało się 73% zachowanych fragmentów, wobec 46% przy embeddingach, a raport kosztował tyle samo.

Dla mnie to ważniejsza wiadomość niż sama premiera Jev. Pokazuje, do czego taki model naprawdę się nadaje: nie do pisania, tylko do odpowiadania na wąskie pytania liczbą, której można zaufać na tyle, żeby postawić na niej próg.

Model, który nie pisze ani słowa

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Jevgrep szuka kodu za agenta. Ile naprawdę na tym oszczędzasz? Premiera / Narzędzie

Jevgrep szuka kodu za agenta. Ile naprawdę na tym oszczędzasz?

4 min

Jevgrep, narzędzie wiersza poleceń wypuszczone przez Davida Zhanga 26 września, szuka kodu po opisie jego zachowania, a o trafności wyników decyduje osobno płatny model Jev firmy TypeSafe AI. Obiecane 40% oszczędności okupiono gorszym wynikiem na SWE-bench, więc uczciwą liczbą jest 25,8% z powtórki na wersji 0.4.3, liczone razem z opłatami za Jev, choć tylko na dziesięciu zadaniach. Wersja 0.5 przerzuca część pracy z powrotem na agenta, przez co przy rozliczaniu za tokeny wychodzi o 2 do 3% drożej, a fragmenty kodu i tak trafiają do zewnętrznego modelu.

Kev: model decyzyjny w stylu Jev, który postawisz na własnym serwerze Premiera / Narzędzie

Kev: model decyzyjny w stylu Jev, który postawisz na własnym serwerze

4 min

Jared Palmer, pracując z agentem Devin, odtworzył w otwartym projekcie Kev model decyzyjny w stylu płatnego Jev od TypeSafe, który zamiast akapitu tekstu zwraca prawdopodobieństwa dla pytań typu tak lub nie albo wyboru z listy. Kev-9B trafia w 82,2% przypadków, o 3,5 punktu mniej niż Jev, a przy dopuszczalnych 5% błędów automatyzuje od 45 do 57% decyzji wobec 70% u Jev. Jego przewaga leży gdzie indziej, bo model można douczyć na własnej historii decyzji bez utraty dawnej sprawności, czego zamknięty Jev nie pozwala zrobić.

Agent przeglądarkowy, który nie patrzy na zrzuty ekranu Premiera / Narzędzie

Agent przeglądarkowy, który nie patrzy na zrzuty ekranu

4 min

Rozszerzenie pi-jev-browser daje agentowi pi przeglądarkę, którą steruje model Jev firmy TypeSafe AI, a ten zamiast zrzutów ekranu dostaje tekst strony i ponumerowaną listę ruchów, z której może tylko wybierać. Kod pilnuje pętli, bo zatrzymuje ją, gdy trzy działania z rzędu nic nie zmieniają, a zgłoszone "gotowe" uznaje za niezweryfikowane, dopóki pi nie sprawdzi wyniku. W Kalkulatorze na macOS dopiero faza planowania podniosła skuteczność z jednego trafnego wciśnięcia do dziesięciu na dziesięć, choć szybkości autor jeszcze nie zmierzył.