SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Bedrock przepisze twój prompt, metrykę wciąż musisz napisać sam

Amazon Bedrock dostał Advanced Prompt Optimization, które przy migracji na nowszy model samo przepisuje prompt i w pętli sprawdza, czy nowa wersja wypada lepiej, celując naraz w maksymalnie pięć modeli i porównując jakość, koszt oraz czas do pierwszego tokenu. Sukces definiujesz na trzy sposoby: własną metryką, drugim modelem w roli sędziego albo opisem słowami. AWS chwali się skokami jakości od 35% do 143%, ale to pojedyncze przebiegi po pięć próbek, a optymalizator wspina się dokładnie po metryce, którą mu dasz, więc tę metrykę wciąż musisz napisać sam.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  3 min  · 

Bedrock przepisze twój prompt, metrykę wciąż musisz napisać sam
Ilustrację przygotowała AI.

Migracja promptu na nowy model wygląda z zewnątrz na drobiazg, a w praktyce potrafi zjeść dni albo tygodnie. Masz działającą aplikację, prompty dopieszczone, odpowiedzi stabilne, użytkownicy zadowoleni. Pojawia się model szybszy i tańszy, więc chcesz się przenieść, i wtedy zaczyna się to samo co zawsze: przepisujesz prompt, puszczasz go na przypadkach testowych, porównujesz odpowiedzi, poprawiasz i znowu od początku. A teraz pomnóż tę robotę przez każdy szablon promptu w produkcji i przez każdy model, który w ogóle warto sprawdzić.

Amazon Bedrock dostał właśnie Advanced Prompt Optimization, narzędzie, które ten cykl automatyzuje: bierze twój prompt, przepisuje go i samo sprawdza, czy wersja po zmianie jest lepsza. Tyle że automatyzując przepisywanie, AWS daje ci do ręki znacznie trudniejszy problem, o którym wpis firmy mówi półgłosem. Optymalizator poprawia dokładnie to, co każesz mu mierzyć, więc cała gra przenosi się z brzmienia promptu na to, czy twoja metryka w ogóle mierzy sukces.

Pętla: oceń, przepisz, oceń

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Anthropic każe wyciąć z promptów to, co kiedyś wymuszało dokładność Poradnik / Praktyka

Anthropic każe wyciąć z promptów to, co kiedyś wymuszało dokładność

4 min

Anthropic odświeżył firmowy przewodnik po promptowaniu i większość pracy przy przenoszeniu starych promptów polega teraz na wycinaniu, nie dopisywaniu. Kategoryczne "KRYTYCZNE: MUSISZ" i pisanie wielkimi literami w najnowszych modelach, od Fable 5 po Opus 4.8, zaczynają szkodzić, bo model bierze je zbyt dosłownie. Prefill na końcu rozmowy i parametr budget_tokens zwracają już twardy błąd 400 na Opus 4.7 i nowszych, więc głębokością namysłu steruje się teraz parametrem effort. Przy długich zadaniach rada jest prosta: stan trzymaj poza kontekstem, na dysku, w plikach i w gicie.

Trzy frameworki, które każą maszynie pisać własne prompty i skille Premiera / Narzędzie

Trzy frameworki, które każą maszynie pisać własne prompty i skille

5 min

Trzy czerwcowe projekty open-source, GEPA, EvoSkill i Self-Harness, oddają maszynie to, co dotąd pisał inżynier: prompt, umiejętności agenta i reguły jego działania. Pętla ewolucyjna sama generuje warianty, ocenia je i zachowuje najlepsze, obiecując kilkudziesięcioprocentowy skok skuteczności bez dotykania wag modelu; GEPA podbił GPT-4.1 Mini na zadaniach AIME z 46,6% do 56,6% przy 100 do 500 prób zamiast tysięcy. Działa to jednak tylko tam, gdzie wynik da się tanio i jednoznacznie zmierzyć, więc nowa rola człowieka to napisać dobrą miarę, a nie cyzelować pojedyncze zdanie.

Prompty, które kiedyś wymuszały dokładność, dziś psują wynik Poradnik / Praktyka

Prompty, które kiedyś wymuszały dokładność, dziś psują wynik

4 min

Anthropic zebrał wskazówki promptowania dla swojej rodziny modeli z 2026 roku w jednym przewodniku, a jego sednem jest lista rzeczy do odkręcenia w starych promptach po przejściu na nowszy model. Stanowcze instrukcje typu "KRYTYCZNE: MUSISZ użyć narzędzia" teraz przesadzają, więc trzeba zdjąć wykrzykniki i zamienić ogólne nakazy na celowane. Twardo znikają dwie rzeczy: prefill (od modeli 4.6 zwraca błąd 400) i budget_tokens, którego rolę przejmuje effort i adaptacyjne myślenie, gdzie model sam decyduje, jak głęboko się zastanowić.