SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Jedno polecenie, dokument w markdownie, nic nie wychodzi z twojego dysku

Docling, projekt z IBM Research w Zurychu, dziś pod fundacją LF AI & Data i na licencji MIT, jednym poleceniem zamienia PDF-y, skany, pliki poczty czy wideo w markdown gotowy dla modelu, a liczy to wszystko lokalnie. Najwięcej zmienia odczyt wykresów słupkowych, kołowych i liniowych, które na wyjściu stają się tabelą albo kodem, dzięki czemu model dostaje liczby zamiast podpisu pod obrazkiem. Przy trudnych układach stron pomaga GraniteDocling o 258 milionach parametrów, a konwersję można wystawić agentowi jako serwer MCP. Miar dokładności nie ma, więc trzeba to sprawdzić na własnych plikach.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Jedno polecenie, dokument w markdownie, nic nie wychodzi z twojego dysku
Ilustrację przygotowała AI.

Wpisujesz w terminalu docling i adres PDF-a z arXiv, a po chwili w bieżącym katalogu leży plik markdown z treścią tego dokumentu, z zachowaną kolejnością czytania, ze wzorami i z tabelami, które nadal są tabelami, a nie rozjechaną papką znaków. Kilka linijek w Pythonie robi dokładnie to samo, jeśli wolisz wpiąć konwersję we własny kod.

Docling zaczął się w IBM Research w Zurychu jako narzędzie do rozbierania PDF-ów na części pierwsze, a dziś jest projektem fundacji LF AI & Data na licencji MIT. Robi jedną rzecz: bierze dokument w niemal dowolnym formacie i oddaje go w postaci, którą da się podać modelowi językowemu. Lista obsługiwanych formatów jest długa i to o niej się pisze, tylko że sama w sobie znaczy niewiele. Liczy się raczej to, że każdy z tych plików ląduje w jednym wewnętrznym opisie dokumentu, więc na wyjściu zawsze dostajesz to samo, niezależnie od tego, czy na wejściu był skan umowy, czy arkusz kalkulacyjny.

Wykres w PDF-ie zwykle przepada

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Czternaście formatów dokumentów, jeden markdown na wyjściu Premiera / Narzędzie

Czternaście formatów dokumentów, jeden markdown na wyjściu

4 min

Firecrawl wypuścił AnyDoc, otwartą bibliotekę na licencji MIT, która zamienia 14 formatów dokumentów, od Worda i Excela po PDF, na jednolity markdown. Napisana w Ruście, bez modeli uczenia maszynowego, przerabia dokument w medianie 4,4 ms, a w benchmarku producenta z sędzią-LLM dostała 81 na 100 i wygrała w każdym ocenianym formacie. Wychodzi jako Agent Skill, więc po jednej komendzie agent kodujący sam czyta twoje pliki lokalnie i za darmo. Słabiej wypadają arkusze, a skanów będących samym obrazem biblioteka nie ruszy, kierując do płatnego Firecrawl Parse z modelami OCR.

Czterdzieści jeden agentów AI zgodziło się na ten sam plik markdownu Premiera / Narzędzie

Czterdzieści jeden agentów AI zgodziło się na ten sam plik markdownu

4 min

SKILL.md — markdown z dwulinijkowym nagłówkiem YAML — cicho stał się wspólnym formatem instrukcji dla agentów kodujących. Vercel Labs wypuścił `npx skills add`, które mapuje ten sam folder na 45 agentów, od Claude Code po Gemini CLI. Google w repo `google/agents-cli` publikuje siedem skilli uczących cudzych asystentów stawiać agenty ADK na Cloud Run, a Hugo He w PPT Master składa edytowalny PowerPoint za 0,08 dolara. Tylko Claude Code wspiera wszystkie cztery funkcje formatu, więc pierwsza zmiana schematu pokaże, czy to npm dla agentów.

Cztery zasady Karpathy'ego w jednym pliku CLAUDE.md, 33 tysiące gwiazdek na GitHubie Poradnik / Praktyka

Cztery zasady Karpathy'ego w jednym pliku CLAUDE.md, 33 tysiące gwiazdek na GitHubie

3 min

Forrest Chang zamknął cztery obserwacje Andreja Karpathy'ego o słabościach LLM-ów w jednym pliku CLAUDE.md i w niespełna dwa miesiące zebrał 33,2 tysiąca gwiazdek na GitHubie. Reguły "myśl przed kodowaniem", "prostota najpierw", "chirurgiczne zmiany" i "sterowanie celem" odpowiadają na konkretne grzechy modeli: ciche wybieranie interpretacji, puchnięcie abstrakcjami i refaktoryzowanie tego, o co nikt nie prosił. Żaden benchmark tego nie potwierdza, ale koszt jest zerowy, a markdown powoli staje się standardową warstwą programowania agentów.