Kompleksowa analiza dokumentów z deepDoctection 1.2.x: od układu po ekstrakcję danych
Artykuł przedstawia szczegółowy przewodnik po tworzeniu kompleksowego potoku analizy dokumentów za pomocą biblioteki deepDoctection w wersji 1.2.x, obejmującego detekcję układu, rozpoznawanie tabel, OCR i ekstrakcję kluc

Biblioteka deepDoctection w wersji 1.2.x oferuje narzędzia do stworzenia zaawansowanego potoku analizy dokumentów, który integruje wiele kluczowych funkcji. Obejmuje to detekcję układu, rozpoznawanie struktury tabel, optyczne rozpoznawanie znaków (OCR), rekonstrukcję kolejności czytania, łączenie adnotacji oraz eksport danych w ustrukturyzowanym formacie. Dzięki temu możliwe jest przetwarzanie dokumentów od surowej formy do gotowych do użycia danych w jednym, spójnym procesie.
Konfiguracja i podstawowe funkcje potoku
Proces konfiguracji potoku w deepDoctection rozpoczyna się od jawnego określenia komponentów analitycznych. W ramach przykładu wykorzystano detekcję układu opartą na modelu DocLayNet, rozpoznawanie struktury tabel za pomocą Table Transformer oraz OCR realizowane przez DocTR. Po przetworzeniu dokumentów, biblioteka generuje obiekty Page, które szczegółowo reprezentują tekst, figury, tabele, zależności między elementami, pochodzenie danych oraz kolejność czytania. Możliwe jest również sprawdzenie rejestru modeli deepDoctection w celu weryfikacji używanych modeli układu i wspieranych kategorii dokumentów.
Konfiguracja analizatora obejmuje szereg parametrów, takich jak USE_ROTATOR=False, USE_LAYOUT=True, USE_TABLE_SEGMENTATION=True czy OCR.USE_DOCTR=True. Dzięki temu użytkownik ma pełną kontrolę nad tym, które moduły są aktywne i w jaki sposób dokumenty są przetwarzane. Po zainicjowaniu analizatora, można sprawdzić jego komponenty potoku oraz typy adnotacji, które są generowane.
Inspekcja wyników i rozszerzanie funkcjonalności
Po uruchomieniu skonfigurowanego analizatora na przykładowym pliku PDF, można szczegółowo zbadać uzyskane wyniki. Obejmują one tekst narracyjny, bloki układu w kolejności czytania, kategorie adnotacji, relacje między figurami a podpisami, pochodzenie słów oraz ich ramki ograniczające (bounding boxy). Wykryte tabele są dostępne w formatach HTML, CSV oraz jako pojedyncze reprezentacje komórek, co pozwala na dokładne zbadanie ich strukturyzowanej zawartości. Przykładowo, można sprawdzić liczbę wierszy i kolumn, a także zakresy scalonych komórek.
deepDoctection pozwala również na rozszerzanie jego funkcjonalności poprzez rejestrowanie własnych typów obiektów i implementowanie niestandardowych komponentów potoku. W ramach tutorialu zarejestrowano niestandardowe typy obiektów dla wzmianek pieniężnych (MONEY_MENTIONS), wzmianek dat (DATE_MENTIONS) oraz klasyfikacji typu dokumentu (DOC_FLAVOUR). Następnie zaimplementowano komponent EntityAndFlavourService, który analizuje tekst strony i pokrycie tabel, aby generować te podsumowania na poziomie strony. Dzięki temu, niestandardowe pola podsumowań stają się bezpośrednio dostępne jako atrybuty obiektów Page.
Budowanie niestandardowych potoków i serializacja danych
Biblioteka umożliwia ręczne składanie potoków za pomocą ServiceFactory, łącząc analizę układu, przetwarzanie tabel, OCR, porządkowanie tekstu oraz niestandardowe komponenty. Przykładowy potok został wykonany na obrazie dokumentu finansowego, co pozwoliło na inspekcję wykrytego typu dokumentu, wartości pieniężnych, dat oraz struktury tabeli. Możliwe jest również zastosowanie filtrów wejściowych (inbound filters) oraz cofanie adnotacji wygenerowanych przez wybrane usługi, co daje elastyczność w zarządzaniu procesem analizy.
Na koniec, przetworzone strony można serializować do formatu JSON, zachowując ich strukturalne adnotacje bez osadzania oryginalnych danych obrazu. Pozwala to na łatwe przechowywanie i ponowne ładowanie przetworzonych dokumentów. Adnotacje dokumentów mogą być również przekształcane w uporządkowane fragmenty JSONL, co jest idealne do dalszego wykorzystania w systemach RAG (Retrieval-Augmented Generation) i systemach wyszukiwania. Takie podejście umożliwia efektywne wykorzystanie danych z dokumentów w zaawansowanych aplikacjach AI.
Możliwość tworzenia tak elastycznych i konfigurowalnych potoków w deepDoctection znacząco ułatwia automatyzację przetwarzania dokumentów, co jest kluczowe w wielu branżach, od finansów po zarządzanie danymi. Integracja różnych modeli i możliwość ich rozszerzania sprawia, że narzędzie to staje się potężnym rozwiązaniem dla inteligentnej analizy dokumentów.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Sztuczna inteligencja staje się największym konsumentem AI: 14-krotny wzrost użycia tokenów przez agentów
Analiza OpenRouter wskazuje, że agenci AI zużywają znacznie więcej tokenów niż ludzie, co świadczy o rosnącej autonomii systemów sztucznej inteligencji.
Redakcja Aigest7 godz. temu

Sztuczna inteligencja może pogorszyć jakość badań naukowych, twierdzą naukowcy z Princeton i University of Washington
Nowe badanie teoretyczne sugeruje, że choć AI oszczędza czas, może to prowadzić do powierzchownych badań, a nie do głębszej analizy, zwiększając obciążenie systemu publikacji.
Redakcja Aigest8 godz. temu

Orbitalne centra danych Starcloud to wizja, która zderza się z rzeczywistością
Inwestycja w Starcloud pokazuje, że rynek szuka innowacyjnych rozwiązań dla rosnącego zapotrzebowania na moc obliczeniową AI, ale koszty i wyzwania techniczne pozostają ogromne.
Michał Chmielarz9 godz. temu

Inherent, startup założony przez byłych pracowników DeepMind, twierdzi, że ich AI przewyższyła modele Anthropic i OpenAI
Brytyjska firma Inherent, założona przez byłych pracowników Google DeepMind, ogłosiła, że jej agent AI, Faraday, przewyższył znacznie większe modele od Anthropic i OpenAI w zadaniu niezależnego replikowania wyników badań
Redakcja Aigest22 godz. temu

Firmy AI zmieniają politykę danych pod naciskiem, co jest dobrym sygnałem dla rynku
Kwestia prywatności i kontroli nad danymi staje się kluczowa dla adaptacji AI w biznesie. Decyzje Anthropic i Mety pokazują, że rynek wymusza większą transparentność i bezpieczeństwo.
Michał Chmielarzwczoraj

RayNeo iO Glasses: Inteligentne okulary AI bez kamery, z naciskiem na nakładki tekstowe
RayNeo wprowadza na rynek okulary AI iO Glasses, które rezygnują z kamery i głośnika, skupiając się na wyświetlaniu tekstu w polu widzenia użytkownika. Urządzenie oferuje zaawansowane funkcje transkrypcji i podsumowywani
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.