Hvad betyder Intelligent document processing?
Intelligent document processing, forkortet IDP, er en samlet proces til at omsætte dokumenter til brugbare oplysninger. Den kan begynde med OCR, fortsætte med identifikation af dokumenttype og udtræk af felter og slutte med validering og menneskelig kontrol.
Det afgørende er ikke blot at kunne læse teksten. En faktura, kontrakt eller ordre indeholder relationer mellem felter, tabeller og betingelser. Et korrekt aflæst tal kan stadig ende i det forkerte felt. Derfor skal dokumentbehandling vurderes på de oplysninger og beslutninger, som den efterfølgende proces faktisk bruger.
Fra fil til et kontrolleret datasæt
Først kontrolleres filtype, læsbarhed og eventuelle sider, der mangler. Derefter kan dokumentet klassificeres og opdeles. Udtrækket producerer felter med forbindelse til de relevante steder i originalen. Et schema beskriver, hvilke felter der forventes, mens forretningsregler kontrollerer deres sammenhæng.
En leverandørreference kan for eksempel slås op, et totalbeløb kan sammenholdes med linjerne, og en dato kan kontrolleres mod dokumenttypen. Ukendte eller modstridende værdier bør markeres eksplicit. Et system bør ikke opfinde et manglende felt for at kunne levere en komplet række.
Vurder fejl på feltniveau og opgaveniveau
Et gennemsnit på tværs af alle felter kan skjule fejl i kritiske oplysninger. En forkert note og et forkert kontonummer har forskellig betydning. Brug derfor feltvise kriterier og en samlet vurdering af, om dokumentet kan behandles videre. En reviewflade bør vise originalens udsnit sammen med udtrækket. Test forskellige layouts, dårlige scanninger, håndrettelser og dokumenter, som løsningen slet ikke er beregnet til. Kvaliteten skal måles på nye dokumenter, ikke kun de eksempler opsætningen blev tilpasset til.
Et eksempel fra praksis
En grossist ønsker at forberede indkøbsordrer fra leverandørbekræftelser. IDP-flowet udtrækker varenummer, antal og forventet leveringsdato og knytter hvert felt til originalen. Ukendte varenumre og delvise leverancer sendes til en medarbejder. Først validerede oplysninger føres videre. Piloten undersøger, hvilke dokumenttyper der kræver mest kontrol, og om kritiske felter er korrekte. Eksemplet indebærer ikke automatisk godkendelse af en ordre eller en dokumenteret besparelse.
Typiske faldgruber
- At sidestille korrekt OCR med korrekt fortolkning af dokumentet.
- At skjule usikre kritiske felter i en samlet høj kvalitetsscore.
- At sende udtræk direkte videre uden kontrol af dubletter og datakontrakter.
Det skal I afklare
- Definér dokumenttyper, felter og kritiske fejl.
- Bevar en tydelig forbindelse mellem udtræk og original.
- Test variationer og en reviewkø før videre automatisering.
Spørgsmål og svar
Er IDP det samme som OCR?
Nej. OCR læser tekst fra billeder. IDP omfatter også klassificering, strukturering, validering og overdragelse til en proces. OCR kan være et af flere trin.
Kan en stor sprogmodel udføre hele processen?
Den kan hjælpe med flere trin, men filkontrol, adgang, strukturel validering og kritiske forretningsregler bør stadig være eksplicitte. Et flydende svar er ikke en erstatning for kontrollerede data.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Google Cloud: Document AI overview ↗OCR, klassificering og struktureret udtræk fra dokumenter.
- Microsoft: Document Intelligence overview ↗Dokumentbehandling og udtræk af indhold og struktur.

