Hvad betyder Dokumentparsing?
Dokumentparsing er bearbejdning af en fil til en struktureret repræsentation. Det kan være tekst, overskrifter, tabeller, lister, sidehenvisninger og metadata fra PDF, Word eller andre formater. Formålet er at gøre materialet brugbart for søgning, dataudtræk og AI-svar.
Parsing er mere end at trække alle tegn ud. En PDF kan placere tekst visuelt i to spalter, mens filens interne rækkefølge er anderledes. Hvis parseren blander spalterne, kan et korrekt skrevet dokument blive til et forkert tekstgrundlag. Overskrifter, fodnoter og tabelceller kan også miste deres sammenhæng.
En RAG-løsning kan ikke pålideligt kompensere for alle disse fejl bagefter. Hvis en undtagelse eller en enhed forsvinder ved import, risikerer modellen at give et overbevisende svar på et mangelfuldt grundlag. Derfor bør parsing være et synligt og testet trin i dokumentkæden.
Bevar relationer, der ændrer betydningen
Gem overskriftshierarki, læserækkefølge, side og kildeposition, hvor formatet tillader det. Tabeller bør bevare kolonnebetydning og enheder, mens fodnoter skal kunne knyttes til den tekst, de begrænser. Skeln mellem digital tekst og scanninger, der kræver OCR. En flad tekstfil kan være tilstrækkelig til en enkel artikel, men utilstrækkelig til en teknisk manual med mange krydshenvisninger og diagrammer.
Gør importfejl synlige før indeksering
Sammenlign et udvalg af parserens output med originalen, især vanskelige sider. Registrér filhash, parserversion og importstatus, så samme dokument kan genbehandles kontrolleret. Tomme eller delvist behandlede filer bør ikke stille forsvinde fra vidensbasen. Giv en ansvarlig mulighed for at se fejl, godkende en alternativ konvertering eller bede om en bedre original. Kvaliteten af importen skal kunne vurderes uden først at opdage fejlen i en kundesamtale.
Et eksempel fra praksis
Illustrativt eksempel: En producent vil gøre installationsmanualer søgbare. Parseren læser en tabel på tværs og kobler den forkerte temperaturgrænse til en produktvariant. Teamet opdager fejlen i en visuel importstikprøve, vælger en strukturbevarende behandling og gemmer tabeloverskrifter sammen med cellerne. De opretter derefter et testspørgsmål om netop produktvarianten. Dermed bliver både import og senere søgesvar kontrolleret mod samme original.
Typiske faldgruber
- At antage, at en fil med udtrukket tekst er korrekt behandlet.
- At miste fodnoter, enheder og rækkefølge i flerspaltede dokumenter.
- At overskrive gamle dokumentversioner uden spor til tidligere svar.
Det skal I afklare
- Test repræsentative og vanskelige sider mod originalen.
- Gem struktur, kildeposition og versionsoplysninger.
- Håndtér delvise fejl og genimport før materialet bliver autoritativt.
Spørgsmål og svar
Er dokumentparsing det samme som OCR?
Nej. OCR genkender tegn i billeder. Parsing skal også forstå og bevare dokumentets struktur og kan bruge eksisterende digital tekst uden OCR.
Skal alle dokumenter konverteres på samme måde?
Ikke nødvendigvis. En enkel tekst, en tabeltung PDF og en scanning kan kræve forskellige metoder. Brug fælles kvalitetskrav, men tilpas behandlingen til formatet.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Docling: dokumentkonvertering og struktur ↗Primærkilde gennemgået 7. september 2026.
- Microsoft: Document layout analysis ↗Primærkilde gennemgået 7. september 2026.

