Waarom OCR voor vrachtbrieven lastiger is dan voor facturen
Een factuur van een vaste leverancier heeft doorgaans een herkenbare lay-out: logo linksboven, totaalbedrag rechtsonder, factuurnummer op een vaste plek. Een CMR-vrachtbrief werkt anders. De CMR-conventie schrijft de velden voor, maar niet de exacte indeling. Elke vervoerder, expediteur of verlader gebruikt een eigen formulier. Veld 18 (opmerkingen) staat bij de een onderaan, bij de ander in de marge. Daarboven komen handgeschreven aanvullingen van chauffeurs, inklaringsstempels, aftekeningen van ontvangers en soms een doorslagkopie die half doorgebloeid is. Klassieke OCR-software leest tekst op basis van coördinaten: zone X bevat het zendingsnummer, zone Y de datum. Zodra de lay-out verschuift, leest de software de verkeerde zone uit of geeft helemaal geen resultaat. Dat is geen fout van de software, het is de fundamentele beperking van template-gebaseerde aanpak.
Wanneer volstaat template-OCR voor het uitlezen van vrachtbrieven?
Template-OCR is niet per definitie de verkeerde keuze. Als je transport loopt via één of twee vaste vervoerders en hun vrachtdocumenten zijn jaar in jaar uit hetzelfde formulier, dan werkt een template prima. Je stelt eenmalig de zones in, de software leest ze consistent uit, en de onderhoudskosten zijn laag. Hetzelfde geldt als je zelf de vrachtbrieven aanmaakt in je TMS: dan is de lay-out per definitie vast. De problemen beginnen zodra je te maken hebt met wisselende vervoerders, internationale zendingen met buitenlandse CMR-formulieren, of documenten die via verschillende kanalen binnenkomen: scan, foto, e-mail of upload. Eén nieuwe vervoerder betekent bij template-OCR een nieuwe template, inrichten, testen en onderhouden. Bij vijf vervoerders heb je vijf templates; bij twintig heb je een onderhoudsprobleem.
Wat doet document-AI anders bij het verwerken van CMR's?
Document-AI leest niet op basis van coördinaten, maar begrijpt de documentcontext. Het systeem herkent dat 'Afzender' of 'Expéditeur' of 'Absender' allemaal verwijzen naar hetzelfde veld, ongeacht waar het op de pagina staat. Het kan omgaan met wisselende lay-outs, verschillende talen op hetzelfde document, en gedeeltelijk leesbare tekst door stempels of vlekken. Voor handgeschreven aanvullingen, zoals een chauffeur die in blokletters een afwijkende hoeveelheid noteert, zijn moderne systemen beduidend beter dan klassieke OCR, al blijft handschrift herkenning een aandachtspunt: niet elk handschrift is even leesbaar voor een machine, en ook voor een mens soms niet. Het grote verschil met template-OCR is dat je geen per-vervoerder configuratie nodig hebt. Nieuwe vervoerders worden verwerkt zonder dat je een nieuwe template inricht. Afwijkingen worden gemarkeerd voor menselijke controle, niet stilzwijgend als goed doorgegeven.
Hoe werkt de menselijke controle bij automatisch verwerkte vrachtbrieven?
Zowel bij template-OCR als bij document-AI is een menselijke check onmisbaar, al is de aard van die check anders. Bij template-OCR controleer je achteraf of de output klopt, want fouten ontstaan stil: de software leest de verkeerde zone uit zonder melding. Bij document-AI worden onzekere velden gemarkeerd, zodat een medewerker alleen kijkt waar twijfel is. Dat is het human-in-the-loop principe: de machine doet het lees- en tikwerk, de mens accordeert. Bij CMR's is dit extra relevant omdat afwijkingen op een vrachtbrief, beschadigde goederen, tekorten, laadgewicht dat niet klopt, rechtsgevolgen kunnen hebben. Die beslissing wil je nooit volledig aan een algoritme overlaten.
Vuistregels voor de keuze: OCR of document-AI voor jouw vrachtbrieven?
Kies template-OCR als je werkt met één of twee vaste vervoerders op vaste formulieren, je volume laag genoeg is om incidentele fouten handmatig op te vangen, en je IT-afdeling capaciteit heeft om templates te onderhouden. Kies document-AI als je werkt met meerdere vervoerders of wisselende formats, internationale CMR's in meerdere talen verwerkt, handgeschreven velden standaard zijn in jouw documentstroom, of je schaalbaarheid nodig hebt zonder proportionele groei in onderhoud. Een derde vraag die je moet stellen: wat doe je met de uitgelezen data? OCR die alleen tekst herkent maar niet koppelt aan een zending, order of TMS-dossier, lost het echte probleem niet op. Het gaat er uiteindelijk om dat de juiste gegevens op de juiste plek belanden, zonder dat iemand ze overtypt.