OCR & documentherkenning
Zet scans en alleen-afbeelding bestanden om in schone, gestructureerde, bewerkbare documenten — herkend, uitgetypt en opgemaakt in veel talen en schriften.
Meer dan ruwe OCR
Een ruwe OCR-dump is een muur van tekst waarbij de opmaak is weggegooid. Wij herkennen de inhoud en bouwen het document opnieuw op: koppen, kolommen, tabellen, lijsten en bijschriften komen waar ze horen, zodat het bestand klaar is om te segmenteren en te vertalen.
Veel talen en schriften
We herkennen Latijnse, Cyrillische en CJK-schriften (Chinees, Japans, Koreaans) en van rechts naar links geschreven schriften zoals het Arabisch en Hebreeuws, inclusief meertalige documenten waarin meer dan één schrift op dezelfde pagina voorkomt.
Moeilijke bronnen welkom
Scans met lage resolutie, faxen, fotokopieën van fotokopieën, stempels en aantekeningen over de tekst, en pagina's met veel afbeeldingen. Dit zijn precies de bestanden waar geautomatiseerde tools op stuklopen, en precies die waar wij voor gemaakt zijn.
Output voor jouw workflow
Geleverd als bewerkbare DOCX of een vertaalklaar pakket voor je CAT of TMS. Je krijgt tekst die je tools kunnen segmenteren, geen plaatje van een document.
Vragen over OCR
Kunnen jullie scans van slechte kwaliteit aan?
Ja. Scans met lage resolutie, faxen en fotokopieën zijn ons dagelijks werk. We herkennen ze en bouwen ze opnieuw op tot schone, gestructureerde, bewerkbare bestanden.
Welke talen en schriften ondersteunen jullie?
Veel werktalen in Latijnse, Cyrillische, CJK- en van rechts naar links geschreven schriften zoals het Arabisch, inclusief documenten waarin meerdere schriften op één pagina staan.
Krijg ik bewerkbare tekst of alleen een afbeelding?
Bewerkbare, gestructureerde tekst met de opmaak gereconstrueerd, klaar om te segmenteren in je CAT of TMS. Geen platgeslagen afbeelding.
Heb je scans die bewerkbare tekst moeten worden?
Stuur de bestanden met je talen en deadline. Offerte terug in 15 minuten.