Dienst 04

OCR & documentherkenning

Zet scans en alleen-afbeelding bestanden om in schone, gestructureerde, bewerkbare documenten — herkend, uitgetypt en opgemaakt in veel talen en schriften.

Meer dan ruwe OCR

Een ruwe OCR-dump is een muur van tekst waarbij de opmaak is weggegooid. Wij herkennen de inhoud en bouwen het document opnieuw op: koppen, kolommen, tabellen, lijsten en bijschriften komen waar ze horen, zodat het bestand klaar is om te segmenteren en te vertalen.

Veel talen en schriften

We herkennen Latijnse, Cyrillische en CJK-schriften (Chinees, Japans, Koreaans) en van rechts naar links geschreven schriften zoals het Arabisch en Hebreeuws, inclusief meertalige documenten waarin meer dan één schrift op dezelfde pagina voorkomt.

Moeilijke bronnen welkom

Scans met lage resolutie, faxen, fotokopieën van fotokopieën, stempels en aantekeningen over de tekst, en pagina's met veel afbeeldingen. Dit zijn precies de bestanden waar geautomatiseerde tools op stuklopen, en precies die waar wij voor gemaakt zijn.

Output voor jouw workflow

Geleverd als bewerkbare DOCX of een vertaalklaar pakket voor je CAT of TMS. Je krijgt tekst die je tools kunnen segmenteren, geen plaatje van een document.

FAQ

Vragen over OCR

Kunnen jullie scans van slechte kwaliteit aan?

Ja. Scans met lage resolutie, faxen en fotokopieën zijn ons dagelijks werk. We herkennen ze en bouwen ze opnieuw op tot schone, gestructureerde, bewerkbare bestanden.

Welke talen en schriften ondersteunen jullie?

Veel werktalen in Latijnse, Cyrillische, CJK- en van rechts naar links geschreven schriften zoals het Arabisch, inclusief documenten waarin meerdere schriften op één pagina staan.

Krijg ik bewerkbare tekst of alleen een afbeelding?

Bewerkbare, gestructureerde tekst met de opmaak gereconstrueerd, klaar om te segmenteren in je CAT of TMS. Geen platgeslagen afbeelding.

Start een project

Heb je scans die bewerkbare tekst moeten worden?

Stuur de bestanden met je talen en deadline. Offerte terug in 15 minuten.