hOCR

hOCR — открытый стандарт, который определяет формат для представления OCR-вывода. Стандарт имеет целью приобщить к распознанному тексту информацию о макете, уровень достоверности распознавания, стиль и другие данные. Для достижения цели вступления этой информации распознанного текста используется стандартный формат HTML.

Существует утилита командной строки hocr2pdf [1] для преобразования hocr-данных в файлы PDF.