Распознать текст

  • Автор теми Автор теми alessandro
  • Дата створення Дата створення
Статус: Офлайн
Реєстрація: 22.05.2008
Повідом.: 1265
Распознать текст

Подскажите плз, если кто сталкивался с подобной проблемой.

Есть фото (jpg) страниц нескольких редких книг. В лучшем варианте в интернете их нет. Текст в принципе нормально читаем. Но надо его распознать. finereader распознает нормально в лучшем случае 30% текста. Может, у кого была подобная задача?
 
Ручками более 3000 страниц как-то не хо... эх, придется отказаться от шабашки...
Как тут предложено действительно попробовать слегка помучать фотожопом на тему улучшить изображение.
Вовторых у файнридера есть режим обучения. То есть от души поипавшись на 10-20 страницах можно попробовать настропалить его на пристойное качество распознования текста с системными искажениями или специфическим шрифтом.
Втретих можно попробовать найти пионэров для работы ручками за еду :)
 
Как тут предложено действительно попробовать слегка помучать фотожопом на тему улучшить изображение.
Вовторых у файнридера есть режим обучения. То есть от души поипавшись на 10-20 страницах можно попробовать настропалить его на пристойное качество распознования текста с системными искажениями или специфическим шрифтом.
Втретих можно попробовать найти пионэров для работы ручками за еду :)


+1.
в 2000м году пришлось мне распознать сканы церковных книг начала 20го века. файнридер уже тогда сумел обучиться и особо правкой заморачиваться не пришлось.
 
Попробуйте одной странице повысить разрешение в фотошопе до 300 dpi. Скорее всего не прийдется даже увеличиать размер изображения в точках.
Если качество распознавания файнридером улучшится, можно написать скриптик для фотошопа, который будет пачками файлы jpg открывать, менять разрешение и сохранять.
Вероятно, Ваши jpg сделаны фотоаппаратом, сканер в заголовке jpg пишет правильное разрешение, а у фотоаппарата нет таких данных. А файнридеру нравится разрешение от 200 dpi.
 
Попробуйте одной странице повысить разрешение в фотошопе до 300 dpi. Скорее всего не прийдется даже увеличиать размер изображения в точках.
Если качество распознавания файнридером улучшится, можно написать скриптик для фотошопа, который будет пачками файлы jpg открывать, менять разрешение и сохранять.
Вероятно, Ваши jpg сделаны фотоаппаратом, сканер в заголовке jpg пишет правильное разрешение, а у фотоаппарата нет таких данных. А файнридеру нравится разрешение от 200 dpi.

имха мимо кассы
 
Назад
Зверху Знизу