Архив: Создание электронных книг из сканов: как получить DjVu или PDF из бумажной книги? [2160930]

Страницы :   Пред.  1, 2, 3 ... 11, 12, 13 ... 96, 97, 98  След.
Тема закрыта
 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 08-Апр-11 12:45 (15 лет 3 месяца назад)

j-pet писал(а):
yuree писал(а):
Метод, при котором сканируют 2D с заведомо завышенным dpi
Печатные машины печатают с разрешением порядка 2400dpi, так как же 600dpi при сканировании может быть завышенным, оно наоборот - заниженное.
А никто в данном сообщении про 600 и не говорил
Цитата:
И ещё раз повторю: растр убирается ИСКЛЮЧИТЕЛЬНО и ПОЛНОСТЬЮ плагином Descreen, т.е. в 300dpi ресэмплить для этого не нужно.
Растр Вы возможно убрать и сможете, только картинку замылите, что не удивительно, потому-как ожидаемо.
Вообщем я понял, Descreen — Ваш любимый фильтр
[Профиль]  [ЛС] 

j-pet

Стаж: 18 лет 9 месяцев

Сообщений: 171

j-pet · 08-Апр-11 13:27 (спустя 41 мин.)

yuree писал(а):
Вообщем я понял, Descreen — Ваш любимый фильтр
Да, гораздо любимее шумодава
[Профиль]  [ЛС] 

YannNovak

Стаж: 17 лет 2 месяца

Сообщений: 163


YannNovak · 13-Апр-11 16:36 (спустя 5 дней)

скажите, почему finereader (десятый) при распознавании игнорирует номера страниц? т.е. цифры страниц не распознает, оставляет пустое место. это его специфический глюк или что? и - если в двух словах - как создавать DjVu c OCR?
[Профиль]  [ЛС] 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 13-Апр-11 17:29 (спустя 52 мин.)

leo1999 писал(а):
скажите, почему finereader (десятый) при распознавании игнорирует номера страниц? т.е. цифры страниц не распознает, оставляет пустое место. это его специфический глюк или что?
У меня точно такая-же беда случается. Только не повально на всех страницах. Кое-где распознаёт а кое-где и нет.
Цитата:
<...> и - если в двух словах - как создавать DjVu c OCR?
Не знаю кто каким там макаром делает, лично я для своей работы использовал рекомендации monday2000 от 06-Апр-11 08:21 (см. стр. 12 данной ветки) Вот что он пишет: "<...> Это ограничение ("невозможность добавить OCR слой в DjVu") можно обойти, если сделать, скажем, в 10-м Файнридере PDF с OCR-слоем - а потом сконвертировать его в DjVu при помощи свободно-бесплатного pdf2djvu от Jakub Wilk (не путать с коммерческим pdftodjvu от LizardTech). При этом OCR-слой перенесётся из PDF в созданный DjVu. Далее мы из полученного DjVu извлекаем OCR-слой (при помощи DjVuOCR 2), и выкидываем этот DjVu (он низкокачественный всё равно). Затем делаем DjVu обычным порядком, и вставляем туда извлечённый ранее OCR-слой." Хочу от себя добавить, что dpi и в первом (OCR'нутом), и во втором (DjVu'шном втором) файле должны совпадать. Равно как и размеры этих страниц из обоих файлов.
А если не хотите особо заморачиваться то советую использовать продукт под названием CuneiDjVu. Он только длинные тире каким-то крякозябром распознаёт. Все остальные слова — вполне правильно. Во всяком случае он работает гораздо качественнее чем покупной продукт от LizardTech.
[Профиль]  [ЛС] 

YannNovak

Стаж: 17 лет 2 месяца

Сообщений: 163


YannNovak · 13-Апр-11 18:03 (спустя 33 мин.)

yuree
большое спасибо за разъяснения.
по поводу finereader. есть ли смысл даунгрейда до скажем девятки? там есть такие проблемы?
[Профиль]  [ЛС] 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 13-Апр-11 18:49 (спустя 45 мин.)

leo1999 писал(а):
yuree
большое спасибо за разъяснения.
Пожалуйста.
Цитата:
<...> по поводу finereader. есть ли смысл даунгрейда до скажем девятки? там есть такие проблемы?
По моему скромному замечанию, сей глюк переходит из версии к версии. В десятке он стал реже встречаться, но он есть!
В чём причина — тайна за семью печатями. Лично я, в таких случаях, перераспознаю в ручном режиме. К тому-же.
Вы знаете, здесь всё упирается в вопрос, а что Вы собственно хотите распознавать? Какой текст?
Ранее, перепробовав несколько бильдов девяток я так и не смог подружить ФР9 с генчовской программой. Поэтому перешёл на 8-ю версию. Она довольно хорошо справляется с распознаванием русского текста. Да и DjVuOCR с этой версией, как известно, неплохо дружит, глюков я не видел. Но так-как у меня на работе скан сломался. А дома его (о ужас!!) нет, то пришлось ... переквалифицироваться. Пока-что я занят обработкой Гугловских сканов книг. Доведением их до ума, если хотите. Чисткой, исправлением кривизны листов и пр. Также, где это позволяет качество текста, внедрением OCR (дореформенный русский) слоя в текст с его вычиткой в FR'е. И, знаете, на удивление 10-я версия довольно хорошо справляется с распознаванием "ятей" и "фит". Правда, перед распознаванием я её учу на паре-тройке листов. Но это уже' нюансы
[Профиль]  [ЛС] 

YannNovak

Стаж: 17 лет 2 месяца

Сообщений: 163


YannNovak · 14-Апр-11 11:59 (спустя 17 часов)

Согласен по поводу 10-й версии. Она всем устраивает, кроме этого глюка. А вручную добавлять номера нескольких сотен страниц... а книг-то ведь много... в общем, если нет решения автоматизации в FR, нужно искать другой софт.
[Профиль]  [ЛС] 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 14-Апр-11 18:23 (спустя 6 часов)

Уважаемый monday2000.
Пишу здесь, потому-как темы посвящённой CuneiDjVu на этом ресурсе нет.
Скажите пожалуйста здесь или укажите где можно прочесть, желательно на русском , как править *.hocr файлы. Менять текст, пунктуацию, если такое возможно, и внедрять отредактированный файл уже в сам DjVu. Есть-ли какой-то редактор для этих целей? Думаю ответ будет интересен не только мне.
Заранее — спасибо
[Профиль]  [ЛС] 

monday2000

Стаж: 16 лет 7 месяцев

Сообщений: 93


monday2000 · 15-Апр-11 09:30 (спустя 15 часов)

yuree
Цитата:
Пишу здесь, потому-как темы посвящённой CuneiDjVu на этом ресурсе нет.
Если хотите, можем подробно это обсудить на моём форуме тут:
http://www.djvu-scan.ru/forum/index.php?topic=115.0 (это топик CuneiDjVu)
Цитата:
Скажите пожалуйста здесь или укажите где можно прочесть, желательно на русском , как править *.hocr файлы.
На русском - не знаю. Есть на английском: http://yandex.ru/yandsearch?text=hOCR .
Вообще CuneiDjVu - это экспериментальная программа. Она пока что во многом сырая. Да и качество распознавания её довольно слабое - по сравнению с Файнридером.
Вообще (как я понял) сам CuneiForm генерирует вывод в небольшом подмножестве языка hOCR. То есть, из всех возможностей hOCR CuneiForm использует лишь малую часть. Поэтому язык CuneiForm-hOCR прост, как пареная репа. Грубо говоря, это набор лексем "буква-координата".
Цитата:
Есть-ли какой-то редактор для этих целей?
CuneiDjVu - это визуальная оболочка над группой консольных утилит. В процессе своей работы CuneiDjVu генерирует hOCR-файл (во внутренней папке) и потом его внедряет в DjVu. Можно брать сгенерированный hOCR-файл, и потом через bat-файлы внедрять этот (или самодельный) hOCR-файл в DjVu (используя консольные утилиты внутри CuneiDjVu). hOCR-файл - это в сущности обычный HTML-файл - так что его легко править.
[Профиль]  [ЛС] 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 15-Апр-11 14:44 (спустя 5 часов)

Спасибо.
Перехожу в Вашу ветку
[Профиль]  [ЛС] 

monday2000

Стаж: 16 лет 7 месяцев

Сообщений: 93


monday2000 · 29-Апр-11 09:17 (спустя 13 дней)

Я сделал новую подверсию CuneiDjVu - 1.1:
CuneiDjVu v1.1
Скачать:
http://djvu-soft0001.nxt.ru/cuneidjvu_v1_1.rar (24,1 МБ)
Новое: устранены некоторые существенные глюки.
[Профиль]  [ЛС] 

monday2000

Стаж: 16 лет 7 месяцев

Сообщений: 93


monday2000 · 06-Май-11 11:28 (спустя 7 дней, ред. 06-Май-11 11:28)

Я сделал новую подверсию CuneiDjVu - 1.2:
CuneiDjVu v1.2
Скачать:
http://djvu-soft0001.nxt.ru/cuneidjvu_v1_2.rar (24,1 МБ)
Новое: Русский интерфейс + исправления мелких глюков.
Это первая по-настоящему стабильная версия программы.
[Профиль]  [ЛС] 

SergeyDM10

Стаж: 17 лет 8 месяцев

Сообщений: 56


SergeyDM10 · 15-Май-11 14:24 (спустя 9 дней, ред. 21-Май-11 21:50)

monday2000
57an
Здравствуйте! Начитался этого руководства, но намного понятнее не стало. Автор использует сканер от HP и программу, которая шла вместе со сканером в комплекте. У меня сканер CanoScan LIDE25 и в комплекте к нему шла программа OmniSoft или что-то такое на английском языке.
Вопрос: Есть ли какая то программа для сканирования, которая бы подходила ну может не ко всем моделям сканеров, но к большинству?
Далее. Есть книга с листами формата А6, маленькая такая, как брошюрка. У неё такой неудобный переплёт, не знаю как по научному называется.
Что нужно делать чтобы максимально корректно отсканировать книги с такими неудобными переплётами?
В книге нужно отсканировать:
1. обложку ( http://img1.immage.de/15050scan10001.jpg );
2. есть вкладка с цветными фотографиями ( http://img1.immage.de/150542dscan10002.jpg );
3. есть вкладка с чёрно-белыми фотографиями ( http://img1.immage.de/1505scan10003.jpg );
4. сам текст чёрно-белый ( http://img1.immage.de/1505c457scan10004.jpg ).
Вопрос:
- учитывая такой небольшой формат листов, посоветуете всё равно разбивать по 1 странице или есть смысл 2 страницы иметь на одном развороте?;
- какие настройки лучше применять для сканирования каждого отдельного типа содержимого, то есть для вкладок, для текста?;
- чёрно-белые фотографии сканировать, выставляя режим "серый" или "цветной"?
- в какой программе потом объединять всё это? (я так понимаю, что отсканировав всю книгу, DjVu файл должен будет содержать несколько слоёв с разным типом)
- из своего опыта, ответьте пожалуйста, можно ли относить книгу в библиотеку, имея лишь сырые сканы или лучше сделать это после того как готова окончательная читабельная версия?))
[Профиль]  [ЛС] 

57an

Стаж: 17 лет 8 месяцев

Сообщений: 191


57an · 15-Май-11 15:25 (спустя 1 час, ред. 15-Май-11 15:25)

Переплет клееный - сильно прижать тяжело.
Со сканером не повезло - CIS-тип из-за слабой глубины резкости слабо подходит для сканирования книг - не просматривается область корешка. Старайтесь прижимать посильнее. То, во что превратились развороты с иллюстрациями - никуда не годится... Ну или поищите для таких книг CCD-сканер.
Разрезать нужно - только так можно более-менее автоматизировано выделить полезную область страниц.
Сканировать черно-белые фотографии, как и текст, можно в режиме серый.
Последующая обработка - ну например такая: Скан Тэйлор - СТ Сепаратор - обязательное удаление растра в иллюстрациях - Djvu Small - Djvu Imager.
[Профиль]  [ЛС] 

SergeyDM10

Стаж: 17 лет 8 месяцев

Сообщений: 56


SergeyDM10 · 16-Май-11 00:10 (спустя 8 часов, ред. 16-Май-11 00:10)

57an
monday2000 писал(а):
ЙЕГРЕС Ф
1. Сканируете - используя бесплатную программу Irfan View. Подробнее об этом см. п.1 тут: http://www.djvu-soft.narod.ru/scan/scan_and_share_1_07.htm
Эта программа для всех сканеров подходит?
И ещё как по научному называется тип чёрно-белых илюстраций, которые приведены в моём посте выше (они я так понимаю, бывают разных типов)?
[Профиль]  [ЛС] 

monday2000

Стаж: 16 лет 7 месяцев

Сообщений: 93


monday2000 · 16-Май-11 11:14 (спустя 11 часов, ред. 16-Май-11 11:14)

SergeyDM10
Добрый день.
Единственная Ваша проблема - плохой сканер. В общем-то, такой сканер (по большому счёту) не годится для сканирования книг - потому что он "смазывает" участки книги, неплотно прилегающие к стеклу сканера - т.е. в районе корешка (из-за крайне низкой глубины резкости).
Выход - либо найти подходящий сканер, либо очень сильно прижимать к стеклу книгу в районе корешка (но есть риск выдавить сканерное стекло).
Сканеры бывают двух принципиальных типов:
1. CCD (хороший) - толстый
2. CIS (плохой) - тонкий - как у Вас.
Подробнее см. статью
Наглядное сравнение сканеров CCD и CIS при сканировании книг
http://www.infanata.org/2007/07/24/print:page,1,nagljadnoe_sravnenie_skanerov_ccd...ovanii_knig.html
Цитата:
Вопрос: Есть ли какая то программа для сканирования, которая бы подходила ну может не ко всем моделям сканеров, но к большинству?
Windows:
Самое главное - иметь подходящий драйвер для сканера. Тогда любая сканирующая программа сможет без проблем обращаться к сканеру. Для данного сканера драйвера есть в Интернете.
Есть ещё программа - VueScan - она напрямую, без драйверов, умеет работать с многими сканерами. C Вашим тоже умеет: http://www.hamrick.com/vuescan/canon_lide_25.html .
Linux: всё сложнее. Используется SANE - программа для сканирования.
Цитата:
Что нужно делать чтобы максимально корректно отсканировать книги с такими неудобными переплётами?
Ничего хитрого - раздобыть любой ССD-сканер (а не CIS, как у Вас), и тогда прижимать книгу к стеклу при сканировании можно будет в пределах разумного.
Цитата:
- учитывая такой небольшой формат листов, посоветуете всё равно разбивать по 1 странице или есть смысл 2 страницы иметь на одном развороте?;
Конечно же, есть смысл иметь 2 страницы на одном развороте - при сканировании. Это называется "сдвоенные развороты". Такие сдвоенные развороты Scan Tailor умеет автоматически разбивать на 2 страницы.
Цитата:
- какие настройки лучше применять для сканирования каждого отдельного типа содержимого, то есть для вкладок, для текста?;
Для сканирования ВСЕЙ книги установите такие параметры: режим сканирования - цветной 24 бит, оптическое разрешение - 300 dpi. Цветной режим сканирования практически не замедлит процесс сканирования. Отсканировав всю книгу в цвете, далее можно будет программами по сканобработке привести отдельные страницы к серому режиму, отдельные - к чёрно-белому. Так будет проще всего.
Цитата:
- чёрно-белые фотографии сканировать, выставляя режим "серый" или "цветной"?
Можете в цвете - а потом их элементарно можно пакетно привести к "серому" - например, при помощи Irfan View.
Цитата:
- в какой программе потом объединять всё это? (я так понимаю, что отсканировав всю книгу, DjVu файл должен будет содержать несколько слоёв с разным типом)
Scan Tailor.
Цитата:
- из своего опыта, ответьте пожалуйста, можно ли относить книгу в библиотеку, имея лишь сырые сканы или лучше сделать это после того как готова окончательная читабельная версия?))
Книгу можно относить в библиотеку, имея лишь сырые сканы. Единственное условие: перед отнесением книги, удостоверьтесь в полной комплектности сканов, проще говоря, проверьте, все ли страницы отсканированы. Бывает, что люди при сканировании случайно пропускают 1-2 страницы из бумажной книги.
Цитата:
Эта программа для всех сканеров подходит?
Для всех, для которых имеется драйвер сканера. Для Вашего подойдёт.
Цитата:
И ещё как по научному называется тип чёрно-белых илюстраций, которые приведены в моём посте выше (они я так понимаю, бывают разных типов)?
Любой файл с растровым изображением имеет приблизительно следующий формат (очень грубо):
1. Заголовок
2. Пиксели.
Заголовок - краткий набор чисел. В заголовке указываются такие числа: длина и ширина файла в пикселях, DPI, битовая разрядность (сколько бит описывают один пиксель), палетка (не всегда).
Пиксели - сплошной массив пикселей изображения. Просто и без затей.
При примера посмотрите на формат BMP (как самый простейший из виндовых растров): http://ru.wikipedia.org/wiki/BMP
Самое интересное для нас тут - это битовая разрядность. Для чёрно-белого изображения используется 1 бит на 1 пиксель - нолик - это чёрный цвет, единица - белый. Поэтому любое чёрно-белое изображение является 1-битным.
Для серого изображения используется 8 бит (реже 16 - для научных целей) на 1 пиксель - 256 цветов на 1 пиксель. Поэтому любое серое изображение является 8-битным.
Для цветного изображения используется 24 бита (реже 32 - плюс прозрачность) на 1 пиксель - 16 млн. цветов на 1 пиксель. Поэтому любое цветное (точнее, полноцветное) изображение является 24-битным.
Палетка - способ сэкономить на размере чёрно-белого и цветного малоцветного файла. Если в 24-битном файле каждый пиксель хранит непосредственно цвет - то в ЧБ и малоцвете каждый пиксель хранит указатель на цвет в палетке. Малоцветный - это, например, 4-х или 8-битный цветной файл, обязательно с палеткой. Но такие в нашем деле редко бывают.
Читайте также:
Базовые понятия DjVu-книгосканирования
http://www.djvu-soft.narod.ru/scan/scan_likbez.htm
[Профиль]  [ЛС] 

SergeyDM10

Стаж: 17 лет 8 месяцев

Сообщений: 56


SergeyDM10 · 16-Май-11 19:10 (спустя 7 часов)

monday2000
Большое спасибо ВАМ! Редко вижу когда вопросам новичков уделяют столько внимания.
[Профиль]  [ЛС] 

j-pet

Стаж: 18 лет 9 месяцев

Сообщений: 171

j-pet · 16-Май-11 23:53 (спустя 4 часа)

monday2000 писал(а):
Палетка
С каких пор палитра стала называться палеткой???
[Профиль]  [ЛС] 

monday2000

Стаж: 16 лет 7 месяцев

Сообщений: 93


monday2000 · 17-Май-11 12:09 (спустя 12 часов, ред. 17-Май-11 12:09)

j-pet
Цитата:
С каких пор палитра стала называться палеткой???
Я же объяснял "на пальцах". Термин "палетка" я сам для себя использую, т.к. по-буржуйски это пишется как "palette" (повсеместно в программных кодах). Термин "палитра" для русского языка, конечно, правильнее. Кстати, как ни странно, я не видел ещё буквально ни одной толковой книжки, где бы все эти вещи (хотя бы про битовую разрядность) толково разъяснялись. Если же что-то и есть - то всегда КРАЙНЕ скупо и неподробно (да и то на английском). Я всё это почерпнул по большей мере из практического программирования растровых изображений (программная библиотека растровой графики FreeImage - отличная вещь).
Вот пример: полутоновые серые и малоцветные изображения программно отличаются лишь порядком следования цветов в палитре - иначе их не различишь программно. В сером цвета в палитре увеличиваются на 1 с шагом вправо. В малоцветном - произвольный хаос в порядке цветов. Получается, стоит только в сером хаотически перемешать порядок цветов в палитре - всё, формально это будет уже цветное малоцветное изображение (при тех же реальных 256 цветах на пиксель и 8-битном режиме).
SergeyDM10
Цитата:
Большое спасибо ВАМ!
Пожалуйста, рад был помочь.
Цитата:
Редко вижу когда вопросам новичков уделяют столько внимания.
И Вам спасибо за вопросы - благодаря им становится понятнее, что же именно новичкам непонятно.
[Профиль]  [ЛС] 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 21-Май-11 21:46 (спустя 4 дня, ред. 21-Май-11 21:46)

Соорудил самопальный словарь русского языка в старой орфографии. ("как делал — отдельная эпопея "). Подключил к FR10 — помогло. Красных подчёркиваний стало меньше. Теперь вот работаю над дополнением словарной базы, ибо предвижу что эббисты не-только к следующей а и к 15-й версии ничего с морфологией не сделают. Вот и приходиться словарь собирать, дабы меньше вычитывать и править текст.
Может есть и менее ресурсозатратный метод?
[Профиль]  [ЛС] 

petoleg

Top Seed 02* 80r

Стаж: 19 лет 2 месяца

Сообщений: 735

petoleg · 21-Май-11 23:25 (спустя 1 час 38 мин., ред. 21-Май-11 23:25)

Цитата:
Цитата:
- какие настройки лучше применять для сканирования каждого отдельного типа содержимого, то есть для вкладок, для текста?;
Для сканирования ВСЕЙ книги установите такие параметры: режим сканирования - цветной 24 бит, оптическое разрешение - 300 dpi. Цветной режим сканирования практически не замедлит процесс сканирования. Отсканировав всю книгу в цвете, далее можно будет программами по сканобработке привести отдельные страницы к серому режиму, отдельные - к чёрно-белому. Так будет проще всего.
Цитата:
- чёрно-белые фотографии сканировать, выставляя режим "серый" или "цветной"?
Можете в цвете - а потом их элементарно можно пакетно привести к "серому" - например, при помощи Irfan View.
Если этот человек на этом сканере будет сканировать в цвете, ему это занятие очень быстро надоест. Пользуюсь таким же. Кроме недостаточной глубины цвета, ужасающая скорость сканирования "в цвете". Полторы минуты на скан. В сером порядка 20 сек. Скорость сканирования тоже является критическим фактором. Epson V10 сдох (появилась вертикальная полоса расслоения цвета), хотел взять Epson V33, так привести не могут. Взял недорогой Benc 5000. Лучше бы не брал. Сканирует еще медленнее чем CanoScan25.
ИМХО CanoScan25 подходит для сканирования книг с прошитым переплетом, переплет которых позволяет раскрыть разворот и плотно прижать страницу к стеклу. С очень небольшим числом цветных страниц.
[Профиль]  [ЛС] 

DjVu-Master

Стаж: 16 лет 6 месяцев

Сообщений: 6113

DjVu-Master · 22-Май-11 22:09 (спустя 22 часа, ред. 22-Май-11 22:09)

Не получается зашить текст в DJVU.
Не пойму как быть со страницами на которых только изображения и с титулками (обложками), их тоже загружать в проэкт ABBYY FineReader 9.0 Professional Edition?
Все делаю по инструкции.
Раз получилось прошить пару страниц (тренировался). Потом решил всю книгу прошить. Извлек с помощю DjvuOCR сохранил ... .
ABBYY FineReader 9.0 Professional Edition разпознал все страницы, исправил все ошибки и ******, выдает ошибку, та даже не ошибку, ток нажал обработка проходит 0.1 секунды и ничего не зашивается !!!!!!!!!
Кто может поделится личным опытом как прошивать книги? Нормально объясните пожалуста все нюансы.
[Профиль]  [ЛС] 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 22-Май-11 23:20 (спустя 1 час 11 мин.)

Stepanenko.P.V. писал(а):
Не получается зашить текст в DJVU.
<...>
Кто может поделится личным опытом как прошивать книги? Нормально объясните пожалуста все нюансы.
"Шью" с помощью FR10 в DjVu практически любой текст который может распознать ФайнРидер. Можете и с девяткой попробовать, если получиться, я-вот не знаю какой у Вас там её билд стои'т. У меня получалось.
Теперь технология:
1. Потрошите DjVu на отдельные сканы. Складируете их все в одну папку. Перед этим смотрите в свойствах DjVu какой там dpi.
2. Сканы чистите и обрабатываете, если надо, и загружаете в ФР. Если документ хорошего качества то можно его и не потрошить.
3. Распознаёте документ в ФР и в его настройках ставите Сервис — Опции — Сохранить (вкладка PDF) — Размер бумаги по умолчанию (ставите "Сохранить размер оригинала"). Это важно.
4. После распознавания, сохраняете документ как PDF.
5. С помощью программы pdf2djvu создаёте djvu файл, обязательно с тем-же dpi что и оригинальный, не распознанный файл.
6. С помощью DjvuOCR извлекаете из второго djvu файла OCR слой и с помощью это-же программы вставляете его в первоначальный djvu файл. Тот в котором Вы хотите сделать поиск.
7. Пока всё. Будут трудности с pdf2djvu могу выслать немного другую версию. Не ту на которую указывал monday2000 ранее.
[Профиль]  [ЛС] 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 23-Май-11 07:03 (спустя 7 часов, ред. 23-Май-11 07:13)

Пожалуйста.
К слову, мне вот самому интересно как поведёт себя 9-ка при работе. Будут трудности — пишите.
По моему скромному мнению, если текст в подавляющем большинстве русский или украинский, английский там, тогда лучше оставаться на 8-ке и не заморачиваться. А если надо "изыски", как в моём случае например, то таким-вот, кандибобером.
Не по теме, но что-бы не создавать ещё одно сообщение пишу здесь.
Даже в 10-ом ФР нет некоторых словарных баз, греческого например, или древнеанглийского про восьмёрку я-уж и молчу. Так вот, есть возможность добавить несколько нужных словарей (наборов слов в столбик) в эти версии.
Словари брал и конвертил из Freelang.
[Профиль]  [ЛС] 

57an

Стаж: 17 лет 8 месяцев

Сообщений: 191


57an · 23-Май-11 07:05 (спустя 2 мин.)

yuree
Похоже, что технология "FR9+ через pdf" может оказаться даже надежнее, чем классическая "FR8 => DjvuOCR", т.к. у меня последняя обычно ломается на пустых страницах, приходится хотя бы точку нарисовать, чтобы было что распознавать... Или не включать пустые страницы в книгу - но тогда имеем проблемы с Djvu HyperLinks Editor.
Единственно, часто обложка кодируется в значительно меньшем dpi, чем остальная книга. С этим проблем не будет? Или в худшем случае на обложке "съедет" распознанный текст?
[Профиль]  [ЛС] 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 23-Май-11 07:17 (спустя 12 мин.)

57an писал(а):
yuree
<...>
Единственно, часто обложка кодируется в значительно меньшем dpi, чем остальная книга. С этим проблем не будет? Или в худшем случае на обложке "съедет" распознанный текст?
Если дело только в обложке и не хочется "перепаковывать" DjVu то я-бы так и оставил, скрепя сердцем Текст будет не на своём месте. А вообще, я люблю что-бы всё было основательно. Все сканы в одном разрешении с одним и тем-же размером листов.
[Профиль]  [ЛС] 

57an

Стаж: 17 лет 8 месяцев

Сообщений: 191


57an · 23-Май-11 07:35 (спустя 18 мин.)

yuree
Цитата:
Все сканы в одном разрешении с одним и тем-же размером листов.
Не согласен.
2-3 Мб на обложку 600 dpi - это перебор.. А если есть еще и задняя сторона обложки - то размер обложек будет сравним с размером книги.
Вот 150 кБ за 150 dpi, или даже 60 кБ за 100 dpi (если нет мелких деталей) - с этим согласен..
Хотя, обложки тоже разные бывают. Иные стоит сохранить в качестве. Правда, даже в этом случае это будет скорее 300dpi, чем 600.
[Профиль]  [ЛС] 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 23-Май-11 12:32 (спустя 4 часа)

57an писал(а):
yuree
Цитата:
Все сканы в одном разрешении с одним и тем-же размером листов.
Не согласен.
2-3 Мб на обложку 600 dpi - это перебор.. А если есть еще и задняя сторона обложки - то размер обложек будет сравним с размером книги.
Вот 150 кБ за 150 dpi, или даже 60 кБ за 100 dpi (если нет мелких деталей) - с этим согласен.
А Вы поставьте в DjVu Imager'е "качество заднего фона" не не всю катушку а 30-40. Жмёте "текущий" и лицезрите качество картинки. Устраивает — хорошо, хотите меньше размер — меньше значение. А потом гляньте dpi в DjVu который Вы соберёте, там где титул
Короче, Вы это и сами прекрасно всё знаете, что это я Вам рассказываю
[Профиль]  [ЛС] 

monday2000

Стаж: 16 лет 7 месяцев

Сообщений: 93


monday2000 · 23-Май-11 13:55 (спустя 1 час 22 мин., ред. 23-Май-11 13:55)

petoleg
Цитата:
Кроме недостаточной глубины цвета, ужасающая скорость сканирования "в цвете"
Что значит "глубина цвета"?
По поводу скорости сканирования: я когда проводил сравнительные тесты по скорости сканирования на 2-х сканерах: http://www.djvu-soft.narod.ru/scan/buy_scanner_2007.htm . У меня получилась практически одинаковая скорость сканирования как на "сером", так и на "цветном" режимах сканирования.
Я так думаю, что сканер на самом деле всегда аппаратно сканирует в "цвете" - просто когда мы задаём режим цветности отличный от цветного, сканер сам внутренне конвертирует отсканированное цветное изображение в серое или чёрно-белое (смотря, что мы заказали сканеру).
Stepanenko.P.V.
Цитата:
Не получается зашить текст в DJVU.
Скачайте по Яндекс-запросу "finereader 8 portable" и все проблемы будут решены. FineReader 9 и тем более 10 не поддерживаются. Процесс вставки OCR в DjVu - см. http://www.djvu-soft.narod.ru/scan/scan_and_share_1_07.htm#5 .
[Профиль]  [ЛС] 

Shassukkum

Стаж: 17 лет 4 месяца

Сообщений: 1178


Shassukkum · 23-Май-11 18:44 (спустя 4 часа)

monday2000 писал(а):
petoleg
Цитата:
Кроме недостаточной глубины цвета, ужасающая скорость сканирования "в цвете"
Что значит "глубина цвета"?
Видимо имеется ввиду это.
[Профиль]  [ЛС] 
 
Тема закрыта
Loading...
Error