
★ いまさら?
本の購入を紙から電子メインに切り替えて6年目になるが、ようやく「積ん読本」を解体する覚悟ができた。
カッターでバラし、スキャナーで読み取って電子化する。どこまでできるかは分からないが、やってみようと思う。
日々、本は劣化してゆく。
汚れ、傷、日焼け、湿気、色褪せ。古い本は酸性紙だったりするので、気がつけば紙が茶色くなっていたりする。

実家に置きっぱなしにしていた本の一部は、保存環境に注意を払っていなかったため酷いことになっていた。
引っ越しのダンボール箱に詰め込んだまま物置の隅に置きっぱなしにしていたものが、湿気を吸い、蟲に喰われ、ボロボロになっていた。

本体は泥の塊のよう(虫のフン?)になっており、残っていたのは表紙カバーのフィルムと背中の糊だけという状態のものもあった。ダンボールで長期保存するのは好ましくないと言われているのは、こういうことだったのかと身に沁みてわかった。
電子版で買い直せるものも少しはあったが表紙絵が無かったり絵師が代わったりしており、古いものは電子版など無いため図書館か古本屋で探すしかない状態だ。
以後、乾燥と防虫には特に注意して「安全な保存」のための環境を整えようと反省した。
そして、残しておきたいもの、もう一度読みたいものは早めに電子化して「劣化」を止めようと決意した。
電子メインに切り替えてから紙本の増加は極めて少なくなっているが、居室の本棚、物置と化している小部屋、二階の物置、実家の物置、すべての本を合わせれば5桁近くにはなるだろう。
もとより、全部の本を電子化しようと思ってもいないし、できるとも思わない。なにより本を読む時間も欲しいし。
ひとまずは、「また読みたい」と感じるものから始めてみよう。
★ 準備したもの
・カッターナイフ 刃幅18mmくらいの折れにくい握りやすいもの
・カッターマット 100円ショップ品
・ディスクカッター CARL DC-210N (13,000円程度)
40枚程度までの切断が可能。
付属品:丸刃2枚、ミシン目刃1枚、カッターマット2本、マグネット式紙あて定規
・ドキュメントスキャナー ScanSnap iX1400 (45,000円程度)
両面読み取り、40枚/分、50枚給紙可能。
出力:PDF、JPEG、Office 変換(Word,Excel,PowrPoint)
標準で20万枚をスキャン可能。400ページの本であれば1000冊相当か。
それを超えると紙送りローラー等消耗品(8,000円程度)の交換が必要となるらしい。


これまでにも、本の電子化手順についてはいろいろと調べてはいた。
裁断機には評価の高い大型のものもあったが、予算との兼ね合いからディスクカッターを選んだ。
若干手数は掛かるが、ズレることなく垂直に切断できるのは自分の好み合っていると思う。
また、ScanSnap の操作や読み取りデータの管理はソフトウェア ScanSnap Home から行うので、あらかじめマニュアルに従いパソコン等にインストールして接続を確認しておいた。
おおまかな手順は、以下のとおりとなる。
1.カッターナイフを使って、本を40枚程度の厚さに切り分ける。
2.切り分けた本の糊付け部分をディスクカッターで切り落とす。
3.1枚ずつバラバラになったものを順番を崩さないようにスキャナーで読み取りデータ化する。
電子化の最終目標は、「いつも持ち歩いているスマートフォンで読める電子書籍を作る」だ。
★ 実作業
・本のカット
ひとまずは古書店で買ってきた文庫(290ページくらい)で試してみた。
ディスクカッターは一度に40枚までカットできるので、本のカバーを外して70ページくらいずつに分割する。
加熱して糊を溶かし本体の表~背~裏表紙をきれいに剥がす人もいるようだが、さすがにそれは手間がかかりすぎるので背表紙は諦める。
切断するページの間を大きく広げてクセをつけ、カッターナイフで切り分ける。
厚紙の本体表紙は1枚目の内容紙と強く接着している場合があるので、先に剥がしておいたほうが良いかもしれない。

次に、切り分けた本から糊の付いた部分をディスクカッターで5~7mmほどカットする。
このとき、マグネット式紙あて定規が紙台定規と直角になっていることを確認しておくとともに、1冊分を切り終えるまで位置がズレないよう注意する。

糊部分が残ってくっついたページがないかパラパラと確認したうえで、ページ順を崩さないようにスキャナーのシートフィーダーに載せる。
標準では、天を下にして、先頭ページをシートフィーダー側に向けて載せることとなる。
・本のスキャン~PDF
ScanSnap でのスキャン操作はソフトウェア ScanSnap Home から行う。

まずは、一般的とされるPDFデータで出力してみる。
カバー・表紙を除いた本文のスキャンは、読み取り設定を次のとおりとした。
カラーモード:白黒
読み取り面 :両面
画質 :スーパーファイン
向き :回転しない
ファイル形式:PDF(単一)
フィード設定:継続スキャン
保存先 :Dドライブ

当初は詳細設定で「白紙ページを自動的に削除する」にチェックを入れていたのだが、読み取りの薄かったページが勝手に削除されてしまったので、このチェックは外すこととした。
また、のちの検索性・テキスト化を考慮し、同詳細設定で「検索可能なPDFにします」にチェックを入れておいた。


この設定を「小説本文PDF」と名前を付けプロファイルとして保存した。
上記のプロファイルでスキャンしたPDFデータを確認してみると、1995年刊行の文庫で紙の色が少し茶色がかっていたためか、汚れのように黒い斑点が入ったページがあった。もしかすると、変色した紙の色を「絵」として認識してしまったのかもしれない。

「検索可能なPDF」となっているのか簡単にテストしてみたが、これはひとまず大丈夫のようだ。

このPDFデータをスマホで表示してみた。そのままだと1ページが画面に収まらない。
左から、① 標準、② 画面に収まるよう縮小したもの、③ 逆に画面内で最大限に拡大したもの、と順に並べてみた。

それぞれ、①16行表示、②18行表示、③13行表示、となっている。
②と③はページをめくるたびにピンチイン・アウトの操作が必要となってしまうので、読書として実用的とは言いがたい。
実際に使えそうなのは①のみとなるが、6.1インチのスマホでの読書は不可能ではないが、けっこう眼が疲れそうだ。
ちなみに、このPDFデータからコピーしたテキストをパソコンとスマホで表示したものが次のとおりとなる。


ページ番号や改行が入ってしまうのは仕様上しかたないが、行頭の全角空白が無くなり、一部に文字化けが見られる。
完全テキスト版とするには、やはり校正が必須だろう。
残っているカバーと本体表紙は、本文とは別にカラーでスキャンし、そのあと本文PDFと結合させる。
カバーは折り返しがあって長いので、背表紙と裏表紙の間で切り離し2枚に分け、本体表紙とともに横にしてスキャンした。
(画像は別の本をスキャンした際のもの)

以下のスキャン設定を「小説表紙PDF横」のプロファイル名で保存した。
カラーモード:カラー
読み取り面 :片面
画質 :スーパーファイン
向き :左90度回転
ファイル形式:PDF(単一)
フィード設定:通常スキャン

カバー表紙と本体表紙、本体裏表紙とカバー裏表紙の組合わせで2回に分けてスキャンし、それぞれのPDFを作成する。
PDFの結合についてはフリーソフトを使用しても良いかと思うが、今回はオンラインのサービス「iLovePDF」を試してみた。
表紙、本文、裏表紙、3個のPDFファイルをサービスページにドロップし、希望する順番に入れ替えて結合ボタンを押す。しばらくするとまたボタンが表示されるのでダウンロードすると結合されたPDFが入手できた。




・本のスキャン~JPEG
次は、再スキャンしてJPEGデータで出力してみる。
以前、書籍の電子化方法を調べていたときに「最初から白黒二値でデータ化するよりも、グレースケールでデータ化したものを調整したほうがより綺麗なものになる」との記述を見た記憶があったので、「小説本文PDF」の読み取り設定から次の2点を変更し、これに「小説本文JPG」と名前を付けプロファイルとして保存した。
カラーモード:グレー
ファイル形式:JPEG

このプロファイルでスキャンしたJPEGデータ(1ページにつき1個のデータが作成される)を、以前から図書館本のカメラ自炊で使っていた「Ralpha」に読み込ませ、色調補正設定画面でガンマ値や輝度・コントラストをあれこれ調整してみると、まずまず見られるものとなった。


カバーと本体表紙はやはりカラーでスキャンするが、前述のとおりデータは個別に作成されるので4枚を一括してスキャンする。
スキャン設定=プロファイル「小説表紙JPG横」は次のとおり。
カラーモード:カラー
読み取り面 :片面
画質 :スーパーファイン
向き :左90度回転
ファイル形式:JPEG
フィード設定:通常スキャン

調整済み本文データの前後に自動整列するよう、作成されたカバー等JPEGデータファイルの名前を変更し、「MeTilTran」に読み込ませて組版再配置を実行したが、カメラ自炊と違って歪みがなく行の誤認識も少なかったので、行幅修正することもほとんどなくスマートフォン版を作成することができた。
(画像の例では、出力幅360×出力高さ720、文字サイズ100%、9行30文字となるように出力した。元原稿の印刷文字が大きい場合は400×800で出力することも多い。)

できあがったJPEGデータファイルをフォルダごとZIP圧縮して電子書籍とした。
なお、「Ralpha」と「MeTilTran」の詳細については、当ブログの過去記事『ゼロ円で「自炊」、電子書籍できました(その2)』を参照のこと。
・本のスキャン~その他
このあとさらに、Wordデータでの出力、ABBYY Scan to Searchable PDF での出力も試してみた。
これらもテキスト化(将来的EPUB化)のために試してみたものだったが、いずれもやはり「校正なし」とはいかないようだ。


★ バックアップと無限書庫?
自分としては、電子書籍はEPUB形式が最良だと思っている。
サイズも小さく、リフロー型なので端末にあわせて文字サイズを調節できるし、画像も扱える。画像のみで構成すればPDFのように固定レイアウトの電子書籍を作ることもできるし、いざとなれば拡張子をZIPに変えて解凍することでXML形式のファイル群の中から文章や図表を取り出すこともできるからだ。
(そこまで現行システムの安定性を信頼していないのかと言われそうだが、万一の際にデータサルベージが容易であることは大切だと思っている。)
PDFで出力すると固定レイアウトとなってしまうため、画面の小さいスマートフォンで読むのはいささか厳しい。
テキストを抽出すれば流動レイアウトとしてスマートフォンでもラクに読めるが、上記で試したとおり校正は必須である。したがってEPUB化もまだ当分はお預けだろう。
よって、労力と成果物を考慮した結果、現時点ではJPEGでの出力を基本としたい。
現在は、Android スマートフォンでアプリ Comic Screen を使い色反転させて読んでいる。黒地に白文字(実際には色反転といっしょに Blue Light フィルターもオンにしているので、薄っす~い茶色文字)は Eink に劣らず十分目に優しいのではないかと思っている。
PDFに比べるとかなりサイズが大きくなってしまうが、上記の調整で汚れも少なく見た目がキレイになるし、スマホ版の作成など擬似的にリフローも可能だ。

今回作成したスマホ版は90Mバイトほどのサイズとなったが、これまでの経験からすると1冊あたり平均で120Mバイトくらいになるかと思われる。
1Tバイトのハードディスクであれば7000冊あまりが保存できるので、高価なRAID1のNASを使わずとも「ハードディスク2台に各々バックアップ」といった比較的安価な代替方法も選択できる。
「安全な保存」のための環境として、それほど無理なく実現できるのではないだろうか。
また、JPEGを基本とした場合、直近記事で復活させた Pixel 4a からグーグルフォトを使えば、クラウドに“無限書庫”を持てるんじゃないかとも考えたが、フォルダが作れなかったりページ順に並べるのが面倒そうなので、これはちょっと保留。惜しいんだけどなぁ。

まずは1000冊目指して、電子化をやってみようと思う。
★★ 追記:あとからOCR
前述のとおり、JPEGでの出力を基本にすることで、ひとまずスマートフォンでの読書はできている。
とはいえ、将来的にEPUBファイルへの変換ができればと考えているので、その前段階としてのテキスト化をやっぱりやっておきたい。
ScanSnap で再スキャンして「検索可能なPDF」で出力すればテキストの抽出は可能となるが、その場合JPEG出力とPDF出力との2回のスキャンが必要となってしまう。
スキャナーの紙送りローラー等は消耗品であり、けっして安いものではない。
消耗品1組で約1000冊の本をスキャンできるが、同じ本を2回スキャンするとなると手数もかかるし冊数も半分に減ってしまうことになる。
作成済みのJPEGデータを元にテキスト版を作れないか?

そう考えていろいろと試してみた。
・ScanSnap Home の再利用
当然ながら ScanSnap Home には、読み取った画像からテキストを生成するOCR機能がある。
目の前にあるんだから、これを利用することはできないかと考えた。
いろいろと試行錯誤した結果、できたことはできた。
だが、問題だらけだったのだ。
以下は私の単なるグチなので、読み飛ばしてもらってもまったくかまわない。
メニューには「検索可能なコンテンツに変換」の項目がある。
JPEGデータでも変換できそうに見える。実行すると「変換中…」の文字も表示されるのだが、実はできない。

オンラインマニュアルをさんざん探して回ってようやく「検索可能なPDFに変換できるイメージは……PDF」という文言を見つけた。PDFからPDFかよ! JPEG、できないじゃん。
そこで、先に作成した一冊分のJPEGデータをすべて指定してエクスプローラーから「印刷」をかけ、出力先を「Microsoft Print to PDF」にしてPDFファイルを作成した。
このPDFファイルを ScanSnap Home に読み込ませて「検索可能なコンテンツに変換」させようとするが、「ScanSnapでスキャンした画像ではないため、処理できません。」とエラーが表示される。

読み込んだPDFファイルのメタデータをチェックしているのが原因らしいとわかったので、このメタデータを書き換えてから ScanSnap Home に読み込ませ、「検索可能なコンテンツに変換」した。
この「検索可能なコンテンツ」=PDFを表示して全文をコピーしエディターに貼り付けてテキストとして保存はできたのだが、認識結果は惨憺たるものだった。

スキャンする際に「検索可能なPDF」として作成したファイルと比較してみると、どうやら画像が2倍以上大きいらしい。
そこで、改めてJPEGデータを3倍に拡大して、これをPDFにまとめ、メタデータを書き換え、ScanSnap Home に読み込ませ、「検索可能なコンテンツに変換」して、全文をコピーして、エディターに貼り付け、テキストとして保存した。
内容を確認してみると、文字の認識結果は悪くはなかったのだが、なぜかしら行があちこちと入れ替わってしまっている。
原因は不明である。

上記の結果をもって ScanSnap Home のOCR機能は使い物にならんと言いたいわけではない。
普通に「検索可能なPDF」として作成したものであれば 99.x %の認識率だし、行の入れ違えもない。直接読み取ったあとシステム内部において最適化処理しているのだろう。
残念ながら、試行錯誤を繰返した今回の結論は「裏ワザ的に作成したテキストは、校正の叩き台としては使えるかもしれないが、その作業はけっしてラクなものではない」ということだ。
・OCRソフトの利用
素直に、OCRソフトを使ってJPEGデータをテキスト化してみた。
無料で利用できるものを探していて、国立国会図書館が開発した NDLOCR-Light が目に入ったので、今回はそのWeb版である NDLOCR-Light Web を試してみた。

お試し用に、一章分70ページほどのJPEGデータを元にPDFファイルを作成し、NDLOCR-Light Web に読み込ませて「認識を開始」ボタンを押す。
15分ほどで認識処理が終わり、表示された「全てダウンロード」ボタンを押してテキストデータをダウンロードした。
内容を確認してみると、ルビやページナンバーが無視されているのはひとまず置くとしても、なぜかしらやはりこれも行が入れ替わってしまっている。

謎だぁ。なんで?
校正の叩き台として、どっちがマシなんだろう?
・AIの利用
最後の手段として、AIにお願いしてみた。
1冊分のPDFをアップロードしてテキスト変換をお願いしてみたが、依頼した形式にならない。
さすがに1冊丸々は量が多すぎたかと思い、前項同様一章分70ページほどの変換を依頼してみた。

途中、何度かプロンプトを修正しながら試してゆくと、誤認識や改行もれなどがときおりあるものの、段落頭のインデント(全角空白)、ルビの青空文庫式表記、余分な改行・ヘッダー・ページナンバーの削除など、ほぼ希望どおり満足のゆくものができあがった。
変換処理も速く、3分ほどで完了した。
さすが“秒進分歩”の世界AI。素直に感心してしまった。

(同じテキストを縦書きビューアーで表示したもの)

1冊分を5分割して順にテキスト化してもらったものを再びひとつにまとめ、未校正テキスト版(331KB)の完成とした。
以下は、この未校正テキスト版を Android スマートフォンのアプリ「読書尚友Lite」で表示したものである。
書名・著者名を加えて章タイトル等を少し修正したが、本文は変更していない。

アプリが自動的に作成した目次は、章タイトルのほか、節となる漢数字や誤変換したアラビア数字など空行に挟まれた数字を拾っており、漢数字の一・二・三を1・11・111と認識したり漏れがあったりと不完全さが目立つが、未校正であればむしろ当然といったところで、校正用原稿としては十分すぎるくらいだろう。
今後、JPEGデータのテキスト化は、AIにお願いしたいと考えている。
★★ 追記その2:ついでにEPUB?
・校正してみた
スキャンした3冊目の小説を読みながら校正してみた。
時代小説だが、前々から興味は持っていて一度読んでみたいとは思っていたものだ。
漢字もルビも比較的多く使われており、AIによるOCRの精度を確認するには良い材料ではないかと思う。
スキャンしたJPEG画像とAIにOCRしてもらったテキストを、パソコン画面に左右半分ずつ並べて表示させる。
テキストエディターは以前から愛用している「Mery」。
動作も軽くキーボードマクロも使え、なによりも横書きと縦書きを簡単に切り替えできるので、今回のように小説画像と見比べながら文章を校正する際などには使いやすいと感じている。

前述のとおり、章ごとに分割してAIにテキスト化してもらったのだが、同じプロンプト内容で指示しているにもかかわらず、成果物にはバラつきが出ていた。
画数の多い難解な漢字を誤認識したり、ときおり一文字抜けたり改行していなかったりするのは、OCRとしてまだまだ許容範囲内だろう。冒頭部分などは完璧とも思える仕上がりだったのだが、チェックを進めてゆくといくつかのクセが見えてきた。
例えば、カギ括弧で表示されるセリフ行が、他の行と入れ違っていることが多い。
行の入れ違いは他のOCRソフトでも見られた症状なので、もしかするとテキスト化の際にはありがちな問題なのかもしれない。
また、第三章分では漢字とルビの表記がすべて逆転していたので修正に手間取ってしまった。
「囀《さえず》り」が正当なところ、「さえず《囀》り」となっていたりする。AIも指示を思い違いすることがあるんだろうか?
さらに、後半に進んでゆくと勝手に創造してくるものが目立つようになっていた。
語句がまるまる抜けているとかはまだマシで、ありもしない語句やルビを追加していたり、読み取れなかった文字をつじつま合わせして繋ぎ合せたのか、一見まともな文章に改変してきたりする。
なんというか、仕事に慣れてくると雑になるテキト-社員を部下に持ったような気分だった。目を光らせていないと手を抜いて誤魔化してサボってしまう。油断も隙もあったもんじゃない。
それでも、基本的にテキスト認識の精度は高かったので、なんとか休日一日を費やして読書・校正し終えることができた。
スマホで表示してみると、自動生成の目次でもきちんと章・節を拾っている。

読書しながら1回だけの校正なので誤りはまだ残っているかもしれないが、ひとまずこれで校了としたい。
・EPUBは?
テキスト化が完了したということで、いよいよ次のステップはEPUB化なのだが、まずまずの出来だったOCRに味をしめて、これもAIにEPUBファイルへの変換をお願いしてみた。
(校正しながらではあるが既に読んでしまった本を、わざわざEPUB化する意義については深く考えない。自己満足だとは思ってます。はい。)
すると、そのたびに違う方法が示されることとなってしまった。
AIは、直接EPUBファイルを作れないらしく、① HTMLファイルを作成するのでこれを無料ソフトでEPUBに変換する、② Python コードとして出力するのでこれを実行してEPUBを作成する、といった方法だ。
それぞれの成果物は以下のとおり。


本来のEPUBファイルは複数のファイル群から作成するものというイメージを持っていたので、日をあらためてEPUBファイルの作成方法から尋ねたところ、その構成要素の解説から個別ファイルの作成、ZIP圧縮の方法と注意点を教えてくれたので、この手順で作成したものが次の ③ となる。

いずれも表紙画像が入っていないので少々物足りなく、目次ページから各章にジャンプできないこともあって完成と言うにはほど遠いが、本格的に作成するとなるとまだまだ知識も時間も不足している。
今回は「とりあえず作れることは確認できたよ」ということで、EPUBファイルの作成については別途時間をとって再チャレンジしたいと思っている。
★★ 追記その3:EPUBできた! ありがとう LeME
「知識も時間も不足している」ということでいったん仕切り直そうとは思ったのだが、もうちょっとだけとEPUB作成ソフトを調べていたら「LeME」にたどりついた。
初心者向けということだったので物は試しと触ってみると、知識も時間も必要とせずアッというまにEPUBファイルができあがってしまった。
すごい! 簡単! ありがとう、LeME。
なによりも有り難かったのが、青空文庫形式のルビ表記がそのまま使えたことだった。
さすが国産ソフト。よく分かってらっしゃる。
先のテストでAIに変換してもらったこのルビ表記を、どうやってHTML5/EPUB3表記に直せばいいのかとか、目次から該当箇所へのジャンプをどう表記すればいいのかとかを心配していたのだが、まったくの杞憂だった。
作成してあった小説(校正済み)テキストファイルを修正したのは、
・各章のタイトル行の頭に「# 」(半角の#記号と空白)を追加
・上記によって目次ページが自動作成されるので、元の目次部分を削除
の2点だけ。

これに、画像としてカバー・扉・奥付を用意して順にLeMEに読み込ませる。



カバーは「表紙に指定」しておく。

本文は先ほどの修正で自動的に目次に収録されるが、読み込ませた画像を目次に入れるには「見出しレベル」と「見出しテキスト」を入力しておく。

本文を選んで「目次ページを挿入」ボタンを押すと、本文の前に目次ページが生成される。

⬇

あとは、本の情報(必須項目だけでも可)を登録し、EPUBファイルを作成するフォルダとファイル名を入力して「作成開始」ボタンを押せば完成だ。


できあがったEPUBファイルを開くと、表紙・扉画像も表示され、目次ページから各章へとジャンプできる。もちろんEPUBリーダーの目次からも跳べる。


スマホでの表示もサイズに応じたものとなり、目次からのジャンプも、文字サイズの変更も問題なくできた。


EPUB作成ソフト「LeME」は、もう少し複雑なこともできる(詳細はLeMEホームページを参照のこと。https://leme.style/)ようなのだが、自分としてはもう十分なできあがりで満足。(自己満足)
ということで、以上をもってEPUB版電子書籍は完成とし、シルバーウィークの自由研究・延長戦を終了としたい。
お世話になったソフト・アプリ制作者に感謝いたします。




















































