2026年9月24日

書籍のDX

もう一つ佐々木俊尚氏の引用から、大量の書籍・古書が買われていて、どうもAIの情報源として使用されているらしいという話し。印刷された媒体をスキャンして、デジタルデータ化してAIに投げて学習用データとして活用しているのではと言う話。少し前にUSなんかでも大量の書籍が廃棄されているという話が出ていましたが、それと同様なんだろうなあ。

私は子供の頃から読書好きで、本に関してはそれなりの愛着があります。ただ、さすがに物理的にスペースを取る存在だけに限度もあるわけで、最近ではごく一部の書籍類を除いて断捨離して、必要なものは基本Kindleで購入するように変わってきました。最近の書籍であれば、電子化(Kindle化)することも簡単だろうし、最初からそれを意識して印刷用データなんかも準備するんでしょうね。問題は、そう言う時代以前の印刷媒体でしか残っていない書籍に関して。最近ではOCR(Optical Character Recognition)技術も発達していて、書籍をコピーのようにスキャンしたら、即座にその内容がテキスト化されるので、取り込みやすいとはいえでも手間は掛かる。特に書籍の場合背表紙で閉じられているので、1ページ1ページ捲らないといけないわけで、それが読書の楽しみでもあるけれど、OCR作業者からすると「面倒」。

以前新入社員の一人が、大学でそのOCR関係の研究をしていて、高速撮影カメラを利用して、1一ページ目繰りするのでは無く、トランプのシャッフルのようにページをパラパラと捲るような仕組みを利用して、一瞬見える左右のページを高速度撮影をして、それを斜め補正とか歪み補正をして、正面から撮影したような映像を作成してOCR化するみたいな話でした。当時は今から20年以上前で、まだカメラ性能も4Kとか無かっただろうし、コンピューターリソースや認識技術も基本的な事しか出来なかった時代だったと思いますが、それでも99%以上の認識率だったと話していた気がします。まぁ、書籍のままスキャンするのは色々大変なので、多くの場合は背表紙部分を切り落として、一枚一枚分離して、それをコピーする容量でどんどんスキャンしていく、当時は「自炊」と言っていたけれど、そういう手段が一番効率的。でも、それって残った「元書籍」は紙直ぐにしかならないわけで、どんな貴重な書籍でも廃棄するしか無くなる。それって、やはり自分的には書籍に対しての冒涜のような気がしますね。

大量のスマホを利用して不正なアクセスをすることが問題というか話題になったけれど、ある意味「書籍工場」みたいな感じなのかもしれない。同じスキャンするにしても、ロボット技術や高速撮影技術にOCR技術と、多分日本が得意な技術を組み合わせれば、もっとスマートなやり方が出来そうな気がするんだけれど。それを、例えば国会図書館で所蔵している書籍に適用して、どんどんデジタルアーカイブ化したら、「Japan's Digital Archive」してかなり付加価値も利用価値も高いものが出来そう。骨太の方針にも、適応できる部分が多い気がするんだけれど、中々予算は付かないのかなあ。デジタル化することで、利用範囲が大きく広がるとともに、その内容にいつでもアクセス出来る可用性が拡大する事は、かなり大きな意味があると思うんですよね。で、そう言うデータをどんどん国産AIに学習させて、日本という国がデジタル世界の中で存在感を増していける気がするんだけれど。個人的には、デジタル化は可用性や効率化のために必須だと思う反面、デジタル機器の故障等で一気にデータ喪失可能性もあるわけで、そう言う意味では印刷媒体として物理的に複数箇所にバックアップ出来る「書籍」という形態も必要だと思うんですよね。だから、書籍のデジタル化と共に、デジタルデータの物理補完という事も並行して考える必要があると思うんだけれど。そう言う意味では、輸出されて喪失されるよりは、国内でどんどんデジタル化して、そのデータを渡しつつ書籍は守るみたいな政策も必要じゃないだろうか。

0 件のコメント:

コメントを投稿