
今、もっとも熱心に紙の本を読んでいるのは人ではない。AIである。
大手出版取次「日販(日本出版販売)」が、米AI開発企業「アンソロピック」に書籍を大量販売していたことがわかった。
出版取次の日販、米AI企業に書籍を大量販売か 業界団体が説明要求:朝日新聞

アンソロピックは、AIに学習させるため、数百万冊の書籍を裁断・スキャン・デジタル化し、その後廃棄(破壊スキャン)した過去がある。今回も、同様の処理をした可能性が極めて高い。出版社団体「日本書籍出版協会」は、日販に対し説明を求めている。
怒れる出版社
出版社側の怒りは容易に想像がつく。彼らにとって、本はAIに読ませるためのものではない。人に読んでもらうためのものだ。データではない。創作物だ。同協会の「造本装幀コンクール※)」を見ればわかる。紙質・装幀にこだわり、重み・厚みがある受賞作は、手元に置いておきたくなるものばかり。これらが、人に読まれることなく裁断され、データだけがAIに喰われ、残った紙面は捨てられる。出版社でなくとも痛ましく感じるのではないか。
※)日本書籍出版協会・日本印刷産業連合会共済

受賞作
造本装幀コンクールより
裏切られたという思いもあるだろう。紙の本において、出版社・印刷会社・取次・書店は一蓮托生の関係にある。日販は、出版各社とともに経済産業省主導の「出版産業における返品削減研究会」の委員に名を連ね、本を存続させるための施策を講じてきた。「滞在型書店 文喫」「ブックホテル 箱根本箱」も、その一環だ。どちらも、本を売ることが目的ではない。「紙の本と接してもらうこと」が目的だ。

左:BUNKITSU(文喫)TOKYO、右:ブックホテル 箱根本箱
もし、紙の本が無くなれば、電子書籍を扱わない取次は、付加価値を創出できなくなり、そのダメージは計り知れない。「紙の本を守るべき」企業であり、実際に守ってきた日販が「破壊スキャン」を行うアンソロピックに本を売り渡していたことに、業界は衝撃を受けている。
ネットはAIの排泄物で溢れてる
そもそも、なぜアンソロピックは紙の本を欲しがるのか。AIの学習データに使うのであれば、ネット上のデータを使った方がはるかに楽なはず。わざわざ手間のかかる紙の本を購入するのはなぜか?
ネットは「汚染」されているからだ。
ある時期から、ネット上に、オリジナリティがない「一般論」が溢れるようになった。AIが書いた文章、あるいは、書いた文章を「参考にして」書かれた文章である。
だが、AIの文章はまちがいを含んでいる。AIがまちがい含みの文章を学習し、それを学習したAIがさらにまちがい含みの文章を書き……。こうしたことが繰り返され、AIが書く文章は現実から乖離していく。
このような文章(やデータ)を「AIスロップ」と呼ぶ。スロップ(slop)とは、残飯やカス、排泄物のことをいう。いまやネットデータは、AIの排泄物まみれなのだ。
そんな汚いデータを、わが社のAIに学習させるわけにはいかない。ではどうする? クリーンなデータはどこにある?……そう。紙の本だ。
「Anthropicは、世界最高水準のAIを実現するには、書籍を利用するのが最も費用対効果の高い手段である、と確信するに至った」
このような記述が、アンソロピックの裁判資料にある。過去、アンソロピックは海賊版書籍700万冊をダウンロードし、著作権者に訴えられている。その後、大手出版社とのライセンス契約を模索するが実現せず、最終的に選んだのが「紙の本をスキャンすること」だった。
紙の本を購入したうえでスキャン・廃棄すれば法的問題がクリアされる。かつてグーグルが行っていたカメラ撮影を用いる「非破壊スキャン」ではなく、本を裁断しスキャナで一気に読み込む「破壊スキャン」でデータ化すれば安価にすむ。アンソロピックが選んだのは、最も安く簡単な方法だった。スキャンプロジェクトの責任者には以下の任務が課された。
「世界中のあらゆる書籍を手に入れること」
(obtaining “all the books in the world”)
こうして、アンソロピックは日本の書籍も視野に入れることとなる。
裁判資料内の「NIPPAN」
日販のアンソロピックへの書籍販売が明らかになったのも裁判資料からだった。”Nippan Japan”(日販)という企業名が資料に複数回登場し、「購入した書籍はスキャンする意向」とみられる記述もあった。日販は朝日新聞の取材に対し
「AI学習向け用途と認識したうえで販売した事実はない」
と回答しているが、言い訳にしてもかなり苦しい。業界内での信用低下は免れないだろう。
汚物を食べる人間たち
「世界最高のAIトレーニングデータは本棚に並んでいる」
AI Companies Are Buying Tons of Old Books Because They’re Free of AI Slop|404media
このようなキャッチコピーでAI企業に「紙の本」を斡旋する企業が出現している。米国のISBNdb社※)である。「世界最大の書籍データベース」を自称する同社は、2022年以前の書籍データを「生成AIの汚染がない」「ネットから取得できない査読済みの専門知識」として売り込んでいる。
※「ISBNdb」は営利民間(小規模)企業。ISBNを管理する機関(国際ISBN機関)ではない。ISBNdbのキャッチコピーは現在削除されている
いまや、AIは自らが汚染したネットに見切りをつけ、「紙の本」という新たな狩場でデータを食い散らかしている。そして、AIが吐き出した汚物を熱心に読んでいるのは、私たち人間なのだ。
【参考】
・UNITED STATES DISTRICT COURT NORTHERN DISTRICT OF CALIFORNIA Case 3:24-cv-05417-WHA(判決文)







コメント