Project Gutenberg とは、著作権の切れた本を無料で公開しているウェブサイトです。日本語でいう青空文庫にあたるものを、英語圏で運営しています。
読者は登録をせずに本を読めます。料金もかかりません。
同サイトは7万5千点を超える本を公開しています1。
一方、日本から Project Gutenberg を使う場合、「米国で公開されている本を、日本でそのまま使ってよいのか」という点は確認が必要です。
同サイトの判断は米国の法律に照らしたものだからです。
本記事では、Project Gutenberg で読める本と読み方について解説した上で、成り立ち、再配布の条件、日本から使う場合に確認すべき点、そしてファイルを自分で扱う場合の形式を紹介します。
Project Gutenbergとはどのようなウェブサイトか
本章では、Project Gutenberg の概要について以下の項目を解説します。
- 世界でもっとも古い部類に入る電子図書館
- 英語の古典を中心にした収録作品
- 日本語の作品を探す場合は青空文庫が向いている
以下、それぞれ詳しく見ていきましょう。
世界でもっとも古い部類に入る電子図書館
Project Gutenberg は1971年に始まりました。電子図書館としては、世界でもっとも古い部類に入ります。
同サイトは著作権の切れた本を無料で公開しており、読者は登録も支払いもせずに7万5千点を超える本をその場で読めます1。
英語の古典を中心にした収録作品
Project Gutenberg でよく読まれている本は、以下のとおりです。
| 著者 | 作品 |
|---|---|
| Jane Austen | Pride and Prejudice |
| Arthur Conan Doyle | The Adventures of Sherlock Holmes |
| Herman Melville | Moby Dick |
| Mary Shelley | Frankenstein |
| Lewis Carroll | Alice’s Adventures in Wonderland |
| Charles Dickens | A Tale of Two Cities |
日本語の作品を探す場合は青空文庫が向いている
Project Gutenberg には、フランス語やドイツ語、フィンランド語の本も入っています。
ただし、点数は英語の本よりずっと少なめです。
読者が日本語の作品を探す場合は、青空文庫のほうが向いています。
青空文庫については青空文庫とは何かで解説しています。
Project Gutenbergの読み方
作品ごとのページには、形式の選択肢が並びます。
読者が選べる形式は以下の3とおりです。
- **ブラウザで読む。**作品ページに HTML 版へのリンクがあります。
- **電子書籍としてダウンロードする。**同サイトは EPUB と Kindle 用のファイルを用意しています。
- **プレーンテキストでダウンロードする。**利用者がプログラムで処理する場合は、この形式がいちばん扱いやすくなります。
長編を読み通す場合は EPUB が向いている
ブラウザ版は、1作品が1ページに収まっています。
そのため、読者は途中でしおりを挟めません。
読者が長い小説を読み通す場合は、EPUB をダウンロードして手元の電子書籍アプリに入れましょう。
Project Gutenbergの成り立ち
本章では、Project Gutenberg がどのように始まり、どのように本を増やしてきたのかを解説します。
- マイケル・ハートが1971年に独立宣言を打ち込んだ
- Distributed Proofreaders が51,120点を校正した
マイケル・ハートが1971年に独立宣言を打ち込んだ
創始者のマイケル・ハートは、イリノイ大学の材料研究所にあったメインフレーム(Xerox Sigma V)の利用権を渡されました。ハート本人の書き方によると、この権限には「1億ドル分の計算時間」が入っていました。
ハートは、最初に「アメリカ独立宣言」を打ち込みました2。
当時、パソコンはまだありません。Web もありません。
読者が手元の機械で本を読む習慣も、当然ありません。
それでもハートは、本文を文字データにして誰でも取り出せる形にしておく価値がある、と判断していました。
Distributed Proofreadersが51,120点を校正した
Distributed Proofreaders は、2000年にチャールズ・フランクスが立ち上げた仕組みです。この仕組みは本をページ単位に切り、複数の人が同時に別々のページを校正できるようにしました3。
同組織は2002年に Project Gutenberg の公式サイトになり、2006年には別法人になりました。
Distributed Proofreaders の考え方は、入力と校正を分ける青空文庫と同じです。
Project Gutenbergの本を再配布するときの条件
本章では、利用者が本を配り直す場合の条件について以下の項目を解説します。
- 商標の使い方に限られる再配布の条件
- 商標を使う場合は商用利用にロイヤリティが発生する
商標の使い方に限られる再配布の条件
Project Gutenberg は、再配布について以下のとおり書いています。
you can freely redistribute any eBook, anywhere, any time, with or without the “Project Gutenberg” trademark included
ファイルの先頭と末尾には、Project Gutenberg の説明文(ヘッダとフッタ)が入っています。利用者がこれを外して名前を使わなければ、どこへでも自由に再配布できます。
商標を使う場合は商用利用にロイヤリティが発生する
一方、利用者が名前を使う場合の条件は以下のとおりです。
If you use the Project Gutenberg name, which is a registered trademark, you need to pay royalties for any commercial use
無料の本に有料の条件が付いているように見えますが、この条件は登録商標の使い方にだけ掛かります。本文は自由に扱えます4。
なお、青空文庫は出典の表示を「希望します」と書くだけですが、Project Gutenberg は商標の使い方に条件を置いています。
日本からProject Gutenbergを使う場合の注意点
本章では、日本から同サイトを使う場合に確認すべき以下の項目を解説します。
- 公有かどうかの判断は米国の法律で行われている
- 日本で配る場合は生没年から判定し直す
公有かどうかの判断は米国の法律で行われている
Project Gutenberg は、公有の判断について以下のとおり書いています。
Not all items that are public domain in the US are public domain in other countries, and vice versa.
この一文は、米国で公有の本が他の国でも公有とは限らず、その逆もある、という意味です。同サイトは「米国外で運用するなら専門家の助言を得るように」とも書いています。
つまり、読者や利用者が日本で本を配り直す場合、米国の判断をそのまま使うことはできません。
日本で配る場合は生没年から判定し直す
青空文庫には作品ごとに著作権の状態が記録されているため、利用者が国内で配るだけであれば、その記録を読めば済みます。
一方、Project Gutenberg にこれにあたる情報はありません。同サイトの目録には、著者や訳者の生没年が入っています。
そのため、利用者は日本の規則を自分で当てはめることになります。関係する規則は以下の3つです。
- 死後70年という原則
- いったん切れた保護は戻らないという扱い
- 日本にだけある戦時加算
詳しい手順は著作権はいつ切れるのかで解説しています。
Project Gutenberg の言う public domain は、米国の法律に照らした判断です。利用者が日本で配れるかどうかは、生没年から判定し直したうえで1件ずつ確かめましょう。
戦時加算が掛かるかどうかは作品ごとの事実によって決まるため、生没年だけでは判断できません。なお、この記事は法律の助言ではありません。
ここから先は、Project Gutenberg のファイルを自分のプログラムで扱う人に向けた内容です。読者が本を読むだけであれば、ここで読み終えて構いません。
Project Gutenbergの目録はRDFから読む
Project Gutenberg は、全作品の目録を CSV と RDF の2つの形式で配っています。
CSV のほうが小さくて扱いやすそうに見えますが、利用者が権利を判定する用途には向きません。
CSVのAuthors欄は1本の文字列になっている
CSV の Authors 欄は、以下のような1本の文字列です。
Balzac, Honoré de, 1799-1850; Marriage, Ellen, 1865-1946 [Translator]
利用者は、役割と生没年を正規表現で分解することになります。これは、訳者かどうかを角かっこの中身で見分け、生没年をハイフンの前後で切り出す処理です。
ただし、名前にセミコロンやハイフンが含まれていれば、この処理は壊れます。
RDFなら役割と生没年が別々の項目に入っている
RDF であれば、pgterms:agent に生年と没年が別々の項目として入っています。役割は要素名で区別され、対応は以下のとおりです。
dcterms:creator……著者marcrel:trl……訳者marcrel:edt……編者
そのため、利用者は権利の判定を文字列処理へ任せずに済みます。
RDF は rdf-files.tar.bz2 という120MBのアーカイブとして配布されています。利用者が展開すると、79,009ファイルになります5。
RDFなら人物番号でWikidataとつながる
利用者が RDF を選ぶ理由は、もう1つあります。RDF の人物には Project Gutenberg の人物番号が付いており、Wikidata の P1938(Project Gutenberg author ID)が同じ番号だからです。
利用者が番号をたどれば、Wikimedia Commons の肖像までたどり着けます。名前を正規化して作った文字列の ID では、この突き合わせができません。
pg-headerとpg-footerに挟まれたProject Gutenbergの本文
青空文庫では、利用者が .main_text という目印を探し、見つからないファイルを処理できません。Project Gutenberg のほうは、この点が確実でした。
yodaka が調べた30冊すべてに id="pg-header" と id="pg-footer" があり、本文はこの2つに挟まれた範囲です。そのため、利用者はヘッダとフッタの除去と本文の切り出しを1回の操作で終えられます。
class名には共通の語彙がない
一方、class 名は利用者にとって扱いにくい点です。Project Gutenberg には、class 名の共通の語彙がありません。
実際に出てきたものを並べると tei-p pnext pagenum poem chapter drama dropcap i0 t3 などがあります。利用者は、青空文庫の jisage_N や sesame_dot のような決まった名前を当てにできません。
そのため yodaka はタグで抽出し、class を小さな除外リストとしてだけ使っています5。
強調には、<em> より <i> のほうが使われていました。yodaka が調べた35冊で <i> が9,934、<em> が106です。
見出しも本によって違います。yodaka が調べた34冊のうち29冊は h1 が書名で章が h2 ですが、残りは h1 が章です。処理が一律に h1 を削除すると、後者の見出しがすべて消えます。yodaka は、h2 のほうが多いときだけ h1 を書名と判定する、という決め方にしました。
挿絵画家の没年は数えない
yodaka は、目録から dcterms:creator(著者)と marcrel:trl(訳者)と marcrel:edt(編者)を参照します。原著が何世紀前のものであっても、訳文と編纂には別の著作権が生まれるためです。
一方、yodaka は挿絵画家の欄を参照しません。取り込みのときに画像とキャプションを除外しているため、挿絵画家の仕事が配信物に残らないからです。
yodaka が挿絵画家を参照した場合と比べると、配れる本の数は9,000件以上ちがいます。この数え方の理由は著作権はいつ切れるのかで解説しています。
英語の作品は設定で有効にした人にだけ表示している
yodaka は、英語の作品を設定で有効にした人にだけ表示しています。日本語の本を読みたい人にとって、7万5千点の英語の本は目的ではないからです。
有効にした人には、出典の断りに以下の1行を足しています。
英語の作品は Project Gutenberg のものを同じように扱います。
また、yodaka は一節を集める用途でも全点を使っていません。ダウンロード数が1,000回以上の本に絞っています。
この数は目録に入っているため、yodaka はそれを基準にしています5。
まとめ
Project Gutenberg とは、著作権の切れた本を無料で公開しているウェブサイトです。1971年に始まった、世界でもっとも古い部類の電子図書館にあたります。
同サイトは英語の古典を中心に公開しており、点数は7万5千点を超えます。読者は登録をせずに、ブラウザまたは EPUB で本を読めます。
再配布の条件は登録商標の使い方にだけ掛かり、本文は自由に扱えます。
ただし、同サイトの「著作権が切れている」という判断は米国の法律に照らしたものです。利用者が日本で本を配り直す場合は、生没年から日本の規則を当てはめ直しましょう。
この記事が、Project Gutenberg についての理解を深める一助になれば幸いです。
Footnotes
-
Project Gutenberg, About。「an online library of more than 75,000 free eBooks」。2026年8月11日に確認しました。 ↩ ↩2
-
Michael Hart, The History and Philosophy of Project Gutenberg(1992年)。gutenberg.org。「Project Gutenberg began in 1971」「the Xerox Sigma V mainframe at the Materials Research Lab at the University of Illinois」「$100,000,000 of computer time」。金額は本人の書き方をそのまま引用したもので、当時の計算時間の値付けによります。 ↩
-
Distributed Proofreaders。「founded in 2000 by Charles Franks」「became an official PG site」(2002年)、「became a separate legal entity」(2006年)、「is now the main source of PG e-books」。完成点数は同サイトの表示で、2026年8月11日の値です。 ↩
-
Project Gutenberg, Permission, How To。米国基準についての引用も同じページです。 ↩
-
RDF のファイル数、抜き出した本の集計、class 名の例は、yodaka の取り込み処理で測った値です。数えた冊数が項目ごとに違うのは、測った時期が違うためです。 ↩ ↩2 ↩3
