研究資源

日本語研究で引くコーパス・辞書・文献データベース・画像アーカイブの目録。 各項目は入口のURL、個別項目のURLの組み立て方、APIの有無、利用条件を持つ。

コーパス

Bluesky 日本語投稿(Jetstream 収集) Bluesky Japanese posts (Jetstream collector) 公開 現代 308MB(日次 gz 8本、日本語投稿 2,270,800 件/観測 21,590,100 件、cursor 保存済み)

現行 SNS 短文(くだけた文体)

jsonl.gz 日別(did, rkey, text, createdAt, langs)

利用条件: AT Protocol 公開投稿(削除尊重・内部研究利用)

FineWeb-2 日本語(jpn_Jpan) FineWeb-2 Japanese subset 公開 現代 222GB / 50 ファイル(全 176 ファイル中。通信断で中断)

現代ウェブ全般(trafilatura 抽出・MinHash 重複タグ付き)

parquet(text, minhash_cluster_size ほか)

利用条件: ODC-By 1.0

JGLUE MARC-ja(配布終了・入手不能) JGLUE MARC-ja (defunct; source data withdrawn) 公開 現代 null(入手不能)

Amazon商品レビューの二値感情分類データ(本来はレビュー本文+positive/negativeラベル)

本来: レビュー本文+ラベル(train 187,528 / dev 5,654 / test 5,639)

利用条件: 元データ Multilingual Amazon Reviews Corpus (MARC) のライセンスに従う(Amazonが配布停止)

JParaCrawl v3.0 英日対訳コーパス JParaCrawl v3.0 English-Japanese parallel corpus 公開 現代 2.8GB (en-ja-v3.0.tar.gz) / 展開後 en-ja.bicleaner05.txt 9.3GB

ウェブクロール由来の英日対訳文(自動文アライン・bicleaner品質スコア付き、日本語側はウェブ全般の書き言葉)

tar.gz内にTSV(source_domain, domain, bicleaner05スコア, 英語文, 日本語文)。約22M対訳ペア(deduped)

利用条件: NTT利用規約(情報解析を伴う研究開発目的のみ。複製・配布可、商用利用不可。CITATION: Morishita et al. 2020 LREC)

LLM-jp Magpie SFT v1.0 llm-jp/magpie-sft-v1.0 公開 現代 272MB

LLM生成の指示応答ペア(instruction tuning用、多様なトピック)

JSONL(1行1会話、conversations配列にrole/content、132,476件)

利用条件: Apache-2.0

NDL Ngram(図書PDM) NDL Ngram tosho-pdm 公開 近代 22.2GB

明治〜昭和戦前刊行図書 約28万点のOCR由来 1〜5gram

TSV行(ngram \t 総頻度 \t {年: 頻度} 辞書)gzip

利用条件: PDM

NINJAL Parsed Corpus of Modern Japanese(NPCMJ) NINJAL Parsed Corpus of Modern Japanese 公開 現代 約90,000文

現代日本語の句構造付きツリーバンク。2022年3月時点で約9万文

2016年から2022年まで年次のスナップショットが公開された。同じ木を継続開発するかいのきツリーバンクが https://kainoki.github.io/ にある

OPUS OpenSubtitles 日本語単言語側 OPUS OpenSubtitles Japanese monolingual side 公開 現代 34MB (ja.txt.gz)

映画・TV字幕から抽出した単言語文(口語・会話的、非公式ファン翻訳含む)

プレーンテキスト(1行1文、生の未トークン化版。tokenized版 ja.tok.gzは未取得)

利用条件: OPUS再配布物(原著作権は各字幕投稿者・opensubtitles.org。OPUS上はODC-BY相当で提供、再配布時は出典表記を推奨)

OPUS TED2020 日本語単言語側 OPUS TED2020 Japanese monolingual side 公開 現代 14MB (ja.txt.gz)

TEDトーク字幕から抽出した単言語文(講演調・書き言葉に近い話し言葉)

プレーンテキスト(1行1文、生の未トークン化版。tokenized版 ja.tok.gzは未取得)

利用条件: OPUS再配布物(原データはTED公式字幕、CC BY-NC-ND 4.0相当。研究利用目的での再配布)

Open2ch対話コーパス Open2ch Dialogue Corpus 公開 現代 1.9GB (corpus.zip 534MB + ranking.zip 1.4MB + 展開後合計)

匿名掲示板(open2ch)のスレッドを対話ペア化した口語・ネットスラング中心テキスト

TSV(context\tresponse、板別 livejupiter.tsv / news4vip.tsv / newsplus.tsv)+ ranking用 dev/test TSV

利用条件: Apache-2.0

WRIME(主観と客観の感情分析データセット) WRIME (subjective and objective emotion analysis dataset) 公開 現代 21MB(.git込み。TSV本体 wrime-ver1.tsv 9.5MB + wrime-ver2.tsv 8.2MB)

SNS投稿文(はてなブログ由来の一人称投稿、感情8分類×書き手・読み手複数評定付き)

タブ区切りテキスト(Sentence, UserID, Datetime, Train/Dev/Test split, Writer/Reader×8感情カテゴリ強度+Sentiment)

利用条件: 研究利用ライセンス(リポジトリ同梱LICENSE参照。研究目的での使用を想定、商用利用は要確認)

e-Gov 全法令 XML e-Gov all current laws (bulk XML) 公開 近代現代 297MB (zip)

現行法令(明治太政官布告の文語を含む法律文体)

法令標準 XML

利用条件: PDL 1.0

livedoorニュースコーパス Livedoor News Corpus 公開 現代 8.4MB (tar.gz) / 展開後 text/ 配下

ニュース記事(9カテゴリ、口語調のブログ的記事含む)

プレーンテキスト(記事ごとに1ファイル、URL・日付・タイトル・本文の順)、9カテゴリのディレクトリ分割

利用条件: CC BY-ND 2.1 JP

みんなで翻刻 Minna de Honkoku 公開 近世中世近代 約52M字

市民参加で翻刻された近世を中心とする古文書テキスト

GitHubでデータが公開される

利用条件: CC BY-SA 4.0

みんなで翻刻 近世散文サブセット Minna de Honkoku early-modern prose subset 公開 中世近世近代 2,877,821 短単位(12,214 丁)

近世の実用書・記録(医療と養生・料理書・疫病関係・地誌)

統一トークン parquet(TOKEN_SCHEMA)×2 シャード

利用条件: CC BY-SA 4.0

南総里見八犬伝 Nansō Satomi Hakkenden 公開 近世 97MB(raw json 4点計90.6MB + 抽出txt 4点計10.6MB、総文字数約364万字)

読本(長編伝奇小説、勧善懲悪・因果応報、全106冊98巻の大作)

NDL fulltext-json(頁別contents+座標)×4巻 + 抽出plain txt ×4巻

利用条件: PD(原典1814–1842年刊、底本1930年博文館版も著作権保護期間満了)

名大会話コーパス Nagoya University Conversation Corpus 公開 現代 129会話

129会話・約100時間の雑談の文字化資料

テキスト一括ダウンロード

利用条件: CC BY-NC-ND 4.0

国会会議録 National Diet Record 公開 現代 全量数十GB規模(テキスト)

議会演説・質疑(整文された話し言葉)

REST API(XML/JSON, speech単位)

利用条件: 利用規約(出典明示で利用可)

国性爺合戦 Kokusen'ya Kassen 公開 近世 1.5MB(raw json 1.3MB + 抽出txt 116KB)

時代浄瑠璃(全5段の合戦物、和藤内の異国活劇)

NDL fulltext-json(頁別contents+座標、合本の頁1-36を抽出)+ 抽出plain txt

利用条件: PD(原典1715年初演、底本1891年鍾美堂版も著作権保護期間満了)

国民之友コーパス Ver. 1.0 Kokumin no Tomo Corpus v1.0 公開 近代 191MB

明治中期の総合雑誌(文語・口語混在)

SUW TSV(UTF-8)+ XML(UTF-16)+ ひまわり

利用条件: CC BY-NC-ND 3.0

帝国議会・国会会議録(API 全量収集) Imperial Diet + National Diet proceedings (full API harvest) 公開 近代 4.2GB(帝国議会 59 ファイル・国会 81 ファイル、全年収集完了)

議会演説・質疑(1890–1947 は文語・旧字 OCR、1947– は整文)

jsonl.gz(1 行 1 会議、speechRecord 入れ子)年別

利用条件: NDL 利用規約(出典明示)

平家女護島 Heike Nyogo no Shima 公開 近世 672KB(raw json 555KB + 抽出txt 111KB)

時代浄瑠璃(俊寛・鬼界が島の段が著名、平家物語に取材)

NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)

利用条件: PD(原典1719年初演、底本1891年三三文房版も著作権保護期間満了)

心中天網島 Shinjū Ten no Amijima 公開 近世 1.4MB(raw json 1.3MB + 抽出txt 75KB)

世話浄瑠璃(心中物、紙屋治兵衛と遊女小春の情話)

NDL fulltext-json(頁別contents+座標、合本の頁37-56を抽出)+ 抽出plain txt

利用条件: PD(原典1720年初演、底本1891年鍾美堂版も著作権保護期間満了)

日本語 Reddit 投稿・コメント(Arctic Shift 経由) Japanese Reddit submissions and comments (via Arctic Shift) 公開 現代 5.8GB(5 サブレディットの投稿・コメント各 jsonl)

掲示板型SNSのくだけた書き言葉(日本語圏サブレディット: newsokur・lowlevelaware・BakaNewsJP・ja・newsokuvip の投稿本文+コメント)

JSONL(1行1レコード、Reddit API準拠フィールド: id, created_utc, subreddit, title/selftext または body ほか)

利用条件: Reddit利用者投稿。Arctic Shiftはアーカイブ研究用に再配布(Reddit API規約・各投稿者の権利に留意。研究利用想定)

日本語史研究用テキストデータ集 NINJAL text datasets for the history of Japanese 公開 通時

共同研究プロジェクトが作成した日本語史資料のテキスト(TXT・XML)

資料単位で直接ダウンロードできる

上代から明治大正までの通時コーパス。短単位・長単位の形態論情報つきで用例を検索する。

利用にはアカウント申請が必要で、未ログインではログイン画面に転送される。語誌データベースの統計情報はこのコーパスの頻度に基づく。

日本語版ウィキソース ダンプ Japanese Wikisource dump 公開 近代 80MB (bz2)

パブリックドメイン原典テキスト(明治法令・近代文学・古典翻刻など、Wikisource寄稿者による校訂込み)

MediaWiki XMLダンプ(pages-articles、wikitext本文、未展開)

利用条件: CC BY-SA 3.0(サイト全体の利用規約)+収録原文自体は多くがPD

日本語諸方言コーパス(COJADS) Corpus of Japanese Dialects 公開 現代

『全国方言談話データベース 日本のふるさとことば集成』を検索可能にしたもの。全国の方言談話の音声と転記

オンライン検索

日英字幕対訳コーパス(JESC) Japanese-English Subtitle Corpus (JESC) 公開 現代 102MB (raw.tar.gz) / 214MB(展開後)

映画・TV字幕の会話体日英対訳

タブ区切りテキスト(英語\t日本語、1行1対訳ペア)。生データ版(raw、シャッフル済み全件)を取得、train/dev/test分割版(split.tar.gz)は別途必要なら取得

利用条件: CC BY-SA 4.0

明六雑誌コーパス Ver. 1.1 Meiroku Zasshi Corpus v1.1 公開 近代 28MB

明治啓蒙期の学術評論誌(文語中心)

SUW TSV(UTF-8, 25列, 語彙素・語種・品詞・文体)+ XML(UTF-16)+ ひまわり

利用条件: CC BY-NC-ND 3.0

曾根崎心中 Sonezaki Shinjū 公開 近世 628KB(raw json 531KB + 抽出txt 91KB)

世話浄瑠璃(心中物の嚆矢、口語体台詞・地の文混在)

NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)

利用条件: PD(原典1703年初演、底本1935年栗田書店版も著作権保護期間満了)

東海道中膝栗毛 Tōkaidōchū Hizakurige 公開 近世 6.8MB (raw json 5.8MB + 抽出txt 906KB)

滑稽本・道中記(弥次郎兵衛・喜多八の東海道旅行記、俗語会話体中心)

NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)

利用条件: PD(原典1802–1814年刊、底本1927年有朋堂書店版も著作権保護期間満了)

源氏物語形態論情報データ(OpenCHJ-Genji) OpenCHJ-Genji — Morphological Data for The Tale of Genji 公開 中古 62MB

平安時代中期の物語文学(源氏物語全文、文語)

タブ区切りテキスト(UTF-8 LF、ファイル名・サブコーパス名・開始終了文字位置・文境界・書字形出現形・語彙素・語彙素読み・品詞・活用型・活用形・発音形・語種の13列)

利用条件: 形態論情報は CC BY 4.0(小木曽智信)。本文自体のライセンスは原典サイト(渋谷栄一氏/宮脇文経氏)に準拠、別途確認要

神戸大学 新聞記事文庫(人手翻刻・戦前新聞) Kobe University Newspaper Clippings Collection 公開 近代 433MB(gz 232 本、記事 231,652 件/本文あり 323,109 件)

戦前中心の新聞記事(人手翻刻・高精度)

jsonl.gz(id, title, newspaper, date, text)

利用条件: 記事本文の引用は出典明示で可(サイト規約)・内部研究利用

近代女性雑誌コーパス Modern Women's Magazine Corpus 公開 近代 91MB(展開後)

女性向け雑誌(女学雑誌 1894–95・女学世界 1909・婦人倶楽部 1925、計40冊 約210万字)

構造タグ付き XML + ひまわりパッケージ(形態論情報なし; CHJ 統合版は中納言)

利用条件: CC BY-NC-ND 3.0

青空文庫 Aozora Bunko 公開 近代現代 約17,000作品

保護期間満了の文学作品の電子テキスト。ルビと外字注記を持つ独自形式

GitHubミラー(aozorabunko/aozorabunko)とextended CSVがあり、CSVに底本・初出年が入る

青空文庫テキスト・ミラー Aozora Bunko text mirror (aozorahack) 公開 近代 894MB

著作権切れ文学・評論(明治〜昭和中期の作家中心)

cards/<person>/files/<work>/*.txt(Shift_JIS, ルビ記法)

利用条件: 大半PD(作品毎に図書カード確認)

書誌 34,896件 語別索引 17,251件 資源 113件 研究者 303名 JSON