研究資源

日本語研究で引くコーパス・辞書・文献データベース・画像アーカイブの目録。 各項目は入口のURL、個別項目のURLの組み立て方、APIの有無、利用条件を持つ。

コーパス

Bluesky 日本語投稿(Jetstream 収集) Bluesky Japanese posts (Jetstream collector) 公開 現代 308MB(日次 gz 8本、日本語投稿 2,270,800 件/観測 21,590,100 件、cursor 保存済み)

現行 SNS 短文(くだけた文体)

jsonl.gz 日別(did, rkey, text, createdAt, langs)

利用条件: AT Protocol 公開投稿(削除尊重・内部研究利用)

CHILDES 日本語コーパス群(Miyata・MiiPro・Noji等) CHILDES Japanese corpora (Miyata, MiiPro, Noji, etc.) 要申請 現代 null(未取得)

幼児言語獲得研究用の親子自然会話書き起こし(CHAT形式)。Miyata・MiiPro・Noji・Ishii・Okayama・Ota・Hamasaki・NINJAL-Okubo・Ogawa・Yokoyama等12コーパス

CHAT形式(.cha)書き起こしテキスト、zip配布

利用条件: CC BY-NC-SA(TalkBankルールにより各コーパス指定の引用文献の明記も必須)

FineWeb-2 日本語(jpn_Jpan) FineWeb-2 Japanese subset 公開 現代 222GB / 50 ファイル(全 176 ファイル中。通信断で中断)

現代ウェブ全般(trafilatura 抽出・MinHash 重複タグ付き)

parquet(text, minhash_cluster_size ほか)

利用条件: ODC-By 1.0

JGLUE MARC-ja(配布終了・入手不能) JGLUE MARC-ja (defunct; source data withdrawn) 公開 現代 null(入手不能)

Amazon商品レビューの二値感情分類データ(本来はレビュー本文+positive/negativeラベル)

本来: レビュー本文+ラベル(train 187,528 / dev 5,654 / test 5,639)

利用条件: 元データ Multilingual Amazon Reviews Corpus (MARC) のライセンスに従う(Amazonが配布停止)

JParaCrawl v3.0 英日対訳コーパス JParaCrawl v3.0 English-Japanese parallel corpus 公開 現代 2.8GB (en-ja-v3.0.tar.gz) / 展開後 en-ja.bicleaner05.txt 9.3GB

ウェブクロール由来の英日対訳文(自動文アライン・bicleaner品質スコア付き、日本語側はウェブ全般の書き言葉)

tar.gz内にTSV(source_domain, domain, bicleaner05スコア, 英語文, 日本語文)。約22M対訳ペア(deduped)

利用条件: NTT利用規約(情報解析を伴う研究開発目的のみ。複製・配布可、商用利用不可。CITATION: Morishita et al. 2020 LREC)

LLM-jp Magpie SFT v1.0 llm-jp/magpie-sft-v1.0 公開 現代 272MB

LLM生成の指示応答ペア(instruction tuning用、多様なトピック)

JSONL(1行1会話、conversations配列にrole/content、132,476件)

利用条件: Apache-2.0

LLM-jp コーパス v3 ja_cc level2 サンプル(公開ミラー由来) LLM-jp corpus v3 ja_cc level2 sample (via public mirror) 要申請 現代 609MB(2 shard: 2013-16 crawl 74k docs / 2023-40 crawl 72k docs)

Common Crawl 日本語ウェブ(品質フィルタ最上位 level2)

parquet(text, meta)

利用条件: 要確認(公式は申請制。ミラー chatblanc-ciel/llm-jp-corpus-v3 由来)

NDL Ngram(図書PDM) NDL Ngram tosho-pdm 公開 近代 22.2GB

明治〜昭和戦前刊行図書 約28万点のOCR由来 1〜5gram

TSV行(ngram \t 総頻度 \t {年: 頻度} 辞書)gzip

利用条件: PDM

NINJAL Parsed Corpus of Modern Japanese(NPCMJ) NINJAL Parsed Corpus of Modern Japanese 公開 現代 約90,000文

現代日本語の句構造付きツリーバンク。2022年3月時点で約9万文

2016年から2022年まで年次のスナップショットが公開された。同じ木を継続開発するかいのきツリーバンクが https://kainoki.github.io/ にある

OPUS OpenSubtitles 日本語単言語側 OPUS OpenSubtitles Japanese monolingual side 公開 現代 34MB (ja.txt.gz)

映画・TV字幕から抽出した単言語文(口語・会話的、非公式ファン翻訳含む)

プレーンテキスト(1行1文、生の未トークン化版。tokenized版 ja.tok.gzは未取得)

利用条件: OPUS再配布物(原著作権は各字幕投稿者・opensubtitles.org。OPUS上はODC-BY相当で提供、再配布時は出典表記を推奨)

OPUS TED2020 日本語単言語側 OPUS TED2020 Japanese monolingual side 公開 現代 14MB (ja.txt.gz)

TEDトーク字幕から抽出した単言語文(講演調・書き言葉に近い話し言葉)

プレーンテキスト(1行1文、生の未トークン化版。tokenized版 ja.tok.gzは未取得)

利用条件: OPUS再配布物(原データはTED公式字幕、CC BY-NC-ND 4.0相当。研究利用目的での再配布)

Open2ch対話コーパス Open2ch Dialogue Corpus 公開 現代 1.9GB (corpus.zip 534MB + ranking.zip 1.4MB + 展開後合計)

匿名掲示板(open2ch)のスレッドを対話ペア化した口語・ネットスラング中心テキスト

TSV(context\tresponse、板別 livejupiter.tsv / news4vip.tsv / newsplus.tsv)+ ranking用 dev/test TSV

利用条件: Apache-2.0

ReazonSpeech 文字起こし(音声分離不可・要申請) ReazonSpeech transcripts (inseparable from audio; access required) 要申請 現代 null(取得せず)

地上波テレビ放送由来の自然な日本語音声の文字起こし(アナウンス・字幕・会話等)

HF datasetsローダ(reazonspeech.py)経由の結合レコード(FLAC音声 + transcription文字列)。全量2.3TB/35000時間

利用条件: CDLA-Sharing-1.0(ただし著作権法30条の4に基づく情報解析目的での利用のみに限定するという配布者の追加条件あり)

WRIME(主観と客観の感情分析データセット) WRIME (subjective and objective emotion analysis dataset) 公開 現代 21MB(.git込み。TSV本体 wrime-ver1.tsv 9.5MB + wrime-ver2.tsv 8.2MB)

SNS投稿文(はてなブログ由来の一人称投稿、感情8分類×書き手・読み手複数評定付き)

タブ区切りテキスト(Sentence, UserID, Datetime, Train/Dev/Test split, Writer/Reader×8感情カテゴリ強度+Sentiment)

利用条件: 研究利用ライセンス(リポジトリ同梱LICENSE参照。研究目的での使用を想定、商用利用は要確認)

e-Gov 全法令 XML e-Gov all current laws (bulk XML) 公開 近代現代 297MB (zip)

現行法令(明治太政官布告の文語を含む法律文体)

法令標準 XML

利用条件: PDL 1.0

livedoorニュースコーパス Livedoor News Corpus 公開 現代 8.4MB (tar.gz) / 展開後 text/ 配下

ニュース記事(9カテゴリ、口語調のブログ的記事含む)

プレーンテキスト(記事ごとに1ファイル、URL・日付・タイトル・本文の順)、9カテゴリのディレクトリ分割

利用条件: CC BY-ND 2.1 JP

みんなで翻刻 Minna de Honkoku 公開 近世中世近代 約52M字

市民参加で翻刻された近世を中心とする古文書テキスト

GitHubでデータが公開される

利用条件: CC BY-SA 4.0

みんなで翻刻 近世散文サブセット Minna de Honkoku early-modern prose subset 公開 中世近世近代 2,877,821 短単位(12,214 丁)

近世の実用書・記録(医療と養生・料理書・疫病関係・地誌)

統一トークン parquet(TOKEN_SCHEMA)×2 シャード

利用条件: CC BY-SA 4.0

南総里見八犬伝 Nansō Satomi Hakkenden 公開 近世 97MB(raw json 4点計90.6MB + 抽出txt 4点計10.6MB、総文字数約364万字)

読本(長編伝奇小説、勧善懲悪・因果応報、全106冊98巻の大作)

NDL fulltext-json(頁別contents+座標)×4巻 + 抽出plain txt ×4巻

利用条件: PD(原典1814–1842年刊、底本1930年博文館版も著作権保護期間満了)

名大会話コーパス Nagoya University Conversation Corpus 公開 現代 129会話

129会話・約100時間の雑談の文字化資料

テキスト一括ダウンロード

利用条件: CC BY-NC-ND 4.0

国会会議録 National Diet Record 公開 現代 全量数十GB規模(テキスト)

議会演説・質疑(整文された話し言葉)

REST API(XML/JSON, speech単位)

利用条件: 利用規約(出典明示で利用可)

国性爺合戦 Kokusen'ya Kassen 公開 近世 1.5MB(raw json 1.3MB + 抽出txt 116KB)

時代浄瑠璃(全5段の合戦物、和藤内の異国活劇)

NDL fulltext-json(頁別contents+座標、合本の頁1-36を抽出)+ 抽出plain txt

利用条件: PD(原典1715年初演、底本1891年鍾美堂版も著作権保護期間満了)

国民之友コーパス Ver. 1.0 Kokumin no Tomo Corpus v1.0 公開 近代 191MB

明治中期の総合雑誌(文語・口語混在)

SUW TSV(UTF-8)+ XML(UTF-16)+ ひまわり

利用条件: CC BY-NC-ND 3.0

国語研日本語ウェブコーパス(NWJC) NINJAL Web Japanese Corpus 要申請 現代 258億語

ウェブから構築した258億語規模のコーパス。派生資源にNWJC-n-gram・NWJC2vec・chiVeがある

検索系「梵天」の一般公開は2021年12月24日で終了した。データ本体はGSK経由の申請で入手する

太陽コーパス CD-ROM版 Taiyo Corpus (CD-ROM edition) 有償 近代 287762432 bytes(ISO)、275720384 bytes(6698ファイル)

雑誌『太陽』1895・1901・1909・1917・1925年(文語・口語・項目)

Shift_JIS XML 60号・Himawari索引・ISO-9660イメージ

利用条件: 購入製品利用条件(個人利用の複製・改変可、再配布不可、二次的著作物の公開は事前許可)

帝国議会・国会会議録(API 全量収集) Imperial Diet + National Diet proceedings (full API harvest) 公開 近代 4.2GB(帝国議会 59 ファイル・国会 81 ファイル、全年収集完了)

議会演説・質疑(1890–1947 は文語・旧字 OCR、1947– は整文)

jsonl.gz(1 行 1 会議、speechRecord 入れ子)年別

利用条件: NDL 利用規約(出典明示)

平家女護島 Heike Nyogo no Shima 公開 近世 672KB(raw json 555KB + 抽出txt 111KB)

時代浄瑠璃(俊寛・鬼界が島の段が著名、平家物語に取材)

NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)

利用条件: PD(原典1719年初演、底本1891年三三文房版も著作権保護期間満了)

心中天網島 Shinjū Ten no Amijima 公開 近世 1.4MB(raw json 1.3MB + 抽出txt 75KB)

世話浄瑠璃(心中物、紙屋治兵衛と遊女小春の情話)

NDL fulltext-json(頁別contents+座標、合本の頁37-56を抽出)+ 抽出plain txt

利用条件: PD(原典1720年初演、底本1891年鍾美堂版も著作権保護期間満了)

日本語 Reddit 投稿・コメント(Arctic Shift 経由) Japanese Reddit submissions and comments (via Arctic Shift) 公開 現代 5.8GB(5 サブレディットの投稿・コメント各 jsonl)

掲示板型SNSのくだけた書き言葉(日本語圏サブレディット: newsokur・lowlevelaware・BakaNewsJP・ja・newsokuvip の投稿本文+コメント)

JSONL(1行1レコード、Reddit API準拠フィールド: id, created_utc, subreddit, title/selftext または body ほか)

利用条件: Reddit利用者投稿。Arctic Shiftはアーカイブ研究用に再配布(Reddit API規約・各投稿者の権利に留意。研究利用想定)

日本語史研究用テキストデータ集 NINJAL text datasets for the history of Japanese 公開 通時

共同研究プロジェクトが作成した日本語史資料のテキスト(TXT・XML)

資料単位で直接ダウンロードできる

日本語日常会話コーパス(CEJC) Corpus of Everyday Japanese Conversation 要契約 現代 200時間

日常場面の会話200時間を映像つきで収録。話者属性と場面情報を持つ

全データは契約による。モニター公開版と中納言検索がある

日本語歴史コーパス(CHJ) Corpus of Historical Japanese 要登録 通時

奈良時代編(万葉集・宣命・祝詞)から明治大正編まで、時代別のサブコーパスを形態論情報つきで提供する日本語史の基幹資料

本文検索は中納言(要登録・無償)。語彙統計と一部の頻度表はサイトから直接取得できる

上代から明治大正までの通時コーパス。短単位・長単位の形態論情報つきで用例を検索する。

利用にはアカウント申請が必要で、未ログインではログイン画面に転送される。語誌データベースの統計情報はこのコーパスの頻度に基づく。

日本語版ウィキソース ダンプ Japanese Wikisource dump 公開 近代 80MB (bz2)

パブリックドメイン原典テキスト(明治法令・近代文学・古典翻刻など、Wikisource寄稿者による校訂込み)

MediaWiki XMLダンプ(pages-articles、wikitext本文、未展開)

利用条件: CC BY-SA 3.0(サイト全体の利用規約)+収録原文自体は多くがPD

日本語話し言葉コーパス(CSJ) Corpus of Spontaneous Japanese 有償 現代 662時間・約752万短単位

学会講演・模擬講演を中心とする自発音声662時間。転記・形態論情報・韻律ラベルつき

DVD配布。コアは人手修正済み。SDBフラットファイルが全体、RDBはコアのみ

利用条件: CSJ利用許諾(購入済み・再配布不可)

日本語諸方言コーパス(COJADS) Corpus of Japanese Dialects 公開 現代

『全国方言談話データベース 日本のふるさとことば集成』を検索可能にしたもの。全国の方言談話の音声と転記

オンライン検索

日英字幕対訳コーパス(JESC) Japanese-English Subtitle Corpus (JESC) 公開 現代 102MB (raw.tar.gz) / 214MB(展開後)

映画・TV字幕の会話体日英対訳

タブ区切りテキスト(英語\t日本語、1行1対訳ペア)。生データ版(raw、シャッフル済み全件)を取得、train/dev/test分割版(split.tar.gz)は別途必要なら取得

利用条件: CC BY-SA 4.0

明六雑誌コーパス Ver. 1.1 Meiroku Zasshi Corpus v1.1 公開 近代 28MB

明治啓蒙期の学術評論誌(文語中心)

SUW TSV(UTF-8, 25列, 語彙素・語種・品詞・文体)+ XML(UTF-16)+ ひまわり

利用条件: CC BY-NC-ND 3.0

昭和・平成書き言葉コーパス(SHC) Showa-Heisei Corpus of written Japanese 要登録 近代現代

1933年から2013年までの雑誌を10年ごとに抽出。BCCWJと接続して昭和戦前から現代までを連続で見る

中納言で検索。語彙統計は公開

昭和話し言葉コーパス(SSC) Showa Speech Corpus 要登録 現代

1950–60年代の録音に基づく話し言葉資料。CSJ・CEJCと接続して話し言葉の通時変化を見る

中納言で検索

曾根崎心中 Sonezaki Shinjū 公開 近世 628KB(raw json 531KB + 抽出txt 91KB)

世話浄瑠璃(心中物の嚆矢、口語体台詞・地の文混在)

NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)

利用条件: PD(原典1703年初演、底本1935年栗田書店版も著作権保護期間満了)

東海道中膝栗毛 Tōkaidōchū Hizakurige 公開 近世 6.8MB (raw json 5.8MB + 抽出txt 906KB)

滑稽本・道中記(弥次郎兵衛・喜多八の東海道旅行記、俗語会話体中心)

NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)

利用条件: PD(原典1802–1814年刊、底本1927年有朋堂書店版も著作権保護期間満了)

源氏物語形態論情報データ(OpenCHJ-Genji) OpenCHJ-Genji — Morphological Data for The Tale of Genji 公開 中古 62MB

平安時代中期の物語文学(源氏物語全文、文語)

タブ区切りテキスト(UTF-8 LF、ファイル名・サブコーパス名・開始終了文字位置・文境界・書字形出現形・語彙素・語彙素読み・品詞・活用型・活用形・発音形・語種の13列)

利用条件: 形態論情報は CC BY 4.0(小木曽智信)。本文自体のライセンスは原典サイト(渋谷栄一氏/宮脇文経氏)に準拠、別途確認要

現代日本語書き言葉均衡コーパス DVD版 1.1 Balanced Corpus of Contemporary Written Japanese (DVD ed. 1.1) 有償 現代 4.4GB

書き言葉13レジスター(書籍・雑誌・新聞・白書・教科書・広報・Yahoo!知恵袋・ブログ・法律・韻文・国会会議録)

M-XML(SUW/LUW形態論情報)・C-XML・CORE TSV(zip内)

利用条件: BCCWJ利用許諾(購入済みDVD・再配布不可)

現代日本語書き言葉均衡コーパス(BCCWJ) Balanced Corpus of Contemporary Written Japanese 有償 現代 1億430万語

書籍・雑誌・新聞・白書・教科書・Yahoo!知恵袋など13レジスターにわたる1億語の均衡コーパス。短単位・長単位の形態論情報つき

DVD版の購入、または中納言でのオンライン検索。頻度表(SUW・LUW)は無償公開

神戸大学 新聞記事文庫(人手翻刻・戦前新聞) Kobe University Newspaper Clippings Collection 公開 近代 433MB(gz 232 本、記事 231,652 件/本文あり 323,109 件)

戦前中心の新聞記事(人手翻刻・高精度)

jsonl.gz(id, title, newspaper, date, text)

利用条件: 記事本文の引用は出典明示で可(サイト規約)・内部研究利用

近代女性雑誌コーパス Modern Women's Magazine Corpus 公開 近代 91MB(展開後)

女性向け雑誌(女学雑誌 1894–95・女学世界 1909・婦人倶楽部 1925、計40冊 約210万字)

構造タグ付き XML + ひまわりパッケージ(形態論情報なし; CHJ 統合版は中納言)

利用条件: CC BY-NC-ND 3.0

近代語のコーパス Corpus of Modern Japanese 要登録 近代

『明六雑誌』『国民之友』『太陽』『女学雑誌』『女性』など明治大正期の雑誌コーパス群。形態論情報つき

明六雑誌と国民之友はTSV・XMLを直接配布。太陽と女性誌はCD-ROM購入または中納言

利用条件: CC BY-NC-ND(明六・国民之友の配布データ)

青空文庫 Aozora Bunko 公開 近代現代 約17,000作品

保護期間満了の文学作品の電子テキスト。ルビと外字注記を持つ独自形式

GitHubミラー(aozorabunko/aozorabunko)とextended CSVがあり、CSVに底本・初出年が入る

青空文庫テキスト・ミラー Aozora Bunko text mirror (aozorahack) 公開 近代 894MB

著作権切れ文学・評論(明治〜昭和中期の作家中心)

cards/<person>/files/<work>/*.txt(Shift_JIS, ルビ記法)

利用条件: 大半PD(作品毎に図書カード確認)

書誌 34,896件 語別索引 17,251件 資源 113件 研究者 303名 JSON