研究資源

日本語研究で引くコーパス・辞書・文献データベース・画像アーカイブの目録。 各項目は入口のURL、個別項目のURLの組み立て方、APIの有無、利用条件を持つ。

注釈データ

BCCWJ追加アノテーション(係り受け・並列構造・PAS/分類語彙表) BCCWJ Annotations (BCCWJ-DepParaPAS + BCCWJ-WLSP) 公開 44MB (DepParaPAS 7.4MB + WLSP 37MB)

『現代日本語書き言葉均衡コーパス』(BCCWJ)に対する追加アノテーション層のみ(本文は含まない)

DepParaPAS はNAIST Text Corpus形式/拡張CaboCha形式(データ本体は同梱されずninjal.ac.jpのBCCWJ DVD版購入者向けに別配布、本リポジトリはdoc/ライセンスのみ)。WLSP はTSV(サブコーパス・サンプルID・開始終了位置・分類語彙表番号・機能語/内容語等16列、BCCWJ-WLSP.zip同梱、347,095行)

利用条件: BCCWJ-DepParaPAS は CC BY 4.0(本文除く)/ BCCWJ-WLSP は CC BY-NC-SA 3.0

Kainoki(NPCMJ後継)統語解析コーパス Kainoki Treebank (successor of NPCMJ - NINJAL Parsed Corpus of Modern Japanese) 公開 現代 39MB

現代日本語の多ジャンル(学術エッセイ・青空文庫小説・国会会議録・新聞・白書・Wikipedia・ブログ・教科書・翻訳等)

Penn Treebank様式の括弧付き構成素木(CorpusSearch形式、機能タグ・空範疇・照応情報付き、本文テキスト込み、1ファイル1テキスト495ファイル、UTF-8)

利用条件: CC BY 4.0

Wikipedia日本語アノテーション付きコーパス Wikipedia Annotated Corpus 公開 60MB

日本語Wikipedia記事(形態論・固有表現・係り受け・述語項構造・共参照アノテーション付き)

KNP形式(形態素・固有表現・係り受け・述語項構造・共参照)+ 生テキスト(org/)+ train/dev/testのid分割

利用条件: CC BY-SA 4.0

京大・NTTブログコーパス(KNBコーパス) Kyoto University and NTT Blog Corpus (KNBC) 公開 現代 4.7MB (tar.bz2) / 展開後 corpus1・corpus2・html・bin・manual.pdf

大学生が執筆したブログ記事(携帯電話・京都観光・スポーツ・グルメの4テーマ)

形態素・係り受け・格関係・評判表現アノテーション付きテキスト(corpus1: 記事別、corpus2: テーマ別TSV)

利用条件: 京都大学テキストコーパス互換ライセンス(研究目的での利用、詳細はREADME.txt参照)

京都大学ウェブ文書リードコーパス Kyoto University Web Document Leads Corpus (KWDLC) 公開 現代 79MB

ウェブ文書(ニュース・百科事典的記事・ブログ・商用ページ等)の冒頭3文。収集時期は2011年前後(w201106〜のドキュメントID)

KNP形式(形態素・固有表現・係り受け・格・省略照応・共参照)+ 談話関係アノテーション(disc/)+ 生テキスト(org/)+ train/dev/testのid分割

利用条件: 明示的なLICENSEファイルなし。研究目的での利用を想定した配布(README参照、著作権者からの削除要請に応じ更新)

文献データベース

CiNii Research 公開 通時

論文・図書・博士論文・研究データ・研究プロジェクトを横断する国内最大の学術情報データベース

OpenSearch。`all` `articles` `books` `data` `dissertations` `projects` の検索種別があり、RSS・Atom・JSON-LD・HTMLを選べる。AND/OR/NOTは大文字・前後空白必須。Access-Control-Allow-Origin: *

https://cir.nii.ac.jp/opensearch/all?q={query}&format=json

論文・図書・研究データの横断検索。CRIDで文献を一意に指せる。

文献レジストリの外部IDとしてCRIDを持つ。

Crossref 公開 現代

DOI登録機関のメタデータ。J-STAGE掲載誌の書誌照合に使う

REST・無認証。mailtoパラメータでpoliteプールを使う

https://api.crossref.org/works?query.bibliographic={query}

OpenAlex 公開 現代

世界規模のオープン学術グラフ。DOIを持つ日本語論文の被引用関係を追える

REST・無認証。mailto付きのUser-Agentで優先レーンに入る。日本語タイトルの収録は不均一で、和文誌の欠落が多い

利用条件: CC0

https://api.openalex.org/works?filter=title.search:{query}

researchmap 公開 現代

研究者本人が維持する業績データベース。所属・業績一覧・researchmap IDによる同定に使う

APIは申請制。公開ページのJSON-LDから業績を読める

ことばに関する新聞記事見出しデータベース Database of Newspaper Headlines on Language 公開 現代

1949年から2009年までの新聞記事のうち、ことばを話題にしたものの見出し。語形や言語問題が世間の話題になった時期を測る

現行の公開URLは未確認

ことばに関する新聞記事見出しデータベース 公開

1949年から2009年までの、ことばを扱った新聞記事の見出し。語形が話題になった時期の手がかりになる。

現行URLは未確認。小林昌樹の語誌調査記事とリサーチ・ナビが工具として挙げる。

国文学・アーカイブズ学論文データベース Database of Research Papers in Japanese Literature and Archival Science 公開 通時 百万件規模

国文学研究資料館が収集する国内刊行の雑誌・紀要・単行本所収論文の目録。国文学のほか日本語学・国語教育を含む。2023年4月に国文学論文目録データベースから改称・統合

検索フォームのみ。校正中のデータを含めて逐次更新される

国立国会図書館サーチ NDL Search 公開 通時

国内刊行物の網羅的な書誌。雑誌記事索引を含み、戦後の学術雑誌記事を著者・誌名で引ける

OpenSearch・SRU・OpenURL・OAI-PMHを公開。書誌IDはR100000002-I…形式

国語学研究文献総索引データ Index to Japanese Linguistics Research Literature 公開 近代現代 約100,000件

日本語学会と国立国語研究所の共同事業。『国語年鑑』1954–1985年の雑誌論文を対象とし、約10万件のうち約5万6千件にキーワードが付く

1998年にオンライン公開。キーワード付与の有無で二層に分かれる

学術機関リポジトリデータベース(IRDB) Institutional Repositories DataBase 公開 現代

国内700機関以上の機関リポジトリのメタデータを収集。大学紀要に載る日本語学論文の全文PDFへ到達する主経路

OAI-PMHでハーベストし、JPCOARスキーマまたはjunii2で提供される。IRDB自身もOAI-PMHのエンドポイントを持つ

日本語研究・日本語教育文献データベース NINJAL Database of Research Literature 公開 通時 約数十万件

『国語年鑑』『日本語教育年鑑』の書誌を統合した日本語学・日本語教育の文献目録。1950年以降の論文・図書を著者・分野・キーワードで検索できる。日本語学会が案内する「国語学研究文献検索」はこれを指す

HTMLの検索フォームのみで、APIも一括ダウンロードも提供されない。取得はページ単位のHTMLを解析する形になる

語彙研究文献語別目録 Word-indexed bibliography of Japanese vocabulary research 公開 通時 17,310行

佐藤喜代治編『講座日本語の語彙 別巻 語彙研究文献語別目録』(明治書院, 1983)の全文テキスト版。語を見出しに、その語を扱った研究を著者・文献名・書誌の3列で並べる

xlsxとタブ区切りtxtを直接配布。凡例・編集のことば・あとがきはPDF。見出し語の列は連続行で空欄になり、前の行から引き継ぐ

利用条件: CC BY-NC 4.0

コーパス

Bluesky 日本語投稿(Jetstream 収集) Bluesky Japanese posts (Jetstream collector) 公開 現代 308MB(日次 gz 8本、日本語投稿 2,270,800 件/観測 21,590,100 件、cursor 保存済み)

現行 SNS 短文(くだけた文体)

jsonl.gz 日別(did, rkey, text, createdAt, langs)

利用条件: AT Protocol 公開投稿(削除尊重・内部研究利用)

CHILDES 日本語コーパス群(Miyata・MiiPro・Noji等) CHILDES Japanese corpora (Miyata, MiiPro, Noji, etc.) 要申請 現代 null(未取得)

幼児言語獲得研究用の親子自然会話書き起こし(CHAT形式)。Miyata・MiiPro・Noji・Ishii・Okayama・Ota・Hamasaki・NINJAL-Okubo・Ogawa・Yokoyama等12コーパス

CHAT形式(.cha)書き起こしテキスト、zip配布

利用条件: CC BY-NC-SA(TalkBankルールにより各コーパス指定の引用文献の明記も必須)

FineWeb-2 日本語(jpn_Jpan) FineWeb-2 Japanese subset 公開 現代 222GB / 50 ファイル(全 176 ファイル中。通信断で中断)

現代ウェブ全般(trafilatura 抽出・MinHash 重複タグ付き)

parquet(text, minhash_cluster_size ほか)

利用条件: ODC-By 1.0

JGLUE MARC-ja(配布終了・入手不能) JGLUE MARC-ja (defunct; source data withdrawn) 公開 現代 null(入手不能)

Amazon商品レビューの二値感情分類データ(本来はレビュー本文+positive/negativeラベル)

本来: レビュー本文+ラベル(train 187,528 / dev 5,654 / test 5,639)

利用条件: 元データ Multilingual Amazon Reviews Corpus (MARC) のライセンスに従う(Amazonが配布停止)

JParaCrawl v3.0 英日対訳コーパス JParaCrawl v3.0 English-Japanese parallel corpus 公開 現代 2.8GB (en-ja-v3.0.tar.gz) / 展開後 en-ja.bicleaner05.txt 9.3GB

ウェブクロール由来の英日対訳文(自動文アライン・bicleaner品質スコア付き、日本語側はウェブ全般の書き言葉)

tar.gz内にTSV(source_domain, domain, bicleaner05スコア, 英語文, 日本語文)。約22M対訳ペア(deduped)

利用条件: NTT利用規約(情報解析を伴う研究開発目的のみ。複製・配布可、商用利用不可。CITATION: Morishita et al. 2020 LREC)

LLM-jp Magpie SFT v1.0 llm-jp/magpie-sft-v1.0 公開 現代 272MB

LLM生成の指示応答ペア(instruction tuning用、多様なトピック)

JSONL(1行1会話、conversations配列にrole/content、132,476件)

利用条件: Apache-2.0

LLM-jp コーパス v3 ja_cc level2 サンプル(公開ミラー由来) LLM-jp corpus v3 ja_cc level2 sample (via public mirror) 要申請 現代 609MB(2 shard: 2013-16 crawl 74k docs / 2023-40 crawl 72k docs)

Common Crawl 日本語ウェブ(品質フィルタ最上位 level2)

parquet(text, meta)

利用条件: 要確認(公式は申請制。ミラー chatblanc-ciel/llm-jp-corpus-v3 由来)

NDL Ngram(図書PDM) NDL Ngram tosho-pdm 公開 近代 22.2GB

明治〜昭和戦前刊行図書 約28万点のOCR由来 1〜5gram

TSV行(ngram \t 総頻度 \t {年: 頻度} 辞書)gzip

利用条件: PDM

NINJAL Parsed Corpus of Modern Japanese(NPCMJ) NINJAL Parsed Corpus of Modern Japanese 公開 現代 約90,000文

現代日本語の句構造付きツリーバンク。2022年3月時点で約9万文

2016年から2022年まで年次のスナップショットが公開された。同じ木を継続開発するかいのきツリーバンクが https://kainoki.github.io/ にある

OPUS OpenSubtitles 日本語単言語側 OPUS OpenSubtitles Japanese monolingual side 公開 現代 34MB (ja.txt.gz)

映画・TV字幕から抽出した単言語文(口語・会話的、非公式ファン翻訳含む)

プレーンテキスト(1行1文、生の未トークン化版。tokenized版 ja.tok.gzは未取得)

利用条件: OPUS再配布物(原著作権は各字幕投稿者・opensubtitles.org。OPUS上はODC-BY相当で提供、再配布時は出典表記を推奨)

OPUS TED2020 日本語単言語側 OPUS TED2020 Japanese monolingual side 公開 現代 14MB (ja.txt.gz)

TEDトーク字幕から抽出した単言語文(講演調・書き言葉に近い話し言葉)

プレーンテキスト(1行1文、生の未トークン化版。tokenized版 ja.tok.gzは未取得)

利用条件: OPUS再配布物(原データはTED公式字幕、CC BY-NC-ND 4.0相当。研究利用目的での再配布)

Open2ch対話コーパス Open2ch Dialogue Corpus 公開 現代 1.9GB (corpus.zip 534MB + ranking.zip 1.4MB + 展開後合計)

匿名掲示板(open2ch)のスレッドを対話ペア化した口語・ネットスラング中心テキスト

TSV(context\tresponse、板別 livejupiter.tsv / news4vip.tsv / newsplus.tsv)+ ranking用 dev/test TSV

利用条件: Apache-2.0

ReazonSpeech 文字起こし(音声分離不可・要申請) ReazonSpeech transcripts (inseparable from audio; access required) 要申請 現代 null(取得せず)

地上波テレビ放送由来の自然な日本語音声の文字起こし(アナウンス・字幕・会話等)

HF datasetsローダ(reazonspeech.py)経由の結合レコード(FLAC音声 + transcription文字列)。全量2.3TB/35000時間

利用条件: CDLA-Sharing-1.0(ただし著作権法30条の4に基づく情報解析目的での利用のみに限定するという配布者の追加条件あり)

WRIME(主観と客観の感情分析データセット) WRIME (subjective and objective emotion analysis dataset) 公開 現代 21MB(.git込み。TSV本体 wrime-ver1.tsv 9.5MB + wrime-ver2.tsv 8.2MB)

SNS投稿文(はてなブログ由来の一人称投稿、感情8分類×書き手・読み手複数評定付き)

タブ区切りテキスト(Sentence, UserID, Datetime, Train/Dev/Test split, Writer/Reader×8感情カテゴリ強度+Sentiment)

利用条件: 研究利用ライセンス(リポジトリ同梱LICENSE参照。研究目的での使用を想定、商用利用は要確認)

e-Gov 全法令 XML e-Gov all current laws (bulk XML) 公開 近代現代 297MB (zip)

現行法令(明治太政官布告の文語を含む法律文体)

法令標準 XML

利用条件: PDL 1.0

livedoorニュースコーパス Livedoor News Corpus 公開 現代 8.4MB (tar.gz) / 展開後 text/ 配下

ニュース記事(9カテゴリ、口語調のブログ的記事含む)

プレーンテキスト(記事ごとに1ファイル、URL・日付・タイトル・本文の順)、9カテゴリのディレクトリ分割

利用条件: CC BY-ND 2.1 JP

みんなで翻刻 Minna de Honkoku 公開 近世中世近代 約52M字

市民参加で翻刻された近世を中心とする古文書テキスト

GitHubでデータが公開される

利用条件: CC BY-SA 4.0

みんなで翻刻 近世散文サブセット Minna de Honkoku early-modern prose subset 公開 中世近世近代 2,877,821 短単位(12,214 丁)

近世の実用書・記録(医療と養生・料理書・疫病関係・地誌)

統一トークン parquet(TOKEN_SCHEMA)×2 シャード

利用条件: CC BY-SA 4.0

南総里見八犬伝 Nansō Satomi Hakkenden 公開 近世 97MB(raw json 4点計90.6MB + 抽出txt 4点計10.6MB、総文字数約364万字)

読本(長編伝奇小説、勧善懲悪・因果応報、全106冊98巻の大作)

NDL fulltext-json(頁別contents+座標)×4巻 + 抽出plain txt ×4巻

利用条件: PD(原典1814–1842年刊、底本1930年博文館版も著作権保護期間満了)

名大会話コーパス Nagoya University Conversation Corpus 公開 現代 129会話

129会話・約100時間の雑談の文字化資料

テキスト一括ダウンロード

利用条件: CC BY-NC-ND 4.0

国会会議録 National Diet Record 公開 現代 全量数十GB規模(テキスト)

議会演説・質疑(整文された話し言葉)

REST API(XML/JSON, speech単位)

利用条件: 利用規約(出典明示で利用可)

国性爺合戦 Kokusen'ya Kassen 公開 近世 1.5MB(raw json 1.3MB + 抽出txt 116KB)

時代浄瑠璃(全5段の合戦物、和藤内の異国活劇)

NDL fulltext-json(頁別contents+座標、合本の頁1-36を抽出)+ 抽出plain txt

利用条件: PD(原典1715年初演、底本1891年鍾美堂版も著作権保護期間満了)

国民之友コーパス Ver. 1.0 Kokumin no Tomo Corpus v1.0 公開 近代 191MB

明治中期の総合雑誌(文語・口語混在)

SUW TSV(UTF-8)+ XML(UTF-16)+ ひまわり

利用条件: CC BY-NC-ND 3.0

国語研日本語ウェブコーパス(NWJC) NINJAL Web Japanese Corpus 要申請 現代 258億語

ウェブから構築した258億語規模のコーパス。派生資源にNWJC-n-gram・NWJC2vec・chiVeがある

検索系「梵天」の一般公開は2021年12月24日で終了した。データ本体はGSK経由の申請で入手する

太陽コーパス CD-ROM版 Taiyo Corpus (CD-ROM edition) 有償 近代 287762432 bytes(ISO)、275720384 bytes(6698ファイル)

雑誌『太陽』1895・1901・1909・1917・1925年(文語・口語・項目)

Shift_JIS XML 60号・Himawari索引・ISO-9660イメージ

利用条件: 購入製品利用条件(個人利用の複製・改変可、再配布不可、二次的著作物の公開は事前許可)

帝国議会・国会会議録(API 全量収集) Imperial Diet + National Diet proceedings (full API harvest) 公開 近代 4.2GB(帝国議会 59 ファイル・国会 81 ファイル、全年収集完了)

議会演説・質疑(1890–1947 は文語・旧字 OCR、1947– は整文)

jsonl.gz(1 行 1 会議、speechRecord 入れ子)年別

利用条件: NDL 利用規約(出典明示)

平家女護島 Heike Nyogo no Shima 公開 近世 672KB(raw json 555KB + 抽出txt 111KB)

時代浄瑠璃(俊寛・鬼界が島の段が著名、平家物語に取材)

NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)

利用条件: PD(原典1719年初演、底本1891年三三文房版も著作権保護期間満了)

心中天網島 Shinjū Ten no Amijima 公開 近世 1.4MB(raw json 1.3MB + 抽出txt 75KB)

世話浄瑠璃(心中物、紙屋治兵衛と遊女小春の情話)

NDL fulltext-json(頁別contents+座標、合本の頁37-56を抽出)+ 抽出plain txt

利用条件: PD(原典1720年初演、底本1891年鍾美堂版も著作権保護期間満了)

日本語 Reddit 投稿・コメント(Arctic Shift 経由) Japanese Reddit submissions and comments (via Arctic Shift) 公開 現代 5.8GB(5 サブレディットの投稿・コメント各 jsonl)

掲示板型SNSのくだけた書き言葉(日本語圏サブレディット: newsokur・lowlevelaware・BakaNewsJP・ja・newsokuvip の投稿本文+コメント)

JSONL(1行1レコード、Reddit API準拠フィールド: id, created_utc, subreddit, title/selftext または body ほか)

利用条件: Reddit利用者投稿。Arctic Shiftはアーカイブ研究用に再配布(Reddit API規約・各投稿者の権利に留意。研究利用想定)

日本語史研究用テキストデータ集 NINJAL text datasets for the history of Japanese 公開 通時

共同研究プロジェクトが作成した日本語史資料のテキスト(TXT・XML)

資料単位で直接ダウンロードできる

日本語日常会話コーパス(CEJC) Corpus of Everyday Japanese Conversation 要契約 現代 200時間

日常場面の会話200時間を映像つきで収録。話者属性と場面情報を持つ

全データは契約による。モニター公開版と中納言検索がある

日本語歴史コーパス(CHJ) Corpus of Historical Japanese 要登録 通時

奈良時代編(万葉集・宣命・祝詞)から明治大正編まで、時代別のサブコーパスを形態論情報つきで提供する日本語史の基幹資料

本文検索は中納言(要登録・無償)。語彙統計と一部の頻度表はサイトから直接取得できる

上代から明治大正までの通時コーパス。短単位・長単位の形態論情報つきで用例を検索する。

利用にはアカウント申請が必要で、未ログインではログイン画面に転送される。語誌データベースの統計情報はこのコーパスの頻度に基づく。

日本語版ウィキソース ダンプ Japanese Wikisource dump 公開 近代 80MB (bz2)

パブリックドメイン原典テキスト(明治法令・近代文学・古典翻刻など、Wikisource寄稿者による校訂込み)

MediaWiki XMLダンプ(pages-articles、wikitext本文、未展開)

利用条件: CC BY-SA 3.0(サイト全体の利用規約)+収録原文自体は多くがPD

日本語話し言葉コーパス(CSJ) Corpus of Spontaneous Japanese 有償 現代 662時間・約752万短単位

学会講演・模擬講演を中心とする自発音声662時間。転記・形態論情報・韻律ラベルつき

DVD配布。コアは人手修正済み。SDBフラットファイルが全体、RDBはコアのみ

利用条件: CSJ利用許諾(購入済み・再配布不可)

日本語諸方言コーパス(COJADS) Corpus of Japanese Dialects 公開 現代

『全国方言談話データベース 日本のふるさとことば集成』を検索可能にしたもの。全国の方言談話の音声と転記

オンライン検索

日英字幕対訳コーパス(JESC) Japanese-English Subtitle Corpus (JESC) 公開 現代 102MB (raw.tar.gz) / 214MB(展開後)

映画・TV字幕の会話体日英対訳

タブ区切りテキスト(英語\t日本語、1行1対訳ペア)。生データ版(raw、シャッフル済み全件)を取得、train/dev/test分割版(split.tar.gz)は別途必要なら取得

利用条件: CC BY-SA 4.0

明六雑誌コーパス Ver. 1.1 Meiroku Zasshi Corpus v1.1 公開 近代 28MB

明治啓蒙期の学術評論誌(文語中心)

SUW TSV(UTF-8, 25列, 語彙素・語種・品詞・文体)+ XML(UTF-16)+ ひまわり

利用条件: CC BY-NC-ND 3.0

昭和・平成書き言葉コーパス(SHC) Showa-Heisei Corpus of written Japanese 要登録 近代現代

1933年から2013年までの雑誌を10年ごとに抽出。BCCWJと接続して昭和戦前から現代までを連続で見る

中納言で検索。語彙統計は公開

昭和話し言葉コーパス(SSC) Showa Speech Corpus 要登録 現代

1950–60年代の録音に基づく話し言葉資料。CSJ・CEJCと接続して話し言葉の通時変化を見る

中納言で検索

曾根崎心中 Sonezaki Shinjū 公開 近世 628KB(raw json 531KB + 抽出txt 91KB)

世話浄瑠璃(心中物の嚆矢、口語体台詞・地の文混在)

NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)

利用条件: PD(原典1703年初演、底本1935年栗田書店版も著作権保護期間満了)

東海道中膝栗毛 Tōkaidōchū Hizakurige 公開 近世 6.8MB (raw json 5.8MB + 抽出txt 906KB)

滑稽本・道中記(弥次郎兵衛・喜多八の東海道旅行記、俗語会話体中心)

NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)

利用条件: PD(原典1802–1814年刊、底本1927年有朋堂書店版も著作権保護期間満了)

源氏物語形態論情報データ(OpenCHJ-Genji) OpenCHJ-Genji — Morphological Data for The Tale of Genji 公開 中古 62MB

平安時代中期の物語文学(源氏物語全文、文語)

タブ区切りテキスト(UTF-8 LF、ファイル名・サブコーパス名・開始終了文字位置・文境界・書字形出現形・語彙素・語彙素読み・品詞・活用型・活用形・発音形・語種の13列)

利用条件: 形態論情報は CC BY 4.0(小木曽智信)。本文自体のライセンスは原典サイト(渋谷栄一氏/宮脇文経氏)に準拠、別途確認要

現代日本語書き言葉均衡コーパス DVD版 1.1 Balanced Corpus of Contemporary Written Japanese (DVD ed. 1.1) 有償 現代 4.4GB

書き言葉13レジスター(書籍・雑誌・新聞・白書・教科書・広報・Yahoo!知恵袋・ブログ・法律・韻文・国会会議録)

M-XML(SUW/LUW形態論情報)・C-XML・CORE TSV(zip内)

利用条件: BCCWJ利用許諾(購入済みDVD・再配布不可)

現代日本語書き言葉均衡コーパス(BCCWJ) Balanced Corpus of Contemporary Written Japanese 有償 現代 1億430万語

書籍・雑誌・新聞・白書・教科書・Yahoo!知恵袋など13レジスターにわたる1億語の均衡コーパス。短単位・長単位の形態論情報つき

DVD版の購入、または中納言でのオンライン検索。頻度表(SUW・LUW)は無償公開

神戸大学 新聞記事文庫(人手翻刻・戦前新聞) Kobe University Newspaper Clippings Collection 公開 近代 433MB(gz 232 本、記事 231,652 件/本文あり 323,109 件)

戦前中心の新聞記事(人手翻刻・高精度)

jsonl.gz(id, title, newspaper, date, text)

利用条件: 記事本文の引用は出典明示で可(サイト規約)・内部研究利用

近代女性雑誌コーパス Modern Women's Magazine Corpus 公開 近代 91MB(展開後)

女性向け雑誌(女学雑誌 1894–95・女学世界 1909・婦人倶楽部 1925、計40冊 約210万字)

構造タグ付き XML + ひまわりパッケージ(形態論情報なし; CHJ 統合版は中納言)

利用条件: CC BY-NC-ND 3.0

近代語のコーパス Corpus of Modern Japanese 要登録 近代

『明六雑誌』『国民之友』『太陽』『女学雑誌』『女性』など明治大正期の雑誌コーパス群。形態論情報つき

明六雑誌と国民之友はTSV・XMLを直接配布。太陽と女性誌はCD-ROM購入または中納言

利用条件: CC BY-NC-ND(明六・国民之友の配布データ)

青空文庫 Aozora Bunko 公開 近代現代 約17,000作品

保護期間満了の文学作品の電子テキスト。ルビと外字注記を持つ独自形式

GitHubミラー(aozorabunko/aozorabunko)とextended CSVがあり、CSVに底本・初出年が入る

青空文庫テキスト・ミラー Aozora Bunko text mirror (aozorahack) 公開 近代 894MB

著作権切れ文学・評論(明治〜昭和中期の作家中心)

cards/<person>/files/<work>/*.txt(Shift_JIS, ルビ記法)

利用条件: 大半PD(作品毎に図書カード確認)

辞書

JMdict / KANJIDIC 公開 現代 約20万項目

多言語対訳の日本語電子辞書。語義の粗い対応づけと表記異形の一覧に使う

XMLの日次ダンプ

利用条件: CC BY-SA 4.0

Sudachi同義語辞書 SudachiDict Synonyms Dictionary 公開 3.0MB

現代語の同義語グループ(体言/用言別、展開制御フラグ・分野情報付き)

CSV(RFC4180、11列:グループ番号・体言/用言フラグ・展開制御フラグ・語彙素番号・語形種別・略語情報・表記ゆれ情報・分野情報・見出し・予約×2)

利用条件: Apache-2.0

UniDic 公開 通時

短単位を単位とする形態素解析辞書。現代書き言葉・話し言葉のほか、上代・中古・中世・近世・近代文語の時代別辞書がある

MeCab・Vibrato・fugashi等から使う。時代別辞書は解析対象の文体に合わせて選ぶ

日本国語大辞典、広辞苑、大辞林、学研古語辞典ほかを串刺し検索する。学研語源辞典は含まない。

JSON APIの記述は2021-11時点のもので、現行の稼働状況は未検証。CORSは無効。2026-08-12現在、APIも一覧取得も403を返し利用不能(過去のAPI仕様は2021-2023年時点のアーカイブによる)

日本国語大辞典の全文。語誌欄と初出用例が語誌調査の起点になる。

有料契約または図書館経由の利用。APIはなく、引用は版と項目名で特定する。

分類語彙表増補改訂版 単語親密度(WLSP-familiarity) WLSP-familiarity (Word Familiarity Rating linked to WLSP) 公開 33MB

『分類語彙表』増補改訂版の見出し語に対するクラウドソーシング単語親密度・位相情報

CSV(bunruidb-fam.csv、分類語彙表番号+26列の親密度評定値)+ TSV(subjrate.txt、被験者別評定生データ)

利用条件: CC BY-NC-SA 3.0

日本国語大辞典(ジャパンナレッジ) Nihon Kokugo Daijiten via JapanKnowledge 要契約 通時 約50万項目

最大の国語辞典。語誌欄と初出用例を持ち、語の来歴を引く起点になる

機関契約または個人会員。本文の機械取得は利用条件で認められない

日本語WordNet Japanese WordNet (wn-ja) 公開 58MB (gz) / 194MB (SQLite展開後)

同義語集合(synset)・上位下位関係・語義定義・日英対訳を持つ語彙資源

SQLite3データベース(wnjpn.db、synset・sense・word・synlink等のテーブル、57,238 synsets・93,834語・158,058語義)

利用条件: NICT Japanese WordNet License(複製・改変・再配布無料、著作権表示保持が条件、無保証)

個人による語源解説サイト。

転送: https://nihongogogen.com/ → https://www.nihongogogen.com/(2026-08-11確認)。出典の扱いは語源由来辞典と同様、単一の個人説として引用する。

琉球語音声データベース Ryukyuan language sound database 公開 現代

首里・那覇、宮古、八重山などの方言辞典を音声つきで公開する

見出し単位のHTMLと音声ファイル

一般向けの語源解説サイト。

出典を明示しない記述が多く、民間語源を含む。参照する場合は当該ページのURLと閲覧日を残し、記述の性格を引用内に明記する。

全文データベース

J-STAGE 公開 現代

国内学協会誌の電子ジャーナルプラットフォーム。日本語学関係では『日本語の研究』『計量国語学』『音声研究』などを収録

WebAPIはservice=2(書誌)とservice=3(論文)。応答はAtom+OpenSearch準拠のXML。同一パラメータの複数条件は空白区切りでAND

https://api.jstage.jst.go.jp/searchapi/do?service=3&text={query}

和歌データベース Waka Database 公開 上代中古中世 約19万首

勅撰集・私家集などの和歌本文を通し検索できる。上代から中世の韻文語彙の用例源

検索フォーム。一括配布はない

新聞記事文庫 Kobe University Newspaper Clipping Collection 公開 近代 約380,000記事

1911年から1970年までの新聞切り抜き約38万記事を人手で翻刻したもの。戦前の新聞文体の資料

記事単位のHTML。利用条件は本文の引用を認める

東京大学史料編纂所データベース Historiographical Institute databases 公開 中古中世近世

『大日本史料』『大日本古文書』ほかの本文・目録・古写真・肖像を横断検索する

データベース単位の検索フォーム

次世代デジタルライブラリー NDL Lab Next Digital Library 公開 近世近代 図書28万点・古典籍8万点

保護期間満了の図書と古典籍をOCR全文で検索し、画像とテキストをまとめて取得できる実験サービス

資料単位のzipで全文を取得できる。OCRの誤りが残る

雑誌『国語学』全文データベース Full-text database of the journal Kokugogaku 公開 現代 219輯

国語学会機関誌『国語学』第1輯(1948)から第219輯(2004)までの全文。日本語学会の学史をたどる一次資料

記事単位のHTMLとPDF。全文検索はサイト内フォーム

画像アーカイブ

国書データベース Kokusho Database 公開 中古中世近世 約1,600,000件

江戸時代以前の古典籍の書誌・所在情報約160万件と、うち約30万件の高精細画像。新日本古典籍総合データベースと日本古典籍総合目録データベースを2023年に統合したもの

IIIFに対応。書誌単位のHTMLとAPI

国立公文書館デジタルアーカイブ National Archives of Japan Digital Archive 公開 近世近代

公文書・古文書・古典籍の画像。明治期の公文書は近代語資料としても使える

IIIFに対応

国立国会図書館デジタルコレクション NDL Digital Collections 要登録 近代現代 約247万点

明治以降の刊行物を中心とする247万点規模のデジタル化資料。全文検索が利用できる

保護期間満了資料は誰でも閲覧。個人送信・図書館送信の資料は登録または館内利用。IIIFに対応

日本古典籍データセット Dataset of Pre-Modern Japanese Text 公開 近世

国文学研究資料館所蔵の古典籍画像を機械学習用に整備したデータセット。くずし字文字画像データセットを併せて公開する

IIIF・一括ダウンロード

利用条件: CC BY-SA 4.0

語彙資源

BCCWJ 頻度表 ver. 1.1(短単位・長単位) BCCWJ frequency lists v1.1 (SUW + LUW) 公開 現代 SUW 77MB / LUW 1.0GB

BCCWJ全体の語彙素頻度(レジスター別列つき)

TSV(rank, lForm, lemma, pos, wType, frequency, pmw, レジスター別)

利用条件: 公式配布(クレジット表記)

CHJ サブコーパス別 SUW 頻度表 2020.3 CHJ per-subcorpus SUW frequency lists 2020.3 公開 近代 48MB

作品単位の短単位頻度(部立て・巻別の頻度列つき)

TSV(UTF-8, CRLF)384点。作品ごとに _suw(語彙素)/ _suw_goshu(語種)/ _suw_pos(品詞)の3種

利用条件: NINJAL配布条件

CHJ 統合頻度表 2023.3 CHJ integrated frequency list 2023.3 公開 近代 269MB

日本語歴史コーパス全体の語彙素×作品頻度(成立年・文体列つき)

TSV(UTF-16LE, CRLF)×3(premodern / modern_mag / modern_nonmag)

利用条件: NINJAL配布条件

言語横断の共語彙化ネットワーク。意味変化の妥当性を測る材料になる。

Concepticon IDで接続する。アイヌ語形態素データベースのcolexifications層が同じ方式を採る。ローカル取得: imports/clics3/・imports/clics4/

Concepticon 公開

語彙リストの概念を統一IDに揃えるカタログ。

語義側の外部IDとして持てば、CLDF書き出しと他言語データとの突き合わせができる。ローカル取得: imports/concepticon/

シナ・チベット語族の語根と同源語のデータベース。放浪語の追跡で漢語側の再構を照合する。

転送先: https://stedt.johnblowe.com/(2026-08-11確認)。ローカル取得: imports/stedt/

TUBELEX 日本語YouTube字幕語彙頻度表 TUBELEX (Japanese subset) — YouTube subtitle word frequency lists 公開 607MB(多言語版リポジトリ全体。日本語専用ファイルはfrequencies/tubelex-ja*.tsv.xz等)

YouTube自動字幕由来の話し言葉語彙頻度(ジャンル別カウント付き)

TSV.xz(word/count/videos/channels + ジャンル別count:*列、tubelex-ja.tsv.xzは409,505行)。lemma-pos版・base-pos版・310チャンネル限定版なども同梱

利用条件: BSD 3-Clause License

「昭和・平成書き言葉コーパス」語彙統計情報 Showa-Heisei Written Corpus (SHC) — vocabulary n-gram/co-occurrence statistics 公開 現代 6.4GB(shc-data本体224KB + gdrive-data zip 3件 1.3GB + 展開後 約5.1GB)

雑誌・書籍(ベストセラー)・新聞の3ジャンル別語彙統計(本文非公開、統計量のみ)

tab区切りn-gram頻度表(surface_ngram・lemmaID_ngram、1〜5gram、ジャンル×年別ファイル)、 SVMlight形式共起情報(lemmaID_svmlight、前後4単語・20回以上出現語彙素)、 Word2Vec(CBoW)学習済みモデル8種(昭和/平成 × all/bestseller/magazine/newspaper)。 参考として近現代雑誌コーパス(CHJ雑誌・SHC雑誌、1881〜2013年)の同形式統計も同梱。

利用条件: CC BY-SA 4.0

分類語彙表 Word List by Semantic Principles 公開 通時 約10万語

日本語の語を意味によって分類したシソーラス。増補改訂版データベースと、古典語を対象とする古典対照分類語彙表がある

テキスト版を直接配布。UniDic語彙素番号との対応表があり、コーパス注釈と接続できる

利用条件: 学術利用無償(NINJAL)

n-gram

デジタル化資料の全文から作成したn-gram頻度の時系列。語形の長期トレンドと初出時期の見当をつける。

頻度は資料のデジタル化状況に依存するため、初出の証明には使えない。

NDL Ngram Viewer / NDL Ngram Dataset NDL Ngram 公開 近代現代 tosho-pdm 22.2GB ほか

デジタル化資料の全文から作った年次別n-gram頻度。語形の長期トレンドを見る

`ngram \t 総頻度 \t {年: 頻度}`形式のgzip。デジタル化の偏りがあり、初出の証明には使えない

利用条件: PDM(対象資料に依存)

検索系・ツール

中納言 Chunagon 要登録 通時

国立国語研究所のコーパス検索アプリケーション。BCCWJ・CHJ・CSJ・SHC・CEJCなどを短単位・長単位・文字列で検索する

無償の利用登録が要る。検索結果はTSVで書き出せる。件数上限がある

書誌 34,896件 語別索引 17,251件 資源 113件 研究者 303名 JSON