研究資源

日本語研究で引くコーパス・辞書・文献データベース・画像アーカイブの目録。 各項目は入口のURL、個別項目のURLの組み立て方、APIの有無、利用条件を持つ。

コーパス

CHILDES 日本語コーパス群(Miyata・MiiPro・Noji等) CHILDES Japanese corpora (Miyata, MiiPro, Noji, etc.) 要申請 現代 null(未取得)

幼児言語獲得研究用の親子自然会話書き起こし(CHAT形式)。Miyata・MiiPro・Noji・Ishii・Okayama・Ota・Hamasaki・NINJAL-Okubo・Ogawa・Yokoyama等12コーパス

CHAT形式(.cha)書き起こしテキスト、zip配布

利用条件: CC BY-NC-SA(TalkBankルールにより各コーパス指定の引用文献の明記も必須)

LLM-jp コーパス v3 ja_cc level2 サンプル(公開ミラー由来) LLM-jp corpus v3 ja_cc level2 sample (via public mirror) 要申請 現代 609MB(2 shard: 2013-16 crawl 74k docs / 2023-40 crawl 72k docs)

Common Crawl 日本語ウェブ(品質フィルタ最上位 level2)

parquet(text, meta)

利用条件: 要確認(公式は申請制。ミラー chatblanc-ciel/llm-jp-corpus-v3 由来)

ReazonSpeech 文字起こし(音声分離不可・要申請) ReazonSpeech transcripts (inseparable from audio; access required) 要申請 現代 null(取得せず)

地上波テレビ放送由来の自然な日本語音声の文字起こし(アナウンス・字幕・会話等)

HF datasetsローダ(reazonspeech.py)経由の結合レコード(FLAC音声 + transcription文字列)。全量2.3TB/35000時間

利用条件: CDLA-Sharing-1.0(ただし著作権法30条の4に基づく情報解析目的での利用のみに限定するという配布者の追加条件あり)

国語研日本語ウェブコーパス(NWJC) NINJAL Web Japanese Corpus 要申請 現代 258億語

ウェブから構築した258億語規模のコーパス。派生資源にNWJC-n-gram・NWJC2vec・chiVeがある

検索系「梵天」の一般公開は2021年12月24日で終了した。データ本体はGSK経由の申請で入手する

書誌 34,896件 語別索引 17,251件 資源 113件 研究者 303名 JSON