Bluesky 日本語投稿(Jetstream 収集) Bluesky Japanese posts (Jetstream collector) 公開 現代 308MB(日次 gz 8本、日本語投稿 2,270,800 件/観測 21,590,100 件、cursor 保存済み) 現行 SNS 短文(くだけた文体)
jsonl.gz 日別(did, rkey, text, createdAt, langs)
利用条件: AT Protocol 公開投稿(削除尊重・内部研究利用)
幼児言語獲得研究用の親子自然会話書き起こし(CHAT形式)。Miyata・MiiPro・Noji・Ishii・Okayama・Ota・Hamasaki・NINJAL-Okubo・Ogawa・Yokoyama等12コーパス
CHAT形式(.cha)書き起こしテキスト、zip配布
利用条件: CC BY-NC-SA(TalkBankルールにより各コーパス指定の引用文献の明記も必須)
現代ウェブ全般(trafilatura 抽出・MinHash 重複タグ付き)
parquet(text, minhash_cluster_size ほか)
利用条件: ODC-By 1.0
Amazon商品レビューの二値感情分類データ(本来はレビュー本文+positive/negativeラベル)
本来: レビュー本文+ラベル(train 187,528 / dev 5,654 / test 5,639)
利用条件: 元データ Multilingual Amazon Reviews Corpus (MARC) のライセンスに従う(Amazonが配布停止)
JParaCrawl v3.0 英日対訳コーパス JParaCrawl v3.0 English-Japanese parallel corpus 公開 現代 2.8GB (en-ja-v3.0.tar.gz) / 展開後 en-ja.bicleaner05.txt 9.3GB ウェブクロール由来の英日対訳文(自動文アライン・bicleaner品質スコア付き、日本語側はウェブ全般の書き言葉)
tar.gz内にTSV(source_domain, domain, bicleaner05スコア, 英語文, 日本語文)。約22M対訳ペア(deduped)
利用条件: NTT利用規約(情報解析を伴う研究開発目的のみ。複製・配布可、商用利用不可。CITATION: Morishita et al. 2020 LREC)
LLM生成の指示応答ペア(instruction tuning用、多様なトピック)
JSONL(1行1会話、conversations配列にrole/content、132,476件)
利用条件: Apache-2.0
Common Crawl 日本語ウェブ(品質フィルタ最上位 level2)
parquet(text, meta)
利用条件: 要確認(公式は申請制。ミラー chatblanc-ciel/llm-jp-corpus-v3 由来)
明治〜昭和戦前刊行図書 約28万点のOCR由来 1〜5gram
TSV行(ngram \t 総頻度 \t {年: 頻度} 辞書)gzip
利用条件: PDM
明治〜昭和前期刊行図書(OCR、旧字・ノイズあり)
fulltext-json(頁別 contents + 座標)+ index.jsonl.gz(publishyear あり)
利用条件: PDM
現代日本語の句構造付きツリーバンク。2022年3月時点で約9万文
2016年から2022年まで年次のスナップショットが公開された。同じ木を継続開発するかいのきツリーバンクが https://kainoki.github.io/ にある
映画・TV字幕から抽出した単言語文(口語・会話的、非公式ファン翻訳含む)
プレーンテキスト(1行1文、生の未トークン化版。tokenized版 ja.tok.gzは未取得)
利用条件: OPUS再配布物(原著作権は各字幕投稿者・opensubtitles.org。OPUS上はODC-BY相当で提供、再配布時は出典表記を推奨)
TEDトーク字幕から抽出した単言語文(講演調・書き言葉に近い話し言葉)
プレーンテキスト(1行1文、生の未トークン化版。tokenized版 ja.tok.gzは未取得)
利用条件: OPUS再配布物(原データはTED公式字幕、CC BY-NC-ND 4.0相当。研究利用目的での再配布)
Open2ch対話コーパス Open2ch Dialogue Corpus 公開 現代 1.9GB (corpus.zip 534MB + ranking.zip 1.4MB + 展開後合計) 匿名掲示板(open2ch)のスレッドを対話ペア化した口語・ネットスラング中心テキスト
TSV(context\tresponse、板別 livejupiter.tsv / news4vip.tsv / newsplus.tsv)+ ranking用 dev/test TSV
利用条件: Apache-2.0
地上波テレビ放送由来の自然な日本語音声の文字起こし(アナウンス・字幕・会話等)
HF datasetsローダ(reazonspeech.py)経由の結合レコード(FLAC音声 + transcription文字列)。全量2.3TB/35000時間
利用条件: CDLA-Sharing-1.0(ただし著作権法30条の4に基づく情報解析目的での利用のみに限定するという配布者の追加条件あり)
WRIME(主観と客観の感情分析データセット) WRIME (subjective and objective emotion analysis dataset) 公開 現代 21MB(.git込み。TSV本体 wrime-ver1.tsv 9.5MB + wrime-ver2.tsv 8.2MB) SNS投稿文(はてなブログ由来の一人称投稿、感情8分類×書き手・読み手複数評定付き)
タブ区切りテキスト(Sentence, UserID, Datetime, Train/Dev/Test split, Writer/Reader×8感情カテゴリ強度+Sentiment)
利用条件: 研究利用ライセンス(リポジトリ同梱LICENSE参照。研究目的での使用を想定、商用利用は要確認)
e-Gov 全法令 XML e-Gov all current laws (bulk XML) 公開 近代現代 297MB (zip) 現行法令(明治太政官布告の文語を含む法律文体)
法令標準 XML
利用条件: PDL 1.0
ニュース記事(9カテゴリ、口語調のブログ的記事含む)
プレーンテキスト(記事ごとに1ファイル、URL・日付・タイトル・本文の順)、9カテゴリのディレクトリ分割
利用条件: CC BY-ND 2.1 JP
みんなで翻刻 Minna de Honkoku 公開 近世中世近代 約52M字 市民参加で翻刻された近世を中心とする古文書テキスト
GitHubでデータが公開される
利用条件: CC BY-SA 4.0
みんなで翻刻 近世散文サブセット Minna de Honkoku early-modern prose subset 公開 中世近世近代 2,877,821 短単位(12,214 丁) 近世の実用書・記録(医療と養生・料理書・疫病関係・地誌)
統一トークン parquet(TOKEN_SCHEMA)×2 シャード
利用条件: CC BY-SA 4.0
『万葉集』を中心とする上代日本語の統語情報つきコーパス。語の情報に加えて句構造を持つ
オンライン検索と、統語木を含むデータの公開がある
南総里見八犬伝 Nansō Satomi Hakkenden 公開 近世 97MB(raw json 4点計90.6MB + 抽出txt 4点計10.6MB、総文字数約364万字) 読本(長編伝奇小説、勧善懲悪・因果応報、全106冊98巻の大作)
NDL fulltext-json(頁別contents+座標)×4巻 + 抽出plain txt ×4巻
利用条件: PD(原典1814–1842年刊、底本1930年博文館版も著作権保護期間満了)
名大会話コーパス Nagoya University Conversation Corpus 公開 現代 129会話 129会話・約100時間の雑談の文字化資料
テキスト一括ダウンロード
利用条件: CC BY-NC-ND 4.0
国会会議録 National Diet Record 公開 現代 全量数十GB規模(テキスト) 議会演説・質疑(整文された話し言葉)
REST API(XML/JSON, speech単位)
利用条件: 利用規約(出典明示で利用可)
国性爺合戦 Kokusen'ya Kassen 公開 近世 1.5MB(raw json 1.3MB + 抽出txt 116KB) 時代浄瑠璃(全5段の合戦物、和藤内の異国活劇)
NDL fulltext-json(頁別contents+座標、合本の頁1-36を抽出)+ 抽出plain txt
利用条件: PD(原典1715年初演、底本1891年鍾美堂版も著作権保護期間満了)
明治中期の総合雑誌(文語・口語混在)
SUW TSV(UTF-8)+ XML(UTF-16)+ ひまわり
利用条件: CC BY-NC-ND 3.0
ウェブから構築した258億語規模のコーパス。派生資源にNWJC-n-gram・NWJC2vec・chiVeがある
検索系「梵天」の一般公開は2021年12月24日で終了した。データ本体はGSK経由の申請で入手する
12の母語背景をもつ日本語学習者1,000名の発話と作文。学習者言語の対照研究に使う
中納言で検索、音声とデータは申請
太陽コーパス CD-ROM版 Taiyo Corpus (CD-ROM edition) 有償 近代 287762432 bytes(ISO)、275720384 bytes(6698ファイル) 雑誌『太陽』1895・1901・1909・1917・1925年(文語・口語・項目)
Shift_JIS XML 60号・Himawari索引・ISO-9660イメージ
利用条件: 購入製品利用条件(個人利用の複製・改変可、再配布不可、二次的著作物の公開は事前許可)
帝国議会・国会会議録(API 全量収集) Imperial Diet + National Diet proceedings (full API harvest) 公開 近代 4.2GB(帝国議会 59 ファイル・国会 81 ファイル、全年収集完了) 議会演説・質疑(1890–1947 は文語・旧字 OCR、1947– は整文)
jsonl.gz(1 行 1 会議、speechRecord 入れ子)年別
利用条件: NDL 利用規約(出典明示)
平家女護島 Heike Nyogo no Shima 公開 近世 672KB(raw json 555KB + 抽出txt 111KB) 時代浄瑠璃(俊寛・鬼界が島の段が著名、平家物語に取材)
NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)
利用条件: PD(原典1719年初演、底本1891年三三文房版も著作権保護期間満了)
心中天網島 Shinjū Ten no Amijima 公開 近世 1.4MB(raw json 1.3MB + 抽出txt 75KB) 世話浄瑠璃(心中物、紙屋治兵衛と遊女小春の情話)
NDL fulltext-json(頁別contents+座標、合本の頁37-56を抽出)+ 抽出plain txt
利用条件: PD(原典1720年初演、底本1891年鍾美堂版も著作権保護期間満了)
掲示板型SNSのくだけた書き言葉(日本語圏サブレディット: newsokur・lowlevelaware・BakaNewsJP・ja・newsokuvip の投稿本文+コメント)
JSONL(1行1レコード、Reddit API準拠フィールド: id, created_utc, subreddit, title/selftext または body ほか)
利用条件: Reddit利用者投稿。Arctic Shiftはアーカイブ研究用に再配布(Reddit API規約・各投稿者の権利に留意。研究利用想定)
共同研究プロジェクトが作成した日本語史資料のテキスト(TXT・XML)
資料単位で直接ダウンロードできる
日常場面の会話200時間を映像つきで収録。話者属性と場面情報を持つ
全データは契約による。モニター公開版と中納言検索がある
奈良時代編(万葉集・宣命・祝詞)から明治大正編まで、時代別のサブコーパスを形態論情報つきで提供する日本語史の基幹資料
本文検索は中納言(要登録・無償)。語彙統計と一部の頻度表はサイトから直接取得できる
上代から明治大正までの通時コーパス。短単位・長単位の形態論情報つきで用例を検索する。
利用にはアカウント申請が必要で、未ログインではログイン画面に転送される。語誌データベースの統計情報はこのコーパスの頻度に基づく。
百科事典的書き言葉(現代規範)
MediaWiki XML export
利用条件: CC BY-SA 4.0 / GFDL
パブリックドメイン原典テキスト(明治法令・近代文学・古典翻刻など、Wikisource寄稿者による校訂込み)
MediaWiki XMLダンプ(pages-articles、wikitext本文、未展開)
利用条件: CC BY-SA 3.0(サイト全体の利用規約)+収録原文自体は多くがPD
学会講演・模擬講演を中心とする自発音声662時間。転記・形態論情報・韻律ラベルつき
DVD配布。コアは人手修正済み。SDBフラットファイルが全体、RDBはコアのみ
利用条件: CSJ利用許諾(購入済み・再配布不可)
『全国方言談話データベース 日本のふるさとことば集成』を検索可能にしたもの。全国の方言談話の音声と転記
オンライン検索
日英字幕対訳コーパス(JESC) Japanese-English Subtitle Corpus (JESC) 公開 現代 102MB (raw.tar.gz) / 214MB(展開後) 映画・TV字幕の会話体日英対訳
タブ区切りテキスト(英語\t日本語、1行1対訳ペア)。生データ版(raw、シャッフル済み全件)を取得、train/dev/test分割版(split.tar.gz)は別途必要なら取得
利用条件: CC BY-SA 4.0
明治啓蒙期の学術評論誌(文語中心)
SUW TSV(UTF-8, 25列, 語彙素・語種・品詞・文体)+ XML(UTF-16)+ ひまわり
利用条件: CC BY-NC-ND 3.0
1933年から2013年までの雑誌を10年ごとに抽出。BCCWJと接続して昭和戦前から現代までを連続で見る
中納言で検索。語彙統計は公開
1950–60年代の録音に基づく話し言葉資料。CSJ・CEJCと接続して話し言葉の通時変化を見る
中納言で検索
曾根崎心中 Sonezaki Shinjū 公開 近世 628KB(raw json 531KB + 抽出txt 91KB) 世話浄瑠璃(心中物の嚆矢、口語体台詞・地の文混在)
NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)
利用条件: PD(原典1703年初演、底本1935年栗田書店版も著作権保護期間満了)
東海道中膝栗毛 Tōkaidōchū Hizakurige 公開 近世 6.8MB (raw json 5.8MB + 抽出txt 906KB) 滑稽本・道中記(弥次郎兵衛・喜多八の東海道旅行記、俗語会話体中心)
NDL fulltext-json(頁別contents+座標)+ 抽出plain txt(頁連結)
利用条件: PD(原典1802–1814年刊、底本1927年有朋堂書店版も著作権保護期間満了)
平安時代中期の物語文学(源氏物語全文、文語)
タブ区切りテキスト(UTF-8 LF、ファイル名・サブコーパス名・開始終了文字位置・文境界・書字形出現形・語彙素・語彙素読み・品詞・活用型・活用形・発音形・語種の13列)
利用条件: 形態論情報は CC BY 4.0(小木曽智信)。本文自体のライセンスは原典サイト(渋谷栄一氏/宮脇文経氏)に準拠、別途確認要
書き言葉13レジスター(書籍・雑誌・新聞・白書・教科書・広報・Yahoo!知恵袋・ブログ・法律・韻文・国会会議録)
M-XML(SUW/LUW形態論情報)・C-XML・CORE TSV(zip内)
利用条件: BCCWJ利用許諾(購入済みDVD・再配布不可)
書籍・雑誌・新聞・白書・教科書・Yahoo!知恵袋など13レジスターにわたる1億語の均衡コーパス。短単位・長単位の形態論情報つき
DVD版の購入、または中納言でのオンライン検索。頻度表(SUW・LUW)は無償公開
神戸大学 新聞記事文庫(人手翻刻・戦前新聞) Kobe University Newspaper Clippings Collection 公開 近代 433MB(gz 232 本、記事 231,652 件/本文あり 323,109 件) 戦前中心の新聞記事(人手翻刻・高精度)
jsonl.gz(id, title, newspaper, date, text)
利用条件: 記事本文の引用は出典明示で可(サイト規約)・内部研究利用
近代女性雑誌コーパス Modern Women's Magazine Corpus 公開 近代 91MB(展開後) 女性向け雑誌(女学雑誌 1894–95・女学世界 1909・婦人倶楽部 1925、計40冊 約210万字)
構造タグ付き XML + ひまわりパッケージ(形態論情報なし; CHJ 統合版は中納言)
利用条件: CC BY-NC-ND 3.0
近代語のコーパス Corpus of Modern Japanese 要登録 近代 『明六雑誌』『国民之友』『太陽』『女学雑誌』『女性』など明治大正期の雑誌コーパス群。形態論情報つき
明六雑誌と国民之友はTSV・XMLを直接配布。太陽と女性誌はCD-ROM購入または中納言
利用条件: CC BY-NC-ND(明六・国民之友の配布データ)
青空文庫 Aozora Bunko 公開 近代現代 約17,000作品 保護期間満了の文学作品の電子テキスト。ルビと外字注記を持つ独自形式
GitHubミラー(aozorabunko/aozorabunko)とextended CSVがあり、CSVに底本・初出年が入る
青空文庫テキスト・ミラー Aozora Bunko text mirror (aozorahack) 公開 近代 894MB 著作権切れ文学・評論(明治〜昭和中期の作家中心)
cards/<person>/files/<work>/*.txt(Shift_JIS, ルビ記法)
利用条件: 大半PD(作品毎に図書カード確認)