BCCWJ全体の語彙素頻度(レジスター別列つき)
TSV(rank, lForm, lemma, pos, wType, frequency, pmw, レジスター別)
利用条件: 公式配布(クレジット表記)
日本語研究で引くコーパス・辞書・文献データベース・画像アーカイブの目録。 各項目は入口のURL、個別項目のURLの組み立て方、APIの有無、利用条件を持つ。
BCCWJ全体の語彙素頻度(レジスター別列つき)
TSV(rank, lForm, lemma, pos, wType, frequency, pmw, レジスター別)
利用条件: 公式配布(クレジット表記)
作品単位の短単位頻度(部立て・巻別の頻度列つき)
TSV(UTF-8, CRLF)384点。作品ごとに _suw(語彙素)/ _suw_goshu(語種)/ _suw_pos(品詞)の3種
利用条件: NINJAL配布条件
日本語歴史コーパス全体の語彙素×作品頻度(成立年・文体列つき)
TSV(UTF-16LE, CRLF)×3(premodern / modern_mag / modern_nonmag)
利用条件: NINJAL配布条件
言語横断の共語彙化ネットワーク。意味変化の妥当性を測る材料になる。
Concepticon IDで接続する。アイヌ語形態素データベースのcolexifications層が同じ方式を採る。ローカル取得: imports/clics3/・imports/clics4/
語彙リストの概念を統一IDに揃えるカタログ。
語義側の外部IDとして持てば、CLDF書き出しと他言語データとの突き合わせができる。ローカル取得: imports/concepticon/
シナ・チベット語族の語根と同源語のデータベース。放浪語の追跡で漢語側の再構を照合する。
転送先: https://stedt.johnblowe.com/(2026-08-11確認)。ローカル取得: imports/stedt/
YouTube自動字幕由来の話し言葉語彙頻度(ジャンル別カウント付き)
TSV.xz(word/count/videos/channels + ジャンル別count:*列、tubelex-ja.tsv.xzは409,505行)。lemma-pos版・base-pos版・310チャンネル限定版なども同梱
利用条件: BSD 3-Clause License
雑誌・書籍(ベストセラー)・新聞の3ジャンル別語彙統計(本文非公開、統計量のみ)
tab区切りn-gram頻度表(surface_ngram・lemmaID_ngram、1〜5gram、ジャンル×年別ファイル)、 SVMlight形式共起情報(lemmaID_svmlight、前後4単語・20回以上出現語彙素)、 Word2Vec(CBoW)学習済みモデル8種(昭和/平成 × all/bestseller/magazine/newspaper)。 参考として近現代雑誌コーパス(CHJ雑誌・SHC雑誌、1881〜2013年)の同形式統計も同梱。
利用条件: CC BY-SA 4.0
日本語の語を意味によって分類したシソーラス。増補改訂版データベースと、古典語を対象とする古典対照分類語彙表がある
テキスト版を直接配布。UniDic語彙素番号との対応表があり、コーパス注釈と接続できる
利用条件: 学術利用無償(NINJAL)