本文へ移動

論文 ·日本語 ·未確認

〈プロジェクト紹介〉超大規模コーパス構築プロジェクト 日本語Webコーパスの構築 : 利活用

浅原 正幸 ・ ASAHARA Masayuki

刊行年
2015-06
収録
『国語研プロジェクトレビュー』 6(1) pp. 1-10
出版
国立国語研究所
CiNii CRID
1390009224767915904
CiNii NAID
http://ci.nii.ac.jp/naid/KJ00009788019
URI
https://repository.ninjal.ac.jp/records/805
NDL書誌ID
027580087
ISSN
2185-0100
DOI
10.15084/00000796
URL
https://cir.nii.ac.jp/crid/1390009224767915904

要旨

国立国語研究所コーパス開発センターでは2011年より超大規模コーパス構築プロジェクトとして,Webを母集団とした100億語規模のコーパスの構築を進めている。構築にあたっては,工程を収集・組織化・利活用・保存の4つに分割して実装を進めている。2012年第4四半期より3か月ごとに1億URLのクロールを繰り返し実施している。本稿では構築されたコーパスデータの基礎統計量を示し,本コーパスを用いて,どのような理論的・応用的研究が可能になると考えられるかを論じる。

この書誌の出所

  • cinii— 1390009224767915904(2026-08-13取得)

引用

浅原 正幸・ASAHARA Masayuki(2015-06) 〈プロジェクト紹介〉超大規模コーパス構築プロジェクト 日本語Webコーパスの構築 : 利活用 『国語研プロジェクトレビュー』 6(1) pp. 1-10 国立国語研究所

浅原2015〈プロジェクト紹介〉
書誌 67,320件 語別索引 17,251件 資源 113件 研究者 303名 JSON