論文 ·日本語 ·未確認

〈プロジェクト紹介〉超大規模コーパス構築プロジェクト 日本語Webコーパスの構築 : 利活用

浅原 正幸 ASAHARA Masayuki

刊行年
2015-06
収録
『国語研プロジェクトレビュー』 6(1) pp. 1-10
出版
国立国語研究所
crid
1390009224767915904
naid
http://ci.nii.ac.jp/naid/KJ00009788019
uri
https://repository.ninjal.ac.jp/records/805
ndl_bib_id
027580087
issn
2185-0100
doi
10.15084/00000796
URL
https://cir.nii.ac.jp/crid/1390009224767915904

要旨

国立国語研究所コーパス開発センターでは2011年より超大規模コーパス構築プロジェクトとして,Webを母集団とした100億語規模のコーパスの構築を進めている。構築にあたっては,工程を収集・組織化・利活用・保存の4つに分割して実装を進めている。2012年第4四半期より3か月ごとに1億URLのクロールを繰り返し実施している。本稿では構築されたコーパスデータの基礎統計量を示し,本コーパスを用いて,どのような理論的・応用的研究が可能になると考えられるかを論じる。

この書誌の出所

  • cinii— 1390009224767915904(2026-08-13取得)

引用キー: 浅原2015〈プロジェクト紹介〉

書誌 56,535件 語別索引 17,251件 資源 113件 研究者 303名 JSON