論文 ·日本語 ·未確認
〈プロジェクト紹介〉超大規模コーパス構築プロジェクト 日本語Webコーパスの構築 : 利活用
- 刊行年
- 2015-06
- 収録
- 『国語研プロジェクトレビュー』 6(1) pp. 1-10
- 出版
- 国立国語研究所
- CiNii CRID
- 1390009224767915904
- CiNii NAID
- http://ci.nii.ac.jp/naid/KJ00009788019
- URI
- https://repository.ninjal.ac.jp/records/805
- NDL書誌ID
- 027580087
- ISSN
- 2185-0100
- DOI
- 10.15084/00000796
- URL
- https://cir.nii.ac.jp/crid/1390009224767915904
要旨
国立国語研究所コーパス開発センターでは2011年より超大規模コーパス構築プロジェクトとして,Webを母集団とした100億語規模のコーパスの構築を進めている。構築にあたっては,工程を収集・組織化・利活用・保存の4つに分割して実装を進めている。2012年第4四半期より3か月ごとに1億URLのクロールを繰り返し実施している。本稿では構築されたコーパスデータの基礎統計量を示し,本コーパスを用いて,どのような理論的・応用的研究が可能になると考えられるかを論じる。
この書誌の出所
- cinii— 1390009224767915904(2026-08-13取得)
引用
浅原 正幸・ASAHARA Masayuki(2015-06) 〈プロジェクト紹介〉超大規模コーパス構築プロジェクト 日本語Webコーパスの構築 : 利活用 『国語研プロジェクトレビュー』 6(1) pp. 1-10 国立国語研究所
浅原2015〈プロジェクト紹介〉