論文 ·日本語 ·未確認
〈プロジェクト紹介〉超大規模コーパス構築プロジェクト 日本語Webコーパスの構築 : 利活用
- 刊行年
- 2015-06
- 収録
- 『国語研プロジェクトレビュー』 6(1) pp. 1-10
- 出版
- 国立国語研究所
- crid
- 1390009224767915904
- naid
- http://ci.nii.ac.jp/naid/KJ00009788019
- uri
- https://repository.ninjal.ac.jp/records/805
- ndl_bib_id
- 027580087
- issn
- 2185-0100
- doi
- 10.15084/00000796
- URL
- https://cir.nii.ac.jp/crid/1390009224767915904
要旨
国立国語研究所コーパス開発センターでは2011年より超大規模コーパス構築プロジェクトとして,Webを母集団とした100億語規模のコーパスの構築を進めている。構築にあたっては,工程を収集・組織化・利活用・保存の4つに分割して実装を進めている。2012年第4四半期より3か月ごとに1億URLのクロールを繰り返し実施している。本稿では構築されたコーパスデータの基礎統計量を示し,本コーパスを用いて,どのような理論的・応用的研究が可能になると考えられるかを論じる。
この書誌の出所
- cinii— 1390009224767915904(2026-08-13取得)
引用キー: 浅原2015〈プロジェクト紹介〉