論文 ·日本語 ·未確認
文構造を考慮した日本語コロケーション情報の抽出とその応用
- crid
- 1040282257134750848
- kaken
- 23520640
- jgn
- JP23520640
- uri
- https://kaken.nii.ac.jp/grant/KAKENHI-PROJECT-23520640/
- URL
- https://cir.nii.ac.jp/crid/1040282257134750848
要旨
文構造を考慮に入れた日本語のコロケーション情報を抽出する方法を考察した。データの検証として、新聞データおよび実際の新聞紙面はどんな違いがあるか確認した。次に、明らかになった新聞データの問題を修正し、2種類のデータ、1文単位に分割されたデータ、及び変更されていないデータを用意した。各々に対し形態素解析を行った後、データベースに変換し、高頻語語彙についてのコロケーション情報を抽出し、結果を考察した。 さらに、対象による結果への影響を考察するために、上記と同様の処理をBCCWJを対象に行う。まず1文単位に分割するために、BCCWJの文構造タグを検証し、サブコーパス単位で問題点を挙げた。
主題
この書誌の出所
- cinii— 1040282257134750848(2026-08-12取得)
引用キー: 長谷川文構造を考慮した日本