論文 ·日本語 ·未確認

文構造を考慮した日本語コロケーション情報の抽出とその応用

長谷川 守寿

crid
1040282257134750848
kaken
23520640
jgn
JP23520640
uri
https://kaken.nii.ac.jp/grant/KAKENHI-PROJECT-23520640/
URL
https://cir.nii.ac.jp/crid/1040282257134750848

要旨

文構造を考慮に入れた日本語のコロケーション情報を抽出する方法を考察した。データの検証として、新聞データおよび実際の新聞紙面はどんな違いがあるか確認した。次に、明らかになった新聞データの問題を修正し、2種類のデータ、1文単位に分割されたデータ、及び変更されていないデータを用意した。各々に対し形態素解析を行った後、データベースに変換し、高頻語語彙についてのコロケーション情報を抽出し、結果を考察した。 さらに、対象による結果への影響を考察するために、上記と同様の処理をBCCWJを対象に行う。まず1文単位に分割するために、BCCWJの文構造タグを検証し、サブコーパス単位で問題点を挙げた。

主題

この書誌の出所

  • cinii— 1040282257134750848(2026-08-12取得)

引用キー: 長谷川文構造を考慮した日本

書誌 34,896件 語別索引 17,251件 資源 113件 研究者 303名 JSON