論文 ·日本語 ·書誌確認済

歴史的日本語資料を対象とした形態素解析

小木曽, 智信 小町, 守 松本, 裕治 小木曽 智信 小町 守 松本 裕治 Toshinobu Ogiso Mamoru Komachi Yūji Matsumoto

刊行年
2013
収録
『自然言語処理』 20(5) pp. 727-748
出版
一般社団法人 言語処理学会
言語
日本語・英語
doi
10.5715/jnlp.20.727
issn
1340-7619
jstage_journal
jnlp
crid
1390282679450356096
uri
https://www.jstage.jst.go.jp/article/jnlp/20/5/20_727/_pdf
naid
130004566461
openalex
W2323110710
mag
2323110710
URL
https://www.jstage.jst.go.jp/article/jnlp/20/5/20_727/_article/-char/ja/

要旨

単語情報がタグ付けされた本格的な通時コーパスを構築するためには,歴史的な日本語資料の形態素解析が必要とされるが,従来はこれを十分な精度で行うことができなかった.そこで,現代語用の UniDic に語彙の追加を行い,明治時代の文語文と平安時代の仮名文学作品のコーパスを整備することで,「近代文語 UniDic」と「中古和文 UniDic」を作成した.この辞書によりコーパス構築に利用可能な約 96~97% での解析が可能になった.この辞書の学習曲線をもとに歴史的資料の形態素解析辞書に必要な訓練用のタグ付きコーパスのサイズを調査した結果,約 5 万語のコーパスで精度 95% を超える実用的な解析が可能になること,5,000 語程度の少量であっても対象テキストの訓練コーパスを用意することが有効であることを確認した.

主題

この書誌の出所

  • refs:sino_japanese— 小木曽2013歴史的資料の形態素解析(2026-08-12取得)
  • jstage— 10.5715/jnlp.20.727(2026-08-12取得)
  • cinii— 1390282679450356096(2026-08-12取得)
  • openalex— W2323110710(2026-08-12取得)

引用キー: 小木曽2013歴史的資料の形態素解析

書誌 34,896件 語別索引 17,251件 資源 113件 研究者 303名 JSON