論文 ·日本語 ·書誌確認済
歴史的日本語資料を対象とした形態素解析
小木曽, 智信 ・ 小町, 守 ・ 松本, 裕治 ・ 小木曽 智信 ・ 小町 守 ・ 松本 裕治 ・ Toshinobu Ogiso ・ Mamoru Komachi ・ Yūji Matsumoto
- 刊行年
- 2013
- 収録
- 『自然言語処理』 20(5) pp. 727-748
- 出版
- 一般社団法人 言語処理学会
- 言語
- 日本語・英語
- doi
- 10.5715/jnlp.20.727
- issn
- 1340-7619
- jstage_journal
- jnlp
- crid
- 1390282679450356096
- uri
- https://www.jstage.jst.go.jp/article/jnlp/20/5/20_727/_pdf
- naid
- 130004566461
- openalex
- W2323110710
- mag
- 2323110710
- URL
- https://www.jstage.jst.go.jp/article/jnlp/20/5/20_727/_article/-char/ja/
要旨
単語情報がタグ付けされた本格的な通時コーパスを構築するためには,歴史的な日本語資料の形態素解析が必要とされるが,従来はこれを十分な精度で行うことができなかった.そこで,現代語用の UniDic に語彙の追加を行い,明治時代の文語文と平安時代の仮名文学作品のコーパスを整備することで,「近代文語 UniDic」と「中古和文 UniDic」を作成した.この辞書によりコーパス構築に利用可能な約 96~97% での解析が可能になった.この辞書の学習曲線をもとに歴史的資料の形態素解析辞書に必要な訓練用のタグ付きコーパスのサイズを調査した結果,約 5 万語のコーパスで精度 95% を超える実用的な解析が可能になること,5,000 語程度の少量であっても対象テキストの訓練コーパスを用意することが有効であることを確認した.
主題
この書誌の出所
- refs:sino_japanese— 小木曽2013歴史的資料の形態素解析(2026-08-12取得)
- jstage— 10.5715/jnlp.20.727(2026-08-12取得)
- cinii— 1390282679450356096(2026-08-12取得)
- openalex— W2323110710(2026-08-12取得)
引用キー: 小木曽2013歴史的資料の形態素解析