論文 ·日本語 ·未確認

文字列正規化パタンの獲得と崩れ表記正規化に基づく日本語形態素解析

斉藤 いつみ 貞光 九月 浅野 久子 松尾 義博 Itsumi Saito Kugatsu Sadamitsu Hisako Asano Yoshihiro Matsuo

刊行年
2017
収録
『自然言語処理』 24(2) pp. 297-314
言語
日本語・英語
doi
10.5715/jnlp.24.297
issn
1340-7619
jstage_journal
jnlp
openalex
W2625191711
mag
2625191711
URL
https://www.jstage.jst.go.jp/article/jnlp/24/2/24_297/_article/-char/ja/

要旨

ソーシャルメディア等の崩れた日本語の解析においては,形態素解析辞書に存在しない語が多く出現するため解析誤りが新聞等のテキストに比べ増加する.辞書に存在しない未知語の中でも,既知の辞書語からの派生に関しては,正規形を考慮しながら解析するという表記正規化との同時解析の有効性が確認されている.本研究では,これまで焦点があてられていなかった,文字列の正規化パタン獲得に着目し,アノテーションデータから文字列の正規化パタンを統計的に抽出する.統計的に抽出した文字列正規化パタンと文字種正規化を用いて辞書語の候補を拡張し形態素解析を行った結果,従来法よりも再現率,精度ともに高い解析結果を得ることができた.

主題

この書誌の出所

  • jstage— 10.5715/jnlp.24.297(2026-08-12取得)
  • openalex— W2625191711(2026-08-12取得)

引用キー: 斉藤2017文字列正規化パタンの

書誌 34,896件 語別索引 17,251件 資源 113件 研究者 303名 JSON