論文 ·日本語 ·未確認

確率的タグ付与コーパスからの言語モデル構築

森 信介 笹田 鉄郎 Neubig Graham Shinsuke Mori Tetsuro Sasada Graham Neubig

刊行年
2011
収録
『自然言語処理』 18(2) pp. 71-87
言語
日本語・英語
doi
10.5715/jnlp.18.71
issn
1340-7619
jstage_journal
jnlp
openalex
W2316323787
mag
2316323787
URL
https://www.jstage.jst.go.jp/article/jnlp/18/2/18_2_71/_article/-char/ja/

要旨

確率的言語モデルは,仮名漢字変換や音声認識などに広く用いられている.パラメータは,コーパスの既存のツールによる処理結果から推定される.精度の高い読み推定ツールは存在しないため,結果として,言語モデルの単位を単語(と品詞の組)とし,仮名漢字モデルを比較的小さい読み付与済みコーパスから推定したり,単語の発音の確率を推定せずに一定値としている.これは,単語の読みの確率を文脈と独立であると仮定していることになり,この仮定に起因する精度低下がある.このような問題を解決するために,本論文では,まず,仮名漢字変換において,単語と読みの組を単位とする言語モデルを利用することを提案する.単語と読みの組を単位とする言語モデルのパラメータは,自動単語分割および自動読み推定の結果から推定される.この処理過程で発生する誤りの問題を回避するために,本論文では,確率的タグ付与を提案する.これらの提案を採用するか否かに応じて複数の仮名漢字変換器を構築し,テストコーパスにおける変換精度を比較した結果,単語と読みの組を言語モデルの単位とし,そのパラメータを確率的に単語分割し,さらに確率的読みを付与したコーパスから推定することで最も高い変換精度となることが分かった.したがって,本論文で提案する単語と読みの組を単位とする言語モデルと,確率的タグ付与コーパスの概念は有用であると結論できる.

主題

この書誌の出所

  • jstage— 10.5715/jnlp.18.71(2026-08-12取得)
  • openalex— W2316323787(2026-08-12取得)

引用キー: 森2011確率的タグ付与コパス

書誌 34,896件 語別索引 17,251件 資源 113件 研究者 303名 JSON