論文 ·日本語 ·未確認

〈共同研究プロジェクト紹介〉萌芽・発掘型 : 統計と機械学習による日本語史研究 歴史的日本語資料のアノテーションと自動濁点付与

小木曽 智信 OGISO Toshinobu

刊行年
2013-10
収録
『国語研プロジェクトレビュー』 4(2) pp. 144-150
出版
国立国語研究所
crid
1390853649698032128
naid
http://ci.nii.ac.jp/naid/KJ00008708727
uri
https://repository.ninjal.ac.jp/records/752
ndl_bib_id
025943484
issn
2185-0100
doi
10.15084/00000743
URL
https://cir.nii.ac.jp/crid/1390853649698032128

要旨

通時コーパスの構築に必要とされる歴史的日本語資料のアノテーションの全体について俯瞰した上で,アノテーション作業の自動化の試みの一つとして濁点の自動付与に関する研究成果を紹介する。歴史的資料では,濁点が十分に付与されていないものが少なくないが,そのままでは読みにくく検索や形態素解析にとって不都合である。そこで統計的機械学習に基づく自動濁点付与の手法を開発し,適合率約96%,再現率約98%での濁点付与を可能にした。これにより通時コーパス構築の作業負担の軽減が期待できる。最後に,今後の歴史コーパスに期待される高度なアノテーションについて展望する。

この書誌の出所

  • cinii— 1390853649698032128(2026-08-13取得)

引用キー: 小木曽2013〈共同研究プロジェク

書誌 56,535件 語別索引 17,251件 資源 113件 研究者 303名 JSON