論文 ·日本語 ·未確認
統計的手法に基づく多言語形態素解析
- crid
- 1040282256545238016
- kaken
- 01J02558
- jgn
- JP01J02558
- uri
- https://kaken.nii.ac.jp/grant/KAKENHI-PROJECT-01J02558/
- URL
- https://cir.nii.ac.jp/crid/1040282256545238016
要旨
昨年から引き続き、形態素解析器、固有表現抽出器、未知語抽出器を開発している。今年は、他機関で開発されている多言語間質問応答システムに、本研究で開発した形態素解析器および固有表現抽出器を組み込み、実用上での有効性を検証した。基礎技術を応用システムに導入する良い機会となった。 昨年までの未知語抽出器は、抽出された未知語の品詞情報を推定することができなかった。今年は大量のラベルなしのデータと少量のラベルつきのデータを用いて、品詞情報を推定する手法を研究した。これにより、形態素解析器辞書整備の半自動化が可能となった。 多言語化に向けて、中国語(簡体字および繁体字)の形態素解析の問題に取り組み、日本語と同様な手法で、固有表現抽出および未知語抽出器を構成した。また、SIGHAN Workshopという国際会議において、中国語の分かち書きに関するコンテストが開かれたが、我々も作成したシステムを参加させ、中程度の順位に食い込むことができた。これは、日本語で我々が提案した手法が中国語においても応用可能であることの証明となった。 コーパス検索システムについては、Windowsでも動くシステムを開発した。これにより、unix環境に不得手な文科系研究者も、大量のテキストデータを検索できるようになると考えている。
主題
この書誌の出所
- cinii— 1040282256545238016(2026-08-13取得)
引用キー: 浅原統計的手法に基づく多