論文 ·日本語 ·未確認

超大規模データによる構文研究手法の研究

近藤 泰弘 近藤, 泰弘, 1955-

刊行年
1996-1998
言語
日本語
crid
1040282256648835712
kaken
08451093
jgn
JP08451093
uri
https://kaken.nii.ac.jp/grant/KAKENHI-PROJECT-08451093/
kakenhino
08451093
ndl_bib
000007011396
URL
https://cir.nii.ac.jp/crid/1040282256648835712

要旨

研究に必要なデータの処理のための環境としてUNIXワークステーションを用意し、開発環境の設定を行った。開発環境のテストはいくつかの処理系を用いて行ったが、最終的にはBSD UNIXを用いて今後の研究を行うことに決定した。またデータ処理言語としては、Perl言語を採用することを決定した。 次に、データとしては、主に市販されている新聞記事CDROMを用い、これらから10億語程度のデータを収集し、今回の研究で開発したKWICプログラムを用いた。またこれらのデータ処理によって文型のデータベースを作成し、必要な文法情報を収集した。 以上の中から得たデータを用いて、日本語の記述文法に必要な情報を重点的に集めて、いくつかの文法記述をテストケースとして行った。具体的には、現代日本語の名詞節、および指示詞の用法を研究し、それぞれを古典語と対比する形での文法記述として論文化し、公刊した。そのうちの一部より報告書を作成した。 また、以上の成果の公表のために、インターネット上にWWWサーバーを構築し、研究成果を公開する態勢を整えた。サーバーのURLは次の通りである。 http://klab.ri.aoyama.ac.jp 現在、このURLを通して、研究成果のうち、KWICプログラム、データの文字種類整列プログラムなどを公開しており、さらに今後公開の範囲を広げる予定である。

主題

この書誌の出所

  • cinii— 1040282256648835712(2026-08-13取得)
  • ndl— 000007011396(2026-08-13取得)

引用キー: 近藤超大規模デタによる構

書誌 56,535件 語別索引 17,251件 資源 113件 研究者 303名 JSON