論文 ·日本語 ·未確認
KWIC System on WEB Documents
Satoshi Sekine ・ Yoshiyuki Takeda ・ Kenji Yoshihira
- 刊行年
- 2005-01-01
- 収録
- 『Journal of Natural Language Processing』 12(4) pp. 245-252
- 言語
- 英語
- openalex
- W2328635657
- doi
- 10.5715/jnlp.12.4_245
- mag
- 2328635657
- issn
- 1340-7619
- URL
- https://www.jstage.jst.go.jp/article/jnlp1994/12/4/12_4_245/_pdf
要旨
言葉を調べる際に有用なKWICシステムをWEBの膨大なテキストを対象に作成した.データは約350GバイトのWEBページにある約100億文字以上の日本語データをクローラーで2ヶ月かけて収集した.テキストの分量は32ビットで表される4Gバイトを超えており, 40ビット長インデックスに対応したサフィックスアレーを用いた高速な検索を実現している.例として, 「と痛む」のKWICリストを集め, その直前に現れるオノマトペを分析し, 日本語学習者に対して有用であることを示した.
主題
この書誌の出所
- openalex— W2328635657(2026-08-13取得)
引用キー: Sekine2005KWICSystemWEB