論文 ·日本語 ·未確認

KWIC System on WEB Documents

Satoshi Sekine Yoshiyuki Takeda Kenji Yoshihira

刊行年
2005-01-01
収録
『Journal of Natural Language Processing』 12(4) pp. 245-252
言語
英語
openalex
W2328635657
doi
10.5715/jnlp.12.4_245
mag
2328635657
issn
1340-7619
URL
https://www.jstage.jst.go.jp/article/jnlp1994/12/4/12_4_245/_pdf

要旨

言葉を調べる際に有用なKWICシステムをWEBの膨大なテキストを対象に作成した.データは約350GバイトのWEBページにある約100億文字以上の日本語データをクローラーで2ヶ月かけて収集した.テキストの分量は32ビットで表される4Gバイトを超えており, 40ビット長インデックスに対応したサフィックスアレーを用いた高速な検索を実現している.例として, 「と痛む」のKWICリストを集め, その直前に現れるオノマトペを分析し, 日本語学習者に対して有用であることを示した.

主題

この書誌の出所

  • openalex— W2328635657(2026-08-13取得)

引用キー: Sekine2005KWICSystemWEB

書誌 56,535件 語別索引 17,251件 資源 113件 研究者 303名 JSON