論文 ·日本語 ·未確認

グラフ情報の記述を使ったCLIPの対照学習は画像エンコーダーのダイアグラム認識能力を向上させる

寺下 直行 戸崎 友輔 表 英輝 CONGKHA Nguyen 中本 陵介 是枝 祐太 尾崎 太亮

刊行年
2025
収録
『人工知能学会全国大会論文集』 JSAI2025(0) pp. 3Win534-3Win534
出版
一般社団法人 人工知能学会
言語
日本語
crid
1390586179694195968
issn
2758-7347
doi
10.11517/pjsai.jsai2025.0_3win534
ndl_bib
R000000016-I2014131765
URL
https://cir.nii.ac.jp/crid/1390586179694195968

要旨

<p>図表を含む文書を入力とするテキスト生成タスクには,テキストと画像の両方に基づく推論が可能なVisual language model(VLM)の活用が期待されている.特に産業応用のためには,技術文書に頻出するフローチャートや回路図など,線と図形を用いて構造や関係性を視覚化する図表(ダイアグラム)を正確に認識することが求められる.しかし、近年の研究は、VLMで広く用いられる画像エンコーダーがダイアグラムを正確に認識していない可能性を指摘している。本研究では、画像エンコーダーのエッジ認識能力獲得における学習データの寄与を実験的に評価した。具体的には、人工的に生成したダイアグラム画像と、Mermaid記法で記述したグラフ情報のテキストを用いた対照学習を実施した。その結果、エッジの有無や方向に関する画像エンコーダーの認識性能が複数の指標で向上することを確認し,VLMのダイアグラム認識能力におけるCLIPの学習データの寄与の一部を明らかにした.</p>

主題

この書誌の出所

  • cinii— 1390586179694195968(2026-08-12取得)
  • ndl— R000000016-I2014131765(2026-08-12取得)
  • ndl— R100000136-I1390586179694195968(2026-08-12取得)

引用キー: 寺下2025グラフ情報の記述を使

書誌 34,896件 語別索引 17,251件 資源 113件 研究者 303名 JSON