論文 ·日本語 ·未確認
グラフ情報の記述を使ったCLIPの対照学習は画像エンコーダーのダイアグラム認識能力を向上させる
寺下 直行 ・ 戸崎 友輔 ・ 表 英輝 ・ CONGKHA Nguyen ・ 中本 陵介 ・ 是枝 祐太 ・ 尾崎 太亮
- 刊行年
- 2025
- 収録
- 『人工知能学会全国大会論文集』 JSAI2025(0) pp. 3Win534-3Win534
- 出版
- 一般社団法人 人工知能学会
- 言語
- 日本語
- crid
- 1390586179694195968
- issn
- 2758-7347
- doi
- 10.11517/pjsai.jsai2025.0_3win534
- ndl_bib
- R000000016-I2014131765
- URL
- https://cir.nii.ac.jp/crid/1390586179694195968
要旨
<p>図表を含む文書を入力とするテキスト生成タスクには,テキストと画像の両方に基づく推論が可能なVisual language model(VLM)の活用が期待されている.特に産業応用のためには,技術文書に頻出するフローチャートや回路図など,線と図形を用いて構造や関係性を視覚化する図表(ダイアグラム)を正確に認識することが求められる.しかし、近年の研究は、VLMで広く用いられる画像エンコーダーがダイアグラムを正確に認識していない可能性を指摘している。本研究では、画像エンコーダーのエッジ認識能力獲得における学習データの寄与を実験的に評価した。具体的には、人工的に生成したダイアグラム画像と、Mermaid記法で記述したグラフ情報のテキストを用いた対照学習を実施した。その結果、エッジの有無や方向に関する画像エンコーダーの認識性能が複数の指標で向上することを確認し,VLMのダイアグラム認識能力におけるCLIPの学習データの寄与の一部を明らかにした.</p>
主題
この書誌の出所
- cinii— 1390586179694195968(2026-08-12取得)
- ndl— R000000016-I2014131765(2026-08-12取得)
- ndl— R100000136-I1390586179694195968(2026-08-12取得)
引用キー: 寺下2025グラフ情報の記述を使