Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA | allainews.com

March 26, 2024, 4:47 a.m. | Li Zhuowan, Jasani Bhavan, Tang Peng, Ghadar Shabnam

cs.CV updates on arXiv.org arxiv.org

arXiv:2403.16385v1 Announce Type: new
Abstract: Understanding data visualizations like charts and plots requires reasoning about both visual elements and numerics. Although strong in extractive questions, current chart visual question answering (chart VQA) models suffer on complex reasoning questions. In this work, we address the lack of reasoning ability by data augmentation. We leverage Large Language Models (LLMs), which have shown to have strong reasoning ability, as an automatic data annotator that generates question-answer annotations for chart images. The key innovation …

abstract arxiv charts cs.cl cs.cv current data data visualizations generators llms plots question question answering questions reasoning step-by-step tools type understanding visual vqa work

More from arxiv.org / cs.CV updates on arXiv.org

Visual Environment Assessment for Safe Autonomous Quadrotor Landing 19 hours ago | arxiv.org

abstract aerial arxiv assessment +21

JPEG Quantized Coefficient Recovery via DCT Domain Spatial-Frequential Transformer 19 hours ago | arxiv.org

abstract arxiv compression cosine +14

Towards Unconstrained Audio Splicing Detection and Localization with Neural Networks 19 hours ago | arxiv.org

abstract arxiv audio audio editing +20

Explainable Light-Weight Deep Learning Pipeline for Improved Drought Stress Identification 19 hours ago | arxiv.org

abstract arxiv crops cs.cv +16

ValUES: A Framework for Systematic Validation of Uncertainty Estimation in Semantic Segmentation 19 hours ago | arxiv.org

arxiv cs.cv framework segmentation +5

A Simple Interpretable Transformer for Fine-Grained Image Classification and Analysis 19 hours ago | arxiv.org

analysis and analysis arxiv classification +7

Early Autism Diagnosis based on Path Signature and Siamese Unsupervised Feature Compressor 19 hours ago | arxiv.org

abstract arxiv autism children +17

Discovering Novel Actions from Open World Egocentric Videos with Object-Grounded Visual Commonsense Reasoning 19 hours ago | arxiv.org

abstract arxiv autonomy commonsense +15

Towards Diverse Binary Segmentation via A Simple yet General Gated Network 19 hours ago | arxiv.org

abstract arxiv basic binary +19

Founding AI Engineer, Agents

@ Occam AI | New York

View on ai-jobs.net

AI Engineer Intern, Agents

@ Occam AI | US

View on ai-jobs.net

AI Research Scientist

@ Vara | Berlin, Germany and Remote

View on ai-jobs.net

Data Architect

@ University of Texas at Austin | Austin, TX

View on ai-jobs.net

Data ETL Engineer

@ University of Texas at Austin | Austin, TX

View on ai-jobs.net

Alternance DATA/AI Engineer (H/F)

@ SQLI | Le Grand-Quevilly, France

View on ai-jobs.net