{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering/papers/13","list_of":"/task/visual-question-answering","task":"Visual Question Answering (VQA)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":13,"pages_in_order":22,"rows_per_page":100,"rows":[1201,1300],"of":2167,"counts":{"archive_papers_tagged":2167,"with_a_code_link":1039,"where_syntology_ran_a_sample":359,"not_listed_spam_title":0,"listed":2167,"listed_where_code_ran":359,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":287,"every_run_a_failure_of_syntologys_instrument":72,"listed_with_a_run_with_no_instrument_failure":287,"listed_every_run_a_failure_of_syntologys_instrument":72,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering","prev":"/task/visual-question-answering/papers/12","next":"/task/visual-question-answering/papers/14","papers":[{"url":null,"slug":"social-llava-enhancing-robot-navigation","title":"Social-LLaVA: Enhancing Robot Navigation through Human-Language Reasoning in Social Spaces","date":"2024-12-30","arxiv_id":"2501.09024","repositories_listed":0,"syntology":null},{"url":null,"slug":"esvqa-perceptual-quality-assessment-of","title":"ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos","date":"2024-12-29","arxiv_id":"2412.20423","repositories_listed":0,"syntology":null},{"url":null,"slug":"ergochat-a-visual-query-system-for-the","title":"ErgoChat: a Visual Query System for the Ergonomic Risk Assessment of Construction Workers","date":"2024-12-27","arxiv_id":"2412.19954","repositories_listed":0,"syntology":null},{"url":null,"slug":"not-all-views-are-created-equal-analyzing","title":"Not all Views are Created Equal: Analyzing Viewpoint Instabilities in Vision Foundation Models","date":"2024-12-27","arxiv_id":"2412.19920","repositories_listed":0,"syntology":null},{"url":null,"slug":"finevq-fine-grained-user-generated-content","title":"FineVQ: Fine-Grained User Generated Content Video Quality Assessment","date":"2024-12-26","arxiv_id":"2412.19238","repositories_listed":0,"syntology":null},{"url":null,"slug":"haur-human-annotation-understanding-and","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","date":"2024-12-24","arxiv_id":"2412.18327","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agents-based-on-large-language-models","title":"Multi-Agents Based on Large Language Models for Knowledge-based Visual Question Answering","date":"2024-12-24","arxiv_id":"2412.18351","repositories_listed":0,"syntology":null},{"url":null,"slug":"textmatch-enhancing-image-text-consistency","title":"TextMatch: Enhancing Image-Text Consistency Through Multimodal Optimization","date":"2024-12-24","arxiv_id":"2412.18185","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-lingual-text-rich-visual-comprehension","title":"Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective","date":"2024-12-23","arxiv_id":"2412.17787","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompting-large-language-models-with-1","title":"Prompting Large Language Models with Rationale Heuristics for Knowledge-based Visual Question Answering","date":"2024-12-22","arxiv_id":"2412.16936","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-multimodal-large-language","title":"Application of Multimodal Large Language Models in Autonomous Driving","date":"2024-12-21","arxiv_id":"2412.16410","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-robust-hyper-detailed-image-captioning","title":"Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage","date":"2024-12-20","arxiv_id":"2412.15484","repositories_listed":0,"syntology":null},{"url":null,"slug":"onlinevpo-align-video-diffusion-model-with","title":"OnlineVPO: Align Video Diffusion Model with Online Video-Centric Preference Optimization","date":"2024-12-19","arxiv_id":"2412.15159","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-makes-a-good-metric-evaluating-automatic","title":"What makes a good metric? Evaluating automatic metrics for text-to-image consistency","date":"2024-12-18","arxiv_id":"2412.13989","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-vision-language-interactions","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","date":"2024-12-14","arxiv_id":"2412.10758","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-state-space-memory-for-large-vision","title":"Selective State Space Memory for Large Vision-Language Models","date":"2024-12-13","arxiv_id":"2412.09875","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlr-bench-multilingual-benchmark-dataset-for","title":"VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation","date":"2024-12-13","arxiv_id":"2412.10151","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-we-generate-visual-programs-without","title":"Can We Generate Visual Programs Without Prompting LLMs?","date":"2024-12-11","arxiv_id":"2412.08564","repositories_listed":0,"syntology":null},{"url":null,"slug":"verb-mirage-unveiling-and-assessing-verb","title":"Verb Mirage: Unveiling and Assessing Verb Concept Hallucinations in Multimodal Large Language Models","date":"2024-12-06","arxiv_id":"2412.04939","repositories_listed":0,"syntology":null},{"url":null,"slug":"t2i-factualbench-benchmarking-the-factuality","title":"T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts","date":"2024-12-05","arxiv_id":"2412.04300","repositories_listed":0,"syntology":null},{"url":null,"slug":"advdreamer-unveils-are-vision-language-models","title":"AdvDreamer Unveils: Are Vision-Language Models Truly Ready for Real-World 3D Variations?","date":"2024-12-04","arxiv_id":"2412.03002","repositories_listed":0,"syntology":null},{"url":null,"slug":"cegi-measuring-the-trade-off-between","title":"CEGI: Measuring the trade-off between efficiency and carbon emissions for SLMs and VLMs","date":"2024-12-03","arxiv_id":"2412.02602","repositories_listed":0,"syntology":null},{"url":null,"slug":"wsi-llava-a-multimodal-large-language-model","title":"WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image","date":"2024-12-03","arxiv_id":"2412.02141","repositories_listed":0,"syntology":null},{"url":null,"slug":"perception-test-2024-challenge-summary-and-a","title":"Perception Test 2024: Challenge Summary and a Novel Hour-Long VideoQA Benchmark","date":"2024-11-29","arxiv_id":"2411.19941","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-attention-vectors-generative","title":"Sparse Attention Vectors: Generative Multimodal Model Features Are Discriminative Vision-Language Classifiers","date":"2024-11-28","arxiv_id":"2412.00142","repositories_listed":0,"syntology":null},{"url":null,"slug":"electrovizqa-how-well-do-multi-modal-llms","title":"ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?","date":"2024-11-27","arxiv_id":"2412.00102","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-language-understanding-and-inference","title":"Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey","date":"2024-11-26","arxiv_id":"2411.17558","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-progressive-curriculum-learning-for","title":"Task Progressive Curriculum Learning for Robust Visual Question Answering","date":"2024-11-26","arxiv_id":"2411.17292","repositories_listed":0,"syntology":null},{"url":null,"slug":"gemex-a-large-scale-groundable-and","title":"GEMeX: A Large-Scale, Groundable, and Explainable Medical VQA Benchmark for Chest X-ray Diagnosis","date":"2024-11-25","arxiv_id":"2411.16778","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-text-dataset-construction-from-multi-ai","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","date":"2024-11-25","arxiv_id":"2411.16201","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-instruction-following-capability-of","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","date":"2024-11-23","arxiv_id":"2411.15453","repositories_listed":0,"syntology":null},{"url":null,"slug":"rewind-understanding-long-videos-with","title":"ReWind: Understanding Long Videos with Instructed Learnable Memory","date":"2024-11-23","arxiv_id":"2411.15556","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-multimodal-models-for-ukrainian","title":"Benchmarking Multimodal Models for Ukrainian Language Understanding Across Academic and Cultural Domains","date":"2024-11-22","arxiv_id":"2411.14647","repositories_listed":0,"syntology":null},{"url":null,"slug":"mr-2-ag-multimodal-retrieval-reflection","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","date":"2024-11-22","arxiv_id":"2411.15041","repositories_listed":0,"syntology":null},{"url":null,"slug":"hints-of-prompt-enhancing-visual","title":"Hints of Prompt: Enhancing Visual Representation for Multimodal LLMs in Autonomous Driving","date":"2024-11-20","arxiv_id":"2411.13076","repositories_listed":0,"syntology":null},{"url":null,"slug":"lavida-drive-vision-text-interaction-vlm-for","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","date":"2024-11-20","arxiv_id":"2411.12980","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-reason-iteratively-and-parallelly","title":"Learning to Reason Iteratively and Parallelly for Complex Visual Reasoning Scenarios","date":"2024-11-20","arxiv_id":"2411.13754","repositories_listed":0,"syntology":null},{"url":null,"slug":"uni-mlip-unified-self-supervision-for-medical","title":"Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training","date":"2024-11-20","arxiv_id":"2411.15207","repositories_listed":0,"syntology":null},{"url":null,"slug":"med-2e3-a-2d-enhanced-3d-medical-multimodal","title":"Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model","date":"2024-11-19","arxiv_id":"2411.12783","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-survey-on-visual-question","title":"A Comprehensive Survey on Visual Question Answering Datasets and Algorithms","date":"2024-11-17","arxiv_id":"2411.11150","repositories_listed":0,"syntology":null},{"url":null,"slug":"f-3-ocus-federated-finetuning-of-vision","title":"F$^3$OCUS -- Federated Finetuning of Vision-Language Foundation Models with Optimal Client Layer Updating Strategy via Multi-objective Meta-Heuristics","date":"2024-11-17","arxiv_id":"2411.11912","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-augmented-multimodal-llms-for-surgical","title":"Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry","date":"2024-11-17","arxiv_id":"2411.10937","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-multimodal-llms-the-mechanistic","title":"Understanding Multimodal LLMs: the Mechanistic Interpretability of Llava in Visual Question Answering","date":"2024-11-17","arxiv_id":"2411.10950","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-based-evaluation","title":"Visual question answering based evaluation metrics for text-to-image generation","date":"2024-11-15","arxiv_id":"2411.10183","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-cognition-consistent-with-perception","title":"Is Cognition consistent with Perception? Assessing and Mitigating Multimodal Knowledge Conflicts in Document Understanding","date":"2024-11-12","arxiv_id":"2411.07722","repositories_listed":0,"syntology":null},{"url":"/paper/aligned-vector-quantization-for-edge-cloud","slug":"aligned-vector-quantization-for-edge-cloud","title":"Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models","date":"2024-11-08","arxiv_id":"2411.05961","repositories_listed":0,"syntology":null},{"url":null,"slug":"neurips-2023-competition-privacy-preserving","title":"NeurIPS 2023 Competition: Privacy Preserving Federated Learning Document VQA","date":"2024-11-06","arxiv_id":"2411.03730","repositories_listed":0,"syntology":null},{"url":null,"slug":"select2plan-training-free-icl-based-planning","title":"Select2Plan: Training-Free ICL-Based Planning through VQA and Memory Retrieval","date":"2024-11-06","arxiv_id":"2411.04006","repositories_listed":0,"syntology":null},{"url":null,"slug":"mme-finance-a-multimodal-finance-benchmark","title":"MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning","date":"2024-11-05","arxiv_id":"2411.03314","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-commonsense-knowledge-distillation","title":"Multimodal Commonsense Knowledge Distillation for Visual Question Answering","date":"2024-11-05","arxiv_id":"2411.02722","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-vlm-to-keep-it-learning-generation-and","title":"One VLM to Keep it Learning: Generation and Balancing for Data-free Continual Visual Question Answering","date":"2024-11-04","arxiv_id":"2411.02210","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-visual-question-answering-method-for-sar","title":"A Visual Question Answering Method for SAR Ship: Breaking the Requirement for Multimodal Dataset Construction and Model Fine-Tuning","date":"2024-11-03","arxiv_id":"2411.01445","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-semantic-communication-for-1","title":"Goal-Oriented Semantic Communication for Wireless Visual Question Answering","date":"2024-11-03","arxiv_id":"2411.02452","repositories_listed":0,"syntology":null},{"url":null,"slug":"aggregate-and-adapt-natural-language-prompts","title":"Aggregate-and-Adapt Natural Language Prompts for Downstream Generalization of CLIP","date":"2024-10-31","arxiv_id":"2410.23698","repositories_listed":0,"syntology":null},{"url":null,"slug":"simpsonsvqa-enhancing-inquiry-based-learning","title":"SimpsonsVQA: Enhancing Inquiry-Based Learning with a Tailored Dataset","date":"2024-10-30","arxiv_id":"2410.22648","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-overlap-is-responsible-for-the","title":"Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!","date":"2024-10-28","arxiv_id":"2410.20972","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-bilinear-attention-based-fusion-for","title":"Efficient Bilinear Attention-based Fusion for Medical Visual Question Answering","date":"2024-10-28","arxiv_id":"2410.21000","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-in-visual-reasoning","title":"Improving Generalization in Visual Reasoning via Self-Ensemble","date":"2024-10-28","arxiv_id":"2410.20883","repositories_listed":0,"syntology":null},{"url":null,"slug":"r-llava-improving-med-vqa-understanding","title":"R-LLaVA: Improving Med-VQA Understanding through Visual Region of Interest","date":"2024-10-27","arxiv_id":"2410.20327","repositories_listed":0,"syntology":null},{"url":"/paper/gpt-4o-system-card","slug":"gpt-4o-system-card","title":"GPT-4o System Card","date":"2024-10-25","arxiv_id":"2410.21276","repositories_listed":0,"syntology":null},{"url":null,"slug":"which-client-is-reliable-a-reliable-and","title":"Which Client is Reliable?: A Reliable and Personalized Prompt-based Federated Learning for Medical Image Question Answering","date":"2024-10-23","arxiv_id":"2410.17484","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-in-ophthalmology-a","title":"Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective","date":"2024-10-22","arxiv_id":"2410.16662","repositories_listed":0,"syntology":null},{"url":null,"slug":"chitrojera-a-regionally-relevant-visual","title":"ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla","date":"2024-10-19","arxiv_id":"2410.14991","repositories_listed":0,"syntology":null},{"url":null,"slug":"llava-ultra-large-chinese-language-and-vision","title":"LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound","date":"2024-10-19","arxiv_id":"2410.15074","repositories_listed":0,"syntology":null},{"url":null,"slug":"naturalbench-evaluating-vision-language","title":"NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples","date":"2024-10-18","arxiv_id":"2410.14669","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-image-and-video-resolution-prediction","title":"Latent Image and Video Resolution Prediction using Convolutional Neural Networks","date":"2024-10-17","arxiv_id":"2410.13227","repositories_listed":0,"syntology":null},{"url":null,"slug":"rescueadi-adaptive-disaster-interpretation-in","title":"RescueADI: Adaptive Disaster Interpretation in Remote Sensing Images with Autonomous Agents","date":"2024-10-17","arxiv_id":"2410.13384","repositories_listed":0,"syntology":null},{"url":null,"slug":"slidechat-a-large-vision-language-assistant","title":"SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image Understanding","date":"2024-10-15","arxiv_id":"2410.11761","repositories_listed":0,"syntology":null},{"url":null,"slug":"eliminating-the-language-bias-for-visual","title":"Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention","date":"2024-10-14","arxiv_id":"2410.10184","repositories_listed":0,"syntology":null},{"url":null,"slug":"quality-prediction-of-ai-generated-images-and","title":"Quality Prediction of AI Generated Images and Videos: Emerging Trends and Opportunities","date":"2024-10-11","arxiv_id":"2410.08534","repositories_listed":0,"syntology":null},{"url":null,"slug":"vit3d-alignment-of-llama3-3d-medical-image","title":"ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation","date":"2024-10-11","arxiv_id":"2410.08588","repositories_listed":0,"syntology":null},{"url":null,"slug":"secure-video-quality-assessment-resisting","title":"Secure Video Quality Assessment Resisting Adversarial Attacks","date":"2024-10-09","arxiv_id":"2410.06866","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-captioning-task-specific-prompting-for","title":"Beyond Captioning: Task-Specific Prompting for Improved VLM Performance in Mathematical Reasoning","date":"2024-10-08","arxiv_id":"2410.05928","repositories_listed":0,"syntology":null},{"url":null,"slug":"logra-med-long-context-multi-graph-alignment","title":"LoGra-Med: Long Context Multi-Graph Alignment for Medical Vision-Language Model","date":"2024-10-03","arxiv_id":"2410.02615","repositories_listed":0,"syntology":null},{"url":"/paper/video-instruction-tuning-with-synthetic-data","slug":"video-instruction-tuning-with-synthetic-data","title":"Video Instruction Tuning With Synthetic Data","date":"2024-10-03","arxiv_id":"2410.02713","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdooring-vision-language-models-with-out","title":"Backdooring Vision-Language Models with Out-Of-Distribution Data","date":"2024-10-02","arxiv_id":"2410.01264","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-context-matters-in-vqa-and-reasoning","title":"Why context matters in VQA and Reasoning: Semantic interventions for VLM input modalities","date":"2024-10-02","arxiv_id":"2410.01690","repositories_listed":0,"syntology":null},{"url":null,"slug":"fmbench-benchmarking-fairness-in-multimodal","title":"FMBench: Benchmarking Fairness in Multimodal Large Language Models on Medical Tasks","date":"2024-10-01","arxiv_id":"2410.01089","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-ct-gpt-generating-3d-radiology-reports","title":"3D-CT-GPT: Generating 3D Radiology Reports through Integration of Large Vision-Language Models","date":"2024-09-28","arxiv_id":"2409.19330","repositories_listed":0,"syntology":null},{"url":null,"slug":"trojvlm-backdoor-attack-against-vision","title":"TrojVLM: Backdoor Attack Against Vision Language Models","date":"2024-09-28","arxiv_id":"2409.19232","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-decomposition-on-multimodal","title":"Visual Question Decomposition on Multimodal Large Language Models","date":"2024-09-28","arxiv_id":"2409.19339","repositories_listed":0,"syntology":null},{"url":null,"slug":"charting-the-future-using-chart-question","title":"Charting the Future: Using Chart Question-Answering for Scalable Evaluation of LLM-Driven Data Visualizations","date":"2024-09-27","arxiv_id":"2409.18764","repositories_listed":0,"syntology":null},{"url":null,"slug":"dare-diverse-visual-question-answering-with","title":"DARE: Diverse Visual Question Answering with Robustness Evaluation","date":"2024-09-26","arxiv_id":"2409.18023","repositories_listed":0,"syntology":null},{"url":null,"slug":"zalm3-zero-shot-enhancement-of-vision","title":"ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue","date":"2024-09-26","arxiv_id":"2409.17610","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-video-quality-assessment-for-aigc","title":"Advancing Video Quality Assessment for AIGC","date":"2024-09-23","arxiv_id":"2409.14888","repositories_listed":0,"syntology":null},{"url":null,"slug":"detect-describe-discriminate-moving-beyond","title":"Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation","date":"2024-09-23","arxiv_id":"2409.15125","repositories_listed":0,"syntology":null},{"url":null,"slug":"bench-benchmarking-vision-language-models-for","title":"@Bench: Benchmarking Vision-Language Models for Human-centered Assistive Technology","date":"2024-09-21","arxiv_id":"2409.14215","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparks-of-artificial-general-intelligence-agi","title":"Sparks of Artificial General Intelligence(AGI) in Semiconductor Material Science: Early Explorations into the Next Frontier of Generative AI-Assisted Electron Micrograph Analysis","date":"2024-09-17","arxiv_id":"2409.12244","repositories_listed":0,"syntology":null},{"url":null,"slug":"qtg-vqa-question-type-guided-architectural","title":"QTG-VQA: Question-Type-Guided Architectural for VideoQA Systems","date":"2024-09-14","arxiv_id":"2409.09348","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-compress-contexts-for-efficient","title":"Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering","date":"2024-09-11","arxiv_id":"2409.07331","repositories_listed":0,"syntology":null},{"url":null,"slug":"look-learn-and-leverage-l-3-mitigating-visual","title":"Look, Learn and Leverage (L$^3$): Mitigating Visual-Domain Shift and Discovering Intrinsic Relations via Symbolic Alignment","date":"2024-08-30","arxiv_id":"2408.17363","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-augmented-natural-language","title":"Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering","date":"2024-08-30","arxiv_id":"2408.17006","repositories_listed":0,"syntology":null},{"url":null,"slug":"m4cxr-exploring-multi-task-potentials-of","title":"M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation","date":"2024-08-29","arxiv_id":"2408.16213","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-sar-improve-rsvqa-performance","title":"Can SAR improve RSVQA performance?","date":"2024-08-28","arxiv_id":"2408.15642","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-visual-language-models-replace-ocr-based","title":"Can Visual Language Models Replace OCR-Based Visual Question Answering Pipelines in Production? A Case Study in Retail","date":"2024-08-28","arxiv_id":"2408.15626","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-instruction-tuning-small-scale","title":"Multi-Modal Instruction-Tuning Small-Scale Language-and-Vision Assistant for Semiconductor Electron Micrograph Analysis","date":"2024-08-27","arxiv_id":"2409.07463","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-visual-reasoning-by-vision-language","title":"Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis","date":"2024-08-27","arxiv_id":"2409.00106","repositories_listed":0,"syntology":null},{"url":null,"slug":"lmm-vqa-advancing-video-quality-assessment","title":"LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models","date":"2024-08-26","arxiv_id":"2408.14008","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-human-level-understanding-of-complex","title":"Towards Human-Level Understanding of Complex Process Engineering Schematics: A Pedagogical, Introspective Multi-Agent Framework for Open-Domain Question Answering","date":"2024-08-24","arxiv_id":"2409.00082","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundational-model-for-electron-micrograph","title":"Foundational Model for Electron Micrograph Analysis: Instruction-Tuning Small-Scale Language-and-Vision Assistant for Enterprise Adoption","date":"2024-08-23","arxiv_id":"2408.13248","repositories_listed":0,"syntology":null}],"record_sha256":"27b9c75783e8d3c61c1fb1171dc74bfffe3ce46cdb87472fa5c2fc9a428669b8","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}