{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering-1/papers/14","list_of":"/task/visual-question-answering-1","task":"Visual Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":14,"pages_in_order":22,"rows_per_page":100,"rows":[1301,1400],"of":2177,"counts":{"archive_papers_tagged":2177,"with_a_code_link":1042,"where_syntology_ran_a_sample":378,"not_listed_spam_title":0,"listed":2177,"listed_where_code_ran":378,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":308,"every_run_a_failure_of_syntologys_instrument":70,"listed_with_a_run_with_no_instrument_failure":308,"listed_every_run_a_failure_of_syntologys_instrument":70,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering-1","prev":"/task/visual-question-answering-1/papers/13","next":"/task/visual-question-answering-1/papers/15","papers":[{"url":null,"slug":"interpretable-bilingual-multimodal-large","title":"Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks","date":"2024-10-24","arxiv_id":"2410.18387","repositories_listed":0,"syntology":null},{"url":null,"slug":"which-client-is-reliable-a-reliable-and","title":"Which Client is Reliable?: A Reliable and Personalized Prompt-based Federated Learning for Medical Image Question Answering","date":"2024-10-23","arxiv_id":"2410.17484","repositories_listed":0,"syntology":null},{"url":null,"slug":"order-matters-exploring-order-sensitivity-in","title":"Order Matters: Exploring Order Sensitivity in Multimodal Large Language Models","date":"2024-10-22","arxiv_id":"2410.16983","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-in-ophthalmology-a","title":"Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective","date":"2024-10-22","arxiv_id":"2410.16662","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-centric-temporal-consistency-via","title":"Object-Centric Temporal Consistency via Conditional Autoregressive Inductive Biases","date":"2024-10-21","arxiv_id":"2410.15728","repositories_listed":0,"syntology":null},{"url":null,"slug":"chitrojera-a-regionally-relevant-visual","title":"ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla","date":"2024-10-19","arxiv_id":"2410.14991","repositories_listed":0,"syntology":null},{"url":null,"slug":"llava-ultra-large-chinese-language-and-vision","title":"LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound","date":"2024-10-19","arxiv_id":"2410.15074","repositories_listed":0,"syntology":null},{"url":null,"slug":"e3d-gpt-enhanced-3d-visual-foundation-for","title":"E3D-GPT: Enhanced 3D Visual Foundation for Medical Vision-Language Model","date":"2024-10-18","arxiv_id":"2410.14200","repositories_listed":0,"syntology":null},{"url":null,"slug":"naturalbench-evaluating-vision-language","title":"NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples","date":"2024-10-18","arxiv_id":"2410.14669","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-action-localization-via-the","title":"Zero-shot Action Localization via the Confidence of Large Vision-Language Models","date":"2024-10-18","arxiv_id":"2410.14340","repositories_listed":0,"syntology":null},{"url":"/paper/g-mod-exploring-mixture-of-depth-adaptation","slug":"g-mod-exploring-mixture-of-depth-adaptation","title":"$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models","date":"2024-10-17","arxiv_id":"2410.13859","repositories_listed":0,"syntology":null},{"url":"/paper/h2ovl-mississippi-vision-language-models","slug":"h2ovl-mississippi-vision-language-models","title":"H2OVL-Mississippi Vision Language Models Technical Report","date":"2024-10-17","arxiv_id":"2410.13611","repositories_listed":0,"syntology":null},{"url":"/paper/improving-multi-modal-large-language-model","slug":"improving-multi-modal-large-language-model","title":"Improving Multi-modal Large Language Model through Boosting Vision Capabilities","date":"2024-10-17","arxiv_id":"2410.13733","repositories_listed":0,"syntology":null},{"url":null,"slug":"rescueadi-adaptive-disaster-interpretation-in","title":"RescueADI: Adaptive Disaster Interpretation in Remote Sensing Images with Autonomous Agents","date":"2024-10-17","arxiv_id":"2410.13384","repositories_listed":0,"syntology":null},{"url":"/paper/cross-modal-safety-mechanism-transfer-in","slug":"cross-modal-safety-mechanism-transfer-in","title":"Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models","date":"2024-10-16","arxiv_id":"2410.12662","repositories_listed":0,"syntology":null},{"url":null,"slug":"omcat-omni-context-aware-transformer","title":"OMCAT: Omni Context Aware Transformer","date":"2024-10-15","arxiv_id":"2410.12109","repositories_listed":0,"syntology":null},{"url":null,"slug":"eliminating-the-language-bias-for-visual","title":"Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention","date":"2024-10-14","arxiv_id":"2410.10184","repositories_listed":0,"syntology":null},{"url":"/paper/mmar-towards-lossless-multi-modal-auto","slug":"mmar-towards-lossless-multi-modal-auto","title":"MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling","date":"2024-10-14","arxiv_id":"2410.10798","repositories_listed":0,"syntology":null},{"url":"/paper/mmcomposition-revisiting-the-compositionality","slug":"mmcomposition-revisiting-the-compositionality","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","date":"2024-10-13","arxiv_id":"2410.09733","repositories_listed":0,"syntology":null},{"url":null,"slug":"surgical-llava-toward-surgical-scenario","title":"Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models","date":"2024-10-13","arxiv_id":"2410.09750","repositories_listed":0,"syntology":null},{"url":"/paper/vlfeedback-a-large-scale-ai-feedback-dataset","slug":"vlfeedback-a-large-scale-ai-feedback-dataset","title":"VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment","date":"2024-10-12","arxiv_id":"2410.09421","repositories_listed":0,"syntology":{"n":7,"n_ran":5,"n_constructed":0,"n_ran_checked":0,"n_instrument":5,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 5 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/vlfeedback-a-large-scale-ai-feedback-dataset#ran","syntology_url":"https://syntology.ai/paper/2410.09421","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2410.09421"}},"official":null}},{"url":null,"slug":"vit3d-alignment-of-llama3-3d-medical-image","title":"ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation","date":"2024-10-11","arxiv_id":"2410.08588","repositories_listed":0,"syntology":null},{"url":null,"slug":"emerging-pixel-grounding-in-large-multimodal","title":"Emerging Pixel Grounding in Large Multimodal Models Without Grounding Supervision","date":"2024-10-10","arxiv_id":"2410.08209","repositories_listed":0,"syntology":null},{"url":"/paper/mono-internvl-pushing-the-boundaries-of","slug":"mono-internvl-pushing-the-boundaries-of","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","date":"2024-10-10","arxiv_id":"2410.08202","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-replace-reduction-an-effective","title":"PAR: Prompt-Aware Token Reduction Method for Efficient Large Multimodal Models","date":"2024-10-09","arxiv_id":"2410.07278","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-captioning-task-specific-prompting-for","title":"Beyond Captioning: Task-Specific Prompting for Improved VLM Performance in Mathematical Reasoning","date":"2024-10-08","arxiv_id":"2410.05928","repositories_listed":0,"syntology":null},{"url":null,"slug":"mm-r-3-on-in-consistency-of-multi-modal-large","title":"MM-R$^3$: On (In-)Consistency of Multi-modal Large Language Models (MLLMs)","date":"2024-10-07","arxiv_id":"2410.04778","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlm2vec-training-vision-language-models-for","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","date":"2024-10-07","arxiv_id":"2410.05160","repositories_listed":0,"syntology":null},{"url":"/paper/gamified-crowd-sourcing-of-high-quality-data","slug":"gamified-crowd-sourcing-of-high-quality-data","title":"Gamified crowd-sourcing of high-quality data for visual fine-tuning","date":"2024-10-05","arxiv_id":"2410.04038","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdooring-vision-language-models-with-out","title":"Backdooring Vision-Language Models with Out-Of-Distribution Data","date":"2024-10-02","arxiv_id":"2410.01264","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-context-matters-in-vqa-and-reasoning","title":"Why context matters in VQA and Reasoning: Semantic interventions for VLM input modalities","date":"2024-10-02","arxiv_id":"2410.01690","repositories_listed":0,"syntology":null},{"url":null,"slug":"fmbench-benchmarking-fairness-in-multimodal","title":"FMBench: Benchmarking Fairness in Multimodal Large Language Models on Medical Tasks","date":"2024-10-01","arxiv_id":"2410.01089","repositories_listed":0,"syntology":null},{"url":"/paper/mm1-5-methods-analysis-insights-from","slug":"mm1-5-methods-analysis-insights-from","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","date":"2024-09-30","arxiv_id":"2409.20566","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-ct-gpt-generating-3d-radiology-reports","title":"3D-CT-GPT: Generating 3D Radiology Reports through Integration of Large Vision-Language Models","date":"2024-09-28","arxiv_id":"2409.19330","repositories_listed":0,"syntology":null},{"url":null,"slug":"trojvlm-backdoor-attack-against-vision","title":"TrojVLM: Backdoor Attack Against Vision Language Models","date":"2024-09-28","arxiv_id":"2409.19232","repositories_listed":0,"syntology":null},{"url":null,"slug":"charting-the-future-using-chart-question","title":"Charting the Future: Using Chart Question-Answering for Scalable Evaluation of LLM-Driven Data Visualizations","date":"2024-09-27","arxiv_id":"2409.18764","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-explainability-in-multimodal-large","title":"Enhancing Explainability in Multimodal Large Language Models Using Ontological Context","date":"2024-09-27","arxiv_id":"2409.18753","repositories_listed":0,"syntology":null},{"url":null,"slug":"dare-diverse-visual-question-answering-with","title":"DARE: Diverse Visual Question Answering with Robustness Evaluation","date":"2024-09-26","arxiv_id":"2409.18023","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-environmental-state-recognition-with","title":"Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization","date":"2024-09-26","arxiv_id":"2409.17519","repositories_listed":0,"syntology":null},{"url":null,"slug":"zalm3-zero-shot-enhancement-of-vision","title":"ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue","date":"2024-09-26","arxiv_id":"2409.17610","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-clip-count-stars-an-empirical-study-on","title":"Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP","date":"2024-09-23","arxiv_id":"2409.15035","repositories_listed":0,"syntology":null},{"url":null,"slug":"detect-describe-discriminate-moving-beyond","title":"Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation","date":"2024-09-23","arxiv_id":"2409.15125","repositories_listed":0,"syntology":null},{"url":null,"slug":"bench-benchmarking-vision-language-models-for","title":"@Bench: Benchmarking Vision-Language Models for Human-centered Assistive Technology","date":"2024-09-21","arxiv_id":"2409.14215","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-models-can-parse-floor-plan","title":"Vision Language Models Can Parse Floor Plan Maps","date":"2024-09-19","arxiv_id":"2409.12842","repositories_listed":0,"syntology":null},{"url":null,"slug":"oneencoder-a-lightweight-framework-for","title":"OneEncoder: A Lightweight Framework for Progressive Alignment of Modalities","date":"2024-09-17","arxiv_id":"2409.11059","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparks-of-artificial-general-intelligence-agi","title":"Sparks of Artificial General Intelligence(AGI) in Semiconductor Material Science: Early Explorations into the Next Frontier of Generative AI-Assisted Electron Micrograph Analysis","date":"2024-09-17","arxiv_id":"2409.12244","repositories_listed":0,"syntology":null},{"url":null,"slug":"explore-the-hallucination-on-low-level","title":"Explore the Hallucination on Low-level Perception for MLLMs","date":"2024-09-15","arxiv_id":"2409.09748","repositories_listed":0,"syntology":null},{"url":null,"slug":"nevlp-noise-robust-framework-for-efficient","title":"NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training","date":"2024-09-15","arxiv_id":"2409.09582","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-compress-contexts-for-efficient","title":"Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering","date":"2024-09-11","arxiv_id":"2409.07331","repositories_listed":0,"syntology":null},{"url":null,"slug":"securing-vision-language-models-with-a-robust","title":"Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks","date":"2024-09-11","arxiv_id":"2409.07353","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-hallucination-in-visual-language-1","title":"Mitigating Hallucination in Visual-Language Models via Re-Balancing Contrastive Decoding","date":"2024-09-10","arxiv_id":"2409.06485","repositories_listed":0,"syntology":null},{"url":null,"slug":"visscience-an-extensive-benchmark-for","title":"VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning","date":"2024-09-10","arxiv_id":"2409.13730","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-neural-network-scaling-laws-with","title":"Breaking Neural Network Scaling Laws with Modularity","date":"2024-09-09","arxiv_id":"2409.05780","repositories_listed":0,"syntology":null},{"url":"/paper/points-improving-your-vision-language-model","slug":"points-improving-your-vision-language-model","title":"POINTS: Improving Your Vision-language Model with Affordable Strategies","date":"2024-09-07","arxiv_id":"2409.04828","repositories_listed":0,"syntology":null},{"url":null,"slug":"occllama-an-occupancy-language-action","title":"OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving","date":"2024-09-05","arxiv_id":"2409.03272","repositories_listed":0,"syntology":null},{"url":null,"slug":"mosmos-multi-organ-segmentation-facilitated","title":"MOSMOS: Multi-organ segmentation facilitated by medical report supervision","date":"2024-09-04","arxiv_id":"2409.02418","repositories_listed":0,"syntology":null},{"url":null,"slug":"blocks-as-probes-dissecting-categorization","title":"Blocks as Probes: Dissecting Categorization Ability of Large Multimodal Models","date":"2024-09-03","arxiv_id":"2409.01560","repositories_listed":0,"syntology":null},{"url":null,"slug":"look-learn-and-leverage-l-3-mitigating-visual","title":"Look, Learn and Leverage (L$^3$): Mitigating Visual-Domain Shift and Discovering Intrinsic Relations via Symbolic Alignment","date":"2024-08-30","arxiv_id":"2408.17363","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-augmented-natural-language","title":"Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering","date":"2024-08-30","arxiv_id":"2408.17006","repositories_listed":0,"syntology":null},{"url":null,"slug":"m4cxr-exploring-multi-task-potentials-of","title":"M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation","date":"2024-08-29","arxiv_id":"2408.16213","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-sar-improve-rsvqa-performance","title":"Can SAR improve RSVQA performance?","date":"2024-08-28","arxiv_id":"2408.15642","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-visual-language-models-replace-ocr-based","title":"Can Visual Language Models Replace OCR-Based Visual Question Answering Pipelines in Production? A Case Study in Retail","date":"2024-08-28","arxiv_id":"2408.15626","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-instruction-tuning-small-scale","title":"Multi-Modal Instruction-Tuning Small-Scale Language-and-Vision Assistant for Semiconductor Electron Micrograph Analysis","date":"2024-08-27","arxiv_id":"2409.07463","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-visual-reasoning-by-vision-language","title":"Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis","date":"2024-08-27","arxiv_id":"2409.00106","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-human-level-understanding-of-complex","title":"Towards Human-Level Understanding of Complex Process Engineering Schematics: A Pedagogical, Introspective Multi-Agent Framework for Open-Domain Question Answering","date":"2024-08-24","arxiv_id":"2409.00082","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundational-model-for-electron-micrograph","title":"Foundational Model for Electron Micrograph Analysis: Instruction-Tuning Small-Scale Language-and-Vision Assistant for Enterprise Adoption","date":"2024-08-23","arxiv_id":"2408.13248","repositories_listed":0,"syntology":null},{"url":"/paper/maven-an-effective-multi-granularity-hybrid","slug":"maven-an-effective-multi-granularity-hybrid","title":"MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model","date":"2024-08-22","arxiv_id":"2408.12321","repositories_listed":0,"syntology":null},{"url":"/paper/sea-supervised-embedding-alignment-for-token","slug":"sea-supervised-embedding-alignment-for-token","title":"SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs","date":"2024-08-21","arxiv_id":"2408.11813","repositories_listed":0,"syntology":null},{"url":null,"slug":"swarm-intelligence-in-geo-localization-a","title":"Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework","date":"2024-08-21","arxiv_id":"2408.11312","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-the-hype-a-dispassionate-look-at","title":"Beyond the Hype: A dispassionate look at vision-language models in medical scenario","date":"2024-08-16","arxiv_id":"2408.08704","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-visual-question-answering-through-1","title":"Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion","date":"2024-08-14","arxiv_id":"2408.07303","repositories_listed":0,"syntology":null},{"url":"/paper/crome-cross-modal-adapters-for-efficient","slug":"crome-cross-modal-adapters-for-efficient","title":"CROME: Cross-Modal Adapters for Efficient Multimodal LLM","date":"2024-08-13","arxiv_id":"2408.06610","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-multi-modal-llm-evaluation","title":"Revisiting Multi-Modal LLM Evaluation","date":"2024-08-09","arxiv_id":"2408.05334","repositories_listed":0,"syntology":null},{"url":"/paper/img-diff-contrastive-data-synthesis-for","slug":"img-diff-contrastive-data-synthesis-for","title":"Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models","date":"2024-08-08","arxiv_id":"2408.04594","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimus-accelerating-large-scale-multi-modal","title":"Optimus: Accelerating Large-Scale Multi-Modal LLM Training by Bubble Exploitation","date":"2024-08-07","arxiv_id":"2408.03505","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01679","title":"MMPKUBase: A Comprehensive and High-quality Chinese Multi-modal Knowledge Graph","date":"2024-08-03","arxiv_id":"2408.01679","repositories_listed":0,"syntology":null},{"url":null,"slug":"2407-21368","title":"Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering","date":"2024-07-31","arxiv_id":"2407.21368","repositories_listed":0,"syntology":null},{"url":null,"slug":"simplellm4ad-an-end-to-end-vision-language","title":"SimpleLLM4AD: An End-to-End Vision-Language Model with Graph Visual Question Answering for Autonomous Driving","date":"2024-07-31","arxiv_id":"2407.21293","repositories_listed":0,"syntology":null},{"url":null,"slug":"pyramid-coder-hierarchical-code-generator-for","title":"Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering","date":"2024-07-30","arxiv_id":"2407.20563","repositories_listed":0,"syntology":null},{"url":null,"slug":"take-a-step-back-rethinking-the-two-stages-in","title":"Take A Step Back: Rethinking the Two Stages in Visual Reasoning","date":"2024-07-29","arxiv_id":"2407.19666","repositories_listed":0,"syntology":null},{"url":null,"slug":"voldoger-llm-assisted-datasets-for-domain","title":"VolDoGer: LLM-assisted Datasets for Domain Generalization in Vision-Language Tasks","date":"2024-07-29","arxiv_id":"2407.19795","repositories_listed":0,"syntology":null},{"url":null,"slug":"adacoder-adaptive-prompt-compression-for","title":"AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering","date":"2024-07-28","arxiv_id":"2407.19410","repositories_listed":0,"syntology":null},{"url":"/paper/vila-2-vila-augmented-vila","slug":"vila-2-vila-augmented-vila","title":"VILA$^2$: VILA Augmented VILA","date":"2024-07-24","arxiv_id":"2407.17453","repositories_listed":0,"syntology":null},{"url":null,"slug":"imperfect-vision-encoders-efficient-and","title":"Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models","date":"2024-07-23","arxiv_id":"2407.16526","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-effectiveness-of-object-centric","title":"Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models","date":"2024-07-22","arxiv_id":"2407.15589","repositories_listed":0,"syntology":null},{"url":null,"slug":"echosight-advancing-visual-language-models","title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge","date":"2024-07-17","arxiv_id":"2407.12735","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-reranking-for-knowledge-intensive","title":"Multimodal Reranking for Knowledge-Intensive Visual Question Answering","date":"2024-07-17","arxiv_id":"2407.12277","repositories_listed":0,"syntology":null},{"url":null,"slug":"tm-pathvqa-90000-textless-multilingual","title":"TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering","date":"2024-07-16","arxiv_id":"2407.11383","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-vision-language-models-for","title":"Benchmarking Vision Language Models for Cultural Understanding","date":"2024-07-15","arxiv_id":"2407.10920","repositories_listed":0,"syntology":null},{"url":null,"slug":"extracting-training-data-from-document-based","title":"Extracting Training Data from Document-Based VQA Models","date":"2024-07-11","arxiv_id":"2407.08707","repositories_listed":0,"syntology":null},{"url":null,"slug":"segmentation-guided-attention-for-visual","title":"Segmentation-guided Attention for Visual Question Answering from Remote Sensing Images","date":"2024-07-11","arxiv_id":"2407.08669","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-diff-exploiting-vqa-and-diffusion-for","title":"VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous Driving","date":"2024-07-09","arxiv_id":"2407.06516","repositories_listed":0,"syntology":null},{"url":"/paper/rethinking-visual-prompting-for-multimodal","slug":"rethinking-visual-prompting-for-multimodal","title":"Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge","date":"2024-07-05","arxiv_id":"2407.04681","repositories_listed":0,"syntology":null},{"url":null,"slug":"second-place-solution-of-wsdm2023-toloka","title":"Second Place Solution of WSDM2023 Toloka Visual Question Answering Challenge","date":"2024-07-05","arxiv_id":"2407.04255","repositories_listed":0,"syntology":null},{"url":null,"slug":"bacon-supercharge-your-vlm-with-bag-of","title":"BACON: Improving Clarity of Image Captions via Bag-of-Concept Graphs","date":"2024-07-03","arxiv_id":"2407.03314","repositories_listed":0,"syntology":null},{"url":null,"slug":"mindbench-a-comprehensive-benchmark-for-mind","title":"MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis","date":"2024-07-03","arxiv_id":"2407.02842","repositories_listed":0,"syntology":null},{"url":null,"slug":"certainly-uncertain-a-benchmark-and-metric","title":"Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness","date":"2024-07-02","arxiv_id":"2407.01942","repositories_listed":0,"syntology":null},{"url":null,"slug":"assistive-image-annotation-systems-with-deep","title":"Assistive Image Annotation Systems with Deep Learning and Natural Language Capabilities: A Review","date":"2024-06-28","arxiv_id":"2407.00252","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-knowledge-based-and-visual","title":"Disentangling Knowledge-based and Visual Reasoning by Question Decomposition in KB-VQA","date":"2024-06-27","arxiv_id":"2406.18839","repositories_listed":0,"syntology":null},{"url":null,"slug":"flowvqa-mapping-multimodal-logic-in-visual","title":"FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts","date":"2024-06-27","arxiv_id":"2406.19237","repositories_listed":0,"syntology":null}],"record_sha256":"6627ed93ed1676cc6ec416e95f96d414dc366509c69c90b9aca518a937cd0e7d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}