{"url":"/task/medical-visual-question-answering","name":"Medical Visual Question Answering","slug":"medical-visual-question-answering","description_markdown":null,"categories":[],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":97,"papers_with_code":47,"benchmarks":0,"benchmark_tables_in_archive":0,"benchmark_tables_shown":0,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":11,"subtasks":0,"parent_tasks":0},"benchmarks":[],"datasets":[{"url":"/dataset/vqa-rad","name":"VQA-RAD","full_name":"Visual Question Answering in Radiology","num_papers_in_archive":145},{"url":"/dataset/pathvqa","name":"PathVQA","full_name":"","num_papers_in_archive":89},{"url":"/dataset/slake","name":"SLAKE","full_name":"","num_papers_in_archive":63},{"url":"/dataset/pmc-vqa","name":"PMC-VQA","full_name":"","num_papers_in_archive":55},{"url":"/dataset/quilt-1m","name":"QUILT-1M","full_name":"","num_papers_in_archive":17},{"url":"/dataset/vqa-slake","name":"SLAKE-English","full_name":"","num_papers_in_archive":7},{"url":"/dataset/ovqa","name":"OVQA","full_name":"","num_papers_in_archive":4},{"url":"/dataset/kvasir-vqa","name":"Kvasir-VQA","full_name":"A Text-Image Pair GI Tract Dataset","num_papers_in_archive":3},{"url":"/dataset/mediconfusion","name":"MediConfusion","full_name":"","num_papers_in_archive":1},{"url":"/dataset/medpromptx-vqa","name":"MedPromptX-VQA","full_name":"","num_papers_in_archive":1},{"url":"/dataset/medtrinity-25m","name":"MedTrinity-25M","full_name":"","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":47,"tagged_in_all":97,"items":[{"url":"/paper/blip-2-bootstrapping-language-image-pre","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","date":"2023-01-30","arxiv_id":"2301.12597","repositories_listed":17,"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/large-scale-domain-specific-pretraining-for","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","date":"2023-03-02","arxiv_id":"2303.00915","repositories_listed":5,"syntology":null},{"url":"/paper/flamingo-a-visual-language-model-for-few-shot-1","title":"Flamingo: a Visual Language Model for Few-Shot Learning","date":"2022-04-29","arxiv_id":"2204.14198","repositories_listed":5,"syntology":{"n":24,"n_ran":18,"n_unverified":6,"n_pointer_only":7}},{"url":"/paper/pathvqa-30000-questions-for-medical-visual","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","date":"2020-03-07","arxiv_id":"2003.10286","repositories_listed":5,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":4}},{"url":"/paper/med-flamingo-a-multimodal-medical-few-shot","title":"Med-Flamingo: a Multimodal Medical Few-shot Learner","date":"2023-07-27","arxiv_id":"2307.15189","repositories_listed":4,"syntology":null},{"url":"/paper/ehrxqa-a-multi-modal-question-answering-1","title":"EHRXQA: A Multi-Modal Question Answering Dataset for Electronic Health Records with Chest X-ray Images","date":"2023-10-28","arxiv_id":"2310.18652","repositories_listed":3,"syntology":{"n":20,"n_ran":12,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/mediconfusion-can-you-trust-your-ai","title":"MediConfusion: Can you trust your AI radiologist? Probing the reliability of multimodal medical foundation models","date":"2024-09-23","arxiv_id":"2409.15477","repositories_listed":2,"syntology":{"n":28,"n_ran":12,"n_unverified":16,"n_pointer_only":28}},{"url":"/paper/pmc-vqa-visual-instruction-tuning-for-medical","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","date":"2023-05-17","arxiv_id":"2305.10415","repositories_listed":2,"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/pmc-clip-contrastive-language-image-pre","title":"PMC-CLIP: Contrastive Language-Image Pre-training using Biomedical Documents","date":"2023-03-13","arxiv_id":"2303.07240","repositories_listed":2,"syntology":{"n":13,"n_ran":6,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/self-supervised-vision-language-pretraining","title":"Self-supervised vision-language pretraining for Medical visual question answering","date":"2022-11-24","arxiv_id":"2211.13594","repositories_listed":2,"syntology":{"n":10,"n_ran":6,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/multiple-meta-model-quantifying-for-medical","title":"Multiple Meta-model Quantifying for Medical Visual Question Answering","date":"2021-05-19","arxiv_id":"2105.08913","repositories_listed":2,"syntology":{"n":11,"n_ran":4,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/slake-a-semantically-labeled-knowledge","title":"SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering","date":"2021-02-18","arxiv_id":"2102.09542","repositories_listed":2,"syntology":null},{"url":"/paper/overcoming-data-limitation-in-medical-visual","title":"Overcoming Data Limitation in Medical Visual Question Answering","date":"2019-09-26","arxiv_id":"1909.11867","repositories_listed":2,"syntology":null},{"url":"/paper/medagentboard-benchmarking-multi-agent","title":"MedAgentBoard: Benchmarking Multi-Agent Collaboration with Conventional Methods for Diverse Medical Tasks","date":"2025-05-18","arxiv_id":"2505.12371","repositories_listed":1,"syntology":{"n":16,"n_ran":1,"n_unverified":15,"n_pointer_only":0}},{"url":"/paper/clinkd-cross-modal-clinical-knowledge","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","date":"2025-02-09","arxiv_id":"2502.05928","repositories_listed":1,"syntology":null},{"url":"/paper/medcot-medical-chain-of-thought-via","title":"MedCoT: Medical Chain of Thought via Hierarchical Expert","date":"2024-12-18","arxiv_id":"2412.13736","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/bimedix2-bio-medical-expert-lmm-for-diverse","title":"BiMediX2: Bio-Medical EXpert LMM for Diverse Medical Modalities","date":"2024-12-10","arxiv_id":"2412.07769","repositories_listed":1,"syntology":null},{"url":"/paper/a-survey-of-medical-vision-and-language","title":"A Survey of Medical Vision-and-Language Applications and Their Techniques","date":"2024-11-19","arxiv_id":"2411.12195","repositories_listed":1,"syntology":null},{"url":"/paper/mc-cot-a-modular-collaborative-cot-framework","title":"MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration","date":"2024-10-06","arxiv_id":"2410.04521","repositories_listed":1,"syntology":{"n":15,"n_ran":15,"n_unverified":0,"n_pointer_only":15}},{"url":"/paper/kvasir-vqa-a-text-image-pair-gi-tract-dataset","title":"Kvasir-VQA: A Text-Image Pair GI Tract Dataset","date":"2024-09-02","arxiv_id":"2409.01437","repositories_listed":1,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":3}},{"url":"/paper/fedmeki-a-benchmark-for-scaling-medical","title":"FEDMEKI: A Benchmark for Scaling Medical Foundation Models via Federated Knowledge Injection","date":"2024-08-17","arxiv_id":"2408.09227","repositories_listed":1,"syntology":{"n":8,"n_ran":8,"n_unverified":0,"n_pointer_only":8}},{"url":"/paper/med-pmc-medical-personalized-multi-modal","title":"Med-PMC: Medical Personalized Multi-modal Consultation with a Proactive Ask-First-Observe-Next Paradigm","date":"2024-08-16","arxiv_id":"2408.08693","repositories_listed":1,"syntology":{"n":8,"n_ran":8,"n_unverified":0,"n_pointer_only":8}},{"url":"/paper/surgical-vqla-adversarial-contrastive","title":"Surgical-VQLA++: Adversarial Contrastive Learning for Calibrated Robust Visual Question-Localized Answering in Robotic Surgery","date":"2024-08-09","arxiv_id":"2408.04958","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/2408-02900","title":"MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine","date":"2024-08-06","arxiv_id":"2408.02900","repositories_listed":1,"syntology":{"n":8,"n_ran":8,"n_unverified":0,"n_pointer_only":8}},{"url":"/paper/2408-03043","title":"Targeted Visual Prompting for Medical Visual Question Answering","date":"2024-08-06","arxiv_id":"2408.03043","repositories_listed":1,"syntology":null},{"url":"/paper/stllava-med-self-training-large-language-and","title":"STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering","date":"2024-06-28","arxiv_id":"2406.19973","repositories_listed":1,"syntology":{"n":19,"n_ran":9,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/worse-than-random-an-embarrassingly-simple","title":"Worse than Random? An Embarrassingly Simple Probing Evaluation of Large Multimodal Models in Medical VQA","date":"2024-05-30","arxiv_id":"2405.20421","repositories_listed":1,"syntology":null},{"url":"/paper/lapa-latent-prompt-assist-model-for-medical","title":"LaPA: Latent Prompt Assist Model For Medical Visual Question Answering","date":"2024-04-19","arxiv_id":"2404.13039","repositories_listed":1,"syntology":{"n":7,"n_ran":3,"n_unverified":4,"n_pointer_only":7}},{"url":"/paper/medpromptx-grounded-multimodal-prompting-for","title":"MedPromptX: Grounded Multimodal Prompting for Chest X-ray Diagnosis","date":"2024-03-22","arxiv_id":"2403.15585","repositories_listed":1,"syntology":null},{"url":"/paper/omnimedvqa-a-new-large-scale-comprehensive","title":"OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM","date":"2024-02-14","arxiv_id":"2402.09181","repositories_listed":1,"syntology":{"n":8,"n_ran":7,"n_unverified":1,"n_pointer_only":8}}],"syntology_records":20,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}