{"url":"/dataset/pmc-vqa","name":"PMC-VQA","full_name":null,"description_markdown":"**PMC-VQA** is a large-scale medical visual question-answering dataset that contains 227k VQA pairs of 149k images that cover various modalities or diseases. The question-answer pairs are generated from PMC-OA.","description_withheld":null,"homepage":"https://huggingface.co/datasets/xmcmic/PMC-VQA","introduced_date":"2023-05-17","introduced_date_note":null,"introduced_by":{"paper":"/paper/pmc-vqa-visual-instruction-tuning-for-medical","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","first_author":"Xiaoman Zhang","url":null},"license":null,"modalities":[{"name":"Images","url":"/datasets/modality/images"},{"name":"Texts","url":"/datasets/modality/texts"},{"name":"Medical","url":"/datasets/modality/medical"}],"tasks":[{"name":"Visual Question Answering (VQA)","url":"/task/visual-question-answering","datasets_with_task":"/datasets/task/visual-question-answering"},{"name":"Generative Visual Question Answering","url":"/task/generative-visual-question-answering","datasets_with_task":"/datasets/task/generative-visual-question-answering"},{"name":"Medical Visual Question Answering","url":"/task/medical-visual-question-answering","datasets_with_task":"/datasets/task/medical-visual-question-answering"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["PMC-VQA"],"data_loaders":[],"num_papers_in_archive":55,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/visual-question-answering-vqa-on-pmc-vqa","task":"Visual Question Answering (VQA)","dataset_variant":"PMC-VQA","rows":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MedVInT","paper":"/paper/pmc-vqa-visual-instruction-tuning-for-medical","metrics":{"Accuracy":"42.3"},"code_links":[{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/generative-visual-question-answering-on-pmc","task":"Generative Visual Question Answering","dataset_variant":"PMC-VQA","rows":3,"metrics":["BLEU-1"],"first_row_in_archive_order":{"model":"MedVInT","paper":"/paper/pmc-vqa-visual-instruction-tuning-for-medical","metrics":{"BLEU-1":"23.2"},"code_links":[{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/pmc-vqa-visual-instruction-tuning-for-medical","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","date":"2023-05-17","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":3,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/pmc-clip-contrastive-language-image-pre","title":"PMC-CLIP: Contrastive Language-Image Pre-training using Biomedical Documents","date":"2023-03-13","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":6,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/blip-2-bootstrapping-language-image-pre","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","date":"2023-01-30","rows_on_this_dataset":2,"code_links":17,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":4,"samples_unverified":4,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/flamingo-a-visual-language-model-for-few-shot-1","title":"Flamingo: a Visual Language Model for Few-Shot Learning","date":"2022-04-29","rows_on_this_dataset":2,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":24,"samples_ran":18,"samples_unverified":6,"pointer_only_for_licence":7,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":4,"samples_harvested":50,"samples_ran":31,"samples_unverified":19,"pointer_only_for_licence":8,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}