Datasets › VCR

VCR (Visual Commonsense Reasoning)

Introduced by Rowan Zellers et al. in From Recognition to Cognition: Visual Commonsense Reasoning1 Jan 2019 archive 2025-07-28

Visual Commonsense Reasoning (VCR) is a large-scale dataset for cognition-level visual understanding. Given a challenging question about an image, machines need to present two sub-tasks: answer correctly and provide a rationale justifying its answer. The VCR dataset contains over 212K (training), 26K (validation) and 25K (testing) questions, answers and rationales derived from 110K movie scenes.

Source: Visual Commonsense R-CNN Image Source: From Recognition to Cognition: Visual Commonsense Reasoning

Benchmarks archive 2025-07-28

All 13 leaderboards whose dataset resolves to this page shown (sort by any header). "First row" is the archive's own first row at snapshot, in the archive's row order; nothing here re-ranks and metric direction is not asserted.

First row (archive order)PaperCode
Visual Question Answering (VQA) VCR (Q-A) test GPT4RoI Accuracy 89.4 GPT4RoI: Instruction Tuning Large Language Model on... jshilong/gpt4roi +2 11 Compare
Visual Question Answering (VQA) VCR (QA-R) test GPT4RoI Accuracy 91.0 GPT4RoI: Instruction Tuning Large Language Model on... jshilong/gpt4roi +2 8 Compare
Visual Question Answering (VQA) VCR (Q-AR) test GPT4RoI Accuracy 81.6 GPT4RoI: Instruction Tuning Large Language Model on... jshilong/gpt4roi +2 7 Compare
Visual Question Answering (VQA) VCR (Q-A) dev VL-BERTLARGE Accuracy 75.5 VL-BERT: Pre-training of Generic Visual-Linguistic... jackroos/VL-BERT +2 3 Compare
Visual Question Answering (VQA) VCR (Q-AR) dev VL-BERTLARGE Accuracy 58.9 VL-BERT: Pre-training of Generic Visual-Linguistic... jackroos/VL-BERT +2 3 Compare
Visual Question Answering (VQA) VCR (QA-R) dev VL-BERTLARGE Accuracy 77.9 VL-BERT: Pre-training of Generic Visual-Linguistic... jackroos/VL-BERT +2 3 Compare
Explanation Generation VCR OFA-X-MT Human Explanation Rating 77.3 Harnessing the Power of Multi-Task Pretraining for... ofa-x/ofa-x 2 Compare
Visual Commonsense Reasoning VCR (Q-A) dev PEVL Accuracy 75.1 PEVL: Position-enhanced Pre-training and Prompt Tuning... thunlp/pevl 1 Compare
Visual Commonsense Reasoning VCR (Q-A) test PEVL Accuracy 76.0 PEVL: Position-enhanced Pre-training and Prompt Tuning... thunlp/pevl 1 Compare
Visual Commonsense Reasoning VCR (Q-AR) dev PEVL Accuracy 57.8 PEVL: Position-enhanced Pre-training and Prompt Tuning... thunlp/pevl 1 Compare
Visual Commonsense Reasoning VCR (Q-AR) test PEVL Accuracy 58.6 PEVL: Position-enhanced Pre-training and Prompt Tuning... thunlp/pevl 1 Compare
Visual Commonsense Reasoning VCR (QA-R) dev PEVL Accuracy 76.4 PEVL: Position-enhanced Pre-training and Prompt Tuning... thunlp/pevl 1 Compare
Visual Commonsense Reasoning VCR (QA-R) test PEVL Accuracy 76.7 PEVL: Position-enhanced Pre-training and Prompt Tuning... thunlp/pevl 1 Compare

Papers archive 2025-07-28

10 shown of 10 papers with a leaderboard row on this dataset's benchmarks, newest first. The archive's own "papers using this dataset" list was never published, so this is the benchmark-backed subset; the archive's count for this dataset is 179. The Syntology column is from Syntology's graph (read 2026-09-24), stated per sample; it is not part of any archive number.

DateSamples run Syntology
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest 3 3 7 Jul 2023 ran 3 of 5 samples (2 unverified; 5 pointer-only for licence)
Harnessing the Power of Multi-Task Pretraining for Ground-Truth Level Natural Language Explanations 1 4 8 Dec 2022 ran 1 of 8 samples (7 unverified)
PEVL: Position-enhanced Pre-training and Prompt Tuning for Vision-language Models 1 6 23 May 2022 ran 3 of 7 samples (4 unverified)
Multimodal Adaptive Distillation for Leveraging Unimodal Encoders for Vision-Language Tasks 0 1 22 Apr 2022 not harvested
Unifying Vision-and-Language Tasks via Text Generation 2 3 4 Feb 2021 ran 2 of 12 samples (10 unverified)
KVL-BERT: Knowledge Enhanced Visual-and-Linguistic BERT for Visual Commonsense Reasoning 0 3 13 Dec 2020 not harvested
ERNIE-ViL: Knowledge Enhanced Vision-Language Representations Through Scene Graph 0 3 30 Jun 2020 not harvested
UNITER: UNiversal Image-TExt Representation Learning 7 5 25 Sep 2019 ran 3 of 3 samples (0 unverified; 2 pointer-only for licence)
VL-BERT: Pre-training of Generic Visual-Linguistic Representations 3 9 22 Aug 2019 ran 0 of 1 samples (1 unverified)
VisualBERT: A Simple and Performant Baseline for Vision and Language 10 6 9 Aug 2019 ran 4 of 9 samples (5 unverified; 6 pointer-only for licence)

Dataset loaders archive 2025-07-28

No loader listed in the archive.

Tasks archive 2025-07-28

License archive 2025-07-28

Custom

Modalities archive 2025-07-28

Languages archive 2025-07-28

Variants archive 2025-07-28

  • VCR
  • VCR (QA-R) test
  • VCR (QA-R) dev
  • VCR (Q-AR) test
  • VCR (Q-AR) dev
  • VCR (Q-A) test
  • VCR (Q-A) dev

7 variant names, as the archive lists them.

Report a problem or propose a change · a person checks every report against the paper or source before anything changes; decisions are listed on /corrections