{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-reasoning/papers/4","list_of":"/task/visual-reasoning","task":"Visual Reasoning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":7,"rows_per_page":100,"rows":[301,400],"of":698,"counts":{"archive_papers_tagged":698,"with_a_code_link":356,"where_syntology_ran_a_sample":165,"not_listed_spam_title":0,"listed":698,"listed_where_code_ran":165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":130,"every_run_a_failure_of_syntologys_instrument":35,"listed_with_a_run_with_no_instrument_failure":130,"listed_every_run_a_failure_of_syntologys_instrument":35,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-reasoning","prev":"/task/visual-reasoning/papers/3","next":"/task/visual-reasoning/papers/5","papers":[{"url":"/paper/multi-grained-vision-language-pre-training","slug":"multi-grained-vision-language-pre-training","title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","date":"2021-11-16","arxiv_id":"2111.08276","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/multi-grained-vision-language-pre-training#ran","syntology_url":"https://syntology.ai/paper/2111.08276","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2111.08276"}},"official":{"repos":["zengyan-97/x-vlm"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/proto-program-guided-transformer-for-program","slug":"proto-program-guided-transformer-for-program","title":"ProTo: Program-Guided Transformer for Program-Guided Tasks","date":"2021-10-02","arxiv_id":"2110.00804","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 1 unverified","sample_list":"/paper/proto-program-guided-transformer-for-program#ran","syntology_url":"https://syntology.ai/paper/2110.00804","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2110.00804"}},"official":{"repos":["sjtuytc/Neurips21-ProTo-Program-guided-Transformers-for-Program-guided-Tasks"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/rosita-enhancing-vision-and-language-semantic","slug":"rosita-enhancing-vision-and-language-semantic","title":"ROSITA: Enhancing Vision-and-Language Semantic Alignments via Cross- and Intra-modal Knowledge Integration","date":"2021-08-16","arxiv_id":"2108.07073","repositories_listed":1,"syntology":null},{"url":"/paper/enforcing-consistency-in-weakly-supervised","slug":"enforcing-consistency-in-weakly-supervised","title":"Enforcing Consistency in Weakly Supervised Semantic Parsing","date":"2021-07-13","arxiv_id":"2107.05833","repositories_listed":1,"syntology":null},{"url":"/paper/bottom-up-shift-and-reasoning-for-referring","slug":"bottom-up-shift-and-reasoning-for-referring","title":"Bottom-Up Shift and Reasoning for Referring Image Segmentation","date":"2021-06-19","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/techniques-for-symbol-grounding-with-satnet","slug":"techniques-for-symbol-grounding-with-satnet","title":"Techniques for Symbol Grounding with SATNet","date":"2021-06-16","arxiv_id":"2106.11072","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":1,"n_honours":1,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 1 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/techniques-for-symbol-grounding-with-satnet#ran","syntology_url":"https://syntology.ai/paper/2106.11072","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2106.11072"}},"official":{"repos":["SeverTopan/SATNet"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/understanding-and-evaluating-racial-biases-in","slug":"understanding-and-evaluating-racial-biases-in","title":"Understanding and Evaluating Racial Biases in Image Captioning","date":"2021-06-16","arxiv_id":"2106.08503","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/understanding-and-evaluating-racial-biases-in#ran","syntology_url":"https://syntology.ai/paper/2106.08503","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2106.08503"}},"official":{"repos":["princetonvisualai/imagecaptioning-bias"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/referring-transformer-a-one-step-approach-to","slug":"referring-transformer-a-one-step-approach-to","title":"Referring Transformer: A One-step Approach to Multi-task Visual Grounding","date":"2021-06-06","arxiv_id":"2106.03089","repositories_listed":1,"syntology":{"n":5,"n_ran":5,"n_constructed":0,"n_ran_checked":5,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/referring-transformer-a-one-step-approach-to#ran","syntology_url":"https://syntology.ai/paper/2106.03089","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2106.03089"}},"official":{"repos":["ubc-vision/RefTR"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/learning-relation-alignment-for-calibrated","slug":"learning-relation-alignment-for-calibrated","title":"Learning Relation Alignment for Calibrated Cross-modal Retrieval","date":"2021-05-28","arxiv_id":"2105.13868","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/learning-relation-alignment-for-calibrated#ran","syntology_url":"https://syntology.ai/paper/2105.13868","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2105.13868"}},"official":{"repos":["lancopku/IAIS"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/inter-gps-interpretable-geometry-problem","slug":"inter-gps-interpretable-geometry-problem","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","date":"2021-05-10","arxiv_id":"2105.04165","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/inter-gps-interpretable-geometry-problem#ran","syntology_url":"https://syntology.ai/paper/2105.04165","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2105.04165"}},"official":{"repos":["lupantech/InterGPS"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/just-because-you-are-right-doesn-t-mean-i-am","slug":"just-because-you-are-right-doesn-t-mean-i-am","title":"'Just because you are right, doesn't mean I am wrong': Overcoming a Bottleneck in the Development and Evaluation of Open-Ended Visual Question Answering (VQA) Tasks","date":"2021-03-28","arxiv_id":"2103.15022","repositories_listed":1,"syntology":null},{"url":"/paper/transformer-is-all-you-need-multimodal","slug":"transformer-is-all-you-need-multimodal","title":"UniT: Multimodal Multitask Learning with a Unified Transformer","date":"2021-02-22","arxiv_id":"2102.10772","repositories_listed":1,"syntology":null},{"url":"/paper/physical-reasoning-using-dynamics-aware","slug":"physical-reasoning-using-dynamics-aware","title":"Physical Reasoning Using Dynamics-Aware Models","date":"2021-02-20","arxiv_id":"2102.10336","repositories_listed":1,"syntology":null},{"url":"/paper/answer-questions-with-right-image-regions-a","slug":"answer-questions-with-right-image-regions-a","title":"Answer Questions with Right Image Regions: A Visual Attention Regularization Approach","date":"2021-02-03","arxiv_id":"2102.01916","repositories_listed":1,"syntology":null},{"url":"/paper/dvd-a-diagnostic-dataset-for-multi-step","slug":"dvd-a-diagnostic-dataset-for-multi-step","title":"DVD: A Diagnostic Dataset for Multi-step Reasoning in Video Grounded Dialogue","date":"2021-01-01","arxiv_id":"2101.00151","repositories_listed":1,"syntology":null},{"url":"/paper/object-based-attention-for-spatio-temporal","slug":"object-based-attention-for-spatio-temporal","title":"Attention over learned object embeddings enables complex visual reasoning","date":"2020-12-15","arxiv_id":"2012.08508","repositories_listed":1,"syntology":null},{"url":"/paper/odd-one-out-representation-learning","slug":"odd-one-out-representation-learning","title":"Odd-One-Out Representation Learning","date":"2020-12-14","arxiv_id":"2012.07966","repositories_listed":1,"syntology":null},{"url":"/paper/multi-label-contrastive-learning-for-abstract","slug":"multi-label-contrastive-learning-for-abstract","title":"Multi-Label Contrastive Learning for Abstract Visual Reasoning","date":"2020-12-03","arxiv_id":"2012.01944","repositories_listed":1,"syntology":null},{"url":"/paper/learning-from-lexical-perturbations-for","slug":"learning-from-lexical-perturbations-for","title":"Learning from Lexical Perturbations for Consistent Visual Question Answering","date":"2020-11-26","arxiv_id":"2011.13406","repositories_listed":1,"syntology":null},{"url":"/paper/transformation-driven-visual-reasoning","slug":"transformation-driven-visual-reasoning","title":"Transformation Driven Visual Reasoning","date":"2020-11-26","arxiv_id":"2011.13160","repositories_listed":1,"syntology":null},{"url":"/paper/interpretable-visual-reasoning-via-induced","slug":"interpretable-visual-reasoning-via-induced","title":"Interpretable Visual Reasoning via Induced Symbolic Space","date":"2020-11-23","arxiv_id":"2011.11603","repositories_listed":1,"syntology":null},{"url":"/paper/natural-language-rationales-with-full-stack","slug":"natural-language-rationales-with-full-stack","title":"Natural Language Rationales with Full-Stack Visual Reasoning: From Pixels to Semantic Frames to Commonsense Graphs","date":"2020-10-15","arxiv_id":"2010.07526","repositories_listed":1,"syntology":null},{"url":"/paper/contextual-modulation-for-relation-level","slug":"contextual-modulation-for-relation-level","title":"Contextual Modulation for Relation-Level Metaphor Identification","date":"2020-10-12","arxiv_id":"2010.05633","repositories_listed":1,"syntology":null},{"url":"/paper/bongard-logo-a-new-benchmark-for-human-level","slug":"bongard-logo-a-new-benchmark-for-human-level","title":"Bongard-LOGO: A New Benchmark for Human-Level Concept Learning and Reasoning","date":"2020-10-02","arxiv_id":"2010.00763","repositories_listed":1,"syntology":{"n":14,"n_ran":11,"n_constructed":0,"n_ran_checked":7,"n_instrument":4,"n_unverified":3,"n_honours":1,"n_violates":0,"n_no_contract":6,"n_pointer_only":14,"phrase":"11 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 1 honoured, 0 violated, 6 with no contract checked; 4 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/bongard-logo-a-new-benchmark-for-human-level#ran","syntology_url":"https://syntology.ai/paper/2010.00763","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.00763"}},"official":{"repos":["NVlabs/Bongard-LOGO"],"state":"official (archive's flag): 11 ran","n_ran":11,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":3,"ran_from_kinds":["official"]}}},{"url":"/paper/clevr-parser-a-graph-parser-library-for","slug":"clevr-parser-a-graph-parser-library-for","title":"CLEVR Parser: A Graph Parser Library for Geometric Learning on Language Grounded Image Scenes","date":"2020-09-19","arxiv_id":"2009.09154","repositories_listed":1,"syntology":null},{"url":"/paper/a-distance-preserving-matrix-sketch","slug":"a-distance-preserving-matrix-sketch","title":"A Distance-preserving Matrix Sketch","date":"2020-09-08","arxiv_id":"2009.03979","repositories_listed":1,"syntology":null},{"url":"/paper/learning-long-term-visual-dynamics-with","slug":"learning-long-term-visual-dynamics-with","title":"Learning Long-term Visual Dynamics with Region Proposal Interaction Networks","date":"2020-08-05","arxiv_id":"2008.02265","repositories_listed":1,"syntology":{"n":3,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":3,"phrase":"0 ran · 3 unverified","sample_list":"/paper/learning-long-term-visual-dynamics-with#ran","syntology_url":"https://syntology.ai/paper/2008.02265","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2008.02265"}},"official":{"repos":["HaozhiQi/RPIN"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":3,"ran_from_kinds":[]}}},{"url":"/paper/a-closer-look-at-generalisation-in-raven","slug":"a-closer-look-at-generalisation-in-raven","title":"A Closer Look at Generalisation in RAVEN","date":"2020-08-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/learning-to-discretely-compose-reasoning","slug":"learning-to-discretely-compose-reasoning","title":"Learning to Discretely Compose Reasoning Module Networks for Video Captioning","date":"2020-07-17","arxiv_id":"2007.09049","repositories_listed":1,"syntology":null},{"url":"/paper/forward-prediction-for-physical-reasoning","slug":"forward-prediction-for-physical-reasoning","title":"Forward Prediction for Physical Reasoning","date":"2020-06-18","arxiv_id":"2006.10734","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/forward-prediction-for-physical-reasoning#ran","syntology_url":"https://syntology.ai/paper/2006.10734","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2006.10734"}},"official":{"repos":["facebookresearch/phyre-fwd"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/attention-based-context-aware-reasoning-for","slug":"attention-based-context-aware-reasoning-for","title":"Attention-Based Context Aware Reasoning for Situation Recognition","date":"2020-06-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/cross-modality-relevance-for-reasoning-on","slug":"cross-modality-relevance-for-reasoning-on","title":"Cross-Modality Relevance for Reasoning on Language and Vision","date":"2020-05-12","arxiv_id":"2005.06035","repositories_listed":1,"syntology":null},{"url":"/paper/dynamic-language-binding-in-relational-visual","slug":"dynamic-language-binding-in-relational-visual","title":"Dynamic Language Binding in Relational Visual Reasoning","date":"2020-04-30","arxiv_id":"2004.14603","repositories_listed":1,"syntology":{"n":9,"n_ran":6,"n_constructed":5,"n_ran_checked":6,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":6,"n_pointer_only":0,"phrase":"6 ran (of which 5 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/dynamic-language-binding-in-relational-visual#ran","syntology_url":"https://syntology.ai/paper/2004.14603","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2004.14603"}},"official":null}},{"url":"/paper/differentiable-adaptive-computation-time-for","slug":"differentiable-adaptive-computation-time-for","title":"Differentiable Adaptive Computation Time for Visual Reasoning","date":"2020-04-27","arxiv_id":"2004.12770","repositories_listed":1,"syntology":null},{"url":"/paper/the-notorious-difficulty-of-comparing-human","slug":"the-notorious-difficulty-of-comparing-human","title":"Five Points to Check when Comparing Visual Perception in Humans and Machines","date":"2020-04-20","arxiv_id":"2004.09406","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/the-notorious-difficulty-of-comparing-human#ran","syntology_url":"https://syntology.ai/paper/2004.09406","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2004.09406"}},"official":{"repos":["bethgelab/notorious_difficulty_of_comparing_human_and_machine_perception"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/pixel-bert-aligning-image-pixels-with-text-by","slug":"pixel-bert-aligning-image-pixels-with-text-by","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","date":"2020-04-02","arxiv_id":"2004.00849","repositories_listed":1,"syntology":null},{"url":"/paper/weakly-supervised-visual-semantic-parsing","slug":"weakly-supervised-visual-semantic-parsing","title":"Weakly Supervised Visual Semantic Parsing","date":"2020-01-08","arxiv_id":"2001.02359","repositories_listed":1,"syntology":null},{"url":"/paper/temporal-reasoning-via-audio-question","slug":"temporal-reasoning-via-audio-question","title":"Temporal Reasoning via Audio Question Answering","date":"2019-11-21","arxiv_id":"1911.09655","repositories_listed":1,"syntology":null},{"url":"/paper/program-synthesis-performance-constrained-by","slug":"program-synthesis-performance-constrained-by","title":"Program synthesis performance constrained by non-linear spatial relations in Synthetic Visual Reasoning Test","date":"2019-11-18","arxiv_id":"1911.07721","repositories_listed":1,"syntology":null},{"url":"/paper/meta-module-network-for-compositional-visual","slug":"meta-module-network-for-compositional-visual","title":"Meta Module Network for Compositional Visual Reasoning","date":"2019-10-08","arxiv_id":"1910.03230","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_constructed":0,"n_ran_checked":0,"n_instrument":4,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":4,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 4 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/meta-module-network-for-compositional-visual#ran","syntology_url":"https://syntology.ai/paper/1910.03230","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1910.03230"}},"official":{"repos":["wenhuchen/Meta-Module-Network"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/learning-dynamics-of-attention-human-prior","slug":"learning-dynamics-of-attention-human-prior","title":"Learning Dynamics of Attention: Human Prior for Interpretable Machine Reasoning","date":"2019-05-28","arxiv_id":"1905.11666","repositories_listed":1,"syntology":null},{"url":"/paper/learning-latent-scene-graph-representations","slug":"learning-latent-scene-graph-representations","title":"Differentiable Scene Graphs","date":"2019-02-26","arxiv_id":"1902.10200","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/learning-latent-scene-graph-representations#ran","syntology_url":"https://syntology.ai/paper/1902.10200","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1902.10200"}},"official":{"repos":["shikorab/DSG"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/when-causal-intervention-meets-image-masking","slug":"when-causal-intervention-meets-image-masking","title":"When Causal Intervention Meets Adversarial Examples and Image Masking for Deep Neural Networks","date":"2019-02-09","arxiv_id":"1902.03380","repositories_listed":1,"syntology":null},{"url":"/paper/visual-entailment-a-novel-task-for-fine","slug":"visual-entailment-a-novel-task-for-fine","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","date":"2019-01-20","arxiv_id":"1901.06706","repositories_listed":1,"syntology":null},{"url":"/paper/cascaded-mutual-modulation-for-visual","slug":"cascaded-mutual-modulation-for-visual","title":"Cascaded Mutual Modulation for Visual Reasoning","date":"2018-09-06","arxiv_id":"1809.01943","repositories_listed":1,"syntology":null},{"url":"/paper/visual-reasoning-with-multi-hop-feature","slug":"visual-reasoning-with-multi-hop-feature","title":"Visual Reasoning with Multi-hop Feature Modulation","date":"2018-08-03","arxiv_id":"1808.04446","repositories_listed":1,"syntology":null},{"url":"/paper/object-level-visual-reasoning-in-videos","slug":"object-level-visual-reasoning-in-videos","title":"Object Level Visual Reasoning in Videos","date":"2018-06-16","arxiv_id":"1806.06157","repositories_listed":1,"syntology":null},{"url":"/paper/visual-reasoning-by-progressive-module","slug":"visual-reasoning-by-progressive-module","title":"Visual Reasoning by Progressive Module Networks","date":"2018-06-06","arxiv_id":"1806.02453","repositories_listed":1,"syntology":{"n":5,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/visual-reasoning-by-progressive-module#ran","syntology_url":"https://syntology.ai/paper/1806.02453","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1806.02453"}},"official":null}},{"url":"/paper/visual-choice-of-plausible-alternatives-an","slug":"visual-choice-of-plausible-alternatives-an","title":"Visual Choice of Plausible Alternatives: An Evaluation of Image-based Commonsense Causal Reasoning","date":"2018-05-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/transparency-by-design-closing-the-gap","slug":"transparency-by-design-closing-the-gap","title":"Transparency by Design: Closing the Gap Between Performance and Interpretability in Visual Reasoning","date":"2018-03-14","arxiv_id":"1803.05268","repositories_listed":1,"syntology":{"n":8,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":4,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/transparency-by-design-closing-the-gap#ran","syntology_url":"https://syntology.ai/paper/1803.05268","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1803.05268"}},"official":{"repos":["davidmascharka/tbd-nets"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":4,"ran_from_kinds":["official"]}}},{"url":"/paper/multi-label-zero-shot-learning-with","slug":"multi-label-zero-shot-learning-with","title":"Multi-Label Zero-Shot Learning with Structured Knowledge Graphs","date":"2017-11-17","arxiv_id":"1711.06526","repositories_listed":1,"syntology":null},{"url":"/paper/weakly-supervised-semantic-parsing-with-1","slug":"weakly-supervised-semantic-parsing-with-1","title":"Weakly-supervised Semantic Parsing with Abstract Examples","date":"2017-11-14","arxiv_id":"1711.05240","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/weakly-supervised-semantic-parsing-with-1#ran","syntology_url":"https://syntology.ai/paper/1711.05240","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1711.05240"}},"official":{"repos":["udiNaveh/nlvr_tau_nlp_final_proj"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/complete-3d-scene-parsing-from-an-rgbd-image","slug":"complete-3d-scene-parsing-from-an-rgbd-image","title":"Complete 3D Scene Parsing from an RGBD Image","date":"2017-10-25","arxiv_id":"1710.09490","repositories_listed":1,"syntology":null},{"url":"/paper/figureqa-an-annotated-figure-dataset-for","slug":"figureqa-an-annotated-figure-dataset-for","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","date":"2017-10-19","arxiv_id":"1710.07300","repositories_listed":1,"syntology":{"n":12,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":5,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":12,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 5 unverified","sample_list":"/paper/figureqa-an-annotated-figure-dataset-for#ran","syntology_url":"https://syntology.ai/paper/1710.07300","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1710.07300"}},"official":{"repos":["vmichals/FigureQA-baseline"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":5,"ran_from_kinds":["official"]}}},{"url":"/paper/how-a-general-purpose-commonsense-ontology","slug":"how-a-general-purpose-commonsense-ontology","title":"How a General-Purpose Commonsense Ontology can Improve Performance of Learning-Based Image Retrieval","date":"2017-05-24","arxiv_id":"1705.08844","repositories_listed":1,"syntology":null},{"url":"/paper/predicting-complete-3d-models-of-indoor","slug":"predicting-complete-3d-models-of-indoor","title":"Predicting Complete 3D Models of Indoor Scenes","date":"2015-04-09","arxiv_id":"1504.02437","repositories_listed":1,"syntology":null},{"url":null,"slug":"laviplan-language-guided-visual-path-planning","title":"LaViPlan : Language-Guided Visual Path Planning with RLVR","date":"2025-07-17","arxiv_id":"2507.12911","repositories_listed":0,"syntology":null},{"url":null,"slug":"pyvision-agentic-vision-with-dynamic-tooling","title":"PyVision: Agentic Vision with Dynamic Tooling","date":"2025-07-10","arxiv_id":"2507.07998","repositories_listed":0,"syntology":null},{"url":null,"slug":"magic-evaluating-multimodal-cognition-toward","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","date":"2025-07-09","arxiv_id":"2507.07297","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-vision-reasoner-transferring-linguistic","title":"Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning","date":"2025-07-07","arxiv_id":"2507.05255","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundation-models-for-zero-shot-segmentation","title":"Foundation Models for Zero-Shot Segmentation of Scientific Images without AI-Ready Data","date":"2025-06-30","arxiv_id":"2506.24039","repositories_listed":0,"syntology":null},{"url":null,"slug":"mico-multi-image-contrast-for-reinforcement","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","date":"2025-06-27","arxiv_id":"2506.22434","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-structures-helps-visual-reasoning","title":"Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs","date":"2025-06-27","arxiv_id":"2506.22146","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallusegbench-counterfactual-visual-reasoning","title":"HalluSegBench: Counterfactual Visual Reasoning for Segmentation Hallucination Evaluation","date":"2025-06-26","arxiv_id":"2506.21546","repositories_listed":0,"syntology":null},{"url":null,"slug":"world-aware-planning-narratives-enhance-large","title":"World-aware Planning Narratives Enhance Large Vision-Language Model Planner","date":"2025-06-26","arxiv_id":"2506.21230","repositories_listed":0,"syntology":null},{"url":null,"slug":"vgr-visual-grounded-reasoning","title":"VGR: Visual Grounded Reasoning","date":"2025-06-13","arxiv_id":"2506.11991","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlm-school-evaluation-of-ai-image","title":"VLM@school -- Evaluation of AI image understanding on German middle school knowledge","date":"2025-06-13","arxiv_id":"2506.11604","repositories_listed":0,"syntology":null},{"url":null,"slug":"llms-are-not-yet-ready-for-deepfake-image","title":"LLMs Are Not Yet Ready for Deepfake Image Detection","date":"2025-06-12","arxiv_id":"2506.10474","repositories_listed":0,"syntology":null},{"url":null,"slug":"chartreasoner-code-driven-modality-bridging","title":"ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering","date":"2025-06-11","arxiv_id":"2506.10116","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-09049","title":"VIKI-R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning","date":"2025-06-10","arxiv_id":"2506.09049","repositories_listed":0,"syntology":null},{"url":null,"slug":"socratic-mcts-test-time-visual-reasoning-by","title":"Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions","date":"2025-06-10","arxiv_id":"2506.08927","repositories_listed":0,"syntology":null},{"url":null,"slug":"kokushimd-10-benchmark-for-evaluating-large","title":"KokushiMD-10: Benchmark for Evaluating Large Language Models on Ten Japanese National Healthcare Licensing Examinations","date":"2025-06-09","arxiv_id":"2506.11114","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-vision-planner-and-executor-for-text","title":"Language-Vision Planner and Executor for Text-to-Visual Reasoning","date":"2025-06-09","arxiv_id":"2506.07778","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthetic-visual-genome-1","title":"Synthetic Visual Genome","date":"2025-06-09","arxiv_id":"2506.07643","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallucination-at-a-glance-controlled-visual","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","date":"2025-06-08","arxiv_id":"2506.07227","repositories_listed":0,"syntology":null},{"url":null,"slug":"matp-bench-can-mllm-be-a-good-automated","title":"MATP-BENCH: Can MLLM Be a Good Automated Theorem Prover for Multimodal Problems?","date":"2025-06-06","arxiv_id":"2506.06034","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-mllms-with-multimodal-multi-image","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","date":"2025-06-04","arxiv_id":"2506.04280","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthrl-scaling-visual-reasoning-with","title":"SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis","date":"2025-06-02","arxiv_id":"2506.02096","repositories_listed":0,"syntology":null},{"url":null,"slug":"mirage-assessing-hallucination-in-multimodal","title":"MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM","date":"2025-05-30","arxiv_id":"2505.24238","repositories_listed":0,"syntology":null},{"url":null,"slug":"gam-agent-game-theoretic-and-uncertainty","title":"GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning","date":"2025-05-29","arxiv_id":"2505.23399","repositories_listed":0,"syntology":null},{"url":null,"slug":"omniad-detect-and-understand-industrial","title":"OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning","date":"2025-05-28","arxiv_id":"2505.22039","repositories_listed":0,"syntology":null},{"url":null,"slug":"thinking-with-generated-images","title":"Thinking with Generated Images","date":"2025-05-28","arxiv_id":"2505.22525","repositories_listed":0,"syntology":null},{"url":null,"slug":"ground-r1-incentivizing-grounded-visual","title":"Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning","date":"2025-05-26","arxiv_id":"2505.20272","repositories_listed":0,"syntology":null},{"url":null,"slug":"point-rft-improving-multimodal-reasoning-with","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","date":"2025-05-26","arxiv_id":"2505.19702","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-is-believing-but-how-much-a","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","date":"2025-05-26","arxiv_id":"2505.20236","repositories_listed":0,"syntology":null},{"url":"/paper/viscra-a-visual-chain-reasoning-attack-for","slug":"viscra-a-visual-chain-reasoning-attack-for","title":"VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models","date":"2025-05-26","arxiv_id":"2505.19684","repositories_listed":0,"syntology":{"n":12,"n_ran":9,"n_constructed":0,"n_ran_checked":8,"n_instrument":1,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":8,"n_pointer_only":2,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 0 violated, 8 with no contract checked; 1 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/viscra-a-visual-chain-reasoning-attack-for#ran","syntology_url":"https://syntology.ai/paper/2505.19684","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.19684"}},"official":null}},{"url":null,"slug":"visualtoolagent-vista-a-reinforcement","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","date":"2025-05-26","arxiv_id":"2505.20289","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-eye-of-sherlock-holmes-uncovering-user","title":"The Eye of Sherlock Holmes: Uncovering User Private Attribute Profiling via Vision-Language Model Agentic Framework","date":"2025-05-25","arxiv_id":"2505.19139","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-mllms-guide-me-home-a-benchmark-study-on","title":"Can MLLMs Guide Me Home? A Benchmark Study on Fine-Grained Visual Reasoning from Transit Maps","date":"2025-05-24","arxiv_id":"2505.18675","repositories_listed":0,"syntology":null},{"url":null,"slug":"doc-cob-enhancing-multi-modal-document","title":"Doc-CoB: Enhancing Multi-Modal Document Understanding with Visual Chain-of-Boxes Reasoning","date":"2025-05-24","arxiv_id":"2505.18603","repositories_listed":0,"syntology":null},{"url":"/paper/futuresightdrive-thinking-visually-with","slug":"futuresightdrive-thinking-visually-with","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","date":"2025-05-23","arxiv_id":"2505.17685","repositories_listed":0,"syntology":{"n":9,"n_ran":6,"n_constructed":5,"n_ran_checked":5,"n_instrument":1,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":9,"phrase":"6 ran (of which 5 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 1 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/futuresightdrive-thinking-visually-with#ran","syntology_url":"https://syntology.ai/paper/2505.17685","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.17685"}},"official":null}},{"url":null,"slug":"one-rl-to-see-them-all-visual-triple-unified","title":"One RL to See Them All: Visual Triple Unified Reinforcement Learning","date":"2025-05-23","arxiv_id":"2505.18129","repositories_listed":0,"syntology":null},{"url":"/paper/ocr-reasoning-benchmark-unveiling-the-true","slug":"ocr-reasoning-benchmark-unveiling-the-true","title":"OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning","date":"2025-05-22","arxiv_id":"2505.17163","repositories_listed":0,"syntology":{"n":10,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":5,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/ocr-reasoning-benchmark-unveiling-the-true#ran","syntology_url":"https://syntology.ai/paper/2505.17163","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.17163"}},"official":null}},{"url":null,"slug":"rbench-v-a-primary-assessment-for-visual","title":"RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs","date":"2025-05-22","arxiv_id":"2505.16770","repositories_listed":0,"syntology":null},{"url":null,"slug":"chain-of-focus-adaptive-visual-search-and","title":"Chain-of-Focus: Adaptive Visual Search and Zooming for Multimodal Reasoning via RL","date":"2025-05-21","arxiv_id":"2505.15436","repositories_listed":0,"syntology":null},{"url":null,"slug":"grit-teaching-mllms-to-think-with-images","title":"GRIT: Teaching MLLMs to Think with Images","date":"2025-05-21","arxiv_id":"2505.15879","repositories_listed":0,"syntology":null},{"url":null,"slug":"pixel-reasoner-incentivizing-pixel-space","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","date":"2025-05-21","arxiv_id":"2505.15966","repositories_listed":0,"syntology":null},{"url":null,"slug":"star-r1-spacial-transformation-reasoning-by","title":"STAR-R1: Spacial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","date":"2025-05-21","arxiv_id":"2505.15804","repositories_listed":0,"syntology":null},{"url":null,"slug":"visionary-r1-mitigating-shortcuts-in-visual","title":"Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning","date":"2025-05-20","arxiv_id":"2505.14677","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-generalization-across-a-variety-of","title":"Advancing Generalization Across a Variety of Abstract Visual Reasoning Tasks","date":"2025-05-19","arxiv_id":"2505.13391","repositories_listed":0,"syntology":null}],"record_sha256":"8415558af4d1e49a66462551ce3a9600fe37b5f695201672cea70209f68df34f","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}