{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-reasoning/papers/6","list_of":"/task/visual-reasoning","task":"Visual Reasoning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":7,"rows_per_page":100,"rows":[501,600],"of":698,"counts":{"archive_papers_tagged":698,"with_a_code_link":356,"where_syntology_ran_a_sample":165,"not_listed_spam_title":0,"listed":698,"listed_where_code_ran":165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":130,"every_run_a_failure_of_syntologys_instrument":35,"listed_with_a_run_with_no_instrument_failure":130,"listed_every_run_a_failure_of_syntologys_instrument":35,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-reasoning","prev":"/task/visual-reasoning/papers/5","next":"/task/visual-reasoning/papers/7","papers":[{"url":null,"slug":"beyond-visual-appearances-privacy-sensitive","title":"Beyond Visual Appearances: Privacy-sensitive Objects Identification via Hybrid Graph Reasoning","date":"2024-06-18","arxiv_id":"2406.12736","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-view-of-abstract-visual-reasoning","title":"A Unified View of Abstract Visual Reasoning Problems","date":"2024-06-16","arxiv_id":"2406.11068","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-and-knowledge-transfer-in","title":"A-I-RAVEN and I-RAVEN-Mesh: Two New Benchmarks for Abstract Visual Reasoning","date":"2024-06-16","arxiv_id":"2406.11061","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparison-visual-instruction-tuning","title":"Comparison Visual Instruction Tuning","date":"2024-06-13","arxiv_id":"2406.09240","repositories_listed":0,"syntology":null},{"url":null,"slug":"eyeballing-combinatorial-problems-a-case","title":"Eyeballing Combinatorial Problems: A Case Study of Using Multimodal Large Language Models to Solve Traveling Salesman Problems","date":"2024-06-11","arxiv_id":"2406.06865","repositories_listed":0,"syntology":null},{"url":null,"slug":"henasy-learning-to-assemble-scene-entities","title":"HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model","date":"2024-06-01","arxiv_id":"2406.00307","repositories_listed":0,"syntology":null},{"url":"/paper/mmctagent-multi-modal-critical-thinking-agent","slug":"mmctagent-multi-modal-critical-thinking-agent","title":"MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning","date":"2024-05-28","arxiv_id":"2405.18358","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-vision-language-transformers-exhibit","title":"Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR","date":"2024-05-27","arxiv_id":"2405.16934","repositories_listed":0,"syntology":null},{"url":null,"slug":"code-repair-with-llms-gives-an-exploration","title":"Code Repair with LLMs gives an Exploration-Exploitation Tradeoff","date":"2024-05-26","arxiv_id":"2405.17503","repositories_listed":0,"syntology":null},{"url":"/paper/image-of-thought-prompting-for-visual","slug":"image-of-thought-prompting-for-visual","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","date":"2024-05-22","arxiv_id":"2405.13872","repositories_listed":0,"syntology":null},{"url":null,"slug":"analogist-out-of-the-box-visual-in-context","title":"Analogist: Out-of-the-box Visual In-Context Learning with Image Diffusion Model","date":"2024-05-16","arxiv_id":"2405.10316","repositories_listed":0,"syntology":null},{"url":null,"slug":"clip-powered-tass-target-aware-single-stream","title":"CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering","date":"2024-05-13","arxiv_id":"2405.07451","repositories_listed":0,"syntology":null},{"url":null,"slug":"naturally-supervised-3d-visual-grounding-with","title":"Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners","date":"2024-04-30","arxiv_id":"2404.19696","repositories_listed":0,"syntology":null},{"url":null,"slug":"blenderalchemy-editing-3d-graphics-with","title":"BlenderAlchemy: Editing 3D Graphics with Vision-Language Models","date":"2024-04-26","arxiv_id":"2404.17672","repositories_listed":0,"syntology":null},{"url":null,"slug":"cantor-inspiring-multimodal-chain-of-thought","title":"Cantor: Inspiring Multimodal Chain-of-Thought of MLLM","date":"2024-04-24","arxiv_id":"2404.16033","repositories_listed":0,"syntology":null},{"url":null,"slug":"think-program-rectify-3d-situated-reasoning","title":"Think-Program-reCtify: 3D Situated Reasoning with Large Language Models","date":"2024-04-23","arxiv_id":"2404.14705","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-evaluation-of-large-vision-language","title":"Automated Evaluation of Large Vision-Language Models on Self-driving Corner Cases","date":"2024-04-16","arxiv_id":"2404.10595","repositories_listed":0,"syntology":null},{"url":null,"slug":"wu-s-method-can-boost-symbolic-ai-to-rival","title":"Wu's Method can Boost Symbolic AI to Rival Silver Medalists and AlphaGeometry to Outperform Gold Medalists at IMO Geometry","date":"2024-04-09","arxiv_id":"2404.06405","repositories_listed":0,"syntology":null},{"url":"/paper/plug-and-play-grounding-of-reasoning-in","slug":"plug-and-play-grounding-of-reasoning-in","title":"Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models","date":"2024-03-28","arxiv_id":"2403.19322","repositories_listed":0,"syntology":null},{"url":null,"slug":"proptest-automatic-property-testing-for","title":"PropTest: Automatic Property Testing for Improved Visual Programming","date":"2024-03-25","arxiv_id":"2403.16921","repositories_listed":0,"syntology":null},{"url":null,"slug":"just-say-the-name-online-continual-learning","title":"Just Say the Name: Online Continual Learning with Category Names Only via Data Generation","date":"2024-03-16","arxiv_id":"2403.10853","repositories_listed":0,"syntology":null},{"url":null,"slug":"test-time-distribution-learning-adapter-for","title":"Test-time Distribution Learning Adapter for Cross-modal Visual Reasoning","date":"2024-03-10","arxiv_id":"2403.06059","repositories_listed":0,"syntology":null},{"url":null,"slug":"sniffer-multimodal-large-language-model-for","title":"SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation Detection","date":"2024-03-05","arxiv_id":"2403.03170","repositories_listed":0,"syntology":null},{"url":null,"slug":"visreas-complex-visual-reasoning-with","title":"VISREAS: Complex Visual Reasoning with Unanswerable Questions","date":"2024-02-23","arxiv_id":"2403.10534","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-in-context-learning-for-large-vision","title":"Visual In-Context Learning for Large Vision-Language Models","date":"2024-02-18","arxiv_id":"2402.11574","repositories_listed":0,"syntology":null},{"url":null,"slug":"muffin-or-chihuahua-challenging-large-vision","title":"Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA","date":"2024-01-29","arxiv_id":"2401.15847","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-conditioned-robotic-manipulation","title":"Language-Conditioned Robotic Manipulation with Fast and Slow Thinking","date":"2024-01-08","arxiv_id":"2401.04181","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-truly-zero-shot-compositional-visual","title":"Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers","date":"2024-01-03","arxiv_id":"2401.01974","repositories_listed":0,"syntology":null},{"url":null,"slug":"generate-subgoal-images-before-act-unlocking","title":"Generate Subgoal Images before Act: Unlocking the Chain-of-Thought Reasoning in Diffusion Model for Robot Manipulation with Multimodal Prompts","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"chartbench-a-benchmark-for-complex-visual","title":"ChartBench: A Benchmark for Complex Visual Reasoning in Charts","date":"2023-12-26","arxiv_id":"2312.15915","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-vlms-for-score-based-multi-probe","title":"Leveraging VLM-Based Pipelines to Annotate 3D Objects","date":"2023-11-29","arxiv_id":"2311.17851","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-wrong-to-right-a-recursive-approach","title":"From Wrong To Right: A Recursive Approach Towards Vision-Language Explanation","date":"2023-11-21","arxiv_id":"2311.12391","repositories_listed":0,"syntology":null},{"url":"/paper/selfeval-leveraging-the-discriminative-nature","slug":"selfeval-leveraging-the-discriminative-nature","title":"SelfEval: Leveraging the discriminative nature of generative models for evaluation","date":"2023-11-17","arxiv_id":"2311.10708","repositories_listed":0,"syntology":null},{"url":"/paper/the-role-of-chain-of-thought-in-complex","slug":"the-role-of-chain-of-thought-in-complex","title":"The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task","date":"2023-11-15","arxiv_id":"2311.09193","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-recurrent-vision-performs-zero-shot","title":"Adaptive recurrent vision performs zero-shot computation scaling to unseen difficulty levels","date":"2023-11-12","arxiv_id":"2311.06964","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-commonsense-based-heterogeneous-graph","title":"Visual Commonsense based Heterogeneous Graph Contrastive Learning","date":"2023-11-11","arxiv_id":"2311.06553","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-unified-neural-architecture-for","title":"Towards A Unified Neural Architecture for Visual Recognition and Reasoning","date":"2023-11-10","arxiv_id":"2311.06386","repositories_listed":0,"syntology":null},{"url":null,"slug":"oc-nmn-object-centric-compositional-neural","title":"OC-NMN: Object-centric Compositional Neural Module Network for Generative Visual Analogical Reasoning","date":"2023-10-28","arxiv_id":"2310.18807","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-visual-knowledge-extraction-via-relation","title":"Open Visual Knowledge Extraction via Relation-Oriented Multimodality Model Prompting","date":"2023-10-28","arxiv_id":"2310.18804","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-representations-for-teacher-guided","title":"Multimodal Representations for Teacher-Guided Compositional Visual Reasoning","date":"2023-10-24","arxiv_id":"2310.15585","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiscale-superpixel-structured-difference","title":"Superpixel Semantics Representation and Pre-training for Vision-Language Task","date":"2023-10-20","arxiv_id":"2310.13447","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-in-the-medical","title":"Visual Question Answering in the Medical Domain","date":"2023-09-20","arxiv_id":"2309.11080","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualprog-distiller-learning-to-fine-tune","title":"A Continual Learning Paradigm for Non-differentiable Visual Programming Frameworks on Visual Reasoning Tasks","date":"2023-09-18","arxiv_id":"2309.09809","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-potential-of-clip-for-compositional","title":"On the Potential of CLIP for Compositional Logical Reasoning","date":"2023-08-30","arxiv_id":"2308.15887","repositories_listed":0,"syntology":null},{"url":null,"slug":"eve-efficient-vision-language-pre-training","title":"EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE","date":"2023-08-23","arxiv_id":"2308.11971","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-the-intangible-surveying-automatic","title":"Seeing the Intangible: Survey of Image Classification into High-Level and Abstract Categories","date":"2023-08-21","arxiv_id":"2308.10562","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-grounded-visual-spatial-reasoning-in","title":"Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models","date":"2023-08-18","arxiv_id":"2308.09778","repositories_listed":0,"syntology":null},{"url":null,"slug":"tree-of-mixed-thought-combining-fast-and-slow","title":"Tree-of-Mixed-Thought: Combining Fast and Slow Thinking for Multi-hop Visual Reasoning","date":"2023-08-18","arxiv_id":"2308.09658","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-imagery-unleashing-large-language","title":"Multimodal Analysis Of Google Bard And GPT-Vision: Experiments In Visual Reasoning","date":"2023-08-17","arxiv_id":"2309.16705","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-gap-exploring-the-capabilities","title":"Bridging the Gap: Exploring the Capabilities of Bridge-Architectures for Complex Visual Reasoning Tasks","date":"2023-07-31","arxiv_id":"2307.16395","repositories_listed":0,"syntology":null},{"url":null,"slug":"lois-looking-out-of-instance-semantics-for","title":"LOIS: Looking Out of Instance Semantics for Visual Question Answering","date":"2023-07-26","arxiv_id":"2307.14142","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-conditional-slot-attention-for","title":"Grounded Object Centric Learning","date":"2023-07-18","arxiv_id":"2307.09437","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-visual-pretraining-help-end-to-end","title":"Does Visual Pretraining Help End-to-End Reasoning?","date":"2023-07-17","arxiv_id":"2307.08506","repositories_listed":0,"syntology":null},{"url":null,"slug":"look-remember-and-reason-visual-reasoning","title":"Look, Remember and Reason: Grounded reasoning in videos with language models","date":"2023-06-30","arxiv_id":"2306.17778","repositories_listed":0,"syntology":null},{"url":null,"slug":"phd-thesis-exploring-the-role-of-self","title":"PhD Thesis: Exploring the role of (self-)attention in cognitive and computer vision architecture","date":"2023-06-26","arxiv_id":"2306.14650","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-domain-independent-agent-architecture-for","title":"A Domain-Independent Agent Architecture for Adaptive Operation in Evolving Open Worlds","date":"2023-06-09","arxiv_id":"2306.06272","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-large-language-models-for-scalable","title":"Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding","date":"2023-06-09","arxiv_id":"2306.06094","repositories_listed":0,"syntology":null},{"url":"/paper/simple-token-level-confidence-improves","slug":"simple-token-level-confidence-improves","title":"Simple Token-Level Confidence Improves Caption Correctness","date":"2023-05-11","arxiv_id":"2305.07021","repositories_listed":0,"syntology":null},{"url":"/paper/incorporating-structured-representations-into","slug":"incorporating-structured-representations-into","title":"Incorporating Structured Representations into Pretrained Vision & Language Models Using Scene Graphs","date":"2023-05-10","arxiv_id":"2305.06343","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-role-of-object-centric-representations","title":"The role of object-centric representations, guided attention, and external memory on generalizing visual relations","date":"2023-04-14","arxiv_id":"2304.07091","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-cross-task-transferability-of","title":"Boosting Cross-task Transferability of Adversarial Patches with Visual Relations","date":"2023-04-11","arxiv_id":"2304.05402","repositories_listed":0,"syntology":null},{"url":null,"slug":"cavl-learning-contrastive-and-adaptive","title":"CAVL: Learning Contrastive and Adaptive Representations of Vision and Language","date":"2023-04-10","arxiv_id":"2304.04399","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-ai-and-visual-reasoning-insights","title":"Explainable AI And Visual Reasoning: Insights From Radiology","date":"2023-04-06","arxiv_id":"2304.03318","repositories_listed":0,"syntology":null},{"url":null,"slug":"navigating-to-objects-specified-by-images","title":"Navigating to Objects Specified by Images","date":"2023-04-03","arxiv_id":"2304.01192","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-learning-for-compositional-visual","title":"Curriculum Learning for Compositional Visual Reasoning","date":"2023-03-27","arxiv_id":"2303.15006","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-concept-learning-and-reasoning-from-multi","title":"3D Concept Learning and Reasoning from Multi-View Images","date":"2023-03-20","arxiv_id":"2303.11327","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-constructing-latent","title":"Understanding and Constructing Latent Modality Structures in Multi-modal Representation Learning","date":"2023-03-10","arxiv_id":"2303.05952","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-abstraction-and-reasoning-through","title":"Abstract Visual Reasoning Enabled by Language","date":"2023-03-07","arxiv_id":"2303.04091","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-analytics-of-neuron-vulnerability-to","title":"Visual Analytics of Neuron Vulnerability to Adversarial Attacks on Convolutional Neural Networks","date":"2023-03-06","arxiv_id":"2303.02814","repositories_listed":0,"syntology":null},{"url":null,"slug":"jointly-visual-and-semantic-aware-graph","title":"Jointly Visual- and Semantic-Aware Graph Memory Networks for Temporal Sentence Localization in Videos","date":"2023-03-02","arxiv_id":"2303.01046","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit3d-graph-network-with-spatial","title":"Explicit3D: Graph Network with Spatial Inference for Single Image 3D Object Detection","date":"2023-02-13","arxiv_id":"2302.06494","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-agree-on-vision-attention-for","title":"Learning to Agree on Vision Attention for Visual Commonsense Reasoning","date":"2023-02-04","arxiv_id":"2302.02117","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-divide-align-conquer-strategy-for-program","title":"A Divide-Align-Conquer Strategy for Program Synthesis","date":"2023-01-08","arxiv_id":"2301.03094","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-representation-for-order-aware-visual","title":"Graph Representation for Order-Aware Visual Transformation","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"image-as-a-foreign-language-beit-pretraining-1","title":"Image as a Foreign Language: BEiT Pretraining for Vision and Vision-Language Tasks","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"open-set-video-hoi-detection-from-action","title":"Open Set Video HOI detection from Action-Centric Chain-of-Look Prompting","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/vilem-visual-language-error-modeling-for","slug":"vilem-visual-language-error-modeling-for","title":"ViLEM: Visual-Language Error Modeling for Image-Text Retrieval","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"euclidnet-deep-visual-reasoning-for","title":"EuclidNet: Deep Visual Reasoning for Constructible Problems in Geometry","date":"2022-12-27","arxiv_id":"2301.13007","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-and-visual-reasoning-an-overview-of","title":"VQA and Visual Reasoning: An Overview of Recent Datasets, Methods and Challenges","date":"2022-12-26","arxiv_id":"2212.13296","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-unsupervised-visual-reasoning-do-off","title":"Towards Unsupervised Visual Reasoning: Do Off-The-Shelf Features Know How to Reason?","date":"2022-12-20","arxiv_id":"2212.10292","repositories_listed":0,"syntology":null},{"url":"/paper/does-structural-attention-improve","slug":"does-structural-attention-improve","title":"Does Structural Attention Improve Compositional Representations in Vision-Language Models?","date":"2022-12-03","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/abstract-visual-reasoning-with-tangram-shapes","slug":"abstract-visual-reasoning-with-tangram-shapes","title":"Abstract Visual Reasoning with Tangram Shapes","date":"2022-11-29","arxiv_id":"2211.16492","repositories_listed":0,"syntology":null},{"url":null,"slug":"reason-from-context-with-self-supervised","title":"Reason from Context with Self-supervised Learning","date":"2022-11-23","arxiv_id":"2211.12817","repositories_listed":0,"syntology":null},{"url":"/paper/unifying-vision-language-representation-space","slug":"unifying-vision-language-representation-space","title":"Unifying Vision-Language Representation Space with Single-tower Transformer","date":"2022-11-21","arxiv_id":"2211.11153","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-knowledge-enhanced-multimodal","title":"A survey on knowledge-enhanced multimodal learning","date":"2022-11-19","arxiv_id":"2211.12328","repositories_listed":0,"syntology":null},{"url":"/paper/lilgym-natural-language-visual-reasoning-with","slug":"lilgym-natural-language-visual-reasoning-with","title":"lilGym: Natural Language Visual Reasoning with Reinforcement Learning","date":"2022-11-03","arxiv_id":"2211.01994","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamo-masked-multimodal-modeling-for-fine","title":"MAMO: Masked Multimodal Modeling for Fine-Grained Vision-Language Representation Learning","date":"2022-10-09","arxiv_id":"2210.04183","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-visual-reasoning-through","title":"Zero-shot visual reasoning through probabilistic analogical mapping","date":"2022-09-29","arxiv_id":"2209.15087","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-neural-networks-for-visual-reasoning","title":"Deep Neural Networks for Visual Reasoning","date":"2022-09-24","arxiv_id":"2209.11990","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-for-all-one-stage-referring-expression","title":"One for All: One-stage Referring Expression Comprehension with Dynamic Reasoning","date":"2022-07-31","arxiv_id":"2208.00361","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-concept-grounding-on-neural-fields","title":"3D Concept Grounding on Neural Fields","date":"2022-07-13","arxiv_id":"2207.06403","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-shallow-to-deep-compositional-reasoning","title":"From Shallow to Deep: Compositional Reasoning over Graphs for Visual Question Answering","date":"2022-06-25","arxiv_id":"2206.12533","repositories_listed":0,"syntology":null},{"url":null,"slug":"est-evaluating-scientific-thinking-in","title":"Interactive Visual Reasoning under Uncertainty","date":"2022-06-18","arxiv_id":"2206.09203","repositories_listed":0,"syntology":null},{"url":null,"slug":"vl-beit-generative-vision-language","title":"VL-BEiT: Generative Vision-Language Pretraining","date":"2022-06-02","arxiv_id":"2206.01127","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-subgoal-planning-with-language","title":"Few-shot Subgoal Planning with Language Models","date":"2022-05-28","arxiv_id":"2205.14288","repositories_listed":0,"syntology":null},{"url":null,"slug":"guiding-visual-question-answering-with","title":"Guiding Visual Question Answering with Attention Priors","date":"2022-05-25","arxiv_id":"2205.12616","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-learning-on-3d-point-clouds-with","title":"Continual learning on 3D point clouds with random compressed rehearsal","date":"2022-05-16","arxiv_id":"2205.08013","repositories_listed":0,"syntology":null},{"url":null,"slug":"introduction-to-soar","title":"Introduction to Soar","date":"2022-05-08","arxiv_id":"2205.03854","repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-me-multi-task-open-vocabulary-visual","title":"Answer-Me: Multi-Task Open-Vocabulary Visual Question Answering","date":"2022-05-02","arxiv_id":"2205.00949","repositories_listed":0,"syntology":null},{"url":null,"slug":"co-vqa-answering-by-interactive-sub-question-1","title":"Co-VQA : Answering by Interactive Sub Question Sequence","date":"2022-04-02","arxiv_id":"2204.00879","repositories_listed":0,"syntology":null}],"record_sha256":"4389ebddc19230ad35e0c73f0ac462e1f27e7146d3c8085a4b5c240656cdbb98","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}