{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-grounding/papers/5","list_of":"/task/visual-grounding","task":"Visual Grounding","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":5,"pages_in_order":6,"rows_per_page":100,"rows":[401,500],"of":571,"counts":{"archive_papers_tagged":571,"with_a_code_link":299,"where_syntology_ran_a_sample":111,"not_listed_spam_title":0,"listed":571,"listed_where_code_ran":111,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":95,"every_run_a_failure_of_syntologys_instrument":16,"listed_with_a_run_with_no_instrument_failure":95,"listed_every_run_a_failure_of_syntologys_instrument":16,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-grounding","prev":"/task/visual-grounding/papers/4","next":"/task/visual-grounding/papers/6","papers":[{"url":null,"slug":"learning-visual-grounding-from-generative","title":"Learning Visual Grounding from Generative Vision and Language Model","date":"2024-07-18","arxiv_id":"2407.14563","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-vocabulary-3d-semantic-segmentation-with-1","title":"Open-Vocabulary 3D Semantic Segmentation with Text-to-Image Diffusion Models","date":"2024-07-18","arxiv_id":"2407.13642","repositories_listed":0,"syntology":null},{"url":null,"slug":"vimi-grounding-video-generation-through-multi","title":"VIMI: Grounding Video Generation through Multi-modal Instruction","date":"2024-07-08","arxiv_id":"2407.06304","repositories_listed":0,"syntology":null},{"url":null,"slug":"second-place-solution-of-wsdm2023-toloka","title":"Second Place Solution of WSDM2023 Toloka Visual Question Answering Challenge","date":"2024-07-05","arxiv_id":"2407.04255","repositories_listed":0,"syntology":null},{"url":null,"slug":"actress-active-retraining-for-semi-supervised","title":"ACTRESS: Active Retraining for Semi-supervised Visual Grounding","date":"2024-07-03","arxiv_id":"2407.03251","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-grounding-with-attention-driven","title":"Visual Grounding with Attention-Driven Constraint Balancing","date":"2024-07-03","arxiv_id":"2407.03243","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-solution-for-the-iccv-2023-perception","title":"The Solution for the ICCV 2023 Perception Test Challenge 2023 -- Task 6 -- Grounded videoQA","date":"2024-07-02","arxiv_id":"2407.01907","repositories_listed":0,"syntology":null},{"url":null,"slug":"empowering-3d-visual-grounding-with-reasoning","title":"ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities","date":"2024-07-01","arxiv_id":"2407.01525","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-local-concepts-to-universals-evaluating","title":"From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language Models","date":"2024-06-28","arxiv_id":"2407.00263","repositories_listed":0,"syntology":null},{"url":null,"slug":"flowvqa-mapping-multimodal-logic-in-visual","title":"FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts","date":"2024-06-27","arxiv_id":"2406.19237","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-role-of-visual-grounding-in-vqa","title":"On the Role of Visual Grounding in VQA","date":"2024-06-26","arxiv_id":"2406.18253","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-open-world-grasping-with-large-vision","title":"Towards Open-World Grasping with Large Vision-Language Models","date":"2024-06-26","arxiv_id":"2406.18722","repositories_listed":0,"syntology":null},{"url":"/paper/learning-hierarchical-semantic-classification","slug":"learning-hierarchical-semantic-classification","title":"Visually Consistent Hierarchical Image Classification","date":"2024-06-17","arxiv_id":"2406.11608","repositories_listed":0,"syntology":{"n":4,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":4,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/learning-hierarchical-semantic-classification#ran","syntology_url":"https://syntology.ai/paper/2406.11608","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2406.11608"}},"official":null}},{"url":null,"slug":"learning-language-structures-through","title":"Learning Language Structures through Grounding","date":"2024-06-14","arxiv_id":"2406.09662","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-attribute-spatial-relation-alignment-for","title":"Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding","date":"2024-06-13","arxiv_id":"2406.08907","repositories_listed":0,"syntology":null},{"url":null,"slug":"hpe-cogvlm-new-head-pose-grounding-task","title":"HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task","date":"2024-06-04","arxiv_id":"2406.01914","repositories_listed":0,"syntology":null},{"url":null,"slug":"henasy-learning-to-assemble-scene-entities","title":"HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model","date":"2024-06-01","arxiv_id":"2406.00307","repositories_listed":0,"syntology":null},{"url":null,"slug":"intent3d-3d-object-detection-in-rgb-d-scans","title":"Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention","date":"2024-05-28","arxiv_id":"2405.18295","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-optic-unveiling-the-capabilities-of-large","title":"LLM-Optic: Unveiling the Capabilities of Large Language Models for Universal Visual Grounding","date":"2024-05-27","arxiv_id":"2405.17104","repositories_listed":0,"syntology":null},{"url":null,"slug":"talk-to-parallel-lidars-a-human-lidar","title":"Talk to Parallel LiDARs: A Human-LiDAR Interaction Method Based on 3D Visual Grounding","date":"2024-05-24","arxiv_id":"2405.15274","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-grounding-for-desktop-graphical-user","title":"Visual grounding for desktop graphical user interfaces","date":"2024-05-05","arxiv_id":"2407.01558","repositories_listed":0,"syntology":null},{"url":null,"slug":"naturally-supervised-3d-visual-grounding-with","title":"Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners","date":"2024-04-30","arxiv_id":"2404.19696","repositories_listed":0,"syntology":null},{"url":null,"slug":"blenderalchemy-editing-3d-graphics-with","title":"BlenderAlchemy: Editing 3D Graphics with Vision-Language Models","date":"2024-04-26","arxiv_id":"2404.17672","repositories_listed":0,"syntology":null},{"url":null,"slug":"medrg-medical-report-grounding-with-multi","title":"MedRG: Medical Report Grounding with Multi-modal Large Language Model","date":"2024-04-10","arxiv_id":"2404.06798","repositories_listed":0,"syntology":null},{"url":null,"slug":"dora-3d-visual-grounding-with-order-aware","title":"Data-Efficient 3D Visual Grounding via Order-Aware Referring","date":"2024-03-25","arxiv_id":"2403.16539","repositories_listed":0,"syntology":null},{"url":null,"slug":"surgical-lvlm-learning-to-adapt-large-vision","title":"Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery","date":"2024-03-22","arxiv_id":"2405.10948","repositories_listed":0,"syntology":null},{"url":null,"slug":"vidla-video-language-alignment-at-scale","title":"VidLA: Video-Language Alignment at Scale","date":"2024-03-21","arxiv_id":"2403.14870","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-models-and-data-for-visual","title":"Learning from Synthetic Data for Visual Grounding","date":"2024-03-20","arxiv_id":"2403.13804","repositories_listed":0,"syntology":null},{"url":null,"slug":"watervg-waterway-visual-grounding-based-on","title":"WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar","date":"2024-03-19","arxiv_id":"2403.12686","repositories_listed":0,"syntology":null},{"url":null,"slug":"right-place-right-time-towards-objectnav-for","title":"Right Place, Right Time! Dynamizing Topological Graphs for Embodied Navigation","date":"2024-03-14","arxiv_id":"2403.09905","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-concrete-visual-tokens-for","title":"Detecting Concrete Visual Tokens for Multimodal Machine Translation","date":"2024-03-05","arxiv_id":"2403.03075","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-testing-for-visual-grounding-via","title":"Adversarial Testing for Visual Grounding via Image-Aware Property Reduction","date":"2024-03-02","arxiv_id":"2403.01118","repositories_listed":0,"syntology":null},{"url":null,"slug":"omniact-a-dataset-and-benchmark-for-enabling","title":"OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web","date":"2024-02-27","arxiv_id":"2402.17553","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-slot-interpreters-grounding-object","title":"Neural Slot Interpreters: Grounding Object Semantics in Emergent Slot Representations","date":"2024-02-02","arxiv_id":"2403.07887","repositories_listed":0,"syntology":null},{"url":null,"slug":"sco-vist-social-interaction-commonsense","title":"SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling","date":"2024-02-01","arxiv_id":"2402.00319","repositories_listed":0,"syntology":null},{"url":null,"slug":"lcvo-an-efficient-pretraining-free-framework","title":"LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering","date":"2024-01-29","arxiv_id":"2401.15842","repositories_listed":0,"syntology":null},{"url":null,"slug":"sceneverse-scaling-3d-vision-language","title":"SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding","date":"2024-01-17","arxiv_id":"2401.09340","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-truly-zero-shot-compositional-visual","title":"Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers","date":"2024-01-03","arxiv_id":"2401.01974","repositories_listed":0,"syntology":null},{"url":null,"slug":"g-3-lq-marrying-hyperbolic-alignment-with","title":"G^3-LQ: Marrying Hyperbolic Alignment with Explicit Semantic-Geometric Modeling for 3D Visual Grounding","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lqmformer-language-aware-query-mask","title":"LQMFormer: Language-aware Query Mask Transformer for Referring Image Segmentation","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"omni-q-omni-directional-scene-understanding","title":"Omni-Q: Omni-Directional Scene Understanding for Unsupervised Visual Grounding","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-clip-driven-language-free-3d-visual","title":"Towards CLIP-driven Language-free 3D Visual Grounding via 2D-3D Relational Enhancement and Consistency","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"viewpoint-aware-visual-grounding-in-3d-scenes","title":"Viewpoint-Aware Visual Grounding in 3D Scenes","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"when-visual-grounding-meets-gigapixel-level","title":"When Visual Grounding Meets Gigapixel-level Large-scale Scenes: Benchmark and Approach","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-modality-gap-for-visual-grounding","title":"Bridging Modality Gap for Visual Grounding with Effecitve Cross-modal Distillation","date":"2023-12-29","arxiv_id":"2312.17648","repositories_listed":0,"syntology":null},{"url":null,"slug":"cycle-consistency-learning-for-captioning-and","title":"Cycle-Consistency Learning for Captioning and Grounding","date":"2023-12-23","arxiv_id":"2312.15162","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-3d-visual-grounding-based","title":"Weakly-Supervised 3D Visual Grounding based on Visual Linguistic Alignment","date":"2023-12-15","arxiv_id":"2312.09625","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-grounding-of-whole-radiology-reports","title":"Visual Grounding of Whole Radiology Reports for 3D CT Images","date":"2023-12-08","arxiv_id":"2312.04794","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-visual-grounding-through-self","title":"Improved Visual Grounding through Self-Consistent Explanations","date":"2023-12-07","arxiv_id":"2312.04554","repositories_listed":0,"syntology":null},{"url":null,"slug":"uni3dl-unified-model-for-3d-and-language","title":"Uni3DL: Unified Model for 3D and Language Understanding","date":"2023-12-05","arxiv_id":"2312.03026","repositories_listed":0,"syntology":null},{"url":null,"slug":"expand-bert-representation-with-visual","title":"Expand BERT Representation with Visual Information via Grounded Language Learning with Multimodal Partial Alignment","date":"2023-12-04","arxiv_id":"2312.01592","repositories_listed":0,"syntology":null},{"url":null,"slug":"pisa-point-cloud-based-instructed-scene","title":"Context-Aware Indoor Point Cloud Object Generation through User Instructions","date":"2023-11-26","arxiv_id":"2311.16501","repositories_listed":0,"syntology":null},{"url":null,"slug":"vilam-a-vision-language-model-with-enhanced","title":"Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models","date":"2023-11-21","arxiv_id":"2311.12327","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-study-of-gpt-4v-s-multimodal","title":"A Systematic Evaluation of GPT-4V's Multimodal Capability for Medical Image Analysis","date":"2023-10-31","arxiv_id":"2310.20381","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-does-matter-end-to-end-panoptic","title":"Context Does Matter: End-to-end Panoptic Narrative Grounding with Deformable Attention Refined Matching Network","date":"2023-10-25","arxiv_id":"2310.16616","repositories_listed":0,"syntology":null},{"url":null,"slug":"lightweight-in-context-tuning-for-multimodal","title":"Lightweight In-Context Tuning for Multimodal Unified Models","date":"2023-10-08","arxiv_id":"2310.05109","repositories_listed":0,"syntology":null},{"url":null,"slug":"object2scene-putting-objects-in-context-for","title":"Object2Scene: Putting Objects in Context for Open-Vocabulary 3D Detection","date":"2023-09-18","arxiv_id":"2309.09456","repositories_listed":0,"syntology":null},{"url":null,"slug":"three-ways-to-improve-verbo-visual-fusion-for","title":"Four Ways to Improve Verbo-visual Fusion for Dense 3D Visual Grounding","date":"2023-09-08","arxiv_id":"2309.04561","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-question-answering-via","title":"Interpretable Visual Question Answering via Reasoning Supervision","date":"2023-09-07","arxiv_id":"2309.03726","repositories_listed":0,"syntology":null},{"url":null,"slug":"facet-fairness-in-computer-vision-evaluation","title":"FACET: Fairness in Computer Vision Evaluation Benchmark","date":"2023-08-31","arxiv_id":"2309.00035","repositories_listed":0,"syntology":null},{"url":null,"slug":"wall-e-embodied-robotic-waiter-load-lifting","title":"WALL-E: Embodied Robotic WAiter Load Lifting with Large Language Model","date":"2023-08-30","arxiv_id":"2308.15962","repositories_listed":0,"syntology":null},{"url":null,"slug":"3drp-net-3d-relative-position-aware-network","title":"3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding","date":"2023-07-25","arxiv_id":"2307.13363","repositories_listed":0,"syntology":null},{"url":null,"slug":"og-equip-vision-occupancy-with-instance","title":"OG: Equip vision occupancy with instance segmentation and visual grounding","date":"2023-07-12","arxiv_id":"2307.05873","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-with-difference-attention-for","title":"Learning with Difference Attention for Visually Grounded Self-supervised Representations","date":"2023-06-26","arxiv_id":"2306.14603","repositories_listed":0,"syntology":null},{"url":null,"slug":"risclip-referring-image-segmentation","title":"Extending CLIP's Image-Text Alignment to Referring Image Segmentation","date":"2023-06-14","arxiv_id":"2306.08498","repositories_listed":0,"syntology":null},{"url":null,"slug":"referring-to-screen-texts-with-voice","title":"Referring to Screen Texts with Voice Assistants","date":"2023-06-10","arxiv_id":"2306.07298","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-diverse-modal-entity-linking","title":"Benchmarking Diverse-Modal Entity Linking with Generative Models","date":"2023-05-27","arxiv_id":"2305.17337","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-guided-3d-object-detection-in-point","title":"Language-Guided 3D Object Detection in Point Cloud for Autonomous Driving","date":"2023-05-25","arxiv_id":"2305.15765","repositories_listed":0,"syntology":null},{"url":null,"slug":"treeprompt-learning-to-compose-tree-prompts","title":"TreePrompt: Learning to Compose Tree Prompts for Explainable Visual Grounding","date":"2023-05-19","arxiv_id":"2305.11497","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-pre-training-with-object","title":"Vision-Language Pre-training with Object Contrastive Learning for 3D Scene Understanding","date":"2023-05-18","arxiv_id":"2305.10714","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-specific-debiasing-for-better-image","title":"Sample-Specific Debiasing for Better Image-Text Models","date":"2023-04-25","arxiv_id":"2304.13181","repositories_listed":0,"syntology":null},{"url":null,"slug":"movie-box-office-prediction-with-self","title":"Movie Box Office Prediction With Self-Supervised and Visually Grounded Pretraining","date":"2023-04-20","arxiv_id":"2304.10311","repositories_listed":0,"syntology":null},{"url":null,"slug":"medical-phrase-grounding-with-region-phrase","title":"Medical Phrase Grounding with Region-Phrase Context Contrastive Alignment","date":"2023-03-14","arxiv_id":"2303.07618","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-vertex-diffusion-for-unified-visual","title":"Parallel Vertex Diffusion for Unified Visual Grounding","date":"2023-03-13","arxiv_id":"2303.07216","repositories_listed":0,"syntology":null},{"url":null,"slug":"focusing-on-targets-for-improving-weakly","title":"Focusing On Targets For Improving Weakly Supervised Visual Grounding","date":"2023-02-22","arxiv_id":"2302.11252","repositories_listed":0,"syntology":null},{"url":null,"slug":"cosign-exploring-co-occurrence-signals-in","title":"CoSign: Exploring Co-occurrence Signals in Skeleton-based Continuous Sign Language Recognition","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-inference-with-grounding-based-vision","title":"Dynamic Inference With Grounding Based Vision and Language Models","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"gafnet-a-global-fourier-self-attention-based","title":"GAFNet: A Global Fourier Self Attention Based Novel Network for multi-modal downstream tasks","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"viewrefer-grasp-the-multi-view-knowledge-for-1","title":"ViewRefer: Grasp the Multi-view Knowledge for 3D Visual Grounding","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"using-multiple-instance-learning-to-build","title":"Using Multiple Instance Learning to Build Multimodal Representations","date":"2022-12-11","arxiv_id":"2212.05561","repositories_listed":0,"syntology":null},{"url":null,"slug":"unit3d-a-unified-transformer-for-3d-dense","title":"UniT3D: A Unified Transformer for 3D Dense Captioning and Visual Grounding","date":"2022-12-01","arxiv_id":"2212.00836","repositories_listed":0,"syntology":null},{"url":null,"slug":"mner-qg-an-end-to-end-mrc-framework-for","title":"MNER-QG: An End-to-End MRC framework for Multimodal Named Entity Recognition with Query Grounding","date":"2022-11-27","arxiv_id":"2211.14739","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-knowledge-enhanced-multimodal","title":"A survey on knowledge-enhanced multimodal learning","date":"2022-11-19","arxiv_id":"2211.12328","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-current-decoding-strategies-capable-of","title":"Are Current Decoding Strategies Capable of Facing the Challenges of Visual Dialogue?","date":"2022-10-24","arxiv_id":"2210.12997","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-visual-tour-of-current-challenges-in","title":"A Visual Tour Of Current Challenges In Multimodal Language Models","date":"2022-10-22","arxiv_id":"2210.12565","repositories_listed":0,"syntology":null},{"url":null,"slug":"like-a-bilingual-baby-the-advantage-of","title":"Like a bilingual baby: The advantage of visually grounding a bilingual language model","date":"2022-10-11","arxiv_id":"2210.05487","repositories_listed":0,"syntology":null},{"url":null,"slug":"yfacc-a-yoruba-speech-image-dataset-for-cross","title":"YFACC: A Yorùbá speech-image dataset for cross-lingual keyword localisation through visual grounding","date":"2022-10-10","arxiv_id":"2210.04600","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamo-masked-multimodal-modeling-for-fine","title":"MAMO: Masked Multimodal Modeling for Fine-Grained Vision-Language Representation Learning","date":"2022-10-09","arxiv_id":"2210.04183","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentiable-parsing-and-visual-grounding","title":"Differentiable Parsing and Visual Grounding of Natural Language Instructions for Object Placement","date":"2022-10-01","arxiv_id":"2210.00215","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-mdetr-a-dynamic-multimodal","title":"Dynamic MDETR: A Dynamic Multimodal Transformer Decoder for Visual Grounding","date":"2022-09-28","arxiv_id":"2209.13959","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-grounding-of-inter-lingual-word","title":"Visual Grounding of Inter-lingual Word-Embeddings","date":"2022-09-08","arxiv_id":"2209.03714","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlmae-vision-language-masked-autoencoder","title":"VLMAE: Vision-Language Masked Autoencoder","date":"2022-08-19","arxiv_id":"2208.09374","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-explainable-and-fine-grained-3d","title":"Toward Explainable and Fine-Grained 3D Grounding through Referring Textual Phrases","date":"2022-07-05","arxiv_id":"2207.01821","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-grounding-of-abstract-and-concrete","title":"How direct is the link between words and images?","date":"2022-06-30","arxiv_id":"2206.15381","repositories_listed":0,"syntology":null},{"url":null,"slug":"tell-me-the-evidence-dual-visual-linguistic","title":"Tell Me the Evidence? Dual Visual-Linguistic Interaction for Answer Grounding","date":"2022-06-21","arxiv_id":"2207.05703","repositories_listed":0,"syntology":null},{"url":null,"slug":"bear-the-query-in-mind-visual-grounding-with","title":"Bear the Query in Mind: Visual Grounding with Query-conditioned Convolution","date":"2022-06-18","arxiv_id":"2206.09114","repositories_listed":0,"syntology":null},{"url":null,"slug":"guiding-visual-question-answering-with","title":"Guiding Visual Question Answering with Attention Priors","date":"2022-05-25","arxiv_id":"2205.12616","repositories_listed":0,"syntology":null},{"url":null,"slug":"sim-to-real-transfer-of-visual-grounding-for","title":"Sim-To-Real Transfer of Visual Grounding for Human-Aided Ambiguity Resolution","date":"2022-05-24","arxiv_id":"2205.12089","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-segmentation-of-referring","title":"Weakly-supervised segmentation of referring expressions","date":"2022-05-10","arxiv_id":"2205.04725","repositories_listed":0,"syntology":null},{"url":null,"slug":"findit-generalized-localization-with-natural","title":"FindIt: Generalized Localization with Natural Language Queries","date":"2022-03-31","arxiv_id":"2203.17273","repositories_listed":0,"syntology":null}],"record_sha256":"ff49d75966ac6563efe96f985846d4c97fc90c81af4e75cd850386572cb571a7","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}