{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/cross-modal-alignment/papers/3","list_of":"/task/cross-modal-alignment","task":"cross-modal alignment","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":4,"rows_per_page":100,"rows":[201,300],"of":342,"counts":{"archive_papers_tagged":342,"with_a_code_link":151,"where_syntology_ran_a_sample":47,"not_listed_spam_title":0,"listed":342,"listed_where_code_ran":47,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":41,"every_run_a_failure_of_syntologys_instrument":6,"listed_with_a_run_with_no_instrument_failure":41,"listed_every_run_a_failure_of_syntologys_instrument":6,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/cross-modal-alignment","prev":"/task/cross-modal-alignment/papers/2","next":"/task/cross-modal-alignment/papers/4","papers":[{"url":null,"slug":"langbridge-interpreting-image-as-a","title":"LangBridge: Interpreting Image as a Combination of Language Embeddings","date":"2025-03-25","arxiv_id":"2503.19404","repositories_listed":0,"syntology":null},{"url":null,"slug":"shushing-let-s-imagine-an-authentic-speech","title":"Shushing! Let's Imagine an Authentic Speech from the Silent Video","date":"2025-03-19","arxiv_id":"2503.14928","repositories_listed":0,"syntology":null},{"url":null,"slug":"observation-graph-interaction-and-key-detail","title":"Observation-Graph Interaction and Key-Detail Guidance for Vision and Language Navigation","date":"2025-03-14","arxiv_id":"2503.11006","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-stage-cross-modal-network-with-dynamic","title":"Technical Approach for the EMI Challenge in the 8th Affective Behavior Analysis in-the-Wild Competition","date":"2025-03-13","arxiv_id":"2503.10603","repositories_listed":0,"syntology":null},{"url":null,"slug":"4d-acfnet-a-4d-attention-mechanism-based","title":"4D-ACFNet: A 4D Attention Mechanism-Based Prognostic Framework for Colorectal Cancer Liver Metastasis Integrating Multimodal Spatiotemporal Features","date":"2025-03-12","arxiv_id":"2503.09652","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-cross-modal-alignment-for-open","title":"Hierarchical Cross-Modal Alignment for Open-Vocabulary 3D Object Detection","date":"2025-03-10","arxiv_id":"2503.07593","repositories_listed":0,"syntology":null},{"url":null,"slug":"llava-radz-can-multimodal-large-language","title":"LLaVA-RadZ: Can Multimodal Large Language Models Effectively Tackle Zero-shot Radiology Recognition?","date":"2025-03-10","arxiv_id":"2503.07487","repositories_listed":0,"syntology":null},{"url":"/paper/ov-scan-semantically-consistent-alignment-for","slug":"ov-scan-semantically-consistent-alignment-for","title":"OV-SCAN: Semantically Consistent Alignment for Novel Object Discovery in Open-Vocabulary 3D Object Detection","date":"2025-03-09","arxiv_id":"2503.06435","repositories_listed":0,"syntology":{"n":8,"n_ran":5,"n_constructed":0,"n_ran_checked":5,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/ov-scan-semantically-consistent-alignment-for#ran","syntology_url":"https://syntology.ai/paper/2503.06435","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2503.06435"}},"official":null}},{"url":null,"slug":"enhancing-vision-language-compositional","title":"Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data","date":"2025-03-03","arxiv_id":"2503.01167","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-00427","title":"Language Model Mapping in Multimodal Music Learning: A Grand Challenge Proposal","date":"2025-03-01","arxiv_id":"2503.00427","repositories_listed":0,"syntology":null},{"url":null,"slug":"unigs-unified-language-image-3d-pretraining","title":"UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting","date":"2025-02-25","arxiv_id":"2502.17860","repositories_listed":0,"syntology":null},{"url":null,"slug":"dunia-pixel-sized-embeddings-via-cross-modal","title":"DUNIA: Pixel-Sized Embeddings via Cross-Modal Alignment for Earth Observation Applications","date":"2025-02-24","arxiv_id":"2502.17066","repositories_listed":0,"syntology":null},{"url":null,"slug":"cardiacmamba-a-multimodal-rgb-rf-fusion","title":"CardiacMamba: A Multimodal RGB-RF Fusion Framework with State Space Models for Remote Physiological Measurement","date":"2025-02-19","arxiv_id":"2502.13624","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-automatic-prompt-engineering-an","title":"A Survey of Automatic Prompt Engineering: An Optimization Perspective","date":"2025-02-17","arxiv_id":"2502.11560","repositories_listed":0,"syntology":null},{"url":null,"slug":"nota-multimodal-music-notation-understanding","title":"NOTA: Multimodal Music Notation Understanding for Visual Large Language Model","date":"2025-02-17","arxiv_id":"2502.14893","repositories_listed":0,"syntology":null},{"url":null,"slug":"mde-modality-discrimination-enhancement-for","title":"MDE: Modality Discrimination Enhancement for Multi-modal Recommendation","date":"2025-02-08","arxiv_id":"2502.18481","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-pre-trained-models-for-multimodal","title":"Leveraging Pre-Trained Models for Multimodal Class-Incremental Learning under Adaptive Fusion","date":"2025-02-07","arxiv_id":"2506.09999","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-context-fusion-and-adaptive-graph","title":"Cross-modal Context Fusion and Adaptive Graph Convolutional Network for Multimodal Conversational Emotion Recognition","date":"2025-01-25","arxiv_id":"2501.15063","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrate-temporal-graph-learning-into-llm","title":"Integrate Temporal Graph Learning into LLM-based Temporal Knowledge Graph Model","date":"2025-01-21","arxiv_id":"2501.11911","repositories_listed":0,"syntology":null},{"url":null,"slug":"cgp-tuning-structure-aware-soft-prompt-tuning","title":"CGP-Tuning: Structure-Aware Soft Prompt Tuning for Code Vulnerability Detection","date":"2025-01-08","arxiv_id":"2501.04510","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-visual-semantic-graph-network-for-audio","title":"Audio-Visual Semantic Graph Network for Audio-Visual Event Localization","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"chat-based-person-retrieval-via-dialogue","title":"Chat-based Person Retrieval via Dialogue-Refined Cross-Modal Alignment","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-zero-shot-classification-via","title":"Generalized Zero-Shot Classification via Semantics-Free Inter-Class Feature Generation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"chartadapter-large-vision-language-model-for","title":"ChartAdapter: Large Vision-Language Model for Chart Summarization","date":"2024-12-30","arxiv_id":"2412.20715","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-multimodal-emotion-recognition","title":"Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment","date":"2024-12-30","arxiv_id":"2412.20821","repositories_listed":0,"syntology":null},{"url":null,"slug":"bag-of-tricks-for-multimodal-automl-with","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","date":"2024-12-19","arxiv_id":"2412.16243","repositories_listed":0,"syntology":null},{"url":null,"slug":"rac3-retrieval-augmented-corner-case","title":"RAC3: Retrieval-Augmented Corner Case Comprehension for Autonomous Driving with Vision-Language Models","date":"2024-12-15","arxiv_id":"2412.11050","repositories_listed":0,"syntology":null},{"url":null,"slug":"wearable-accelerometer-foundation-models-for","title":"Wearable Accelerometer Foundation Models for Health via Knowledge Distillation","date":"2024-12-15","arxiv_id":"2412.11276","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-cross-modal-alignment-for-robust","title":"Dynamic Cross-Modal Alignment for Robust Semantic Location Prediction","date":"2024-12-13","arxiv_id":"2412.09870","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-modality-representation-and","title":"Enhancing Modality Representation and Alignment for Multimodal Cold-start Active Learning","date":"2024-12-12","arxiv_id":"2412.09126","repositories_listed":0,"syntology":null},{"url":null,"slug":"gexia-granularity-expansion-and-iterative","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","date":"2024-12-10","arxiv_id":"2412.07704","repositories_listed":0,"syntology":null},{"url":null,"slug":"deeper-dense-electroencephalography-passage","title":"Towards Brain Passage Retrieval -- An Investigation of EEG Query Representations","date":"2024-12-09","arxiv_id":"2412.06695","repositories_listed":0,"syntology":null},{"url":null,"slug":"clip-ping-boosting-lightweight-vision","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","date":"2024-12-05","arxiv_id":"2412.03871","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignmamba-enhancing-multimodal-mamba-with","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","date":"2024-12-01","arxiv_id":"2412.00833","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-misalignment-in-multispectral","title":"Revisiting Misalignment in Multispectral Pedestrian Detection: A Language-Driven Approach for Cross-modal Alignment Fusion","date":"2024-11-27","arxiv_id":"2411.17995","repositories_listed":0,"syntology":null},{"url":null,"slug":"tiny-align-bridging-automatic-speech","title":"Tiny-Align: Bridging Automatic Speech Recognition and Large Language Model on the Edge","date":"2024-11-21","arxiv_id":"2411.13766","repositories_listed":0,"syntology":null},{"url":null,"slug":"ctpd-cross-modal-temporal-pattern-discovery","title":"CTPD: Cross-Modal Temporal Pattern Discovery for Enhanced Multimodal Electronic Health Records Analysis","date":"2024-11-01","arxiv_id":"2411.00696","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-path-exploration-and-feedback","title":"Multi-path Exploration and Feedback Adjustment for Text-to-Image Person Retrieval","date":"2024-10-26","arxiv_id":"2410.21318","repositories_listed":0,"syntology":null},{"url":null,"slug":"let-me-finish-my-sentence-video-temporal","title":"Let Me Finish My Sentence: Video Temporal Grounding with Holistic Text Understanding","date":"2024-10-17","arxiv_id":"2410.13598","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-the-human-visual-system-comparative","title":"Modeling the Human Visual System: Comparative Insights from Response-Optimized and Task-Optimized Vision Models, Language Models, and different Readout Mechanisms","date":"2024-10-17","arxiv_id":"2410.14031","repositories_listed":0,"syntology":null},{"url":null,"slug":"omcat-omni-context-aware-transformer","title":"OMCAT: Omni Context Aware Transformer","date":"2024-10-15","arxiv_id":"2410.12109","repositories_listed":0,"syntology":null},{"url":null,"slug":"emma-empowering-multi-modal-mamba-with","title":"EMMA: Empowering Multi-modal Mamba with Structural and Hierarchical Alignment","date":"2024-10-08","arxiv_id":"2410.05938","repositories_listed":0,"syntology":null},{"url":null,"slug":"intriguing-properties-of-large-language-and","title":"Intriguing Properties of Large Language and Vision Models","date":"2024-10-07","arxiv_id":"2410.04751","repositories_listed":0,"syntology":null},{"url":null,"slug":"tango-co-speech-gesture-video-reenactment","title":"TANGO: Co-Speech Gesture Video Reenactment with Hierarchical Audio Motion Embedding and Diffusion Interpolation","date":"2024-10-05","arxiv_id":"2410.04221","repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-aligned-network-for-referring-image","title":"Fully Aligned Network for Referring Image Segmentation","date":"2024-09-29","arxiv_id":"2409.19569","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-information-theoretic-metrics","title":"Exploring Information-Theoretic Metrics Associated with Neural Collapse in Supervised Training","date":"2024-09-25","arxiv_id":"2409.16767","repositories_listed":0,"syntology":null},{"url":null,"slug":"ts-tcd-triplet-level-cross-modal-distillation","title":"TS-HTFA: Advancing Time Series Forecasting via Hierarchical Text-Free Alignment with Large Language Models","date":"2024-09-23","arxiv_id":"2409.14978","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-localize-actions-in-instructional","title":"Learning to Localize Actions in Instructional Videos with LLM-Based Multi-Pathway Text-Video Alignment","date":"2024-09-22","arxiv_id":"2409.16145","repositories_listed":0,"syntology":null},{"url":null,"slug":"oneencoder-a-lightweight-framework-for","title":"OneEncoder: A Lightweight Framework for Progressive Alignment of Modalities","date":"2024-09-17","arxiv_id":"2409.11059","repositories_listed":0,"syntology":null},{"url":null,"slug":"nevlp-noise-robust-framework-for-efficient","title":"NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training","date":"2024-09-15","arxiv_id":"2409.09582","repositories_listed":0,"syntology":null},{"url":null,"slug":"locality-aware-cross-modal-correspondence","title":"Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization","date":"2024-09-12","arxiv_id":"2409.07967","repositories_listed":0,"syntology":null},{"url":null,"slug":"galla-graph-aligned-large-language-models-for","title":"GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding","date":"2024-09-06","arxiv_id":"2409.04183","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-order-preserved-optimal-transport","title":"Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR","date":"2024-09-03","arxiv_id":"2409.02239","repositories_listed":0,"syntology":null},{"url":null,"slug":"coarse-to-fine-alignment-makes-better-speech","title":"Coarse-to-fine Alignment Makes Better Speech-image Retrieval","date":"2024-08-15","arxiv_id":"2408.13119","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-denoising-a-novel-training","title":"Cross-Modal Denoising: A Novel Training Paradigm for Enhancing Speech-Image Retrieval","date":"2024-08-15","arxiv_id":"2408.13705","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-aware-early-fusion-with-stage-divided","title":"Cross-aware Early Fusion with Stage-divided Vision and Language Transformer Encoders for Referring Image Segmentation","date":"2024-08-14","arxiv_id":"2408.07539","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangled-noisy-correspondence-learning","title":"Disentangled Noisy Correspondence Learning","date":"2024-08-10","arxiv_id":"2408.05503","repositories_listed":0,"syntology":null},{"url":null,"slug":"unifying-visual-and-semantic-feature-spaces","title":"Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment","date":"2024-07-26","arxiv_id":"2407.18854","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-machine-learning-in-mental-health","title":"Multimodal Machine Learning in Mental Health: A Survey of Data, Algorithms, and Challenges","date":"2024-07-23","arxiv_id":"2407.16804","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-emotion-recognition-in-incomplete","title":"Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework","date":"2024-07-12","arxiv_id":"2407.09029","repositories_listed":0,"syntology":null},{"url":null,"slug":"ea-vtr-event-aware-video-text-retrieval","title":"EA-VTR: Event-Aware Video-Text Retrieval","date":"2024-07-10","arxiv_id":"2407.07478","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-attention-alignment-network-with","title":"Cross-Modal Attention Alignment Network with Auxiliary Text Description for zero-shot sketch-based image retrieval","date":"2024-07-01","arxiv_id":"2407.00979","repositories_listed":0,"syntology":null},{"url":null,"slug":"mllm-as-video-narrator-mitigating-modality","title":"MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval","date":"2024-06-25","arxiv_id":"2406.17880","repositories_listed":0,"syntology":null},{"url":null,"slug":"hire-hybrid-modal-interaction-with-multiple","title":"Hire: Hybrid-modal Interaction with Multiple Relational Enhancements for Image-Text Matching","date":"2024-06-05","arxiv_id":"2406.18579","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-reasoning-with-multimodal","title":"Multimodal Reasoning with Multimodal Knowledge Graph","date":"2024-06-04","arxiv_id":"2406.02030","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnibind-teach-to-build-unequal-scale","title":"OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All","date":"2024-05-25","arxiv_id":"2405.16108","repositories_listed":0,"syntology":null},{"url":"/paper/aligngpt-multi-modal-large-language-models","slug":"aligngpt-multi-modal-large-language-models","title":"AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability","date":"2024-05-23","arxiv_id":"2405.14129","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-enhanced-video-moment-retrieval-with","title":"Context-Enhanced Video Moment Retrieval with Large Language Models","date":"2024-05-21","arxiv_id":"2405.12540","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-heterogeneity-in-federated","title":"Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity","date":"2024-04-05","arxiv_id":"2404.03854","repositories_listed":0,"syntology":null},{"url":null,"slug":"cirp-cross-item-relational-pre-training-for","title":"CIRP: Cross-Item Relational Pre-training for Multimodal Product Bundling","date":"2024-04-02","arxiv_id":"2404.01735","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-grained-cross-modal-alignment-for","title":"Multi-Grained Cross-modal Alignment for Learning Open-vocabulary Semantic Segmentation from Text Supervision","date":"2024-03-06","arxiv_id":"2403.03707","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-attribute-prompting-for-vision","title":"Multi-modal Attribute Prompting for Vision-Language Models","date":"2024-03-01","arxiv_id":"2403.00219","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantics-enhanced-cross-modal-masked-image","title":"Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training","date":"2024-03-01","arxiv_id":"2403.00249","repositories_listed":0,"syntology":null},{"url":null,"slug":"mind-the-modality-gap-towards-a-remote","title":"Mind the Modality Gap: Towards a Remote Sensing Vision-Language Model via Cross-modal Alignment","date":"2024-02-15","arxiv_id":"2402.09816","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-prototype-based-multimodal","title":"Cross-Modal Prototype based Multimodal Federated Learning under Severely Missing Modality","date":"2024-01-25","arxiv_id":"2401.13898","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-level-cross-modal-alignment-for-image","title":"Multi-level Cross-modal Alignment for Image Clustering","date":"2024-01-22","arxiv_id":"2401.11740","repositories_listed":0,"syntology":null},{"url":"/paper/self-supervised-feature-adaptation-for-3d","slug":"self-supervised-feature-adaptation-for-3d","title":"Self-supervised Feature Adaptation for 3D Industrial Anomaly Detection","date":"2024-01-06","arxiv_id":"2401.03145","repositories_listed":0,"syntology":{"n":11,"n_ran":10,"n_constructed":0,"n_ran_checked":8,"n_instrument":2,"n_unverified":1,"n_honours":1,"n_violates":0,"n_no_contract":7,"n_pointer_only":11,"phrase":"10 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 1 honoured, 0 violated, 7 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/self-supervised-feature-adaptation-for-3d#ran","syntology_url":"https://syntology.ai/paper/2401.03145","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2401.03145"}},"official":null}},{"url":null,"slug":"multi-prompts-learning-with-cross-modal","title":"Multi-Prompts Learning with Cross-Modal Alignment for Attribute-based Person Re-Identification","date":"2023-12-28","arxiv_id":"2312.16797","repositories_listed":0,"syntology":null},{"url":null,"slug":"detection-based-intermediate-supervision-for","title":"Detection-based Intermediate Supervision for Visual Question Answering","date":"2023-12-26","arxiv_id":"2312.16012","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-cross-modal-alignment-with","title":"Improving Cross-modal Alignment with Synthetic Pairs for Text-only Image Captioning","date":"2023-12-14","arxiv_id":"2312.08865","repositories_listed":0,"syntology":null},{"url":null,"slug":"opensight-a-simple-open-vocabulary-framework","title":"OpenSight: A Simple Open-Vocabulary Framework for LiDAR-Based Object Detection","date":"2023-12-12","arxiv_id":"2312.08876","repositories_listed":0,"syntology":null},{"url":null,"slug":"pmmtalk-speech-driven-3d-facial-animation","title":"PMMTalk: Speech-Driven 3D Facial Animation from Complementary Pseudo Multi-modal Features","date":"2023-12-05","arxiv_id":"2312.02781","repositories_listed":0,"syntology":null},{"url":null,"slug":"dap-domain-aware-prompt-learning-for-vision","title":"DAP: Domain-aware Prompt Learning for Vision-and-Language Navigation","date":"2023-11-29","arxiv_id":"2311.17812","repositories_listed":0,"syntology":null},{"url":null,"slug":"mcad-multi-teacher-cross-modal-alignment","title":"MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval","date":"2023-10-30","arxiv_id":"2310.19654","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-referring-expression-comprehension-via-1","title":"Video Referring Expression Comprehension via Transformer with Content-conditioned Query","date":"2023-10-25","arxiv_id":"2310.16402","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-language-encoder-of-contrastive-cross","title":"On the Language Encoder of Contrastive Cross-modal Models","date":"2023-10-20","arxiv_id":"2310.13267","repositories_listed":0,"syntology":null},{"url":null,"slug":"dhot-gm-robust-graph-matching-using-a","title":"Robust Graph Matching Using An Unbalanced Hierarchical Optimal Transport Framework","date":"2023-10-18","arxiv_id":"2310.12081","repositories_listed":0,"syntology":null},{"url":null,"slug":"separating-invisible-sounds-toward-universal","title":"Separating Invisible Sounds Toward Universal Audiovisual Scene-Aware Sound Separation","date":"2023-10-18","arxiv_id":"2310.11713","repositories_listed":0,"syntology":null},{"url":null,"slug":"prototype-guided-cross-modal-completion-and","title":"Prototype-guided Cross-modal Completion and Alignment for Incomplete Text-based Person Re-identification","date":"2023-09-29","arxiv_id":"2309.17104","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-alignment-with-optimal-transport","title":"Cross-modal Alignment with Optimal Transport for CTC-based ASR","date":"2023-09-24","arxiv_id":"2309.13650","repositories_listed":0,"syntology":null},{"url":null,"slug":"sound-source-localization-is-all-about-cross","title":"Sound Source Localization is All about Cross-Modal Alignment","date":"2023-09-19","arxiv_id":"2309.10724","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-based-context-and-domain-aware","title":"Prompt-based Context- and Domain-aware Pretraining for Vision and Language Navigation","date":"2023-09-07","arxiv_id":"2309.03661","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-high-fidelity-text-guided-3d-face","title":"Towards High-Fidelity Text-Guided 3D Face Generation and Manipulation Using only Images","date":"2023-08-31","arxiv_id":"2308.16758","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffcloth-diffusion-based-garment-synthesis","title":"DiffCloth: Diffusion Based Garment Synthesis and Manipulation via Structural Cross-modal Semantic Alignment","date":"2023-08-22","arxiv_id":"2308.11206","repositories_listed":0,"syntology":null},{"url":null,"slug":"wico-win-win-cooperation-of-bottom-up-and-top","title":"WiCo: Win-win Cooperation of Bottom-up and Top-down Referring Image Segmentation","date":"2023-06-19","arxiv_id":"2306.10750","repositories_listed":0,"syntology":null},{"url":"/paper/retrieving-to-answer-zero-shot-video-question","slug":"retrieving-to-answer-zero-shot-video-question","title":"Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models","date":"2023-06-15","arxiv_id":"2306.11732","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-speech-translation-by-fusing-speech","title":"Improving speech translation by fusing speech and text","date":"2023-05-23","arxiv_id":"2305.14042","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-paired-masking-with-alignment","title":"Multi-task Paired Masking with Alignment Modeling for Medical Vision-Language Pre-training","date":"2023-05-13","arxiv_id":"2305.07920","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignsts-speech-to-singing-conversion-via","title":"AlignSTS: Speech-to-Singing Conversion via Cross-Modal Alignment","date":"2023-05-08","arxiv_id":"2305.04476","repositories_listed":0,"syntology":null},{"url":null,"slug":"covlr-coordinating-cross-modal-consistency","title":"CoVLR: Coordinating Cross-Modal Consistency and Intra-Modal Structure for Vision-Language Retrieval","date":"2023-04-15","arxiv_id":"2304.07567","repositories_listed":0,"syntology":null}],"record_sha256":"68aff15387b7273048b916be04ca4b3de9bd92c5410036ef2c2a0d556a386086","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}