{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-to-text/papers/2","list_of":"/task/image-to-text","task":"Image to text","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":3,"rows_per_page":100,"rows":[101,200],"of":246,"counts":{"archive_papers_tagged":246,"with_a_code_link":103,"where_syntology_ran_a_sample":33,"not_listed_spam_title":0,"listed":246,"listed_where_code_ran":33,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":30,"every_run_a_failure_of_syntologys_instrument":3,"listed_with_a_run_with_no_instrument_failure":30,"listed_every_run_a_failure_of_syntologys_instrument":3,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-to-text","prev":"/task/image-to-text","next":"/task/image-to-text/papers/3","papers":[{"url":"/paper/spatialvoc2k-a-multilingual-dataset-of-images","slug":"spatialvoc2k-a-multilingual-dataset-of-images","title":"SpatialVOC2K: A Multilingual Dataset of Images with Annotations and Features for Spatial Relations between Objects","date":"2018-11-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/face2text-collecting-an-annotated-image","slug":"face2text-collecting-an-annotated-image","title":"Face2Text: Collecting an Annotated Image Description Corpus for the Generation of Rich Face Descriptions","date":"2018-03-10","arxiv_id":"1803.03827","repositories_listed":1,"syntology":null},{"url":"/paper/a-gentle-tutorial-of-recurrent-neural-network","slug":"a-gentle-tutorial-of-recurrent-neural-network","title":"A Gentle Tutorial of Recurrent Neural Network with Error Backpropagation","date":"2016-10-08","arxiv_id":"1610.02583","repositories_listed":1,"syntology":null},{"url":null,"slug":"improving-medical-visual-representation","title":"Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration","date":"2025-06-12","arxiv_id":"2506.10573","repositories_listed":0,"syntology":null},{"url":null,"slug":"chartreasoner-code-driven-modality-bridging","title":"ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering","date":"2025-06-11","arxiv_id":"2506.10116","repositories_listed":0,"syntology":null},{"url":null,"slug":"brit-bidirectional-retrieval-over-unified","title":"BRIT: Bidirectional Retrieval over Unified Image-Text Graph","date":"2025-05-24","arxiv_id":"2505.18450","repositories_listed":0,"syntology":null},{"url":null,"slug":"tng-clip-training-time-negation-data","title":"TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP","date":"2025-05-24","arxiv_id":"2505.18434","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustifying-vision-language-models-via","title":"Robustifying Vision-Language Models via Dynamic Token Reweighting","date":"2025-05-22","arxiv_id":"2505.17132","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10921","title":"Towards Cross-modal Retrieval in Chinese Cultural Heritage Documents: Dataset and Solution","date":"2025-05-16","arxiv_id":"2505.10921","repositories_listed":0,"syntology":null},{"url":null,"slug":"x-fusion-introducing-new-modality-to-frozen","title":"X-Fusion: Introducing New Modality to Frozen Large Language Models","date":"2025-04-29","arxiv_id":"2504.20996","repositories_listed":0,"syntology":null},{"url":null,"slug":"semcore-a-semantic-enhanced-generative-cross","title":"SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs","date":"2025-04-17","arxiv_id":"2504.13172","repositories_listed":0,"syntology":null},{"url":null,"slug":"dart-disease-aware-image-text-alignment-and","title":"DART: Disease-aware Image-Text Alignment and Self-correcting Re-alignment for Trustworthy Radiology Report Generation","date":"2025-04-16","arxiv_id":"2504.11786","repositories_listed":0,"syntology":null},{"url":"/paper/tmcir-token-merge-benefits-composed-image","slug":"tmcir-token-merge-benefits-composed-image","title":"TMCIR: Token Merge Benefits Composed Image Retrieval","date":"2025-04-15","arxiv_id":"2504.10995","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-to-text-for-medical-reports-using","title":"Image-to-Text for Medical Reports Using Adaptive Co-Attention and Triple-LSTM Module","date":"2025-03-24","arxiv_id":"2503.18297","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-language-generation-1","title":"Natural Language Generation","date":"2025-03-20","arxiv_id":"2503.16728","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompthash-affinity-prompted-collaborative","title":"PromptHash: Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval","date":"2025-03-20","arxiv_id":"2503.16064","repositories_listed":0,"syntology":null},{"url":null,"slug":"mfp-clip-exploring-the-efficacy-of-multi-form","title":"MFP-CLIP: Exploring the Efficacy of Multi-Form Prompts for Zero-Shot Industrial Anomaly Detection","date":"2025-03-17","arxiv_id":"2503.12910","repositories_listed":0,"syntology":null},{"url":null,"slug":"abc-achieving-better-control-of-multimodal","title":"ABC: Achieving Better Control of Multimodal Embeddings using VLMs","date":"2025-03-01","arxiv_id":"2503.00329","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-importance-of-text-preprocessing-for","title":"On the Importance of Text Preprocessing for Multimodal Representation Learning and Pathology Report Generation","date":"2025-02-26","arxiv_id":"2502.19285","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-language-generation-from-visual","title":"Natural Language Generation from Visual Sequences: Challenges and Future Directions","date":"2025-02-18","arxiv_id":"2502.13034","repositories_listed":0,"syntology":null},{"url":null,"slug":"unite-fnd-reframing-multimodal-fake-news","title":"UNITE-FND: Reframing Multimodal Fake News Detection through Unimodal Scene Translation","date":"2025-02-16","arxiv_id":"2502.11132","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-myopia-to-holism-fully-contrastive","title":"Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"prompthash-affinity-prompted-collaborative-1","title":"PromptHash:Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"retaining-knowledge-and-enhancing-long-text","title":"Retaining Knowledge and Enhancing Long-Text Representations in CLIP through Dual-Teacher Distillation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"clip-fsac-few-shot-anomaly-classification","title":"CLIP-FSAC++: Few-Shot Anomaly Classification with Anomaly Descriptor Based on CLIP","date":"2024-12-05","arxiv_id":"2412.03829","repositories_listed":0,"syntology":null},{"url":null,"slug":"dir-retrieval-augmented-image-captioning-with","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","date":"2024-12-02","arxiv_id":"2412.01115","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-factuality-of-3d-brain-mri-report","title":"Improving Factuality of 3D Brain MRI Report Generation with Paired Image-domain Retrieval and Text-domain Augmentation","date":"2024-11-23","arxiv_id":"2411.15490","repositories_listed":0,"syntology":null},{"url":null,"slug":"everything-is-a-video-unifying-modalities","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","date":"2024-11-15","arxiv_id":"2411.10503","repositories_listed":0,"syntology":null},{"url":null,"slug":"image2text2image-a-novel-framework-for-label","title":"Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models","date":"2024-11-08","arxiv_id":"2411.05706","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-pixels-to-prose-advancing-multi-modal","title":"From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing","date":"2024-11-05","arxiv_id":"2411.05826","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-state-recognition-with-image-to-text","title":"Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization","date":"2024-10-30","arxiv_id":"2410.22707","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-color-and-lines-zero-shot-style","title":"Beyond Color and Lines: Zero-Shot Style-Specific Image Variations with Coordinated Semantics","date":"2024-10-24","arxiv_id":"2410.18537","repositories_listed":0,"syntology":null},{"url":null,"slug":"synergistic-dual-spatial-aware-generation-of","title":"Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image","date":"2024-10-20","arxiv_id":"2410.15312","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-online-learning-approach-to-prompt-based","title":"An Online Learning Approach to Prompt-based Selection of Generative Models","date":"2024-10-17","arxiv_id":"2410.13287","repositories_listed":0,"syntology":null},{"url":null,"slug":"patch-is-enough-naturalistic-adversarial","title":"Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models","date":"2024-10-07","arxiv_id":"2410.04884","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdooring-vision-language-models-with-out","title":"Backdooring Vision-Language Models with Out-Of-Distribution Data","date":"2024-10-02","arxiv_id":"2410.01264","repositories_listed":0,"syntology":null},{"url":null,"slug":"see-then-tell-enhancing-key-information","title":"See then Tell: Enhancing Key Information Extraction with Vision Grounding","date":"2024-09-29","arxiv_id":"2409.19573","repositories_listed":0,"syntology":null},{"url":null,"slug":"trojvlm-backdoor-attack-against-vision","title":"TrojVLM: Backdoor Attack Against Vision Language Models","date":"2024-09-28","arxiv_id":"2409.19232","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-environmental-state-recognition-with","title":"Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization","date":"2024-09-26","arxiv_id":"2409.17519","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-authenticity-and-quality-of-image","title":"Evaluating authenticity and quality of image captions via sentiment and semantic analyses","date":"2024-09-14","arxiv_id":"2409.09560","repositories_listed":0,"syntology":null},{"url":null,"slug":"ask-attend-attack-a-effective-decision-based","title":"Ask, Attend, Attack: A Effective Decision-Based Black-Box Targeted Attack for Image-to-Text Models","date":"2024-08-16","arxiv_id":"2408.08989","repositories_listed":0,"syntology":null},{"url":null,"slug":"instruction-tuning-free-visual-token","title":"Instruction Tuning-free Visual Token Complement for Multimodal LLMs","date":"2024-08-09","arxiv_id":"2408.05019","repositories_listed":0,"syntology":null},{"url":null,"slug":"dallah-a-dialect-aware-multimodal-large","title":"Dallah: A Dialect-Aware Multimodal Large Language Model for Arabic","date":"2024-07-25","arxiv_id":"2407.18129","repositories_listed":0,"syntology":null},{"url":null,"slug":"gpc-generative-and-general-pathology-image","title":"GPC: Generative and General Pathology Image Classifier","date":"2024-07-12","arxiv_id":"2407.09035","repositories_listed":0,"syntology":null},{"url":null,"slug":"15m-multimodal-facial-image-text-dataset","title":"15M Multimodal Facial Image-Text Dataset","date":"2024-07-11","arxiv_id":"2407.08515","repositories_listed":0,"syntology":null},{"url":null,"slug":"hycir-boosting-zero-shot-composed-image","title":"HyCIR: Boosting Zero-Shot Composed Image Retrieval with Synthetic Labels","date":"2024-07-08","arxiv_id":"2407.05795","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-braille-an-end-to-end-tool-for-chinese","title":"Vision-Braille: An End-to-End Tool for Chinese Braille Image-to-Text Translation","date":"2024-07-08","arxiv_id":"2407.06048","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-to-text-logic-jailbreak-your","title":"Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything","date":"2024-07-01","arxiv_id":"2407.02534","repositories_listed":0,"syntology":null},{"url":null,"slug":"reminding-multimodal-large-language-models-of","title":"Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags","date":"2024-06-16","arxiv_id":"2406.10839","repositories_listed":0,"syntology":null},{"url":null,"slug":"fetch-a-set-a-large-scale-ocr-free-benchmark","title":"Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval","date":"2024-06-11","arxiv_id":"2406.07315","repositories_listed":0,"syntology":null},{"url":null,"slug":"aicodereval-improving-ai-domain-code","title":"AICoderEval: Improving AI Domain Code Generation of Large Language Models","date":"2024-06-07","arxiv_id":"2406.04712","repositories_listed":0,"syntology":null},{"url":null,"slug":"faithful-chart-summarization-with-chats-pi","title":"Faithful Chart Summarization with ChaTS-Pi","date":"2024-05-29","arxiv_id":"2405.19094","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-effect-of-using","title":"Understanding the Effect of using Semantically Meaningful Tokens for Visual Representation Learning","date":"2024-05-26","arxiv_id":"2405.16401","repositories_listed":0,"syntology":null},{"url":null,"slug":"docci-descriptions-of-connected-and","title":"DOCCI: Descriptions of Connected and Contrasting Images","date":"2024-04-30","arxiv_id":"2404.19753","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-fact-checker-enabling-high-fidelity","title":"Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation","date":"2024-04-30","arxiv_id":"2404.19752","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-ai-to-generate-audio-for-user","title":"Leveraging AI to Generate Audio for User-generated Content in Video Games","date":"2024-04-25","arxiv_id":"2404.17018","repositories_listed":0,"syntology":null},{"url":null,"slug":"visla-benchmark-evaluating-embedding","title":"VISLA Benchmark: Evaluating Embedding Sensitivity to Semantic and Lexical Alterations","date":"2024-04-25","arxiv_id":"2404.16365","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-llms-understand-visual-anomalies","title":"Do LLMs Understand Visual Anomalies? Uncovering LLM's Capabilities in Zero-shot Anomaly Detection","date":"2024-04-15","arxiv_id":"2404.09654","repositories_listed":0,"syntology":null},{"url":null,"slug":"ovfoodseg-elevating-open-vocabulary-food","title":"OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual Representation","date":"2024-04-01","arxiv_id":"2404.01409","repositories_listed":0,"syntology":null},{"url":null,"slug":"bimcv-r-a-landmark-dataset-for-3d-ct-text","title":"BIMCV-R: A Landmark Dataset for 3D CT Text-Image Retrieval","date":"2024-03-24","arxiv_id":"2403.15992","repositories_listed":0,"syntology":null},{"url":null,"slug":"eyes-closed-safety-on-protecting-multimodal","title":"Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation","date":"2024-03-14","arxiv_id":"2403.09572","repositories_listed":0,"syntology":null},{"url":null,"slug":"clip-the-bias-how-useful-is-balancing-data-in","title":"CLIP the Bias: How Useful is Balancing Data in Multimodal Learning?","date":"2024-03-07","arxiv_id":"2403.04547","repositories_listed":0,"syntology":null},{"url":null,"slug":"medm2g-unifying-medical-multi-modal","title":"MedM2G: Unifying Medical Multi-Modal Generation via Cross-Guided Diffusion with Visual Invariant","date":"2024-03-07","arxiv_id":"2403.04290","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-vision-language-pre-training-with-1","title":"Enhancing Vision-Language Pre-training with Rich Supervisions","date":"2024-03-05","arxiv_id":"2403.03346","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-guidance-mechanism-for-handwritten","title":"Attention Guidance Mechanism for Handwritten Mathematical Expression Recognition","date":"2024-03-04","arxiv_id":"2403.01756","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-framework-and-dataset-for-assessing","title":"A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models","date":"2024-02-21","arxiv_id":"2402.13636","repositories_listed":0,"syntology":null},{"url":null,"slug":"captions-are-worth-a-thousand-words-enhancing","title":"Captions Are Worth a Thousand Words: Enhancing Product Retrieval with Pretrained Image-to-Text Models","date":"2024-02-13","arxiv_id":"2402.08532","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-modal-dynamic-traceback-learning-for","title":"Dynamic Traceback Learning for Medical Report Generation","date":"2024-01-24","arxiv_id":"2401.13267","repositories_listed":0,"syntology":null},{"url":"/paper/sycoca-symmetrizing-contrastive-captioners","slug":"sycoca-symmetrizing-contrastive-captioners","title":"SyCoCa: Symmetrizing Contrastive Captioners with Attentive Masking for Multimodal Alignment","date":"2024-01-04","arxiv_id":"2401.02137","repositories_listed":0,"syntology":null},{"url":null,"slug":"accept-the-modality-gap-an-exploration-in-the","title":"Accept the Modality Gap: An Exploration in the Hyperbolic Space","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"refinenet-enhancing-text-to-image-conversion","title":"RefineNet: Enhancing Text-to-Image Conversion with High-Resolution and Detail Accuracy through Hierarchical Transformers and Progressive Refinement","date":"2023-12-27","arxiv_id":"2312.17274","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffuvst-narrating-fictional-scenes-with","title":"DiffuVST: Narrating Fictional Scenes with Global-History-Guided Denoising Models","date":"2023-12-12","arxiv_id":"2312.07066","repositories_listed":0,"syntology":null},{"url":"/paper/cross-modal-adaptive-dual-association-for","slug":"cross-modal-adaptive-dual-association-for","title":"Cross-Modal Adaptive Dual Association for Text-to-Image Person Retrieval","date":"2023-12-04","arxiv_id":"2312.01745","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-pseudo-labeler-beyond-noun-concepts","title":"Learning Pseudo-Labeler beyond Noun Concepts for Open-Vocabulary Object Detection","date":"2023-12-04","arxiv_id":"2312.02103","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-images-an-integrative-multi-modal","title":"Beyond Images: An Integrative Multi-modal Approach to Chest X-Ray Report Generation","date":"2023-11-18","arxiv_id":"2311.11090","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-recommendation-system-for-enhanced","title":"AI Recommendation System for Enhanced Customer Experience: A Novel Image-to-Text Method","date":"2023-11-16","arxiv_id":"2311.09624","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-end-to-end-visual-document","title":"Efficient End-to-End Visual Document Understanding with Rationale Distillation","date":"2023-11-16","arxiv_id":"2311.09612","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-grounded-qformer-for-efficient","title":"Semantically Grounded QFormer for Efficient Vision Language Understanding","date":"2023-11-13","arxiv_id":"2311.07449","repositories_listed":0,"syntology":null},{"url":null,"slug":"gpt-4v-ision-as-a-generalist-evaluator-for","title":"GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks","date":"2023-11-02","arxiv_id":"2311.01361","repositories_listed":0,"syntology":null},{"url":null,"slug":"singleinsert-inserting-new-concepts-from-a","title":"SingleInsert: Inserting New Concepts from a Single Image into Text-to-Image Models for Flexible Editing","date":"2023-10-12","arxiv_id":"2310.08094","repositories_listed":0,"syntology":null},{"url":null,"slug":"ziya-vl-bilingual-large-vision-language-model","title":"Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning","date":"2023-10-12","arxiv_id":"2310.08166","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-ui-instruction-grounding-towards-a","title":"Reinforced UI Instruction Grounding: Towards a Generic UI Task Automation API","date":"2023-10-07","arxiv_id":"2310.04716","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-unpaired-data-for-vision-language","title":"Leveraging Unpaired Data for Vision-Language Generative Models via Cycle Consistency","date":"2023-10-05","arxiv_id":"2310.03734","repositories_listed":0,"syntology":null},{"url":null,"slug":"surrogateprompt-bypassing-the-safety-filter","title":"SurrogatePrompt: Bypassing the Safety Filter of Text-to-Image Models via Substitution","date":"2023-09-25","arxiv_id":"2309.14122","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-detection-of-misspelled-handwritten","title":"Offline Detection of Misspelled Handwritten Words by Convolving Recognition Model Features with Text Labels","date":"2023-09-18","arxiv_id":"2309.10158","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilma-bidirectional-local-matching-for-text","title":"BiLMa: Bidirectional Local-Matching for Text-based Person Re-identification","date":"2023-09-09","arxiv_id":"2309.04675","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-semantic-generative-communication","title":"Sequential Semantic Generative Communication for Progressive Text-to-Image Generation","date":"2023-09-08","arxiv_id":"2309.04287","repositories_listed":0,"syntology":null},{"url":null,"slug":"growclip-data-aware-automatic-model-growing","title":"GrowCLIP: Data-aware Automatic Model Growing for Large-scale Contrastive Language-Image Pre-training","date":"2023-08-22","arxiv_id":"2308.11331","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-neurons-in-pretrained-text-only","title":"Multimodal Neurons in Pretrained Text-Only Transformers","date":"2023-08-03","arxiv_id":"2308.01544","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-detr-pre-training-for-object","title":"Revisiting DETR Pre-training for Object Detection","date":"2023-08-02","arxiv_id":"2308.01300","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-visual-language-foundation-model","title":"Towards a Visual-Language Foundation Model for Computational Pathology","date":"2023-07-24","arxiv_id":"2307.12914","repositories_listed":0,"syntology":null},{"url":null,"slug":"pitl-cross-modal-retrieval-with-weakly","title":"PiTL: Cross-modal Retrieval with Weakly-supervised Vision-language Pre-training via Prompting","date":"2023-07-14","arxiv_id":"2307.07341","repositories_listed":0,"syntology":null},{"url":"/paper/diffusionstr-diffusion-model-for-scene-text","slug":"diffusionstr-diffusion-model-for-scene-text","title":"DiffusionSTR: Diffusion Model for Scene Text Recognition","date":"2023-06-29","arxiv_id":"2306.16707","repositories_listed":0,"syntology":null},{"url":null,"slug":"i-see-dead-people-gray-box-adversarial-attack","title":"I See Dead People: Gray-Box Adversarial Attack on Image-To-Text Models","date":"2023-06-13","arxiv_id":"2306.07591","repositories_listed":0,"syntology":null},{"url":null,"slug":"captext-large-language-model-based-caption","title":"CapText: Large Language Model-based Caption Generation From Image Context and Description","date":"2023-06-01","arxiv_id":"2306.00301","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixer-image-to-multi-modal-retrieval-learning","title":"Category-Oriented Representation Learning for Image to Multi-Modal Retrieval","date":"2023-05-06","arxiv_id":"2305.03972","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioners-sometimes-tell-more-than","title":"Image Captioners Sometimes Tell More Than Images They See","date":"2023-05-04","arxiv_id":"2305.02932","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpreting-vision-and-language-generative","title":"Interpreting Vision and Language Generative Models with Semantic Visual Priors","date":"2023-04-28","arxiv_id":"2304.14986","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-cross-modal-information-retrieval-possible","title":"Is Cross-modal Information Retrieval Possible without Training?","date":"2023-04-20","arxiv_id":"2304.11095","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-oriented-multi-modal-mutual-leaning-for","title":"Task-Oriented Multi-Modal Mutual Leaning for Vision-Language Models","date":"2023-03-30","arxiv_id":"2303.17169","repositories_listed":0,"syntology":null}],"record_sha256":"aec9fb838ae71c1ca5681036cc88963eb92e7d512782766163ca7304f4a774c4","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}