{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-captioning/papers/13","list_of":"/task/image-captioning","task":"Image Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":13,"pages_in_order":19,"rows_per_page":100,"rows":[1201,1300],"of":1878,"counts":{"archive_papers_tagged":1878,"with_a_code_link":774,"where_syntology_ran_a_sample":243,"not_listed_spam_title":0,"listed":1878,"listed_where_code_ran":243,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":201,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":201,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-captioning","prev":"/task/image-captioning/papers/12","next":"/task/image-captioning/papers/14","papers":[{"url":null,"slug":"an-empirical-investigation-into-the-use-of","title":"An Empirical Investigation into the Use of Image Captioning for Automated Software Documentation","date":"2023-01-03","arxiv_id":"2301.01224","repositories_listed":0,"syntology":null},{"url":null,"slug":"crossing-the-gap-domain-generalization-for","title":"Crossing the Gap: Domain Generalization for Image Captioning","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"image-as-a-foreign-language-beit-pretraining-1","title":"Image as a Foreign Language: BEiT Pretraining for Vision and Vision-Language Tasks","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"promptcap-prompt-guided-image-captioning-for","title":"PromptCap: Prompt-Guided Image Captioning for VQA with GPT-3","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"do-dall-e-and-flamingo-understand-each-other","title":"Do DALL-E and Flamingo Understand Each Other?","date":"2022-12-23","arxiv_id":"2212.12249","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-image-captioning-for-edge-devices","title":"Efficient Image Captioning for Edge Devices","date":"2022-12-18","arxiv_id":"2212.08985","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-similarity-based-curriculum","title":"Cross-Modal Similarity-Based Curriculum Learning for Image Captioning","date":"2022-12-14","arxiv_id":"2212.07075","repositories_listed":0,"syntology":null},{"url":null,"slug":"nlip-noise-robust-language-image-pre-training","title":"NLIP: Noise-robust Language-Image Pre-training","date":"2022-12-14","arxiv_id":"2212.07086","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffalign-few-shot-learning-using-diffusion","title":"Cap2Aug: Caption guided Image to Image data Augmentation","date":"2022-12-11","arxiv_id":"2212.05404","repositories_listed":0,"syntology":null},{"url":"/paper/parsvqa-caps-a-benchmark-for-visual-question","slug":"parsvqa-caps-a-benchmark-for-visual-question","title":"ParsVQA-Caps: A Benchmark for Visual Question Answering and Image Captioning in Persian","date":"2022-12-07","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dataset-vs-reality-understanding-model","title":"Dataset vs Reality: Understanding Model Performance from the Perspective of Information Need","date":"2022-12-06","arxiv_id":"2212.02726","repositories_listed":0,"syntology":null},{"url":null,"slug":"controllable-image-captioning-via-prompting","title":"Controllable Image Captioning via Prompting","date":"2022-12-04","arxiv_id":"2212.01803","repositories_listed":0,"syntology":null},{"url":null,"slug":"focus-relevant-and-sufficient-context","title":"Focus! Relevant and Sufficient Context Selection for News Image Captioning","date":"2022-12-01","arxiv_id":"2212.00843","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-annotations-for-multi-modal","title":"Weakly Supervised Annotations for Multi-modal Greeting Cards Dataset","date":"2022-12-01","arxiv_id":"2212.00847","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-image-captioning","title":"Uncertainty-Aware Image Captioning","date":"2022-11-30","arxiv_id":"2211.16769","repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-linguistic-cues-for-fake-news-a","title":"Predictive linguistic cues for fake news: a societal artificial intelligence problem","date":"2022-11-26","arxiv_id":"2211.14505","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-or-machine-turing-tests-for-vision-and","title":"Can Machines Imitate Humans? Integrative Turing Tests for Vision and Language Demonstrate a Narrowing Gap","date":"2022-11-23","arxiv_id":"2211.13087","repositories_listed":0,"syntology":null},{"url":"/paper/retrieval-augmented-multimodal-language","slug":"retrieval-augmented-multimodal-language","title":"Retrieval-Augmented Multimodal Language Modeling","date":"2022-11-22","arxiv_id":"2211.12561","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-knowledge-enhanced-multimodal","title":"A survey on knowledge-enhanced multimodal learning","date":"2022-11-19","arxiv_id":"2211.12328","repositories_listed":0,"syntology":null},{"url":"/paper/an-enhanced-object-detection-model-for-scene","slug":"an-enhanced-object-detection-model-for-scene","title":"An Enhanced Object Detection Model for Scene Graph Generation","date":"2022-11-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"feedback-is-needed-for-retakes-an-explainable","title":"Feedback is Needed for Retakes: An Explainable Poor Image Notification Framework for the Visually Impaired","date":"2022-11-17","arxiv_id":"2211.09427","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-image-captioning-by-anchor","title":"Zero-shot Image Captioning by Anchor-augmented Vision-Language Space Alignment","date":"2022-11-14","arxiv_id":"2211.07275","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigations-in-audio-captioning-addressing","title":"Investigations in Audio Captioning: Addressing Vocabulary Imbalance and Evaluating Suitability of Language-Centric Performance Metrics","date":"2022-11-12","arxiv_id":"2211.06547","repositories_listed":0,"syntology":null},{"url":null,"slug":"viecap4h-vlsp-2021-objectaoa-enhancing","title":"VieCap4H-VLSP 2021: ObjectAoA-Enhancing performance of Object Relation Transformer with Attention on Attention for Vietnamese image captioning","date":"2022-11-10","arxiv_id":"2211.05405","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-cross-modal-interactions-in-v-l","title":"Understanding Cross-modal Interactions in V&L Models that Generate Scene Descriptions","date":"2022-11-09","arxiv_id":"2211.04971","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-caption-generation-for-low-resource","title":"Image Caption Generation for Low-Resource Assamese Language","date":"2022-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dimbert-learning-vision-language-grounded","title":"DiMBERT: Learning Vision-Language Grounded Representations with Disentangled Multimodal-Attention","date":"2022-10-28","arxiv_id":"2210.16431","repositories_listed":0,"syntology":null},{"url":null,"slug":"bloom-library-multimodal-datasets-in-300","title":"Bloom Library: Multimodal Datasets in 300+ Languages for a Variety of Downstream Tasks","date":"2022-10-26","arxiv_id":"2210.14712","repositories_listed":0,"syntology":null},{"url":null,"slug":"fad-vlp-fashion-vision-and-language-pre","title":"FaD-VLP: Fashion Vision-and-Language Pre-training towards Unified Retrieval and Captioning","date":"2022-10-26","arxiv_id":"2210.15028","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-text-retrieval-with-binary-and","title":"Image-Text Retrieval with Binary and Continuous Label Supervision","date":"2022-10-20","arxiv_id":"2210.11319","repositories_listed":0,"syntology":null},{"url":null,"slug":"prophet-attention-predicting-attention-with-1","title":"Prophet Attention: Predicting Attention with Future Attention for Image Captioning","date":"2022-10-19","arxiv_id":"2210.10914","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-magma-by-few-shot-learning-and","title":"Aligning MAGMA by Few-Shot Learning and Finetuning","date":"2022-10-18","arxiv_id":"2210.14161","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-cross-modal-semantics-alignment","title":"Probing Cross-modal Semantics Alignment Capability from the Textual Perspective","date":"2022-10-18","arxiv_id":"2210.09550","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-image-captions-with-external","title":"Generating image captions with external encyclopedic knowledge","date":"2022-10-10","arxiv_id":"2210.04806","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-audio-grounding-based-novel-metric","title":"Text-to-Audio Grounding Based Novel Metric for Evaluating Audio Caption Similarity","date":"2022-10-03","arxiv_id":"2210.06354","repositories_listed":0,"syntology":null},{"url":null,"slug":"deltanet-conditional-medical-report","title":"DeltaNet: Conditional Medical Report Generation for COVID-19 Diagnosis","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"jpg-jointly-learn-to-align-automated-disease","title":"JPG - Jointly Learn to Align: Automated Disease Prediction and Radiology Report Generation","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-view-and-cross-view-brain-decoding","title":"Multi-view and Cross-view Brain Decoding","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effects-of-video-grounding-on-language","title":"On the Effects of Video Grounding on Language Models","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"medical-image-captioning-via-generative","title":"Medical Image Captioning via Generative Pretrained Transformers","date":"2022-09-28","arxiv_id":"2209.13983","repositories_listed":0,"syntology":null},{"url":null,"slug":"drama-joint-risk-localization-and-captioning","title":"DRAMA: Joint Risk Localization and Captioning in Driving","date":"2022-09-22","arxiv_id":"2209.10767","repositories_listed":0,"syntology":null},{"url":null,"slug":"show-interpret-and-tell-entity-aware","title":"Show, Interpret and Tell: Entity-aware Contextualised Image Captioning in Wikipedia","date":"2022-09-21","arxiv_id":"2209.10474","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-3d-spatial-reasoning-for-human-like","title":"Toward 3D Spatial Reasoning for Human-like Text-based Visual Question Answering","date":"2022-09-21","arxiv_id":"2209.10326","repositories_listed":0,"syntology":null},{"url":"/paper/omnivl-one-foundation-model-for-image","slug":"omnivl-one-foundation-model-for-image","title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","date":"2022-09-15","arxiv_id":"2209.07526","repositories_listed":0,"syntology":null},{"url":null,"slug":"prestu-pre-training-for-scene-text","title":"PreSTU: Pre-Training for Scene-Text Understanding","date":"2022-09-12","arxiv_id":"2209.05534","repositories_listed":0,"syntology":null},{"url":null,"slug":"every-picture-tells-a-story-image-grounded","title":"Every picture tells a story: Image-grounded controllable stylistic story generation","date":"2022-09-04","arxiv_id":"2209.01638","repositories_listed":0,"syntology":null},{"url":null,"slug":"viecap4h-vlsp-2021-vietnamese-image","title":"vieCap4H-VLSP 2021: Vietnamese Image Captioning for Healthcare Domain using Swin Transformer and Attention-based LSTM","date":"2022-09-03","arxiv_id":"2209.01304","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-medical-semantic-assisted-transformer-for","title":"A Medical Semantic-Assisted Transformer for Radiographic Report Generation","date":"2022-08-22","arxiv_id":"2208.10358","repositories_listed":0,"syntology":null},{"url":null,"slug":"aesthetic-attributes-assessment-of-images-1","title":"Aesthetic Attributes Assessment of Images with AMANv2 and DPC-CaptionsV2","date":"2022-08-09","arxiv_id":"2208.04522","repositories_listed":0,"syntology":null},{"url":null,"slug":"distincive-image-captioning-via-clip-guided","title":"Distinctive Image Captioning via CLIP Guided Group Optimization","date":"2022-08-08","arxiv_id":"2208.04254","repositories_listed":0,"syntology":null},{"url":null,"slug":"radtex-learning-efficient-radiograph","title":"RadTex: Learning Efficient Radiograph Representations from Text Reports","date":"2022-08-05","arxiv_id":"2208.03218","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-learning-principles-and","title":"Neuro-Symbolic Learning: Principles and Applications in Ophthalmology","date":"2022-07-31","arxiv_id":"2208.00374","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-augmented-transformer-for-image","title":"Retrieval-Augmented Transformer for Image Captioning","date":"2022-07-26","arxiv_id":"2207.13162","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-baseline-for-detecting-out-of-distribution","title":"A Baseline for Detecting Out-of-Distribution Examples in Image Captioning","date":"2022-07-12","arxiv_id":"2207.05418","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-fine-grained-predicates-learning-for","title":"Adaptive Fine-Grained Predicates Learning for Scene Graph Generation","date":"2022-07-11","arxiv_id":"2207.04602","repositories_listed":0,"syntology":null},{"url":null,"slug":"expansionnet-exploring-the-sequence-length","title":"Exploring the sequence length bottleneck in the Transformer for Image Captioning","date":"2022-07-07","arxiv_id":"2207.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-word-learning-in-children-from-the","title":"Predicting Word Learning in Children from the Performance of Computer Vision Systems","date":"2022-07-07","arxiv_id":"2207.09847","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-metrics-measuring-what-they-should-an","title":"Are metrics measuring what they should? An evaluation of image captioning task metrics","date":"2022-07-04","arxiv_id":"2207.01733","repositories_listed":0,"syntology":null},{"url":null,"slug":"american-white-in-multimodal-language-and","title":"American == White in Multimodal Language-and-Image AI","date":"2022-07-01","arxiv_id":"2207.00691","repositories_listed":0,"syntology":null},{"url":null,"slug":"competence-based-multimodal-curriculum-1","title":"Competence-based Multimodal Curriculum Learning for Medical Report Generation","date":"2022-06-24","arxiv_id":"2206.14579","repositories_listed":0,"syntology":null},{"url":null,"slug":"dall-e-for-detection-language-driven-context","title":"DALL-E for Detection: Language-driven Compositional Image Synthesis for Object Detection","date":"2022-06-20","arxiv_id":"2206.09592","repositories_listed":0,"syntology":null},{"url":"/paper/0-1-deep-neural-networks-via-block-coordinate","slug":"0-1-deep-neural-networks-via-block-coordinate","title":"0/1 Deep Neural Networks via Block Coordinate Descent","date":"2022-06-19","arxiv_id":"2206.09379","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-self-guided-framework-for-radiology-report","title":"A Self-Guided Framework for Radiology Report Generation","date":"2022-06-19","arxiv_id":"2206.09378","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-based-on-feature-refinement","title":"Image Captioning based on Feature Refinement and Reflective Decoding","date":"2022-06-16","arxiv_id":"2206.07986","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-representational-harms-in-image","title":"Measuring Representational Harms in Image Captioning","date":"2022-06-14","arxiv_id":"2206.07173","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-image-captioning-with-control","title":"Improving Image Captioning with Control Signal of Sentence Quality","date":"2022-06-07","arxiv_id":"2206.03196","repositories_listed":0,"syntology":null},{"url":null,"slug":"intra-agent-speech-permits-zero-shot-task","title":"Intra-agent speech permits zero-shot task acquisition","date":"2022-06-07","arxiv_id":"2206.03139","repositories_listed":0,"syntology":null},{"url":null,"slug":"examining-the-effects-of-language-and-vision","title":"Examining the Effects of Language-and-Vision Data Augmentation for Generation of Descriptions of Human Faces","date":"2022-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-transformer-for-object-detection","title":"Visual Transformer for Object Detection","date":"2022-06-01","arxiv_id":"2206.06323","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-based-learning-for-unpaired-image","title":"Prompt-based Learning for Unpaired Image Captioning","date":"2022-05-26","arxiv_id":"2205.13125","repositories_listed":0,"syntology":null},{"url":"/paper/crossmodal-3600-a-massively-multilingual-1","slug":"crossmodal-3600-a-massively-multilingual-1","title":"Crossmodal-3600: A Massively Multilingual Multimodal Evaluation Dataset","date":"2022-05-25","arxiv_id":"2205.12522","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-advances-in-text-generation-from-images","title":"On Advances in Text Generation from Images Beyond Captioning: A Case Study in Self-Rationalization","date":"2022-05-24","arxiv_id":"2205.11686","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-evaluation-practices-in-visual","title":"Reassessing Evaluation Practices in Visual Question Answering: A Case Study on Out-of-Distribution Generalization","date":"2022-05-24","arxiv_id":"2205.12191","repositories_listed":0,"syntology":null},{"url":null,"slug":"it-isn-t-sh-tposting-it-s-my-cat-posting","title":"It Isn't Sh!tposting, It's My CAT Posting","date":"2022-05-18","arxiv_id":"2205.08710","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-transfer-learning-for-chest","title":"Understanding Transfer Learning for Chest Radiograph Clinical Report Generation with Modified Transformer Architectures","date":"2022-05-05","arxiv_id":"2205.02841","repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-me-multi-task-open-vocabulary-visual","title":"Answer-Me: Multi-Task Open-Vocabulary Visual Question Answering","date":"2022-05-02","arxiv_id":"2205.00949","repositories_listed":0,"syntology":null},{"url":null,"slug":"combine-to-describe-evaluating-compositional","title":"Combine to Describe: Evaluating Compositional Generalization in Image Captioning","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"molecular-identification-from-afm-images","title":"Molecular Identification from AFM images using the IUPAC Nomenclature and Attribute Multimodal Recurrent Neural Networks","date":"2022-05-01","arxiv_id":"2205.00449","repositories_listed":0,"syntology":null},{"url":null,"slug":"controllable-image-captioning","title":"Controllable Image Captioning","date":"2022-04-28","arxiv_id":"2204.13324","repositories_listed":0,"syntology":null},{"url":null,"slug":"caponimage-context-driven-dense-captioning-on","title":"CapOnImage: Context-driven Dense-Captioning on Image","date":"2022-04-27","arxiv_id":"2204.12974","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-view-brain-decoding","title":"Cross-view Brain Decoding","date":"2022-04-18","arxiv_id":"2204.09564","repositories_listed":0,"syntology":null},{"url":null,"slug":"guiding-attention-using-partial-order","title":"Guiding Attention using Partial-Order Relationships for Image Captioning","date":"2022-04-15","arxiv_id":"2204.07476","repositories_listed":0,"syntology":null},{"url":"/paper/robust-cross-modal-representation-learning","slug":"robust-cross-modal-representation-learning","title":"Robust Cross-Modal Representation Learning with Progressive Self-Distillation","date":"2022-04-10","arxiv_id":"2204.04588","repositories_listed":0,"syntology":null},{"url":"/paper/multimodal-quasi-autoregression-forecasting","slug":"multimodal-quasi-autoregression-forecasting","title":"Multimodal Quasi-AutoRegression: Forecasting the visual popularity of new fashion products","date":"2022-04-08","arxiv_id":"2204.04014","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-distinctive-image-captioning-via-comparing","title":"On Distinctive Image Captioning via Comparing and Reweighting","date":"2022-04-08","arxiv_id":"2204.03938","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-exploration-from-language","title":"Semantic Exploration from Language Abstractions and Pretrained Representations","date":"2022-04-08","arxiv_id":"2204.05080","repositories_listed":0,"syntology":null},{"url":"/paper/learning-audio-video-modalities-from-image","slug":"learning-audio-video-modalities-from-image","title":"Learning Audio-Video Modalities from Image Captions","date":"2022-04-01","arxiv_id":"2204.00679","repositories_listed":0,"syntology":null},{"url":null,"slug":"wudaomm-a-large-scale-multi-modal-dataset-for","title":"WuDaoMM: A large-scale Multi-Modal Dataset for Pre-training models","date":"2022-03-22","arxiv_id":"2203.11480","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligntransformer-hierarchical-alignment-of","title":"AlignTransformer: Hierarchical Alignment of Visual Regions and Disease Tags for Medical Report Generation","date":"2022-03-18","arxiv_id":"2203.10095","repositories_listed":0,"syntology":null},{"url":null,"slug":"du-vlg-unifying-vision-and-language","title":"DU-VLG: Unifying Vision-and-Language Generation via Dual Sequence-to-Sequence Pre-training","date":"2022-03-17","arxiv_id":"2203.09052","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-visual-semantic-pretraining","title":"Contrastive Visual Semantic Pretraining Magnifies the Semantics of Natural Language Representations","date":"2022-03-14","arxiv_id":"2203.07511","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-visual-knowledge-in-language-tasks-1","title":"Leveraging Visual Knowledge in Language Tasks: An Empirical Study on Intermediate Pre-training for Cross-modal Knowledge Transfer","date":"2022-03-14","arxiv_id":"2203.07519","repositories_listed":0,"syntology":null},{"url":null,"slug":"enabling-multimodal-generation-on-clip-via-1","title":"Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation","date":"2022-03-12","arxiv_id":"2203.06386","repositories_listed":0,"syntology":null},{"url":null,"slug":"taking-an-emotional-look-at-video-paragraph","title":"Taking an Emotional Look at Video Paragraph Captioning","date":"2022-03-12","arxiv_id":"2203.06356","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-distillation-guided-salient-object","title":"Semantic Distillation Guided Salient Object Detection","date":"2022-03-08","arxiv_id":"2203.04076","repositories_listed":0,"syntology":null},{"url":null,"slug":"unpaired-image-captioning-by-image-level","title":"Unpaired Image Captioning by Image-level Weakly-Supervised Visual Concept Recognition","date":"2022-03-07","arxiv_id":"2203.03195","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-neural-framework-for-image-caption","title":"A Deep Neural Framework for Image Caption Generation Using GRU-Based Attention Mechanism","date":"2022-03-03","arxiv_id":"2203.01594","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-machine-learning-for-image","title":"Interactive Machine Learning for Image Captioning","date":"2022-02-28","arxiv_id":"2202.13623","repositories_listed":0,"syntology":null},{"url":null,"slug":"i-tuning-tuning-language-models-with-image","title":"I-Tuning: Tuning Frozen Language Models with Image for Lightweight Image Captioning","date":"2022-02-14","arxiv_id":"2202.06574","repositories_listed":0,"syntology":null},{"url":null,"slug":"bench-marking-and-improving-arabic-automatic","title":"Bench-Marking And Improving Arabic Automatic Image Captioning Through The Use Of Multi-Task Learning Paradigm","date":"2022-02-11","arxiv_id":"2202.05474","repositories_listed":0,"syntology":null}],"record_sha256":"524505f46d048252e1732d67bf171c267a6e7c2be7247b5013925b36136765df","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}