{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-captioning/papers/14","list_of":"/task/image-captioning","task":"Image Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":14,"pages_in_order":19,"rows_per_page":100,"rows":[1301,1400],"of":1878,"counts":{"archive_papers_tagged":1878,"with_a_code_link":774,"where_syntology_ran_a_sample":243,"not_listed_spam_title":0,"listed":1878,"listed_where_code_ran":243,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":201,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":201,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-captioning","prev":"/task/image-captioning/papers/13","next":"/task/image-captioning/papers/15","papers":[{"url":null,"slug":"describing-image-focused-in-cognitive-and","title":"Describing image focused in cognitive and visual details for visually impaired people: An approach to generating inclusive paragraphs","date":"2022-02-10","arxiv_id":"2202.05331","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-approaches-on-image-captioning","title":"Deep Learning Approaches on Image Captioning: A Review","date":"2022-01-31","arxiv_id":"2201.12944","repositories_listed":0,"syntology":null},{"url":null,"slug":"vc-gpt-visual-conditioned-gpt-for-end-to-end","title":"A Frustratingly Simple Approach for End-to-End Image Captioning","date":"2022-01-30","arxiv_id":"2201.12723","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-integrated-approach-for-video-captioning","title":"An Integrated Approach for Video Captioning and Applications","date":"2022-01-23","arxiv_id":"2201.09153","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-non-monotonic-autoregressive-1","title":"Discovering Non-Monotonic Autoregressive Ordering for Text Generation Models using Sinkhorn Distributions","date":"2022-01-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"all-you-may-need-for-vqa-are-image-captions","title":"All You May Need for VQA are Image Captions","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bidimensional-leaderboards-generate-and-1","title":"Bidimensional Leaderboards: Generate and Evaluate Language Hand in Hand","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"crossmodal-3600-a-massively-multilingual","title":"Crossmodal-3600: A Massively Multilingual Multimodal Evaluation Dataset","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"long-tail-classification-for-distinctive","title":"Long-Tail Classification for Distinctive Image Captioning: A Simple yet Effective Remedy for Side Effects of Reinforcement Learning","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transparent-human-evaluation-for-image-1","title":"Transparent Human Evaluation for Image Captioning","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uni-eden-universal-encoder-decoder-network-by","title":"Uni-EDEN: Universal Encoder-Decoder Network by Multi-Granular Vision-Language Pre-training","date":"2022-01-11","arxiv_id":"2201.04026","repositories_listed":0,"syntology":null},{"url":null,"slug":"repurposing-existing-deep-networks-for","title":"Repurposing Existing Deep Networks for Caption and Aesthetic-Guided Image Cropping","date":"2022-01-07","arxiv_id":"2201.02280","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthesizing-tensor-transformations-for","title":"Synthesizer Based Efficient Self-Attention for Vision Tasks","date":"2022-01-05","arxiv_id":"2201.01410","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-attention-ai-to-translate-low","title":"Interactive Attention AI to translate low light photos to captions for night scene understanding in women safety","date":"2022-01-04","arxiv_id":"2201.00969","repositories_listed":0,"syntology":null},{"url":null,"slug":"stylem-stylized-metrics-for-image-captioning","title":"StyleM: Stylized Metrics for Image Captioning Built with Contrastive N-grams","date":"2022-01-04","arxiv_id":"2201.00975","repositories_listed":0,"syntology":null},{"url":null,"slug":"difnet-boosting-visual-information-flow-for","title":"DIFNet: Boosting Visual Information Flow for Image Captioning","date":"2022-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-matters-radiology-report-generation","title":"Knowledge Matters: Radiology Report Generation with General and Specific Knowledge","date":"2021-12-30","arxiv_id":"2112.15009","repositories_listed":0,"syntology":null},{"url":null,"slug":"extended-self-critical-pipeline-for","title":"Extended Self-Critical Pipeline for Transforming Videos to Text (TRECVID-VTT Task 2021) -- Team: MMCUniAugsburg","date":"2021-12-28","arxiv_id":"2112.14100","repositories_listed":0,"syntology":null},{"url":null,"slug":"synchronized-audio-visual-frames-with","title":"Synchronized Audio-Visual Frames with Fractional Positional Encoding for Transformers in Video-to-Text Translation","date":"2021-12-28","arxiv_id":"2112.14088","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-fistful-of-words-learning-transferable","title":"A Fistful of Words: Learning Transferable Visual Models from Bag-of-Words Supervision","date":"2021-12-27","arxiv_id":"2112.13884","repositories_listed":0,"syntology":null},{"url":null,"slug":"magic-multimodal-relational-graph-adversarial","title":"MAGIC: Multimodal relAtional Graph adversarIal inferenCe for Diverse and Unpaired Text-based Image Captioning","date":"2021-12-13","arxiv_id":"2112.06558","repositories_listed":0,"syntology":null},{"url":null,"slug":"consensus-graph-representation-learning-for","title":"Consensus Graph Representation Learning for Better Grounded Image Captioning","date":"2021-12-02","arxiv_id":"2112.00974","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scaled-encoder-decoder-network-for-image","title":"A Scaled Encoder Decoder Network for Image Captioning in Hindi","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"image-caption-generation-framework-for","title":"Image Caption Generation Framework for Assamese News using Attention Mechanism","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-attention-for-image-captioning-review","title":"Neural Attention for Image Captioning: Review of Outstanding Methods","date":"2021-11-29","arxiv_id":"2111.15015","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graph-generation-with-geometric-context","title":"Scene Graph Generation with Geometric Context","date":"2021-11-25","arxiv_id":"2111.13131","repositories_listed":0,"syntology":null},{"url":"/paper/scaling-up-vision-language-pre-training-for","slug":"scaling-up-vision-language-pre-training-for","title":"Scaling Up Vision-Language Pre-training for Image Captioning","date":"2021-11-24","arxiv_id":"2111.12233","repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-captioner-long-tail-vision-and","title":"Generating More Pertinent Captions by Leveraging Semantics and Style on Multi-Source Datasets","date":"2021-11-24","arxiv_id":"2111.12727","repositories_listed":0,"syntology":null},{"url":null,"slug":"ufo-a-unified-transformer-for-vision-language","title":"UFO: A UniFied TransfOrmer for Vision-Language Representation Learning","date":"2021-11-19","arxiv_id":"2111.10023","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenges-in-region-specific-image","title":"Challenges in Region-Specific Image Captioning: A Deep Learning Approach","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/enabling-multimodal-generation-on-clip-via","slug":"enabling-multimodal-generation-on-clip-via","title":"Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-visual-knowledge-in-language-tasks","title":"Leveraging Visual Knowledge in Language Tasks: An Empirical Study on Intermediate Pre-training for Cross-Modal Knowledge Transfer","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-learning-are-captions-all-you-need","title":"Multimodal Learning: Are Captions All You Need?","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-vision-features-in-multimodal-machine","title":"On Vision Features in Multimodal Machine Translation","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-knowledge-aware-image-captioning","title":"Temporal Knowledge-Aware Image Captioning","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-analogy-and-composition-a-framework","title":"Retrieval, Analogy, and Composition: A framework for Compositional Generalization in Image Captioning","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"wikily-supervised-neural-translation-tailored","title":"“Wikily” Supervised Neural Translation Tailored to Cross-Lingual Tasks","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-cross-modal-prediction-and","title":"Exploiting Cross-Modal Prediction and Relation Consistency for Semi-Supervised Image Captioning","date":"2021-10-22","arxiv_id":"2110.11767","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-self-explainable-stylish-image-captioning","title":"A Self-Explainable Stylish Image Captioning Framework via Multi-References","date":"2021-10-20","arxiv_id":"2110.10704","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-annotated-training-for-controllable","title":"Self-Annotated Training for Controllable Image Captioning","date":"2021-10-16","arxiv_id":"2110.08446","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-an-image-worth-five-sentences-a-new-look","title":"Is An Image Worth Five Sentences? A New Look into Semantics for Image-Text Matching","date":"2021-10-06","arxiv_id":"2110.02623","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-structural-representations-for","title":"Learning Structural Representations for Recipe Generation and Food Retrieval","date":"2021-10-04","arxiv_id":"2110.01209","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoupling-pragmatics-discriminative-decoding","title":"Decoupling Pragmatics: Discriminative Decoding for Referring Expression Generation","date":"2021-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"geometry-entangled-visual-semantic","title":"Geometry-Entangled Visual Semantic Transformer for Image Captioning","date":"2021-09-29","arxiv_id":"2109.14137","repositories_listed":0,"syntology":null},{"url":null,"slug":"google-neural-network-models-for-edge-devices","title":"Google Neural Network Models for Edge Devices: Analyzing and Mitigating Machine Learning Inference Bottlenecks","date":"2021-09-29","arxiv_id":"2109.14320","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-visual-linguistic-adequacy-fidelity","title":"Learning Visual-Linguistic Adequacy, Fidelity, and Fluency for Novel Object Captioning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graph-generation-for-better-image","title":"Scene Graph Generation for Better Image Captioning?","date":"2021-09-23","arxiv_id":"2109.11398","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modification-attention-based","title":"Cross Modification Attention Based Deliberation Model for Image Captioning","date":"2021-09-17","arxiv_id":"2109.08411","repositories_listed":0,"syntology":null},{"url":null,"slug":"denoising-large-scale-image-captioning-from","title":"Denoising Large-Scale Image Captioning from Alt-text Data using Content Selection Models","date":"2021-09-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unims-a-unified-framework-for-multimodal","title":"UniMS: A Unified Framework for Multimodal Summarization with Knowledge Distillation","date":"2021-09-13","arxiv_id":"2109.05812","repositories_listed":0,"syntology":null},{"url":null,"slug":"bornon-bengali-image-captioning-with","title":"Bornon: Bengali Image Captioning with Transformer-based Deep learning approach","date":"2021-09-11","arxiv_id":"2109.05218","repositories_listed":0,"syntology":null},{"url":null,"slug":"partially-supervised-novel-object-captioning","title":"Partially-Supervised Novel Object Captioning Leveraging Context from Paired Data","date":"2021-09-10","arxiv_id":"2109.05115","repositories_listed":0,"syntology":null},{"url":"/paper/refinecap-concept-aware-refinement-for-image","slug":"refinecap-concept-aware-refinement-for-image","title":"RefineCap: Concept-Aware Refinement for Image Captioning","date":"2021-09-08","arxiv_id":"2109.03529","repositories_listed":0,"syntology":null},{"url":null,"slug":"img2smi-translating-molecular-structure","title":"IMG2SMI: Translating Molecular Structure Images to Simplified Molecular-input Line-entry System","date":"2021-09-03","arxiv_id":"2109.04202","repositories_listed":0,"syntology":null},{"url":null,"slug":"similar-scenes-arouse-similar-emotions","title":"Similar Scenes arouse Similar Emotions: Parallel Data Augmentation for Stylized Image Captioning","date":"2021-08-26","arxiv_id":"2108.11912","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-parsing-network-for-image-captioning-and","title":"Auto-Parsing Network for Image Captioning and Visual Question Answering","date":"2021-08-24","arxiv_id":"2108.10568","repositories_listed":0,"syntology":null},{"url":null,"slug":"group-based-distinctive-image-captioning-with","title":"Group-based Distinctive Image Captioning with Memory Attention","date":"2021-08-20","arxiv_id":"2108.09151","repositories_listed":0,"syntology":null},{"url":null,"slug":"visbuddy-a-smart-wearable-assistant-for-the","title":"VisBuddy -- A Smart Wearable Assistant for the Visually Challenged","date":"2021-08-17","arxiv_id":"2108.07761","repositories_listed":0,"syntology":null},{"url":null,"slug":"o2na-an-object-oriented-non-autoregressive","title":"O2NA: An Object-Oriented Non-Autoregressive Approach for Controllable Video Captioning","date":"2021-08-05","arxiv_id":"2108.02359","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-attention-for-grounded-image","title":"Distributed Attention for Grounded Image Captioning","date":"2021-08-02","arxiv_id":"2108.01056","repositories_listed":0,"syntology":null},{"url":"/paper/control-image-captioning-spatially-and","slug":"control-image-captioning-spatially-and","title":"Control Image Captioning Spatially and Temporally","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-fast-and-slow-a-case-study-on","title":"Decoding, Fast and Slow: A Case Study on Balancing Trade-Offs in Incremental, Character-level Pragmatic Reasoning","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"i-ve-seen-things-you-people-wouldn-t-believe","title":"``I've Seen Things You People Wouldn't Believe'': Hallucinating Entities in GuessWhat?!","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"li-yong-tu-xiang-miao-shu-yu-zhi-shi-tu-pu","title":"利用图像描述与知识图谱增强表示的视觉问答(Exploiting Image Captions and External Knowledge as Representation Enhancement for Visual Question Answering)","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"nlphuts-participation-at-wat2021","title":"NLPHut’s Participation at WAT2021","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-thorough-review-on-recent-deep-learning","title":"A Thorough Review on Recent Deep Learning Methodologies for Image Captioning","date":"2021-07-28","arxiv_id":"2107.13114","repositories_listed":0,"syntology":null},{"url":null,"slug":"experimenting-with-self-supervision-using","title":"Experimenting with Self-Supervision using Rotation Prediction for Image Captioning","date":"2021-07-28","arxiv_id":"2107.13111","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-entity-aware-image-captioning-with","title":"Boosting Entity-aware Image Captioning with Multi-modal Knowledge Graph","date":"2021-07-26","arxiv_id":"2107.11970","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-show-to-tell-a-survey-on-image","title":"From Show to Tell: A Survey on Deep Learning-based Image Captioning","date":"2021-07-14","arxiv_id":"2107.06912","repositories_listed":0,"syntology":null},{"url":"/paper/an-encoder-decoder-based-framework-for-hindi","slug":"an-encoder-decoder-based-framework-for-hindi","title":"An encoder-decoder based framework for hindi image caption generation","date":"2021-07-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"controlled-caption-generation-for-images","title":"Controlled Caption Generation for Images Through Adversarial Attacks","date":"2021-07-07","arxiv_id":"2107.03050","repositories_listed":0,"syntology":null},{"url":null,"slug":"diversity-as-a-by-product-goal-oriented","title":"Diversity as a By-Product: Goal-oriented Language Generation Leads to Linguistic Variation","date":"2021-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"egocentric-image-captioning-for-privacy","title":"Egocentric Image Captioning for Privacy-Preserved Passive Dietary Intake Monitoring","date":"2021-07-01","arxiv_id":"2107.00372","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-semantic-similarity-learning-for","title":"Contrastive Semantic Similarity Learning for Image Captioning Evaluation with Intrinsic Auto-encoder","date":"2021-06-29","arxiv_id":"2106.15312","repositories_listed":0,"syntology":null},{"url":null,"slug":"confidence-guided-radiology-report-generation","title":"Trust It or Not: Confidence-Guided Automatic Radiology Report Generation","date":"2021-06-21","arxiv_id":"2106.10887","repositories_listed":0,"syntology":null},{"url":null,"slug":"tcic-theme-concepts-learning-cross-language","title":"TCIC: Theme Concepts Learning Cross Language and Vision for Image Captioning","date":"2021-06-21","arxiv_id":"2106.10936","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-semantic-relationships-for-unpaired","title":"Exploring Semantic Relationships for Unpaired Image Captioning","date":"2021-06-20","arxiv_id":"2106.10658","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-self-boosting-framework-for-automated","title":"A Self-Boosting Framework for Automated Radiographic Report Generation","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"faier-fidelity-and-adequacy-ensured-image","title":"FAIEr: Fidelity and Adequacy Ensured Image Caption Evaluation","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-ocr-based-image-captioning-by","title":"Improving OCR-Based Image Captioning by Incorporating Geometrical Relationship","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/transitional-adaptation-of-pretrained-models","slug":"transitional-adaptation-of-pretrained-models","title":"Transitional Adaptation of Pretrained Models for Visual Storytelling","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-visual-futures-with-image","title":"Predicting Visual Futures with Image Captioning and Pre-Trained Language Models","date":"2021-06-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-augmentation-to-improve-robustness-of","title":"Data augmentation to improve robustness of image captioning solutions","date":"2021-06-10","arxiv_id":"2106.05437","repositories_listed":0,"syntology":null},{"url":null,"slug":"e2e-vlp-end-to-end-vision-language-pre","title":"E2E-VLP: End-to-End Vision-Language Pre-training Enhanced by Visual Learning","date":"2021-06-03","arxiv_id":"2106.01804","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-select-a-fully-attentive-approach","title":"Learning to Select: A Fully Attentive Approach for Novel Object Captioning","date":"2021-06-02","arxiv_id":"2106.01424","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-vision-affects-language-comparing-masked","title":"How Vision Affects Language: Comparing Masked Self-Attention in Uni-Modal and Multi-Modal Transformer","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-partial-dependency-trees-to","title":"Leveraging Partial Dependency Trees to Control Image Captions","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-randomized-classification-layers-and-their","title":"On Randomized Classification Layers and Their Implications in Natural Language Generation","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"validity-based-sampling-and-smoothing-methods","title":"Validity-Based Sampling and Smoothing Methods for Multiple Reference Image Captioning","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"longer-version-for-deep-context-encoding","title":"Longer Version for \"Deep Context-Encoding Network for Retinal Image Captioning\"","date":"2021-05-30","arxiv_id":"2105.14538","repositories_listed":0,"syntology":null},{"url":null,"slug":"new-image-captioning-encoder-via-semantic","title":"New Encoder Learning for Captioning Heavy Rain Images via Semantic Visual Feature Matching","date":"2021-05-28","arxiv_id":"2105.13753","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-representation-of-negation-real-world","title":"Visual representation of negation: Real world data analysis on comic image design","date":"2021-05-21","arxiv_id":"2105.10131","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-than-just-attention-learning-cross-modal","title":"More Than Just Attention: Improving Cross-Modal Attentions with Contrastive Constraints for Image-Text Matching","date":"2021-05-20","arxiv_id":"2105.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"dependent-multi-task-learning-with-causal","title":"Dependent Multi-Task Learning with Causal Intervention for Image Captioning","date":"2021-05-18","arxiv_id":"2105.08573","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-image-captioning-for-the-visually","title":"Multi-Modal Image Captioning for the Visually Impaired","date":"2021-05-17","arxiv_id":"2105.08106","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-visual-semantic-embedding-methods","title":"Survey of Visual-Semantic Embedding Methods for Zero-Shot Image Retrieval","date":"2021-05-16","arxiv_id":"2105.07391","repositories_listed":0,"syntology":null},{"url":null,"slug":"empirical-analysis-of-image-caption","title":"Empirical Analysis of Image Caption Generation using Deep Learning","date":"2021-05-14","arxiv_id":"2105.09906","repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-aware-remote-sensing-image","title":"Instance-aware Remote Sensing Image Captioning with Cross-hierarchy Attention","date":"2021-05-11","arxiv_id":"2105.04996","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-explicit-and-implicit-visual","title":"Exploring Explicit and Implicit Visual Relationships for Image Captioning","date":"2021-05-06","arxiv_id":"2105.02391","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextualized-keyword-representations-for","title":"Contextualized Keyword Representations for Multi-modal Retinal Image Captioning","date":"2021-04-26","arxiv_id":"2104.12471","repositories_listed":0,"syntology":null}],"record_sha256":"70706047cc2f47d1965b4286e426d8455dbf76627d8d685f93b83cc9438463fd","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}