{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-captioning/papers/15","list_of":"/task/image-captioning","task":"Image Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":15,"pages_in_order":19,"rows_per_page":100,"rows":[1401,1500],"of":1878,"counts":{"archive_papers_tagged":1878,"with_a_code_link":774,"where_syntology_ran_a_sample":243,"not_listed_spam_title":0,"listed":1878,"listed_where_code_ran":243,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":201,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":201,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-captioning","prev":"/task/image-captioning/papers/14","next":"/task/image-captioning/papers/16","papers":[{"url":null,"slug":"hindsight-a-graph-based-vision-model","title":"HindSight: A Graph-Based Vision Model Architecture For Representing Part-Whole Hierarchies","date":"2021-04-08","arxiv_id":"2104.03722","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressing-visual-linguistic-model-via","title":"Compressing Visual-linguistic Model via Knowledge Distillation","date":"2021-04-05","arxiv_id":"2104.02096","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-image-text-synergy-for-contextual","title":"Exploiting Image–Text Synergy for Contextual Image Captioning","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"making-use-of-latent-space-in-language-gans","title":"Making Use of Latent Space in Language GANs for Generating Diverse Text without Pre-training","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-hallucination-and-predictive-uncertainty","title":"On Hallucination and Predictive Uncertainty in Conditional Language Generation","date":"2021-03-28","arxiv_id":"2103.15025","repositories_listed":0,"syntology":null},{"url":null,"slug":"3m-multi-style-image-caption-generation-using","title":"3M: Multi-style image caption generation using Multi-modality features under Multi-UPDOWN model","date":"2021-03-20","arxiv_id":"2103.11186","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graphs-a-survey-of-generations-and","title":"A Comprehensive Survey of Scene Graphs: Generation and Application","date":"2021-03-17","arxiv_id":"2104.01111","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-driven-description-synthesis-for","title":"Knowledge driven Description Synthesis for Floor Plan Interpretation","date":"2021-03-15","arxiv_id":"2103.08298","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-convolutional-decoder-for-image","title":"Analysis of Convolutional Decoder for Image Caption Generation","date":"2021-03-08","arxiv_id":"2103.04914","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepfn-towards-generalizable-facial-action","title":"DeepFN: Towards Generalizable Facial Action Unit Recognition with Deep Face Normalization","date":"2021-03-03","arxiv_id":"2103.02484","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-modality-transition-for-image","title":"Enhanced Modality Transition for Image Captioning","date":"2021-02-23","arxiv_id":"2102.11526","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-using-deep-stacked-lstms","title":"Image Captioning using Deep Stacked LSTMs, Contextual Word Embeddings and Data Augmentation","date":"2021-02-22","arxiv_id":"2102.11237","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-using-multiple-transformers","title":"Image Captioning using Multiple Transformers for Self-Attention Mechanism","date":"2021-02-14","arxiv_id":"2103.05103","repositories_listed":0,"syntology":null},{"url":null,"slug":"l2c-describing-visual-differences-needs","title":"L2C: Describing Visual Differences Needs Semantic Understanding of Individuals","date":"2021-02-03","arxiv_id":"2102.01860","repositories_listed":0,"syntology":null},{"url":null,"slug":"cptr-full-transformer-network-for-image","title":"CPTR: Full Transformer Network for Image Captioning","date":"2021-01-26","arxiv_id":"2101.10804","repositories_listed":0,"syntology":null},{"url":null,"slug":"ecol-r-encouraging-copying-in-novel-object","title":"ECOL-R: Encouraging Copying in Novel Object Captioning with Reinforcement Learning","date":"2021-01-25","arxiv_id":"2101.09865","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-sequence-generation-with-multi-agent","title":"Fast Sequence Generation with Multi-Agent Reinforcement Learning","date":"2021-01-24","arxiv_id":"2101.09698","repositories_listed":0,"syntology":null},{"url":null,"slug":"macroscopic-control-of-text-generation-for","title":"Macroscopic Control of Text Generation for Image Captioning","date":"2021-01-20","arxiv_id":"2101.08000","repositories_listed":0,"syntology":null},{"url":null,"slug":"diagnostic-captioning-a-survey","title":"Diagnostic Captioning: A Survey","date":"2021-01-18","arxiv_id":"2101.07299","repositories_listed":0,"syntology":null},{"url":null,"slug":"canvasemb-learning-layout-representation-with","title":"CANVASEMB: Learning Layout Representation with Large-scale Pre-training for Graphic Design","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-graph-attention-network-for-few","title":"Hierarchical Graph Attention Network for Few-Shot Visual-Semantic Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"partial-off-policy-learning-balance-accuracy","title":"Partial Off-Policy Learning: Balance Accuracy and Diversity for Human-Oriented Image Captioning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-text-generation-with-artificial","title":"Neural Text Generation with Artificial Negative Examples","date":"2020-12-28","arxiv_id":"2012.14124","repositories_listed":0,"syntology":null},{"url":null,"slug":"subicap-towards-subword-informed-image","title":"SubICap: Towards Subword-informed Image Captioning","date":"2020-12-24","arxiv_id":"2012.13122","repositories_listed":0,"syntology":null},{"url":null,"slug":"wembsim-a-simple-yet-effective-metric-for","title":"WEmbSim: A Simple yet Effective Metric for Image Captioning","date":"2020-12-24","arxiv_id":"2012.13137","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-to-bengali-caption-generation-using","title":"Image to Bengali Caption Generation Using Deep CNN and Bidirectional Gated Recurrent Unit","date":"2020-12-22","arxiv_id":"2012.12139","repositories_listed":0,"syntology":null},{"url":null,"slug":"alleviating-noisy-data-in-image-captioning","title":"Alleviating Noisy Data in Image Captioning with Cooperative Distillation","date":"2020-12-21","arxiv_id":"2012.11691","repositories_listed":0,"syntology":null},{"url":null,"slug":"autocaption-image-captioning-with-neural","title":"AutoCaption: Image Captioning with Neural Architecture Search","date":"2020-12-16","arxiv_id":"2012.09742","repositories_listed":0,"syntology":null},{"url":null,"slug":"robots-understanding-contextual-information","title":"Robots Understanding Contextual Information in Human-Centered Environments using Weakly Supervised Mask Data Distillation","date":"2020-12-15","arxiv_id":"2012.08282","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsic-image-captioning-evaluation","title":"Intrinsic Image Captioning Evaluation","date":"2020-12-14","arxiv_id":"2012.07333","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-context-aware-auxiliary","title":"Image Captioning with Context-Aware Auxiliary Guidance","date":"2020-12-10","arxiv_id":"2012.05545","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-annotation-free-evaluation-of-cross","title":"Towards Annotation-Free Evaluation of Cross-Lingual Image Captioning","date":"2020-12-09","arxiv_id":"2012.04925","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-image-captioning","title":"Robust Image Captioning","date":"2020-12-06","arxiv_id":"2012.09732","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-framework-and-dataset-for-abstract-art","title":"A Framework and Dataset for Abstract Art Generation via CalligraphyGAN","date":"2020-12-02","arxiv_id":"2012.00744","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridge-the-gap-high-level-semantic-planning","title":"Bridge the Gap: High-level Semantic Planning for Image Captioning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"from-before-to-after-generating-natural","title":"From “Before” to “After”: Generating Natural Language Instructions from Image Pairs in a Simple Visual Domain","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"geo-aware-image-caption-generation","title":"Geo-Aware Image Caption Generation","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"odianlps-participation-in-wat2020","title":"ODIANLP’s Participation in WAT2020","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"prophet-attention-predicting-attention-with","title":"Prophet Attention: Predicting Attention with Future Attention","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"superocr-a-conversion-from-optical-character","title":"SuperOCR: A Conversion from Optical Character Recognition to Image Captioning","date":"2020-11-21","arxiv_id":"2012.02033","repositories_listed":0,"syntology":null},{"url":null,"slug":"structural-and-functional-decomposition-for","title":"Structural and Functional Decomposition for Personality Image Captioning in a Communication Game","date":"2020-11-17","arxiv_id":"2011.08543","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-apposcorpus-a-new-multilingual-multi","title":"The ApposCorpus: A new multilingual, multi-domain dataset for factual appositive generation","date":"2020-11-06","arxiv_id":"2011.03287","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-beam-an-image-captioning-approach","title":"Attention Beam: An Image Captioning Approach","date":"2020-11-03","arxiv_id":"2011.01753","repositories_listed":0,"syntology":null},{"url":null,"slug":"boost-image-captioning-with-knowledge","title":"Boost Image Captioning with Knowledge Reasoning","date":"2020-11-02","arxiv_id":"2011.00927","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-attention-on-pyramid-feature-maps-for","title":"Dual Attention on Pyramid Feature Maps for Image Captioning","date":"2020-11-02","arxiv_id":"2011.01385","repositories_listed":0,"syntology":null},{"url":null,"slug":"capwap-image-captioning-with-a-purpose","title":"CapWAP: Image Captioning with a Purpose","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fusion-models-for-improved-visual-captioning","title":"Fusion Models for Improved Visual Captioning","date":"2020-10-28","arxiv_id":"2010.15251","repositories_listed":0,"syntology":null},{"url":null,"slug":"curious-case-of-language-generation","title":"Curious Case of Language Generation Evaluation Metrics: A Cautionary Tale","date":"2020-10-26","arxiv_id":"2010.13588","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-visual-object","title":"Image Captioning with Visual Object Representations Grounded in the Textual Modality","date":"2020-10-19","arxiv_id":"2010.09413","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-corpus-for-english-japanese-multimodal","title":"A Corpus for English-Japanese Multimodal Neural Machine Translation with Comparable Sentences","date":"2020-10-17","arxiv_id":"2010.08725","repositories_listed":0,"syntology":null},{"url":null,"slug":"new-ideas-and-trends-in-deep-multimodal","title":"New Ideas and Trends in Deep Multimodal Content Understanding: A Review","date":"2020-10-16","arxiv_id":"2010.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"dissecting-the-components-and-factors-of","title":"Positioning yourself in the maze of Neural Text Generation: A Task-Agnostic Survey","date":"2020-10-14","arxiv_id":"2010.07279","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-actor-dual-critic-model-for-remote","title":"A Novel Actor Dual-Critic Model for Remote Sensing Image Captioning","date":"2020-10-05","arxiv_id":"2010.01999","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-cross-lingual-image-captioning","title":"UNISON: Unpaired Cross-lingual Image Captioning","date":"2020-10-03","arxiv_id":"2010.01288","repositories_listed":0,"syntology":null},{"url":null,"slug":"caption-correction-by-analyses-pos-tagging","title":"CAPTION: Correction by Analyses, POS-Tagging and Interpretation of Objects using only Nouns","date":"2020-10-02","arxiv_id":"2010.00839","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-object-detection-from-captions-via","title":"Learning Object Detection from Captions via Textual Scene Attributes","date":"2020-09-30","arxiv_id":"2009.14558","repositories_listed":0,"syntology":null},{"url":null,"slug":"teacher-critical-training-strategies-for","title":"Teacher-Critical Training Strategies for Image Captioning","date":"2020-09-30","arxiv_id":"2009.14405","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-attention-as-an-interface-for-image","title":"Spatial Attention as an Interface for Image Captioning Models","date":"2020-09-29","arxiv_id":"2010.11701","repositories_listed":0,"syntology":null},{"url":"/paper/vivo-surpassing-human-performance-in-novel","slug":"vivo-surpassing-human-performance-in-novel","title":"VIVO: Visual Vocabulary Pre-Training for Novel Object Captioning","date":"2020-09-28","arxiv_id":"2009.13682","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multimodal-memes-classification-a-survey","title":"A Multimodal Memes Classification: A Survey and Open Research Issues","date":"2020-09-17","arxiv_id":"2009.08395","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-content-selection-for","title":"Denoising Large-Scale Image Captioning from Alt-text Data using Content Selection Models","date":"2020-09-10","arxiv_id":"2009.05175","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-efficient-technique-for-image-captioning","title":"An Efficient Technique for Image Captioning using Deep Neural Network","date":"2020-09-05","arxiv_id":"2009.02565","repositories_listed":0,"syntology":null},{"url":"/paper/hierarchical-memory-decoder-for-visual","slug":"hierarchical-memory-decoder-for-visual","title":"Hierarchical memory decoder for visual narrating","date":"2020-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-evaluation-metrics-used-for-nlg","title":"A Survey of Evaluation Metrics Used for NLG Systems","date":"2020-08-27","arxiv_id":"2008.12009","repositories_listed":0,"syntology":null},{"url":null,"slug":"attr2style-a-transfer-learning-approach-for","title":"Attr2Style: A Transfer Learning Approach for Inferring Fashion Styles via Apparel Attributes","date":"2020-08-26","arxiv_id":"2008.11662","repositories_listed":0,"syntology":null},{"url":null,"slug":"linguistically-aware-attention-for-reducing","title":"Linguistically-aware Attention for Reducing the Semantic-Gap in Vision-Language Tasks","date":"2020-08-18","arxiv_id":"2008.08012","repositories_listed":0,"syntology":null},{"url":null,"slug":"assisting-scene-graph-generation-with-self","title":"Assisting Scene Graph Generation with Self-Supervision","date":"2020-08-08","arxiv_id":"2008.03555","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-visual-representations-with-caption","title":"Learning Visual Representations with Caption Annotations","date":"2020-08-04","arxiv_id":"2008.01392","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-automatically-generated-phoneme","title":"Evaluating Automatically Generated Phoneme Captions for Images","date":"2020-07-31","arxiv_id":"2007.15916","repositories_listed":0,"syntology":null},{"url":null,"slug":"decomposed-generation-networks-with-structure","title":"Decomposing Generation Networks with Structure Prediction for Recipe Generation","date":"2020-07-27","arxiv_id":"2007.13374","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-image-captioning-with-rule-based","title":"Integrating Image Captioning with Rule-based Entity Masking","date":"2020-07-22","arxiv_id":"2007.11690","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-diversity-and-reducing-redundancy","title":"Improving Diversity and Reducing Redundancy in Paragraph Captions","date":"2020-07-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"compare-and-reweight-distinctive-image","title":"Compare and Reweight: Distinctive Image Captioning Using Similar Images Sets","date":"2020-07-14","arxiv_id":"2007.06877","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-compositional-neural","title":"Image Captioning with Compositional Neural Module Networks","date":"2020-07-10","arxiv_id":"2007.05608","repositories_listed":0,"syntology":null},{"url":null,"slug":"alleviating-the-burden-of-labeling-sentence","title":"Alleviating the Burden of Labeling: Sentence Generation by Attention Branch Encoder-Decoder Network","date":"2020-07-09","arxiv_id":"2007.04557","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-paraphrasing-via-deep","title":"Unsupervised Paraphrasing via Deep Reinforcement Learning","date":"2020-07-05","arxiv_id":"2007.02244","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-sensing-for-robotics-using-deep-learning","title":"AI Sensing for Robotics using Deep Learning based Visual and Language Modeling","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-coherence-modeling-for-caption","title":"Cross-modal Coherence Modeling for Caption Generation","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-difference-makes-sense-a-medical","title":"Feature Difference Makes Sense: A medical image captioning model exploiting feature difference and tag information","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-image-captioning-evaluation-by","title":"Improving Image Captioning Evaluation by Considering Inter References Variance","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-image-captioning-with-better-use-of","title":"Improving Image Captioning with Better Use of Caption","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-advertisements-with-bert","title":"Understanding Advertisements with BERT","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-relational-memory-network-for","title":"Recurrent Relational Memory Network for Unsupervised Image Captioning","date":"2020-06-24","arxiv_id":"2006.13611","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-self-critical-training-for","title":"Off-Policy Self-Critical Training for Transformer in Visual Paragraph Generation","date":"2020-06-21","arxiv_id":"2006.11714","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperparameter-analysis-for-image-captioning","title":"Hyperparameter Analysis for Image Captioning","date":"2020-06-19","arxiv_id":"2006.10923","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-image-summarization-textual-summary","title":"Multi-Image Summarization: Textual Summary from a Set of Cohesive Images","date":"2020-06-15","arxiv_id":"2006.08686","repositories_listed":0,"syntology":null},{"url":null,"slug":"ord-object-relationship-discovery-for-visual","title":"ORD: Object Relationship Discovery for Visual Dialogue Generation","date":"2020-06-15","arxiv_id":"2006.08322","repositories_listed":0,"syntology":null},{"url":null,"slug":"sd-rsic-summarization-driven-deep-remote","title":"SD-RSIC: Summarization Driven Deep Remote Sensing Image Captioning","date":"2020-06-15","arxiv_id":"2006.08432","repositories_listed":0,"syntology":null},{"url":null,"slug":"magnet-multi-region-attention-assisted","title":"MAGNet: Multi-Region Attention-Assisted Grounding of Natural Language Queries at Phrase Level","date":"2020-06-06","arxiv_id":"2006.03776","repositories_listed":0,"syntology":null},{"url":"/paper/a-dataset-and-benchmarks-for-multimedia","slug":"a-dataset-and-benchmarks-for-multimedia","title":"A Dataset and Benchmarks for Multimedia Social Analysis","date":"2020-06-05","arxiv_id":"2006.08335","repositories_listed":0,"syntology":null},{"url":null,"slug":"informativity-in-image-captions-vs-referring","title":"Informativity in Image Captions vs. Referring Expressions","date":"2020-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"time-text-and-image-mutual-translation","title":"TIME: Text and Image Mutual-Translation Adversarial Networks","date":"2020-05-27","arxiv_id":"2005.13192","repositories_listed":0,"syntology":null},{"url":null,"slug":"layer-wise-cross-view-decoding-for-sequence","title":"Rethinking and Improving Natural Language Generation with Layer-Wise Multi-View Decoding","date":"2020-05-16","arxiv_id":"2005.08081","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-image-captioning-with","title":"Non-Autoregressive Image Captioning with Counterfactuals-Critical Multi-Agent Learning","date":"2020-05-10","arxiv_id":"2005.04690","repositories_listed":0,"syntology":null},{"url":null,"slug":"clue-cross-modal-coherence-modeling-for","title":"Clue: Cross-modal Coherence Modeling for Caption Generation","date":"2020-05-02","arxiv_id":"2005.00908","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-visually-grounded-parallel-corpus-with","title":"A Visually-Grounded Parallel Corpus with Phrase-to-Region Linking","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-myanmar-image-captioning-using-cnn","title":"Automatic Myanmar Image Captioning using CNN and LSTM-Based Language Model","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-language-generation-using-pivot","title":"Cross-modal Language Generation using Pivot Stabilization for Web-scale Language Coverage","date":"2020-05-01","arxiv_id":"2005.00246","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-dependent-gaussian-prior-objective-for","title":"Data-dependent Gaussian Prior Objective for Language Generation","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-attention-based-aggregation-function","title":"A Novel Attention-based Aggregation Function to Combine Vision and Language","date":"2020-04-27","arxiv_id":"2004.13073","repositories_listed":0,"syntology":null}],"record_sha256":"94744420d6181c633c9820da54f9b45cd9824f7e0d4de2b75f05f8647b1ee7ea","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}