{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-captioning/papers/16","list_of":"/task/image-captioning","task":"Image Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":16,"pages_in_order":19,"rows_per_page":100,"rows":[1501,1600],"of":1878,"counts":{"archive_papers_tagged":1878,"with_a_code_link":774,"where_syntology_ran_a_sample":243,"not_listed_spam_title":0,"listed":1878,"listed_where_code_ran":243,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":201,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":201,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-captioning","prev":"/task/image-captioning/papers/15","next":"/task/image-captioning/papers/17","papers":[{"url":null,"slug":"paracnn-visual-paragraph-generation-via","title":"ParaCNN: Visual Paragraph Generation via Adversarial Twin Contextual CNNs","date":"2020-04-21","arxiv_id":"2004.10258","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-in-depth-walkthrough-on-evolution-of","title":"An In-depth Walkthrough on Evolution of Neural Machine Translation","date":"2020-04-10","arxiv_id":"2004.04902","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-group-captioning-via-self","title":"Context-Aware Group Captioning via Self-Attention and Contrastive Features","date":"2020-04-07","arxiv_id":"2004.03708","repositories_listed":0,"syntology":null},{"url":null,"slug":"b-scst-bayesian-self-critical-sequence","title":"B-SCST: Bayesian Self-Critical Sequence Training for Image Captioning","date":"2020-04-06","arxiv_id":"2004.02435","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistent-multiple-sequence-decoding","title":"Consistent Multiple Sequence Decoding","date":"2020-04-02","arxiv_id":"2004.00760","repositories_listed":0,"syntology":null},{"url":"/paper/assessing-image-quality-issues-for-real-world","slug":"assessing-image-quality-issues-for-real-world","title":"Assessing Image Quality Issues for Real-World Problems","date":"2020-03-27","arxiv_id":"2003.12511","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-compact-reward-for-image-captioning-1","title":"Learning Compact Reward for Image Captioning","date":"2020-03-24","arxiv_id":"2003.10925","repositories_listed":0,"syntology":null},{"url":"/paper/textcaps-a-dataset-for-image-captioning-with","slug":"textcaps-a-dataset-for-image-captioning-with","title":"TextCaps: a Dataset for Image Captioning with Reading Comprehension","date":"2020-03-24","arxiv_id":"2003.12462","repositories_listed":0,"syntology":null},{"url":null,"slug":"normalized-and-geometry-aware-self-attention","title":"Normalized and Geometry-Aware Self-Attention Network for Image Captioning","date":"2020-03-19","arxiv_id":"2003.08897","repositories_listed":0,"syntology":null},{"url":null,"slug":"deconfounded-image-captioning-a-causal","title":"Deconfounded Image Captioning: A Causal Retrospect","date":"2020-03-09","arxiv_id":"2003.03923","repositories_listed":0,"syntology":null},{"url":null,"slug":"better-captioning-with-sequence-level","title":"Better Captioning with Sequence-Level Exploration","date":"2020-03-08","arxiv_id":"2003.03749","repositories_listed":0,"syntology":null},{"url":null,"slug":"captioning-images-with-novel-objects-via","title":"Captioning Images with Novel Objects via Online Vocabulary Expansion","date":"2020-03-06","arxiv_id":"2003.03305","repositories_listed":0,"syntology":null},{"url":"/paper/xgpt-cross-modal-generative-pre-training-for","slug":"xgpt-cross-modal-generative-pre-training-for","title":"XGPT: Cross-modal Generative Pre-Training for Image Captioning","date":"2020-03-03","arxiv_id":"2003.01473","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-image-captions-and-multitask-learning","title":"Using Image Captions and Multitask Learning for Recommending Query Reformulations","date":"2020-03-02","arxiv_id":"2003.00708","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-and-distilling-cross-modal","title":"Exploring and Distilling Cross-Modal Information for Image Captioning","date":"2020-02-28","arxiv_id":"2002.12585","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-to-language-understanding-captioning","title":"Image to Language Understanding: Captioning approach","date":"2020-02-21","arxiv_id":"2002.09536","repositories_listed":0,"syntology":null},{"url":"/paper/captioning-images-taken-by-people-who-are","slug":"captioning-images-taken-by-people-who-are","title":"Captioning Images Taken by People Who Are Blind","date":"2020-02-20","arxiv_id":"2002.08565","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-radiology-report-generation-meets","title":"When Radiology Report Generation Meets Knowledge Graph","date":"2020-02-19","arxiv_id":"2002.08277","repositories_listed":0,"syntology":null},{"url":null,"slug":"gaussian-smoothen-semantic-features-gssf","title":"Gaussian Smoothen Semantic Features (GSSF) -- Exploring the Linguistic Aspects of Visual Captioning in Indian Languages (Bengali) Using MSCOCO Framework","date":"2020-02-16","arxiv_id":"2002.06701","repositories_listed":0,"syntology":null},{"url":null,"slug":"mrrc-multiple-role-representation-crossover","title":"MRRC: Multiple Role Representation Crossover Interpretation for Image Captioning With R-CNN Feature Distribution Composition (FDC)","date":"2020-02-15","arxiv_id":"2002.06436","repositories_listed":0,"syntology":null},{"url":"/paper/dual-cnn-a-convolutional-language-decoder-for","slug":"dual-cnn-a-convolutional-language-decoder-for","title":"Dual-CNN: A Convolutional language decoder for paragraph image captioning","date":"2020-02-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-long-and-short-term-user-literal","title":"Learning Long- and Short-Term User Literal-Preference with Multimodal Hierarchical Transformer Network for Personalized Image Caption","date":"2020-02-04","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/hide-and-tell-learning-to-bridge-photo","slug":"hide-and-tell-learning-to-bridge-photo","title":"Hide-and-Tell: Learning to Bridge Photo Streams for Visual Storytelling","date":"2020-02-03","arxiv_id":"2002.00774","repositories_listed":0,"syntology":null},{"url":null,"slug":"icap-interative-image-captioning-with","title":"iCap: Interactive Image Captioning with Predictive Text","date":"2020-01-31","arxiv_id":"2001.11782","repositories_listed":0,"syntology":null},{"url":null,"slug":"aitpr-attribute-interaction-tensor-product","title":"aiTPR: Attribute Interaction-Tensor Product Representation for Image Caption","date":"2020-01-27","arxiv_id":"2001.09545","repositories_listed":0,"syntology":null},{"url":null,"slug":"show-recall-and-tell-image-captioning-with","title":"Show, Recall, and Tell: Image Captioning with Recall Mechanism","date":"2020-01-15","arxiv_id":"2001.05876","repositories_listed":0,"syntology":null},{"url":null,"slug":"discoverability-in-satellite-imagery-a-good","title":"Discoverability in Satellite Imagery: A Good Sentence is Worth a Thousand Pictures","date":"2020-01-03","arxiv_id":"2001.05839","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-important-are-network-weights-to-what","title":"HOW IMPORTANT ARE NETWORK WEIGHTS? TO WHAT EXTENT DO THEY NEED AN UPDATE?","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"going-beneath-the-surface-evaluating-image","title":"Going Beneath the Surface: Evaluating Image Captioning for Grammaticality, Truthfulness and Diversity","date":"2019-12-19","arxiv_id":"1912.08960","repositories_listed":0,"syntology":null},{"url":null,"slug":"sampling-good-latent-variables-via-cpp-vaes","title":"Contextually Plausible and Diverse 3D Human Motion Prediction","date":"2019-12-18","arxiv_id":"1912.08521","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-image-caption-generation-with-position","title":"Fast Image Caption Generation with Position Alignment","date":"2019-12-13","arxiv_id":"1912.06365","repositories_listed":0,"syntology":null},{"url":null,"slug":"better-understanding-hierarchical-visual","title":"Better Understanding Hierarchical Visual Relationship for Image Caption","date":"2019-12-04","arxiv_id":"1912.01881","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-bayesian-active-learning-for-multiple","title":"Deep Bayesian Active Learning for Multiple Correct Outputs","date":"2019-12-02","arxiv_id":"1912.01119","repositories_listed":0,"syntology":null},{"url":null,"slug":"exposing-and-correcting-the-gender-bias-in","title":"Exposing and Correcting the Gender Bias in Image Captioning Datasets and Models","date":"2019-12-02","arxiv_id":"1912.00578","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpreting-context-of-images-using-scene","title":"Interpreting Context of Images using Scene Graphs","date":"2019-12-01","arxiv_id":"1912.00501","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-relate-from-captions-and-bounding-1","title":"Learning to Relate from Captions and Bounding Boxes","date":"2019-12-01","arxiv_id":"1912.00311","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-structured-semantic-inference-for","title":"Variational Structured Semantic Inference for Diverse Image Captioning","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optibox-breaking-the-limits-of-proposals-for","title":"OptiBox: Breaking the Limits of Proposals for Visual Grounding","date":"2019-11-29","arxiv_id":"1912.00076","repositories_listed":0,"syntology":null},{"url":"/paper/multimodal-machine-translation-through","slug":"multimodal-machine-translation-through","title":"Multimodal Machine Translation through Visuals and Speech","date":"2019-11-28","arxiv_id":"1911.12798","repositories_listed":0,"syntology":null},{"url":null,"slug":"event-recognition-with-automatic-album","title":"Event Recognition with Automatic Album Detection based on Sequential Processing, Neural Attention and Image Captioning","date":"2019-11-25","arxiv_id":"1911.11010","repositories_listed":0,"syntology":null},{"url":null,"slug":"crur-coupled-recurrent-unit-for-unification","title":"CRUR: Coupled-Recurrent Unit for Unification, Conceptualization and Context Capture for Language Representation -- A Generalization of Bi Directional LSTM","date":"2019-11-22","arxiv_id":"1911.10132","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-caption-images-with-two-stream","title":"Injecting Prior Knowledge into Image Caption Generation","date":"2019-11-22","arxiv_id":"1911.10082","repositories_listed":0,"syntology":null},{"url":null,"slug":"tpsgtr-neural-symbolic-tensor-product-scene","title":"TPsgtR: Neural-Symbolic Tensor Product Scene-Graph-Triplet Representation for Image Captioning","date":"2019-11-22","arxiv_id":"1911.10115","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcing-an-image-caption-generator-using","title":"Reinforcing an Image Caption Generator Using Off-Line Human Feedback","date":"2019-11-21","arxiv_id":"1911.09753","repositories_listed":0,"syntology":null},{"url":"/paper/keep-it-consistent-topic-aware-storytelling","slug":"keep-it-consistent-topic-aware-storytelling","title":"Keep it Consistent: Topic-Aware Storytelling from an Image Stream via Iterative Multi-agent Communication","date":"2019-11-11","arxiv_id":"1911.04192","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-neural-image-captioning-be-controlled-via","title":"Can Neural Image Captioning be Controlled via Forced Attention?","date":"2019-11-10","arxiv_id":"1911.03936","repositories_listed":0,"syntology":null},{"url":null,"slug":"english-to-hindi-multi-modal-neural-machine","title":"English to Hindi Multi-modal Neural Machine Translation and Hindi Image Captioning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-role-of-scene-graphs-in-image","title":"On the Role of Scene Graphs in Image Captioning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-adaptive-scaling-for-learnable-residual","title":"Self-Adaptive Scaling for Learnable Residual Structure","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hidden-state-guidance-improving-image","title":"Hidden State Guidance: Improving Image Captioning using An Image Conditioned Autoencoder","date":"2019-10-31","arxiv_id":"1910.14208","repositories_listed":0,"syntology":null},{"url":null,"slug":"atzsl-defensive-zero-shot-recognition-in-the","title":"ATZSL: Defensive Zero-Shot Recognition in the Presence of Adversaries","date":"2019-10-24","arxiv_id":"1910.10994","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-prototype-learning-for-zero-shot","title":"Hierarchical Prototype Learning for Zero-Shot Recognition","date":"2019-10-24","arxiv_id":"1910.11671","repositories_listed":0,"syntology":null},{"url":null,"slug":"convolutional-prototype-learning-for-zero","title":"Convolutional Prototype Learning for Zero-Shot Recognition","date":"2019-10-22","arxiv_id":"1910.09728","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-overall-contextual-information-for","title":"Exploring Overall Contextual Information for Image Captioning in Human-Like Cognitive Style","date":"2019-10-15","arxiv_id":"1910.06475","repositories_listed":0,"syntology":null},{"url":null,"slug":"tell-the-difference-fine-grained-visual","title":"Tell-the-difference: Fine-grained Visual Descriptor via a Discriminating Referee","date":"2019-10-14","arxiv_id":"1910.06426","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-aware-image-deblurring","title":"Semantic-aware Image Deblurring","date":"2019-10-09","arxiv_id":"1910.03853","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-image-synthesis-based-on-machine","title":"Text-to-Image Synthesis Based on Machine Generated Captions","date":"2019-10-09","arxiv_id":"1910.04056","repositories_listed":0,"syntology":null},{"url":null,"slug":"entangled-transformer-for-image-captioning","title":"Entangled Transformer for Image Captioning","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-diverse-and-descriptive-image","title":"Generating Diverse and Descriptive Image Captions Using Visual Paraphrases","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-optimization-for-cooperative-image","title":"Joint Optimization for Cooperative Image Captioning","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sketch-me-if-you-can-towards-generating","title":"Sketch Me if You Can: Towards Generating Detailed Descriptions of Object Shape by Grounding in Images and Drawings","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-transformer-concentrated-attention","title":"Sparse Transformer: Concentrated Attention Through Explicit Selection","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"190909953","title":"Learning Visual Relation Priors for Image-Text Matching and Image Captioning with Neural Scene Graph Generators","date":"2019-09-22","arxiv_id":"1909.09953","repositories_listed":0,"syntology":null},{"url":null,"slug":"highlighting-bias-with-explainable-neural","title":"Towards Explainable Neural-Symbolic Visual Reasoning","date":"2019-09-19","arxiv_id":"1909.09065","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-representation-learning-from","title":"Large-scale representation learning from visually grounded untranscribed speech","date":"2019-09-19","arxiv_id":"1909.08782","repositories_listed":0,"syntology":null},{"url":null,"slug":"sanvis-visual-analytics-for-understanding","title":"SANVis: Visual Analytics for Understanding Self-Attention Networks","date":"2019-09-13","arxiv_id":"1909.09595","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchy-parsing-for-image-captioning","title":"Hierarchy Parsing for Image Captioning","date":"2019-09-09","arxiv_id":"1909.03918","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-reward-learning-for-policy-gradient","title":"Transfer Reward Learning for Policy Gradient-Based Text Generation","date":"2019-09-09","arxiv_id":"1909.03622","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-very-scarce-supervised","title":"Image Captioning with Very Scarce Supervised Data: Adversarial Semi-Supervised Learning Approach","date":"2019-09-05","arxiv_id":"1909.02201","repositories_listed":0,"syntology":null},{"url":"/paper/decoupled-box-proposal-and-featurization-with","slug":"decoupled-box-proposal-and-featurization-with","title":"Decoupled Box Proposal and Featurization with Ultrafine-Grained Semantic Labels Improve Image Captioning and Visual Question Answering","date":"2019-09-04","arxiv_id":"1909.02097","repositories_listed":0,"syntology":null},{"url":"/paper/reflective-decoding-network-for-image","slug":"reflective-decoding-network-for-image","title":"Reflective Decoding Network for Image Captioning","date":"2019-08-30","arxiv_id":"1908.11824","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-representation-learning-for-text","title":"Adversarial Representation Learning for Text-to-Image Matching","date":"2019-08-28","arxiv_id":"1908.10534","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-unsupervised-image-captioning-with","title":"Towards Unsupervised Image Captioning with Shared Multimodal Embeddings","date":"2019-08-25","arxiv_id":"1908.09317","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-latent-spaces-for-modeling-the","title":"Sequential Latent Spaces for Modeling the Intention During Diverse Image Captioning","date":"2019-08-22","arxiv_id":"1908.08529","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-features-matter-effective-language","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","date":"2019-08-17","arxiv_id":"1908.06327","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-sentence-similarity-in-natural","title":"Leveraging Sentence Similarity in Natural Language Generation: Improving Beam Search using Range Voting","date":"2019-08-17","arxiv_id":"1908.06288","repositories_listed":0,"syntology":null},{"url":null,"slug":"unpaired-cross-lingual-image-caption","title":"Unpaired Cross-lingual Image Caption Generation with Self-Supervised Rewards","date":"2019-08-15","arxiv_id":"1908.05407","repositories_listed":0,"syntology":null},{"url":null,"slug":"hornet-a-hierarchical-offshoot-recurrent","title":"HorNet: A Hierarchical Offshoot Recurrent Network for Improving Person Re-ID via Image Captioning","date":"2019-08-14","arxiv_id":"1908.04915","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-using-facial-expression-and","title":"Image Captioning using Facial Expression and Attention","date":"2019-08-08","arxiv_id":"1908.02923","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-generating-stylized-image-captions","title":"Towards Generating Stylized Image Captions via Adversarial Training","date":"2019-08-08","arxiv_id":"1908.02943","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-based-factored-attention-for-image","title":"Scene-based Factored Attention for Image Captioning","date":"2019-08-07","arxiv_id":"1908.02632","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-unseen-objects","title":"Image Captioning with Unseen Objects","date":"2019-07-31","arxiv_id":"1908.00047","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-image-captioning","title":"Cooperative image captioning","date":"2019-07-26","arxiv_id":"1907.11565","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-radiology-report-generation-based","title":"Automatic Radiology Report Generation based on Multi-view Image Fusion and Medical Concept Enrichment","date":"2019-07-22","arxiv_id":"1907.09085","repositories_listed":0,"syntology":null},{"url":null,"slug":"m3d-gan-multi-modal-multi-domain-translation","title":"M3D-GAN: Multi-Modal Multi-Domain Translation with Universal Attention","date":"2019-07-09","arxiv_id":"1907.04378","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-image-captioning","title":"Neural Image Captioning","date":"2019-07-02","arxiv_id":"1907.02065","repositories_listed":0,"syntology":null},{"url":null,"slug":"categorizing-and-inferring-the-relationship","title":"Categorizing and Inferring the Relationship between the Text and Image of Twitter Posts","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-decoder-structure-based-on","title":"A Deep Decoder Structure Based on WordEmbedding Regression for An Encoder-Decoder Based Model for Image Captioning","date":"2019-06-26","arxiv_id":"1906.12188","repositories_listed":0,"syntology":null},{"url":null,"slug":"informative-image-captioning-with-external","title":"Informative Image Captioning with External Sources of Information","date":"2019-06-20","arxiv_id":"1906.08876","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-categorizing-and-predicting","title":"Understanding, Categorizing and Predicting Semantic Image-Text Relations","date":"2019-06-20","arxiv_id":"1906.08595","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-integrated-bottom-up","title":"Image Captioning with Integrated Bottom-Up and Multi-level Residual Top-Down Attention for Game Scene Understanding","date":"2019-06-16","arxiv_id":"1906.06632","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-diverse-and-informative-natural","title":"Generating Diverse and Informative Natural Language Fashion Feedback","date":"2019-06-15","arxiv_id":"1906.06619","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-visual-question-answering-by","title":"Improving Visual Question Answering by Referring to Generated Paragraph Captions","date":"2019-06-14","arxiv_id":"1906.06216","repositories_listed":0,"syntology":null},{"url":null,"slug":"vispi-automatic-visual-perception-and","title":"Vispi: Automatic Visual Perception and Interpretation of Chest X-rays","date":"2019-06-12","arxiv_id":"1906.05190","repositories_listed":0,"syntology":null},{"url":null,"slug":"figure-captioning-with-reasoning-and-sequence","title":"Figure Captioning with Reasoning and Sequence-Level Training","date":"2019-06-07","arxiv_id":"1906.02850","repositories_listed":0,"syntology":null},{"url":null,"slug":"relational-reasoning-using-prior-knowledge","title":"Relational Reasoning using Prior Knowledge for Visual Captioning","date":"2019-06-04","arxiv_id":"1906.01290","repositories_listed":0,"syntology":null},{"url":"/paper/190600513","slug":"190600513","title":"Generating Question Relevant Captions to Aid Visual Question Answering","date":"2019-06-03","arxiv_id":"1906.00513","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600579","title":"Listening while Speaking and Visualizing: Improving ASR through Multimodal Chain","date":"2019-06-03","arxiv_id":"1906.00579","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600717","title":"Masked Non-Autoregressive Image Captioning","date":"2019-06-03","arxiv_id":"1906.00717","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-semantic-alignment-for-improved","title":"Adversarial Semantic Alignment for Improved Image Captions","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"c9a21c25a3e358a5992d274d2dbfd216517ad4cb2edc8bab078fd10c279a91d4","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}