{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-captioning/papers/18","list_of":"/task/image-captioning","task":"Image Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":18,"pages_in_order":19,"rows_per_page":100,"rows":[1701,1800],"of":1878,"counts":{"archive_papers_tagged":1878,"with_a_code_link":774,"where_syntology_ran_a_sample":243,"not_listed_spam_title":0,"listed":1878,"listed_where_code_ran":243,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":201,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":201,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-captioning","prev":"/task/image-captioning/papers/17","next":"/task/image-captioning/papers/19","papers":[{"url":null,"slug":"generative-bridging-network-for-neural","title":"Generative Bridging Network for Neural Sequence Prediction","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"groupcap-group-based-image-captioning-with","title":"GroupCap: Group-Based Image Captioning With Structured Relevance and Diversity Constraints","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-video-captioning-via-trajectory","title":"Interpretable Video Captioning via Trajectory Structured Localization","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-word-embeddings-for-low-resource","title":"Learning Word Embeddings for Low-Resource Languages by PU Learning","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-latent-attention-for-multimodal","title":"Stacked Latent Attention for Multimodal Reasoning","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"telling-stories-with-soundtracks-an-empirical","title":"Telling Stories with Soundtracks: An Empirical Analysis of Music in Film","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"visually-guided-spatial-relation-extraction","title":"Visually Guided Spatial Relation Extraction from Text","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-diverse-and-accurate-image-captioning","title":"Fast, Diverse and Accurate Image Captioning Guided By Part-of-Speech","date":"2018-05-31","arxiv_id":"1805.12589","repositories_listed":0,"syntology":null},{"url":null,"slug":"grow-and-prune-compact-fast-and-accurate","title":"Grow and Prune Compact, Fast, and Accurate LSTMs","date":"2018-05-30","arxiv_id":"1805.11797","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-joking-machine-humorous-image","title":"Neural Joking Machine : Humorous image captioning","date":"2018-05-30","arxiv_id":"1805.11850","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-image-captioning-and-question-answering","title":"Joint Image Captioning and Question Answering","date":"2018-05-22","arxiv_id":"1805.08389","repositories_listed":0,"syntology":null},{"url":null,"slug":"turbo-learning-for-captionbot-and-drawingbot","title":"Turbo Learning for Captionbot and Drawingbot","date":"2018-05-21","arxiv_id":"1805.08170","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-vision-grounded-dataset-for-predicting","title":"A vision-grounded dataset for predicting typical locations for verbs","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"annotating-modality-expressions-and-event","title":"Annotating Modality Expressions and Event Factuality for a Japanese Chess Commentary Corpus","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-image-question-answering-dataset","title":"Augmenting Image Question Answering Dataset by Exploiting Image Captions","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"edit-me-a-corpus-and-a-framework-for","title":"Edit me: A Corpus and a Framework for Understanding Natural Language Image Editing","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-semantic-attention-in-video","title":"Incorporating Semantic Attention in Video Description Generation","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-caption-generation-for-news-images","title":"Neural Caption Generation for News Images","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-image-captioning-with-adversarial","title":"Adversarial Semantic Alignment for Improved Image Captions","date":"2018-04-30","arxiv_id":"1805.00063","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-counts-bringing-explicit-detections","title":"Object Counts! Bringing Explicit Detections Back into Image Captioning","date":"2018-04-23","arxiv_id":"1805.00314","repositories_listed":0,"syntology":null},{"url":null,"slug":"entity-aware-image-caption-generation","title":"Entity-aware Image Caption Generation","date":"2018-04-21","arxiv_id":"1804.07889","repositories_listed":0,"syntology":null},{"url":null,"slug":"pragmatically-informative-image-captioning","title":"Pragmatically Informative Image Captioning with Character-Level Inference","date":"2018-04-15","arxiv_id":"1804.05417","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovery-and-usage-of-joint-attention-in","title":"Discovery and usage of joint attention in images","date":"2018-04-10","arxiv_id":"1804.04604","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-language-statistical-features-of-lstm","title":"Natural Language Statistical Features of LSTM-generated Texts","date":"2018-04-10","arxiv_id":"1804.04087","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-guide-decoding-for-image","title":"Learning to Guide Decoding for Image Captioning","date":"2018-04-03","arxiv_id":"1804.00887","repositories_listed":0,"syntology":null},{"url":null,"slug":"guide-me-interacting-with-deep-networks","title":"Guide Me: Interacting with Deep Networks","date":"2018-03-30","arxiv_id":"1803.11544","repositories_listed":0,"syntology":null},{"url":"/paper/two-can-play-this-game-visual-dialog-with","slug":"two-can-play-this-game-visual-dialog-with","title":"Two can play this Game: Visual Dialog with Discriminative Question Generation and Answering","date":"2018-03-29","arxiv_id":"1803.11186","repositories_listed":0,"syntology":null},{"url":null,"slug":"show-tell-and-discriminate-image-captioning","title":"Show, Tell and Discriminate: Image Captioning by Self-retrieval with Partially Labeled Data","date":"2018-03-22","arxiv_id":"1803.08314","repositories_listed":0,"syntology":null},{"url":null,"slug":"unpaired-image-captioning-by-language","title":"Unpaired Image Captioning by Language Pivoting","date":"2018-03-14","arxiv_id":"1803.05526","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoupled-spatial-neural-attention-for-weakly","title":"Decoupled Spatial Neural Attention for Weakly Supervised Semantic Segmentation","date":"2018-03-07","arxiv_id":"1803.02563","repositories_listed":0,"syntology":null},{"url":"/paper/a-dataset-and-reranking-method-for-multimodal","slug":"a-dataset-and-reranking-method-for-multimodal","title":"A Dataset and Reranking Method for Multimodal MT of User-Generated Image Captions","date":"2018-03-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-monkey-the-current-state-and-beyond","title":"Neural Monkey: The Current State and Beyond","date":"2018-03-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"attentive-tensor-product-learning","title":"Attentive Tensor Product Learning","date":"2018-02-20","arxiv_id":"1802.07089","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-resource-neural-machine-translation-with","title":"Zero-Resource Neural Machine Translation with Multi-Agent Communication Game","date":"2018-02-09","arxiv_id":"1802.03116","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-triples-with-adversarial-networks","title":"Generating Triples with Adversarial Networks for Scene Graph Construction","date":"2018-02-07","arxiv_id":"1802.02598","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-image-captioning-for-marketing","title":"Multimodal Image Captioning for Marketing Analysis","date":"2018-02-06","arxiv_id":"1802.01958","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-action-adverb-recognition-adha-dataset","title":"Human Action Adverb Recognition: ADHA Dataset and A Three-Stream Hybrid Model","date":"2018-02-04","arxiv_id":"1802.01144","repositories_listed":0,"syntology":null},{"url":null,"slug":"netizen-style-commenting-on-fashion-photos","title":"Netizen-Style Commenting on Fashion Photos: Dataset and Diversity Measures","date":"2018-01-31","arxiv_id":"1801.10300","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-at-will-a-versatile-scheme","title":"Image Captioning at Will: A Versatile Scheme for Effectively Injecting Sentiments into Image Descriptions","date":"2018-01-30","arxiv_id":"1801.10121","repositories_listed":0,"syntology":null},{"url":null,"slug":"tell-and-answer-towards-explainable-visual","title":"Tell-and-Answer: Towards Explainable Visual Question Answering using Attributes and Captions","date":"2018-01-27","arxiv_id":"1801.09041","repositories_listed":0,"syntology":null},{"url":null,"slug":"describing-semantic-representations-of-brain","title":"Describing Semantic Representations of Brain Activity Evoked by Visual Stimuli","date":"2018-01-19","arxiv_id":"1802.02210","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepseek-content-based-image-search-retrieval","title":"DeepSeek: Content Based Image Search & Retrieval","date":"2018-01-11","arxiv_id":"1801.03406","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-fpga-based-lstms-under","title":"Approximate FPGA-based LSTMs under Computation Time Constraints","date":"2018-01-07","arxiv_id":"1801.02190","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-multi-domain-multi-task-learning","title":"Large Scale Multi-Domain Multi-Task Learning with MultiModel","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-bayes-by-backprop","title":"Revisiting Bayes by Backprop","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-compact-recurrent-neural-networks-1","title":"Learning Compact Recurrent Neural Networks with Block-Term Tensor Decomposition","date":"2017-12-14","arxiv_id":"1712.05134","repositories_listed":0,"syntology":null},{"url":"/paper/deliberation-networks-sequence-generation","slug":"deliberation-networks-sequence-generation","title":"Deliberation Networks: Sequence Generation Beyond One-Pass Decoding","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"teaching-machines-to-describe-images-with","title":"Teaching Machines to Describe Images with Natural Language Feedback","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"advise-symbolism-and-external-knowledge-for","title":"ADVISE: Symbolism and External Knowledge for Decoding Advertisements","date":"2017-11-17","arxiv_id":"1711.06666","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-matching-autoencoders","title":"Deep Matching Autoencoders","date":"2017-11-16","arxiv_id":"1711.06047","repositories_listed":0,"syntology":null},{"url":null,"slug":"phrase-based-image-captioning-with","title":"Phrase-based Image Captioning with Hierarchical LSTM Model","date":"2017-11-11","arxiv_id":"1711.05557","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-and-classification-of","title":"Image Captioning and Classification of Dangerous Situations","date":"2017-11-07","arxiv_id":"1711.02578","repositories_listed":0,"syntology":null},{"url":null,"slug":"attentive-language-models","title":"Attentive Language Models","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-recurrent-and-convolutional","title":"Comparing Recurrent and Convolutional Architectures for English-Hindi Neural Machine Translation","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inference-is-everything-recasting-semantic","title":"Inference is Everything: Recasting Semantic Resources into a Unified Evaluation Framework","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-vision-and-language-datasets-to","title":"Integrating Vision and Language Datasets to Measure Word Concreteness","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lexical-simplification-with-the-deep","title":"Lexical Simplification with the Deep Structured Similarity Model","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-machine-translation-basics-practical","title":"Neural Machine Translation: Basics, Practical Aspects and Recent Trends","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-neural-symbolic-approach-to-design-of","title":"A Neural-Symbolic Approach to Design of CAPTCHA","date":"2017-10-29","arxiv_id":"1710.11475","repositories_listed":0,"syntology":null},{"url":null,"slug":"geoseq2seq-information-geometric-sequence-to","title":"GeoSeq2Seq: Information Geometric Sequence-to-Sequence Networks","date":"2017-10-25","arxiv_id":"1710.09363","repositories_listed":0,"syntology":null},{"url":null,"slug":"osu-multimodal-machine-translation-system","title":"OSU Multimodal Machine Translation System Report","date":"2017-10-07","arxiv_id":"1710.02718","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-learning-for-image-captioning","title":"Contrastive Learning for Image Captioning","date":"2017-10-06","arxiv_id":"1710.02534","repositories_listed":0,"syntology":null},{"url":null,"slug":"aesthetic-critiques-generation-for-photos","title":"Aesthetic Critiques Generation for Photos","date":"2017-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-guiding-multimodal-lstm-when-we-do-not","title":"Self-Guiding Multimodal LSTM - when we do not have a perfect training dataset for image captioning","date":"2017-09-15","arxiv_id":"1709.05038","repositories_listed":0,"syntology":null},{"url":null,"slug":"cuni-system-for-the-wmt17-multimodal","title":"CUNI System for the WMT17 Multimodal Translation Task","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-image-descriptions-using","title":"Generating Image Descriptions using Multilingual Data","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sheffield-multimt-using-object-posterior","title":"Sheffield MultiMT: Using Object Posterior Predictions for Multimodal Machine Translation","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-language-understanding-with","title":"Spatial Language Understanding with Multimodal Graphs using Declarative Learning based Programming","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-afrl-osu-wmt17-multimodal-translation","title":"The AFRL-OSU WMT17 Multimodal Translation System: An Image Processing Approach","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-video-descriptions-with-topic","title":"Generating Video Descriptions with Topic Guidance","date":"2017-08-31","arxiv_id":"1708.09666","repositories_listed":0,"syntology":null},{"url":null,"slug":"cold-fusion-training-seq2seq-models-together","title":"Cold Fusion: Training Seq2Seq Models Together with Language Models","date":"2017-08-21","arxiv_id":"1708.06426","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-copying-mechanism-in-image","title":"Incorporating Copying Mechanism in Image Captioning for Learning Novel Objects","date":"2017-08-17","arxiv_id":"1708.05271","repositories_listed":0,"syntology":null},{"url":"/paper/learning-to-disambiguate-by-asking","slug":"learning-to-disambiguate-by-asking","title":"Learning to Disambiguate by Asking Discriminative Questions","date":"2017-08-09","arxiv_id":"1708.02760","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitre-at-semeval-2017-task-1-simple-semantic","title":"MITRE at SemEval-2017 Task 1: Simple Semantic Similarity","date":"2017-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-interactive-region-segmentation-and","title":"Deep Interactive Region Segmentation and Captioning","date":"2017-07-26","arxiv_id":"1707.08364","repositories_listed":0,"syntology":null},{"url":null,"slug":"obj2text-generating-visually-descriptive","title":"OBJ2TEXT: Generating Visually Descriptive Language from Object Layouts","date":"2017-07-22","arxiv_id":"1707.07102","repositories_listed":0,"syntology":null},{"url":null,"slug":"order-free-rnn-with-visual-attention-for","title":"Order-Free RNN with Visual Attention for Multi-Label Classification","date":"2017-07-18","arxiv_id":"1707.05495","repositories_listed":0,"syntology":null},{"url":null,"slug":"cuni-system-for-the-wmt17-multimodal-1","title":"CUNI System for the WMT17 Multimodal Translation Task","date":"2017-07-14","arxiv_id":"1707.04550","repositories_listed":0,"syntology":null},{"url":null,"slug":"where-to-play-retrieval-of-video-segments","title":"Where to Play: Retrieval of Video Segments using Natural-Language Queries","date":"2017-07-02","arxiv_id":"1707.00251","repositories_listed":0,"syntology":null},{"url":"/paper/abstractive-document-summarization-with-a","slug":"abstractive-document-summarization-with-a","title":"Abstractive Document Summarization with a Graph-Based Attentional Neural Model","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-strategies-for-multi-source-1","title":"Attention Strategies for Multi-Source Sequence-to-Sequence Learning","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-object-interactions-and-descriptions","title":"Learning Object Interactions and Descriptions for Semantic Image Segmentation","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-machine-learning-integrating","title":"Multimodal Machine Learning: Integrating Language, Vision and Speech","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-scene-de-rendering","title":"Neural Scene De-Rendering","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-audio-captioning-with-recurrent","title":"Automated Audio Captioning with Recurrent Neural Networks","date":"2017-06-30","arxiv_id":"1706.10006","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-critic-sequence-training-for-image","title":"Actor-Critic Sequence Training for Image Captioning","date":"2017-06-29","arxiv_id":"1706.09601","repositories_listed":0,"syntology":null},{"url":"/paper/paying-more-attention-to-saliency-image","slug":"paying-more-attention-to-saliency-image","title":"Paying More Attention to Saliency: Image Captioning with Saliency and Context Attention","date":"2017-06-26","arxiv_id":"1706.08474","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-object-detection-and","title":"Image Captioning with Object Detection and Localization","date":"2017-06-08","arxiv_id":"1706.02430","repositories_listed":0,"syntology":null},{"url":null,"slug":"teaching-machines-to-describe-images-via","title":"Teaching Machines to Describe Images via Natural Language Feedback","date":"2017-06-01","arxiv_id":"1706.00130","repositories_listed":0,"syntology":null},{"url":null,"slug":"bidirectional-beam-search-forward-backward","title":"Bidirectional Beam Search: Forward-Backward Inference in Neural Sequence Models for Fill-in-the-Blank Image Captioning","date":"2017-05-24","arxiv_id":"1705.08759","repositories_listed":0,"syntology":null},{"url":null,"slug":"softmax-q-distribution-estimation-for","title":"Softmax Q-Distribution Estimation for Structured Prediction: A Theoretical Interpretation for RAML","date":"2017-05-19","arxiv_id":"1705.07136","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-hard-alignments-with-variational","title":"Learning Hard Alignments with Variational Inference","date":"2017-05-16","arxiv_id":"1705.05524","repositories_listed":0,"syntology":null},{"url":null,"slug":"cham-action-recognition-using-convolutional","title":"CHAM: action recognition using convolutional hierarchical attention model","date":"2017-05-09","arxiv_id":"1705.03146","repositories_listed":0,"syntology":null},{"url":null,"slug":"skeleton-key-image-captioning-by-skeleton","title":"Skeleton Key: Image Captioning by Skeleton-Attribute Decomposition","date":"2017-04-23","arxiv_id":"1704.06972","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-image","title":"Deep Reinforcement Learning-based Image Captioning with Embedding Reward","date":"2017-04-12","arxiv_id":"1704.03899","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-multilinguality-with-language","title":"Continuous multilinguality with language vectors","date":"2017-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-breakingnews-dataset","title":"The BreakingNews Dataset","date":"2017-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"i2t2i-learning-text-to-image-synthesis-with","title":"I2T2I: Learning Text to Image Synthesis with Textual Data Augmentation","date":"2017-03-20","arxiv_id":"1703.06676","repositories_listed":0,"syntology":null},{"url":"/paper/recurrent-models-for-situation-recognition","slug":"recurrent-models-for-situation-recognition","title":"Recurrent Models for Situation Recognition","date":"2017-03-18","arxiv_id":"1703.06233","repositories_listed":0,"syntology":null},{"url":null,"slug":"miml-fcn-multi-instance-multi-label-learning","title":"MIML-FCN+: Multi-instance Multi-label Learning via Fully Convolutional Networks with Privileged Information","date":"2017-02-28","arxiv_id":"1702.08681","repositories_listed":0,"syntology":null}],"record_sha256":"0f4a4a665ee1c022ae4e50a79d109b8859d22d671248d613c9ba3fa711178b8b","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}