{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/caption-generation/papers/3","list_of":"/task/caption-generation","task":"Caption Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":4,"rows_per_page":100,"rows":[201,300],"of":310,"counts":{"archive_papers_tagged":310,"with_a_code_link":119,"where_syntology_ran_a_sample":33,"not_listed_spam_title":0,"listed":310,"listed_where_code_ran":33,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":29,"every_run_a_failure_of_syntologys_instrument":4,"listed_with_a_run_with_no_instrument_failure":29,"listed_every_run_a_failure_of_syntologys_instrument":4,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/caption-generation","prev":"/task/caption-generation/papers/2","next":"/task/caption-generation/papers/4","papers":[{"url":null,"slug":"word-to-sentence-visual-semantic-similarity","title":"Word to Sentence Visual Semantic Similarity for Caption Generation: Lessons Learned","date":"2022-09-26","arxiv_id":"2209.12817","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-images-and-text-with-semantic-role","title":"Aligning Images and Text with Semantic Role Labels for Fine-Grained Cross-Modal Understanding","date":"2022-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"examining-the-effects-of-language-and-vision","title":"Examining the Effects of Language-and-Vision Data Augmentation for Generation of Descriptions of Human Faces","date":"2022-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-image-corpus-towards-a","title":"Multilingual Image Corpus – Towards a Multimodal and Multilingual Dataset","date":"2022-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-audio-captioning-an-overview-of","title":"Automated Audio Captioning: An Overview of Recent Progress and New Challenges","date":"2022-05-12","arxiv_id":"2205.05949","repositories_listed":0,"syntology":null},{"url":null,"slug":"guiding-attention-using-partial-order","title":"Guiding Attention using Partial-Order Relationships for Image Captioning","date":"2022-04-15","arxiv_id":"2204.07476","repositories_listed":0,"syntology":null},{"url":null,"slug":"noc-rek-novel-object-captioning-with","title":"NOC-REK: Novel Object Captioning with Retrieved Vocabulary from External Knowledge","date":"2022-03-28","arxiv_id":"2203.14499","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-neural-framework-for-image-caption","title":"A Deep Neural Framework for Image Caption Generation Using GRU-Based Attention Mechanism","date":"2022-03-03","arxiv_id":"2203.01594","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-approaches-on-image-captioning","title":"Deep Learning Approaches on Image Captioning: A Review","date":"2022-01-31","arxiv_id":"2201.12944","repositories_listed":0,"syntology":null},{"url":null,"slug":"magic-multimodal-relational-graph-adversarial","title":"MAGIC: Multimodal relAtional Graph adversarIal inferenCe for Diverse and Unpaired Text-based Image Captioning","date":"2021-12-13","arxiv_id":"2112.06558","repositories_listed":0,"syntology":null},{"url":"/paper/d3net-a-speaker-listener-architecture-for","slug":"d3net-a-speaker-listener-architecture-for","title":"D3Net: A Unified Speaker-Listener Architecture for 3D Dense Captioning and Visual Grounding","date":"2021-12-02","arxiv_id":"2112.01551","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-caption-generation-framework-for","title":"Image Caption Generation Framework for Assamese News using Attention Mechanism","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-dependency-tree-for-video","title":"Multi-modal Dependency Tree for Video Captioning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"e-mmad-multimodal-advertising-caption","title":"E-MMAD: Multimodal Advertising Caption Generation Based on Structured Information","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-knowledge-aware-image-captioning","title":"Temporal Knowledge-Aware Image Captioning","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"geometry-entangled-visual-semantic","title":"Geometry-Entangled Visual Semantic Transformer for Image Captioning","date":"2021-09-29","arxiv_id":"2109.14137","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graph-generation-for-better-image","title":"Scene Graph Generation for Better Image Captioning?","date":"2021-09-23","arxiv_id":"2109.11398","repositories_listed":0,"syntology":null},{"url":null,"slug":"denoising-large-scale-image-captioning-from","title":"Denoising Large-Scale Image Captioning from Alt-text Data using Content Selection Models","date":"2021-09-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-driven-text-descriptions-for-images","title":"Goal-driven text descriptions for images","date":"2021-08-28","arxiv_id":"2108.12575","repositories_listed":0,"syntology":null},{"url":null,"slug":"detection-and-captioning-with-unseen-object","title":"Caption Generation on Scenes with Seen and Unseen Object Categories","date":"2021-08-13","arxiv_id":"2108.06165","repositories_listed":0,"syntology":null},{"url":null,"slug":"o2na-an-object-oriented-non-autoregressive","title":"O2NA: An Object-Oriented Non-Autoregressive Approach for Controllable Video Captioning","date":"2021-08-05","arxiv_id":"2108.02359","repositories_listed":0,"syntology":null},{"url":null,"slug":"nlphuts-participation-at-wat2021","title":"NLPHut’s Participation at WAT2021","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-thorough-review-on-recent-deep-learning","title":"A Thorough Review on Recent Deep Learning Methodologies for Image Captioning","date":"2021-07-28","arxiv_id":"2107.13114","repositories_listed":0,"syntology":null},{"url":"/paper/an-encoder-decoder-based-framework-for-hindi","slug":"an-encoder-decoder-based-framework-for-hindi","title":"An encoder-decoder based framework for hindi image caption generation","date":"2021-07-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"controlled-caption-generation-for-images","title":"Controlled Caption Generation for Images Through Adversarial Attacks","date":"2021-07-07","arxiv_id":"2107.03050","repositories_listed":0,"syntology":null},{"url":"/paper/the-dcase-2021-challenge-task-6-system","slug":"the-dcase-2021-challenge-task-6-system","title":"THE DCASE 2021 CHALLENGE TASK 6 SYSTEM: AUTOMATED AUDIO CAPTIONING WITH WEAKLY SUPERVISED PRE-TRAING AND WORD SELECTION METHODS","date":"2021-07-06","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"error-causal-inference-for-multi-fusion","title":"Error Causal inference for Multi-Fusion models","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-dense-video-captioning-via","title":"Weakly Supervised Dense Video Captioning via Jointly Usage of Knowledge Distillation and Cross-modal Matching","date":"2021-05-18","arxiv_id":"2105.08252","repositories_listed":0,"syntology":null},{"url":null,"slug":"empirical-analysis-of-image-caption","title":"Empirical Analysis of Image Caption Generation using Deep Learning","date":"2021-05-14","arxiv_id":"2105.09906","repositories_listed":0,"syntology":null},{"url":null,"slug":"3m-multi-style-image-caption-generation-using","title":"3M: Multi-style image caption generation using Multi-modality features under Multi-UPDOWN model","date":"2021-03-20","arxiv_id":"2103.11186","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-driven-description-synthesis-for","title":"Knowledge driven Description Synthesis for Floor Plan Interpretation","date":"2021-03-15","arxiv_id":"2103.08298","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-convolutional-decoder-for-image","title":"Analysis of Convolutional Decoder for Image Caption Generation","date":"2021-03-08","arxiv_id":"2103.04914","repositories_listed":0,"syntology":null},{"url":null,"slug":"relationship-based-neural-baby-talk","title":"Relationship-based Neural Baby Talk","date":"2021-03-08","arxiv_id":"2103.04846","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-captioning-in-compressed-video","title":"Video Captioning in Compressed Video","date":"2021-01-02","arxiv_id":"2101.00359","repositories_listed":0,"syntology":null},{"url":null,"slug":"cortico-cerebellar-networks-as-decoupled","title":"Cortico-cerebellar networks as decoupled neural interfaces","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"topic-scene-graph-generation-by-attention","title":"Topic Scene Graph Generation by Attention Distillation From Caption","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"image-to-bengali-caption-generation-using","title":"Image to Bengali Caption Generation Using Deep CNN and Bidirectional Gated Recurrent Unit","date":"2020-12-22","arxiv_id":"2012.12139","repositories_listed":0,"syntology":null},{"url":null,"slug":"geo-aware-image-caption-generation","title":"Geo-Aware Image Caption Generation","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"structural-and-functional-decomposition-for","title":"Structural and Functional Decomposition for Personality Image Captioning in a Communication Game","date":"2020-11-17","arxiv_id":"2011.08543","repositories_listed":0,"syntology":null},{"url":null,"slug":"seq2mol-automatic-design-of-de-novo-molecules","title":"Seq2Mol: Automatic design of de novo molecules conditioned by the target protein sequences through deep neural networks","date":"2020-10-29","arxiv_id":"2010.15900","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusion-models-for-improved-visual-captioning","title":"Fusion Models for Improved Visual Captioning","date":"2020-10-28","arxiv_id":"2010.15251","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-cross-lingual-image-captioning","title":"UNISON: Unpaired Cross-lingual Image Captioning","date":"2020-10-03","arxiv_id":"2010.01288","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-content-selection-for","title":"Denoising Large-Scale Image Captioning from Alt-text Data using Content Selection Models","date":"2020-09-10","arxiv_id":"2009.05175","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-coherence-modeling-for-caption","title":"Cross-modal Coherence Modeling for Caption Generation","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-image-captioning-with-better-use-of","title":"Improving Image Captioning with Better Use of Caption","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/the-ntt-dcase2020-challenge-task-6-system","slug":"the-ntt-dcase2020-challenge-task-6-system","title":"The NTT DCASE2020 Challenge Task 6 system: Automated Audio Captioning with Keywords and Sentence Length Estimation","date":"2020-07-01","arxiv_id":"2007.00225","repositories_listed":0,"syntology":null},{"url":null,"slug":"clue-cross-modal-coherence-modeling-for","title":"Clue: Cross-modal Coherence Modeling for Caption Generation","date":"2020-05-02","arxiv_id":"2005.00908","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-position-prediction-in-multimodal","title":"Image Position Prediction in Multimodal Documents","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"caption-generation-of-robot-behaviors-based","title":"Caption Generation of Robot Behaviors based on Unsupervised Learning of Action Segments","date":"2020-03-23","arxiv_id":"2003.10066","repositories_listed":0,"syntology":null},{"url":"/paper/video-caption-dataset-for-describing-human","slug":"video-caption-dataset-for-describing-human","title":"Video Caption Dataset for Describing Human Actions in Japanese","date":"2020-03-10","arxiv_id":"2003.04865","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-image-caption-generation-with-position","title":"Fast Image Caption Generation with Position Alignment","date":"2019-12-13","arxiv_id":"1912.06365","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-caption-images-with-two-stream","title":"Injecting Prior Knowledge into Image Caption Generation","date":"2019-11-22","arxiv_id":"1911.10082","repositories_listed":0,"syntology":null},{"url":null,"slug":"tpsgtr-neural-symbolic-tensor-product-scene","title":"TPsgtR: Neural-Symbolic Tensor Product Scene-Graph-Triplet Representation for Image Captioning","date":"2019-11-22","arxiv_id":"1911.10115","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-verifier-networks-verification-of-deep","title":"Deep Verifier Networks: Verification of Deep Discriminative Models with Deep Generative Models","date":"2019-11-18","arxiv_id":"1911.07421","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-intelligence-representation","title":"Multimodal Intelligence: Representation Learning, Information Fusion, and Applications","date":"2019-11-10","arxiv_id":"1911.03977","repositories_listed":0,"syntology":null},{"url":null,"slug":"wat2019-english-hindi-translation-on-hindi","title":"WAT2019: English-Hindi Translation on Hindi Visual Genome Dataset","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"youmakeup-a-large-scale-domain-specific","title":"YouMakeup: A Large-Scale Domain-Specific Multimodal Dataset for Fine-Grained Semantic Comprehension","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneous-segmentation-and-recognition","title":"Simultaneous Segmentation and Recognition: Towards more accurate Ego Gesture Recognition","date":"2019-09-18","arxiv_id":"1909.08606","repositories_listed":0,"syntology":null},{"url":null,"slug":"stack-vs-stacked-visual-semantic-attention","title":"Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation","date":"2019-09-05","arxiv_id":"1909.02489","repositories_listed":0,"syntology":null},{"url":null,"slug":"unpaired-cross-lingual-image-caption","title":"Unpaired Cross-lingual Image Caption Generation with Self-Supervised Rewards","date":"2019-08-15","arxiv_id":"1908.05407","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-using-facial-expression-and","title":"Image Captioning using Facial Expression and Attention","date":"2019-08-08","arxiv_id":"1908.02923","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-based-factored-attention-for-image","title":"Scene-based Factored Attention for Image Captioning","date":"2019-08-07","arxiv_id":"1908.02632","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-unseen-objects","title":"Image Captioning with Unseen Objects","date":"2019-07-31","arxiv_id":"1908.00047","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-bayesian-natural-language-processing","title":"Deep Bayesian Natural Language Processing","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-integrated-bottom-up","title":"Image Captioning with Integrated Bottom-Up and Multi-level Residual Top-Down Attention for Game Scene Understanding","date":"2019-06-16","arxiv_id":"1906.06632","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-recognition-system-for-recognizing","title":"End to End Recognition System for Recognizing Offline Unconstrained Vietnamese Handwriting","date":"2019-05-14","arxiv_id":"1905.05381","repositories_listed":0,"syntology":null},{"url":null,"slug":"3g-structure-for-image-caption-generation","title":"3G structure for image caption generation","date":"2019-04-21","arxiv_id":"1904.09544","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-end-to-end-baseline-for-video-captioning","title":"End-to-End Video Captioning","date":"2019-04-04","arxiv_id":"1904.02628","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-understanding-for-autonomous","title":"Scene Understanding for Autonomous Manipulation with Deep Learning","date":"2019-03-23","arxiv_id":"1903.09761","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatio-temporal-dynamics-and-semantic","title":"Spatio-Temporal Dynamics and Semantic Attribute Enriched Visual Encoding for Video Captioning","date":"2019-02-27","arxiv_id":"1902.10322","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-the-mumble-of-wireless-channel","title":"Predicting the Mumble of Wireless Channel with Sequence-to-Sequence Models","date":"2019-01-14","arxiv_id":"1901.04119","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-lstms-with-adaptive-attention","title":"Hierarchical LSTMs with Adaptive Attention for Visual Captioning","date":"2018-12-26","arxiv_id":"1812.11004","repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-fusion-effects-of-tensor-product","title":"Feature Fusion Effects of Tensor Product Representation on (De)Compositional Network for Caption Generation for Images","date":"2018-12-17","arxiv_id":"1812.06624","repositories_listed":0,"syntology":null},{"url":null,"slug":"bringing-back-simplicity-and-lightliness-into","title":"Bringing back simplicity and lightliness into neural image captioning","date":"2018-10-15","arxiv_id":"1810.06245","repositories_listed":0,"syntology":null},{"url":"/paper/chittron-an-automatic-bangla-image-captioning","slug":"chittron-an-automatic-bangla-image-captioning","title":"Chittron: An Automatic Bangla Image Captioning System","date":"2018-09-02","arxiv_id":"1809.00339","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-the-form-of-latent-states-in-image","title":"Rethinking the Form of Latent States in Image Captioning","date":"2018-07-26","arxiv_id":"1807.09958","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-is-not-where-the-challenge-of","title":"What is not where: the challenge of integrating spatial representations into deep learning architectures","date":"2018-07-21","arxiv_id":"1807.08133","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-production-dynamics-with-recurrent","title":"Language Production Dynamics with Recurrent Neural Networks","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ruccmu-system-report-for-dense-captioning","title":"RUC+CMU: System Report for Dense Captioning Events in Videos","date":"2018-06-22","arxiv_id":"1806.08854","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-image-captions-in-arabic-using","title":"Generating Image Captions in Arabic using Root-Word Based Recurrent Neural Networks and Deep Neural Networks","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-diverse-and-accurate-image-captioning","title":"Fast, Diverse and Accurate Image Captioning Guided By Part-of-Speech","date":"2018-05-31","arxiv_id":"1805.12589","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-caption-generation-for-news-images","title":"Neural Caption Generation for News Images","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"entity-aware-image-caption-generation","title":"Entity-aware Image Caption Generation","date":"2018-04-21","arxiv_id":"1804.07889","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-and-accurate-image-description-using","title":"Diverse and Accurate Image Description Using a Variational Auto-Encoder with an Additive Gaussian Encoding Space","date":"2017-11-19","arxiv_id":"1711.07068","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-automatic-video-captioning","title":"Evaluation of Automatic Video Captioning Using Direct Assessment","date":"2017-10-29","arxiv_id":"1710.10586","repositories_listed":0,"syntology":null},{"url":null,"slug":"describing-natural-images-containing-novel","title":"Describing Natural Images Containing Novel Objects with Knowledge Guided Assitance","date":"2017-10-17","arxiv_id":"1710.06303","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-captioning-with-guidance-of-multimodal","title":"Video Captioning with Guidance of Multimodal Latent Topics","date":"2017-08-31","arxiv_id":"1708.09667","repositories_listed":0,"syntology":null},{"url":null,"slug":"obj2text-generating-visually-descriptive","title":"OBJ2TEXT: Generating Visually Descriptive Language from Object Layouts","date":"2017-07-22","arxiv_id":"1707.07102","repositories_listed":0,"syntology":null},{"url":null,"slug":"skip-gram-zipf-uniform-vector-additivity","title":"Skip-Gram âˆ’ Zipf + Uniform = Vector Additivity","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/stylenet-generating-attractive-visual","slug":"stylenet-generating-attractive-visual","title":"StyleNet: Generating Attractive Visual Captions With Styles","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-lstm-with-adjusted-temporal","title":"Hierarchical LSTM with Adjusted Temporal Attention for Video Captioning","date":"2017-06-05","arxiv_id":"1706.01231","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-use-of-object-labels-and-spatial","title":"The Use of Object Labels and Spatial Prepositions as Keywords in a Web-Retrieval-Based Image Caption Generation System","date":"2017-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"i2t2i-learning-text-to-image-synthesis-with","title":"I2T2I: Learning Text to Image Synthesis with Textual Data Augmentation","date":"2017-03-20","arxiv_id":"1703.06676","repositories_listed":0,"syntology":null},{"url":null,"slug":"mat-a-multimodal-attentive-translator-for","title":"MAT: A Multimodal Attentive Translator for Image Captioning","date":"2017-02-18","arxiv_id":"1702.05658","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-hardwired-attention-an-lstm-framework","title":"Soft + Hardwired Attention: An LSTM Framework for Human Trajectory Prediction and Abnormal Event Detection","date":"2017-02-18","arxiv_id":"1702.05552","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-video-description-using-sequence","title":"Generating Video Description using Sequence-to-sequence Model with Temporal Attention","date":"2016-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-captions-without-looking-beyond","title":"Generating captions without looking beyond objects","date":"2016-10-12","arxiv_id":"1610.03708","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-lingual-image-caption-generation","title":"Cross-Lingual Image Caption Generation","date":"2016-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-for-neural-networks-by","title":"Domain Adaptation for Neural Networks by Parameter Augmentation","date":"2016-07-01","arxiv_id":"1607.00410","repositories_listed":0,"syntology":null},{"url":null,"slug":"review-networks-for-caption-generation","title":"Review Networks for Caption Generation","date":"2016-05-25","arxiv_id":"1605.07912","repositories_listed":0,"syntology":null}],"record_sha256":"c46ef2acbfec1937931b48337ccabc964c667330a486c931a2ecc4aa83519600","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}