{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/video-captioning/papers/4","list_of":"/task/video-captioning","task":"Video Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":5,"rows_per_page":100,"rows":[301,400],"of":473,"counts":{"archive_papers_tagged":473,"with_a_code_link":211,"where_syntology_ran_a_sample":64,"not_listed_spam_title":0,"listed":473,"listed_where_code_ran":64,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":56,"every_run_a_failure_of_syntologys_instrument":8,"listed_with_a_run_with_no_instrument_failure":56,"listed_every_run_a_failure_of_syntologys_instrument":8,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/video-captioning","prev":"/task/video-captioning/papers/3","next":"/task/video-captioning/papers/5","papers":[{"url":null,"slug":"generating-templated-caption-for-video","title":"Exploiting Auxiliary Caption for Video Grounding","date":"2023-01-15","arxiv_id":"2301.05997","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-group-video-captioning-with","title":"Exploring Group Video Captioning with Efficient Relational Approximation","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hivlp-hierarchical-interactive-video-language","title":"HiVLP: Hierarchical Interactive Video-Language Pre-Training","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"regen-a-good-generative-zero-shot-video","title":"ReGen: A good Generative Zero-Shot Video Classifier Should be Rewarded","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/hitea-hierarchical-temporal-aware-video","slug":"hitea-hierarchical-temporal-aware-video","title":"HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training","date":"2022-12-30","arxiv_id":"2212.14546","repositories_listed":0,"syntology":null},{"url":null,"slug":"mavic-multimodal-active-learning-for-video","title":"MAViC: Multimodal Active Learning for Video Captioning","date":"2022-12-11","arxiv_id":"2212.11109","repositories_listed":0,"syntology":null},{"url":"/paper/video-text-modeling-with-zero-shot-transfer","slug":"video-text-modeling-with-zero-shot-transfer","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","date":"2022-12-09","arxiv_id":"2212.04979","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-source-visual-and-target-language","title":"Aligning Source Visual and Target Language Domains for Unpaired Video Captioning","date":"2022-11-22","arxiv_id":"2211.12148","repositories_listed":0,"syntology":null},{"url":null,"slug":"fighting-fire-with-fire-assessing-the","title":"Fighting FIRe with FIRE: Assessing the Validity of Text-to-Video Retrieval Benchmarks","date":"2022-10-10","arxiv_id":"2210.05038","repositories_listed":0,"syntology":null},{"url":null,"slug":"recipe-generation-from-unsegmented-cooking","title":"Recipe Generation from Unsegmented Cooking Videos","date":"2022-09-21","arxiv_id":"2209.10134","repositories_listed":0,"syntology":null},{"url":"/paper/omnivl-one-foundation-model-for-image","slug":"omnivl-one-foundation-model-for-image","title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","date":"2022-09-15","arxiv_id":"2209.07526","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-video-text-retrieval-with-explicit","title":"Boosting Video-Text Retrieval with Explicit High-Level Semantics","date":"2022-08-08","arxiv_id":"2208.04215","repositories_listed":0,"syntology":null},{"url":null,"slug":"savchoi-detecting-suspicious-activities-using","title":"SAVCHOI: Detecting Suspicious Activities using Dense Video Captioning with Human Object Interactions","date":"2022-07-24","arxiv_id":"2207.11838","repositories_listed":0,"syntology":null},{"url":null,"slug":"pic-4th-challenge-semantic-assisted-multi","title":"PIC 4th Challenge: Semantic-Assisted Multi-Feature Encoding and Multi-Head Decoding for Dense Video Captioning","date":"2022-07-06","arxiv_id":"2207.02583","repositories_listed":0,"syntology":null},{"url":null,"slug":"modality-alignment-between-deep","title":"Modality Alignment between Deep Representations for Effective Video-and-Language Learning","date":"2022-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"attract-me-to-buy-advertisement-copywriting","title":"Attract me to Buy: Advertisement Copywriting Generation with Multimodal Multi-structured Information","date":"2022-05-07","arxiv_id":"2205.03534","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-level-decoupled-transformer-for-video","title":"Dual-Level Decoupled Transformer for Video Captioning","date":"2022-05-06","arxiv_id":"2205.03039","repositories_listed":0,"syntology":null},{"url":"/paper/end-to-end-dense-video-captioning-as-sequence-1","slug":"end-to-end-dense-video-captioning-as-sequence-1","title":"End-to-end Dense Video Captioning as Sequence Generation","date":"2022-04-18","arxiv_id":"2204.08121","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-aware-pretraining-for-dense-video","title":"Semantic-Aware Pretraining for Dense Video Captioning","date":"2022-04-13","arxiv_id":"2204.07449","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-captioning-a-comparative-review-of","title":"Video Captioning: a comparative review of where we are and which could be the route","date":"2022-04-12","arxiv_id":"2204.05976","repositories_listed":0,"syntology":null},{"url":"/paper/learning-audio-video-modalities-from-image","slug":"learning-audio-video-modalities-from-image","title":"Learning Audio-Video Modalities from Image Captions","date":"2022-04-01","arxiv_id":"2204.00679","repositories_listed":0,"syntology":null},{"url":null,"slug":"create-a-benchmark-for-chinese-short-video-1","title":"CREATE: A Benchmark for Chinese Short Video Retrieval and Title Generation","date":"2022-03-31","arxiv_id":"2203.16763","repositories_listed":0,"syntology":null},{"url":null,"slug":"global2local-a-joint-hierarchical-attention","title":"Global2Local: A Joint-Hierarchical Attention for Video Captioning","date":"2022-03-13","arxiv_id":"2203.06663","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-long-term-temporal-dynamics-for","title":"Exploiting long-term temporal dynamics for video captioning","date":"2022-02-22","arxiv_id":"2202.10828","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-integrated-approach-for-video-captioning","title":"An Integrated Approach for Video Captioning and Applications","date":"2022-01-23","arxiv_id":"2201.09153","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-network-applications","title":"Generative Adversarial Network Applications in Creating a Meta-Universe","date":"2022-01-23","arxiv_id":"2201.09152","repositories_listed":0,"syntology":null},{"url":"/paper/end-to-end-generative-pretraining-for","slug":"end-to-end-generative-pretraining-for","title":"End-to-end Generative Pretraining for Multimodal Video Captioning","date":"2022-01-20","arxiv_id":"2201.08264","repositories_listed":0,"syntology":null},{"url":null,"slug":"discourse-analysis-for-evaluating-coherence","title":"Discourse Analysis for Evaluating Coherence in Video Paragraph Captions","date":"2022-01-17","arxiv_id":"2201.06207","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-dense-video-captioning-as-sequence","title":"End-to-end Dense Video Captioning as Sequence Generation","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-video-representation-learning-with-1","title":"Boosting Video Representation Learning with Multi-Faceted Integration","date":"2022-01-11","arxiv_id":"2201.04023","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-stacked-local-attention-networks","title":"Variational Stacked Local Attention Networks for Diverse Video Captioning","date":"2022-01-04","arxiv_id":"2201.00985","repositories_listed":0,"syntology":null},{"url":null,"slug":"coco-bert-improving-video-language-pre","title":"CoCo-BERT: Improving Video-Language Pre-training with Contrastive Cross-modal Matching and Denoising","date":"2021-12-14","arxiv_id":"2112.07515","repositories_listed":0,"syntology":null},{"url":"/paper/an-efficient-keyframes-selection-based","slug":"an-efficient-keyframes-selection-based","title":"An Efficient Keyframes Selection Based Framework for Video Captioning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-dependency-tree-for-video","title":"Multi-modal Dependency Tree for Video Captioning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dvcflow-modeling-information-flow-towards","title":"DVCFlow: Modeling Information Flow Towards Human-like Video Captioning","date":"2021-11-19","arxiv_id":"2111.10146","repositories_listed":0,"syntology":null},{"url":null,"slug":"create-a-benchmark-for-chinese-short-video","title":"CREATE: A Benchmark for Chinese Short Video Retrieval and Title Generation","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"e-mmad-multimodal-advertising-caption","title":"E-MMAD: Multimodal Advertising Caption Generation Based on Structured Information","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fill-in-the-blank-a-challenging-video","title":"Fill-in-the-Blank: A Challenging Video Understanding Evaluation Framework","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-aware-attention-dual-stream-decoder","title":"Visual-aware Attention Dual-stream Decoder for Video Captioning","date":"2021-10-16","arxiv_id":"2110.08578","repositories_listed":0,"syntology":null},{"url":null,"slug":"clip4caption-clip-for-video-caption","title":"CLIP4Caption: CLIP for Video Caption","date":"2021-10-13","arxiv_id":"2110.06615","repositories_listed":0,"syntology":null},{"url":null,"slug":"crossclr-cross-modal-contrastive-learning-for","title":"CrossCLR: Cross-modal Contrastive Learning For Multi-modal Video Representations","date":"2021-09-30","arxiv_id":"2109.14910","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-similarities-and-dual-approach-for","title":"Graph Similarities and Dual Approach for Sequential Text-to-Image Retrieval","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/hierarchical-multimodal-transformer-to","slug":"hierarchical-multimodal-transformer-to","title":"Hierarchical Multimodal Transformer to Summarize Videos","date":"2021-09-22","arxiv_id":"2109.10559","repositories_listed":0,"syntology":null},{"url":null,"slug":"o2na-an-object-oriented-non-autoregressive","title":"O2NA: An Object-Oriented Non-Autoregressive Approach for Controllable Video Captioning","date":"2021-08-05","arxiv_id":"2108.02359","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-latency-for-online-video","title":"Optimizing Latency for Online Video CaptioningUsing Audio-Visual Transformers","date":"2021-08-04","arxiv_id":"2108.02147","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-video-captioning-with-dynamic-loss","title":"Boosting Video Captioning with Dynamic Loss Network","date":"2021-07-25","arxiv_id":"2107.11707","repositories_listed":0,"syntology":null},{"url":null,"slug":"ireason-multimodal-commonsense-reasoning","title":"iReason: Multimodal Commonsense Reasoning using Videos and Natural Language with Interpretability","date":"2021-06-25","arxiv_id":"2107.10300","repositories_listed":0,"syntology":null},{"url":null,"slug":"sketch-ground-and-refine-top-down-dense-video","title":"Sketch, Ground, and Refine: Top-Down Dense Video Captioning","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-bridging-event-captioner-and-sentence","title":"Towards Bridging Event Captioner and Sentence Localizer for Weakly Supervised Dense Event Captioning","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/attention-based-video-captioning-framework","slug":"attention-based-video-captioning-framework","title":"Attention based video captioning framework for Hindi","date":"2021-06-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-dense-video-captioning-via","title":"Weakly Supervised Dense Video Captioning via Jointly Usage of Knowledge Distillation and Cross-modal Matching","date":"2021-05-18","arxiv_id":"2105.08252","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-generation-of-descriptive-titles","title":"Automatic Generation of Descriptive Titles for Video Clips Using Deep Learning","date":"2021-04-07","arxiv_id":"2104.03337","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-use-of-video-captioning-for-fostering","title":"The Use of Video Captioning for Fostering Physical Activity","date":"2021-04-07","arxiv_id":"2104.03207","repositories_listed":0,"syntology":null},{"url":null,"slug":"cupid-adaptive-curation-of-pre-training-data","title":"CUPID: Adaptive Curation of Pre-training Data for Video-and-Language Representation Learning","date":"2021-04-01","arxiv_id":"2104.00285","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-book-video-captioning-with-retrieve-copy","title":"Open-book Video Captioning with Retrieve-Copy-Generate Network","date":"2021-03-09","arxiv_id":"2103.05284","repositories_listed":0,"syntology":null},{"url":null,"slug":"recent-advances-in-video-question-answering-a","title":"Recent Advances in Video Question Answering: A Review of Datasets and Methods","date":"2021-01-15","arxiv_id":"2101.05954","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-of-visual-features-and-their","title":"Exploration of Visual Features and their weighted-additive fusion for Video Captioning","date":"2021-01-14","arxiv_id":"2101.05806","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-captioning-in-compressed-video","title":"Video Captioning in Compressed Video","date":"2021-01-02","arxiv_id":"2101.00359","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-guided-region-message-passing-for","title":"Motion Guided Region Message Passing for Video Captioning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"guidance-module-network-for-video-captioning","title":"Guidance Module Network for Video Captioning","date":"2020-12-20","arxiv_id":"2012.10930","repositories_listed":0,"syntology":null},{"url":null,"slug":"msvd-turkish-a-comprehensive-multimodal","title":"MSVD-Turkish: A Comprehensive Multimodal Dataset for Integrated Vision and Language Research in Turkish","date":"2020-12-13","arxiv_id":"2012.07098","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-action-sequences-based-on-video","title":"Understanding Action Sequences based on Video Captioning for Learning-from-Observation","date":"2020-12-09","arxiv_id":"2101.05061","repositories_listed":0,"syntology":null},{"url":"/paper/iperceive-applying-common-sense-reasoning-to-1","slug":"iperceive-applying-common-sense-reasoning-to-1","title":"iPerceive: Applying Common-Sense Reasoning to Multi-Modal Dense Video Captioning and Video Question Answering","date":"2020-11-16","arxiv_id":"2011.07735","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-learning-for-video-captioning","title":"Semi-Supervised Learning for Video Captioning","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-in-action-a-comparative-study-of","title":"Transformer in action: a comparative study of transformer-based acoustic models for large scale speech recognition applications","date":"2020-10-27","arxiv_id":"2010.14665","repositories_listed":0,"syntology":null},{"url":null,"slug":"trecvid-2019-an-evaluation-campaign-to","title":"TRECVID 2019: An Evaluation Campaign to Benchmark Video Activity Detection, Video Captioning and Matching, and Video Search & Retrieval","date":"2020-09-21","arxiv_id":"2009.09984","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-captioning-using-weak-annotation","title":"Video Captioning Using Weak Annotation","date":"2020-09-02","arxiv_id":"2009.01067","repositories_listed":0,"syntology":null},{"url":"/paper/hierarchical-memory-decoder-for-visual","slug":"hierarchical-memory-decoder-for-visual","title":"Hierarchical memory decoder for visual narrating","date":"2020-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"in-home-daily-life-captioning-using-radio","title":"In-Home Daily-Life Captioning Using Radio Signals","date":"2020-08-25","arxiv_id":"2008.10966","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-for-video-description-with","title":"Active Learning for Video Description With Cluster-Regularized Ensemble Ranking","date":"2020-07-27","arxiv_id":"2007.13913","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-for-video-captioning-challenge","title":"Pre-training for Video Captioning Challenge 2020 Summary","date":"2020-07-27","arxiv_id":"2008.00947","repositories_listed":0,"syntology":null},{"url":null,"slug":"sbat-video-captioning-with-sparse-boundary","title":"SBAT: Video Captioning with Sparse Boundary-Aware Transformer","date":"2020-07-23","arxiv_id":"2007.11888","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-graph-to-sequence-learning-for-vision","title":"Sparse Graph to Sequence Learning for Vision Conditioned Long Textual Sequence Generation","date":"2020-07-12","arxiv_id":"2007.06077","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-captions-on-gif-a-large-scale-video","title":"Auto-captions on GIF: A Large-scale Video-sentence Dataset for Vision-language Pre-training","date":"2020-07-05","arxiv_id":"2007.02375","repositories_listed":0,"syntology":null},{"url":null,"slug":"sact-self-aware-multi-space-feature","title":"SACT: Self-Aware Multi-Space Feature Composition Transformer for Multinomial Attention for Video Captioning","date":"2020-06-25","arxiv_id":"2006.14262","repositories_listed":0,"syntology":null},{"url":"/paper/team-ruc-aim3-technical-report-at-activitynet","slug":"team-ruc-aim3-technical-report-at-activitynet","title":"Team RUC_AIM3 Technical Report at Activitynet 2020 Task 2: Exploring Sequential Events Detection for Dense Video Captioning","date":"2020-06-14","arxiv_id":"2006.07896","repositories_listed":0,"syntology":null},{"url":"/paper/nits-vc-system-for-vatex-video-captioning","slug":"nits-vc-system-for-vatex-video-captioning","title":"NITS-VC System for VATEX Video Captioning Challenge 2020","date":"2020-06-07","arxiv_id":"2006.04058","repositories_listed":0,"syntology":null},{"url":null,"slug":"layer-wise-cross-view-decoding-for-sequence","title":"Rethinking and Improving Natural Language Generation with Layer-Wise Multi-View Decoding","date":"2020-05-16","arxiv_id":"2005.08081","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatio-temporal-graph-for-video-captioning","title":"Spatio-Temporal Graph for Video Captioning with Knowledge Distillation","date":"2020-03-31","arxiv_id":"2003.13942","repositories_listed":0,"syntology":null},{"url":null,"slug":"normalized-and-geometry-aware-self-attention","title":"Normalized and Geometry-Aware Self-Attention Network for Image Captioning","date":"2020-03-19","arxiv_id":"2003.08897","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-oriented-video-captioning-with","title":"OVC-Net: Object-Oriented Video Captioning with Temporal Graph and Detail Enhancement","date":"2020-03-08","arxiv_id":"2003.03715","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-memory-decoding-for-video","title":"Hierarchical Memory Decoding for Video Captioning","date":"2020-02-27","arxiv_id":"2002.11886","repositories_listed":0,"syntology":null},{"url":"/paper/object-relational-graph-with-teacher","slug":"object-relational-graph-with-teacher","title":"Object Relational Graph with Teacher-Recommended Learning for Video Captioning","date":"2020-02-26","arxiv_id":"2002.11566","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatio-temporal-ranked-attention-networks-for","title":"Spatio-Temporal Ranked-Attention Networks for Video Captioning","date":"2020-01-17","arxiv_id":"2001.06127","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-and-language-from-visual-perception-to","title":"Vision and Language: from Visual Perception to Content Creation","date":"2019-12-26","arxiv_id":"1912.11872","repositories_listed":0,"syntology":null},{"url":"/paper/multimodal-machine-translation-through","slug":"multimodal-machine-translation-through","title":"Multimodal Machine Translation through Visuals and Speech","date":"2019-11-28","arxiv_id":"1911.12798","repositories_listed":0,"syntology":null},{"url":null,"slug":"characterizing-the-impact-of-using-features","title":"Characterizing the impact of using features extracted from pre-trained models on the quality of video captioning sequence-to-sequence models","date":"2019-11-22","arxiv_id":"1911.09989","repositories_listed":0,"syntology":null},{"url":null,"slug":"empirical-autopsy-of-deep-video-captioning","title":"Empirical Autopsy of Deep Video Captioning Frameworks","date":"2019-11-21","arxiv_id":"1911.09345","repositories_listed":0,"syntology":null},{"url":null,"slug":"crowd-video-captioning","title":"Crowd Video Captioning","date":"2019-11-13","arxiv_id":"1911.05449","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-captioning-with-text-based-dynamic","title":"Video Captioning with Text-based Dynamic Attention and Step-by-Step Learning","date":"2019-11-05","arxiv_id":"1911.01857","repositories_listed":0,"syntology":null},{"url":null,"slug":"guiding-the-flowing-of-semantics","title":"Guiding the Flowing of Semantics: Interpretable Video Captioning via POS Tag","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"low-rank-hoca-efficient-high-order-cross-1","title":"Low-Rank HOCA: Efficient High-Order Cross-Modal Attention for Video Captioning","date":"2019-11-01","arxiv_id":"1911.00212","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-video-captioning-through-latent","title":"Diverse Video Captioning Through Latent Variable Expansion","date":"2019-10-26","arxiv_id":"1910.12019","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-view-features-and-hybrid-reward","title":"Vatex Video Captioning Challenge 2020: Multi-View Features and Hybrid Reward Strategies for Video Captioning","date":"2019-10-17","arxiv_id":"1910.11102","repositories_listed":0,"syntology":null},{"url":null,"slug":"imperial-college-london-submission-to-vatex","title":"Imperial College London Submission to VATEX Video Captioning Task","date":"2019-10-16","arxiv_id":"1910.07482","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-temporal-and-spatial-attentions","title":"Integrating Temporal and Spatial Attentions for VATEX Video Captioning Challenge 2019","date":"2019-10-15","arxiv_id":"1910.06737","repositories_listed":0,"syntology":null},{"url":null,"slug":"vatex-captioning-challenge-2019-multi-modal","title":"VATEX Captioning Challenge 2019: Multi-modal Information Fusion and Multi-stage Training Strategy for Video Captioning","date":"2019-10-13","arxiv_id":"1910.05752","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-action-sequence-classification","title":"Human Action Sequence Classification","date":"2019-10-07","arxiv_id":"1910.02602","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-training-shallow-memory-aware","title":"SMArT: Training Shallow Memory-aware Transformers for Robotic Explainability","date":"2019-10-07","arxiv_id":"1910.02974","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-syntax-representation-learning-and","title":"Joint Syntax Representation Learning and Visual Cue Translation for Video Captioning","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"286d92f84949dd9145e68e4cd602920ff9e72f5c66e4170ee764121de7ded481","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}