{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/video-captioning/papers/3","list_of":"/task/video-captioning","task":"Video Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":5,"rows_per_page":100,"rows":[201,300],"of":473,"counts":{"archive_papers_tagged":473,"with_a_code_link":211,"where_syntology_ran_a_sample":64,"not_listed_spam_title":0,"listed":473,"listed_where_code_ran":64,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":56,"every_run_a_failure_of_syntologys_instrument":8,"listed_with_a_run_with_no_instrument_failure":56,"listed_every_run_a_failure_of_syntologys_instrument":8,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/video-captioning","prev":"/task/video-captioning/papers/2","next":"/task/video-captioning/papers/4","papers":[{"url":"/paper/end-to-end-video-captioning-with-multitask","slug":"end-to-end-video-captioning-with-multitask","title":"End-to-End Video Captioning with Multitask Reinforcement Learning","date":"2018-03-21","arxiv_id":"1803.07950","repositories_listed":1,"syntology":null},{"url":"/paper/joint-event-detection-and-description-in","slug":"joint-event-detection-and-description-in","title":"Joint Event Detection and Description in Continuous Video Streams","date":"2018-02-28","arxiv_id":"1802.10250","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 1 unverified","sample_list":"/paper/joint-event-detection-and-description-in#ran","syntology_url":"https://syntology.ai/paper/1802.10250","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1802.10250"}},"official":{"repos":["VisionLearningGroup/JEDDi-Net"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/excitation-backprop-for-rnns","slug":"excitation-backprop-for-rnns","title":"Excitation Backprop for RNNs","date":"2017-11-18","arxiv_id":"1711.06778","repositories_listed":1,"syntology":null},{"url":"/paper/towards-automatic-learning-of-procedures-from","slug":"towards-automatic-learning-of-procedures-from","title":"Towards Automatic Learning of Procedures from Web Instructional Videos","date":"2017-03-28","arxiv_id":"1703.09788","repositories_listed":1,"syntology":{"n":2,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 2 unverified","sample_list":"/paper/towards-automatic-learning-of-procedures-from#ran","syntology_url":"https://syntology.ai/paper/1703.09788","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1703.09788"}},"official":null}},{"url":"/paper/temporal-tessellation-a-unified-approach-for","slug":"temporal-tessellation-a-unified-approach-for","title":"Temporal Tessellation: A Unified Approach for Video Analysis","date":"2016-12-21","arxiv_id":"1612.06950","repositories_listed":1,"syntology":null},{"url":"/paper/deep-learning-for-video-classification-and","slug":"deep-learning-for-video-classification-and","title":"Deep Learning for Video Classification and Captioning","date":"2016-09-22","arxiv_id":"1609.06782","repositories_listed":1,"syntology":null},{"url":"/paper/frame-and-segment-level-features-and","slug":"frame-and-segment-level-features-and","title":"Frame- and Segment-Level Features and Candidate Pool Evaluation for Video Caption Generation","date":"2016-08-17","arxiv_id":"1608.04959","repositories_listed":1,"syntology":null},{"url":"/paper/video-description-using-bidirectional","slug":"video-description-using-bidirectional","title":"Video Description using Bidirectional Recurrent Neural Networks","date":"2016-04-12","arxiv_id":"1604.03390","repositories_listed":1,"syntology":null},{"url":"/paper/deep-compositional-captioning-describing","slug":"deep-compositional-captioning-describing","title":"Deep Compositional Captioning: Describing Novel Object Categories without Paired Training Data","date":"2015-11-17","arxiv_id":"1511.05284","repositories_listed":1,"syntology":null},{"url":"/paper/oracle-performance-for-visual-captioning","slug":"oracle-performance-for-visual-captioning","title":"Oracle performance for visual captioning","date":"2015-11-14","arxiv_id":"1511.04590","repositories_listed":1,"syntology":null},{"url":"/paper/translating-videos-to-natural-language-using","slug":"translating-videos-to-natural-language-using","title":"Translating Videos to Natural Language Using Deep Recurrent Neural Networks","date":"2014-12-15","arxiv_id":"1412.4729","repositories_listed":1,"syntology":null},{"url":null,"slug":"dense-video-captioning-using-graph-based","title":"Dense Video Captioning using Graph-based Sentence Summarization","date":"2025-06-25","arxiv_id":"2506.20583","repositories_listed":0,"syntology":null},{"url":null,"slug":"show-tell-and-summarize-dense-video","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","date":"2025-06-25","arxiv_id":"2506.20567","repositories_listed":0,"syntology":null},{"url":null,"slug":"versavid-r1-a-versatile-video-understanding","title":"VersaVid-R1: A Versatile Video Understanding and Reasoning Model from Question Answering to Captioning Tasks","date":"2025-06-10","arxiv_id":"2506.09079","repositories_listed":0,"syntology":null},{"url":null,"slug":"argus-hallucination-and-omission-evaluation","title":"ARGUS: Hallucination and Omission Evaluation in Video-LLMs","date":"2025-06-09","arxiv_id":"2506.07371","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-object-captioning-for-street-scene","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","date":"2025-05-22","arxiv_id":"2505.16594","repositories_listed":0,"syntology":null},{"url":null,"slug":"timesoccer-an-end-to-end-multimodal-large","title":"TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation","date":"2025-04-24","arxiv_id":"2504.17365","repositories_listed":0,"syntology":null},{"url":null,"slug":"describe-anything-detailed-localized-image","title":"Describe Anything: Detailed Localized Image and Video Captioning","date":"2025-04-22","arxiv_id":"2504.16072","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-devil-is-in-the-distributions-explicit","title":"The Devil is in the Distributions: Explicit Modeling of Scene Content is Key in Zero-Shot Video Captioning","date":"2025-03-31","arxiv_id":"2503.23679","repositories_listed":0,"syntology":null},{"url":null,"slug":"watch-and-learn-leveraging-expert-knowledge","title":"Watch and Learn: Leveraging Expert Knowledge and Language for Surgical Video Understanding","date":"2025-03-14","arxiv_id":"2503.11392","repositories_listed":0,"syntology":null},{"url":null,"slug":"get-in-video-add-anything-you-want-to-the","title":"Get In Video: Add Anything You Want to the Video","date":"2025-03-08","arxiv_id":"2503.06268","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-video-captioning-through-scene","title":"Fine-Grained Video Captioning through Scene Graph Consolidation","date":"2025-02-23","arxiv_id":"2502.16427","repositories_listed":0,"syntology":null},{"url":null,"slug":"longcaptioning-unlocking-the-power-of-long","title":"LongCaptioning: Unlocking the Power of Long Caption Generation in Large Multimodal Models","date":"2025-02-21","arxiv_id":"2502.15393","repositories_listed":0,"syntology":null},{"url":null,"slug":"capturing-rich-behavior-representations-a","title":"Capturing Rich Behavior Representations: A Dynamic Action Semantic-Aware Graph Transformer for Video Captioning","date":"2025-02-19","arxiv_id":"2502.13754","repositories_listed":0,"syntology":null},{"url":null,"slug":"mams-model-agnostic-module-selection","title":"MAMS: Model-Agnostic Module Selection Framework for Video Captioning","date":"2025-01-30","arxiv_id":"2501.18269","repositories_listed":0,"syntology":null},{"url":null,"slug":"classifier-guided-captioning-across","title":"Classifier-Guided Captioning Across Modalities","date":"2025-01-03","arxiv_id":"2501.03183","repositories_listed":0,"syntology":null},{"url":null,"slug":"adacm-2-on-understanding-extremely-long-term-1","title":"AdaCM^2: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"event-equalized-dense-video-captioning","title":"Event-Equalized Dense Video Captioning","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-video-text-retrieval-a-new","title":"CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval","date":"2024-12-31","arxiv_id":"2501.00513","repositories_listed":0,"syntology":null},{"url":null,"slug":"polysmart-trecvid-2024-video-to-text","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","date":"2024-12-20","arxiv_id":"2412.15509","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-temporal-event-cues-for-dense-video","title":"Exploring Temporal Event Cues for Dense Video Captioning in Cyclic Co-learning","date":"2024-12-16","arxiv_id":"2412.11467","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-vision-and-language-modeling","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","date":"2024-12-14","arxiv_id":"2412.10720","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-based-video-trimming","title":"Agent-based Video Trimming","date":"2024-12-12","arxiv_id":"2412.09513","repositories_listed":0,"syntology":null},{"url":null,"slug":"vicas-a-dataset-for-combining-holistic-and","title":"ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation","date":"2024-12-12","arxiv_id":"2412.09754","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-llms-for-temporal-reasoning-in-long","title":"Video LLMs for Temporal Reasoning in Long Videos","date":"2024-12-04","arxiv_id":"2412.02930","repositories_listed":0,"syntology":null},{"url":null,"slug":"progress-aware-video-frame-captioning","title":"Progress-Aware Video Frame Captioning","date":"2024-12-03","arxiv_id":"2412.02071","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperglm-hypergraph-for-video-scene-graph","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","date":"2024-11-27","arxiv_id":"2411.18042","repositories_listed":0,"syntology":null},{"url":null,"slug":"seq2time-sequential-knowledge-transfer-for","title":"Seq2Time: Sequential Knowledge Transfer for Video LLM Temporal Grounding","date":"2024-11-25","arxiv_id":"2411.16932","repositories_listed":0,"syntology":null},{"url":null,"slug":"finecaption-compositional-image-captioning","title":"FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity","date":"2024-11-23","arxiv_id":"2411.15411","repositories_listed":0,"syntology":null},{"url":null,"slug":"whats-in-a-video-factorized-autoregressive","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","date":"2024-11-22","arxiv_id":"2411.14688","repositories_listed":0,"syntology":null},{"url":null,"slug":"adacm-2-on-understanding-extremely-long-term","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","date":"2024-11-19","arxiv_id":"2411.12593","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-interpretable-automatic-video","title":"Multi-Modal interpretable automatic video captioning","date":"2024-11-11","arxiv_id":"2411.06872","repositories_listed":0,"syntology":null},{"url":null,"slug":"spectrum-semantic-processing-and-emotion","title":"SPECTRUM: Semantic Processing and Emotion-informed video-Captioning Through Retrieval and Understanding Modalities","date":"2024-11-04","arxiv_id":"2411.01975","repositories_listed":0,"syntology":null},{"url":null,"slug":"technical-report-for-soccernet-2023-dense","title":"Technical Report for Soccernet 2023 -- Dense Video Captioning","date":"2024-10-31","arxiv_id":"2411.00882","repositories_listed":0,"syntology":null},{"url":null,"slug":"evc-mf-end-to-end-video-captioning-network","title":"EVC-MF: End-to-end Video Captioning Network with Multi-scale Features","date":"2024-10-22","arxiv_id":"2410.16624","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-lvlms-describe-videos-like-humans-a-five","title":"FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning","date":"2024-10-20","arxiv_id":"2410.15270","repositories_listed":0,"syntology":null},{"url":null,"slug":"it-s-just-another-day-unique-video-captioning","title":"It's Just Another Day: Unique Video Captioning by Discriminative Prompting","date":"2024-10-15","arxiv_id":"2410.11702","repositories_listed":0,"syntology":null},{"url":"/paper/mmcomposition-revisiting-the-compositionality","slug":"mmcomposition-revisiting-the-compositionality","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","date":"2024-10-13","arxiv_id":"2410.09733","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-multimodal-llm-for-detailed-and","title":"Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization","date":"2024-10-09","arxiv_id":"2410.06682","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-length-controllable-video","title":"Fine-grained length controllable video captioning with ordinal embeddings","date":"2024-08-27","arxiv_id":"2408.15447","repositories_listed":0,"syntology":null},{"url":null,"slug":"wolf-captioning-everything-with-a-world","title":"Wolf: Captioning Everything with a World Summarization Framework","date":"2024-07-26","arxiv_id":"2407.18908","repositories_listed":0,"syntology":null},{"url":null,"slug":"evlm-an-efficient-vision-language-model-for","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","date":"2024-07-19","arxiv_id":"2407.14177","repositories_listed":0,"syntology":null},{"url":null,"slug":"reexamining-racial-disparities-in-automatic","title":"Reexamining Racial Disparities in Automatic Speech Recognition Performance: The Role of Confounding by Provenance","date":"2024-07-19","arxiv_id":"2407.13982","repositories_listed":0,"syntology":null},{"url":null,"slug":"https-arxiv-org-abs-2407-00634","title":"https://arxiv.org/abs/2407.00634","date":"2024-07-02","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"directed-domain-fine-tuning-tailoring","title":"Directed Domain Fine-Tuning: Tailoring Separate Modalities for Specific Training Tasks","date":"2024-06-24","arxiv_id":"2406.16346","repositories_listed":0,"syntology":null},{"url":null,"slug":"gui-action-narrator-where-and-when-did-that","title":"GUI Action Narrator: Where and When Did That Action Take Place?","date":"2024-06-19","arxiv_id":"2406.13719","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-holistic-language-video","title":"Towards Holistic Language-video Representation: the language model-enhanced MSR-Video to Text Dataset","date":"2024-06-19","arxiv_id":"2406.13809","repositories_listed":0,"syntology":null},{"url":"/paper/narrativebridge-enhancing-video-captioning","slug":"narrativebridge-enhancing-video-captioning","title":"NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative","date":"2024-06-10","arxiv_id":"2406.06499","repositories_listed":0,"syntology":null},{"url":null,"slug":"story-generation-from-visual-inputs","title":"Story Generation from Visual Inputs: Techniques, Related Tasks, and Challenges","date":"2024-06-04","arxiv_id":"2406.02748","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-enhanced-zero-shot-video-captioning","title":"RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning","date":"2024-05-11","arxiv_id":"2405.07046","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-toolchain-for-comprehensive-audio-video","title":"A Toolchain for Comprehensive Audio/Video Analysis Using Deep Learning Based Multimodal Approach (A use case of riot or violent context detection)","date":"2024-05-02","arxiv_id":"2407.03110","repositories_listed":0,"syntology":null},{"url":"/paper/the-8th-ai-city-challenge","slug":"the-8th-ai-city-challenge","title":"The 8th AI City Challenge","date":"2024-04-15","arxiv_id":"2404.09432","repositories_listed":0,"syntology":null},{"url":null,"slug":"dibs-enhancing-dense-video-captioning-with","title":"DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement","date":"2024-04-03","arxiv_id":"2404.02755","repositories_listed":0,"syntology":null},{"url":null,"slug":"avicuna-audio-visual-llm-with-interleaver-and","title":"Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding","date":"2024-03-24","arxiv_id":"2403.16276","repositories_listed":0,"syntology":null},{"url":null,"slug":"sora-as-an-agi-world-model-a-complete-survey","title":"Sora as an AGI World Model? A Complete Survey on Text-to-Video Generation","date":"2024-03-08","arxiv_id":"2403.05131","repositories_listed":0,"syntology":null},{"url":null,"slug":"mcf-vc-mitigate-catastrophic-forgetting-in","title":"MCF-VC: Mitigate Catastrophic Forgetting in Class-Incremental Learning for Multimodal Video Captioning","date":"2024-02-27","arxiv_id":"2402.17680","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-graph-supported-benchmark-and-video","title":"Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark","date":"2024-01-25","arxiv_id":"2401.13888","repositories_listed":0,"syntology":null},{"url":null,"slug":"snapcap-efficient-snapshot-compressive-video","title":"SnapCap: Efficient Snapshot Compressive Video Captioning","date":"2024-01-10","arxiv_id":"2401.04903","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-scaling-up-a-multilingual-vision-and","title":"On Scaling Up a Multilingual Vision and Language Model","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-augmented-egocentric-video","title":"Retrieval-Augmented Egocentric Video Captioning","date":"2024-01-01","arxiv_id":"2401.00789","repositories_listed":0,"syntology":null},{"url":null,"slug":"set-prediction-guided-by-semantic-concepts","title":"Set Prediction Guided by Semantic Concepts for Diverse Video Captioning","date":"2023-12-25","arxiv_id":"2312.15720","repositories_listed":0,"syntology":null},{"url":null,"slug":"subject-oriented-video-captioning","title":"SOVC: Subject-Oriented Video Captioning","date":"2023-12-20","arxiv_id":"2312.13330","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-based-encoder-decoder-model-for","title":"Attention Based Encoder Decoder Model for Video Captioning in Nepali (2023)","date":"2023-12-12","arxiv_id":"2312.07418","repositories_listed":0,"syntology":null},{"url":null,"slug":"exo2egodvc-dense-video-captioning-of","title":"Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos","date":"2023-11-28","arxiv_id":"2311.16444","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-granularity-bias-as-the-margin","title":"Incorporating granularity bias as the margin into contrastive loss for video captioning","date":"2023-11-25","arxiv_id":"2311.14977","repositories_listed":0,"syntology":null},{"url":null,"slug":"dense-video-captioning-a-survey-of-techniques","title":"Dense Video Captioning: A Survey of Techniques, Datasets and Evaluation Protocols","date":"2023-11-05","arxiv_id":"2311.02538","repositories_listed":0,"syntology":null},{"url":null,"slug":"nepali-video-captioning-using-cnn-rnn","title":"Nepali Video Captioning using CNN-RNN Architecture","date":"2023-11-05","arxiv_id":"2311.02699","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-interactive-real-world-simulators","title":"Learning Interactive Real-World Simulators","date":"2023-10-09","arxiv_id":"2310.06114","repositories_listed":0,"syntology":null},{"url":"/paper/icocap-improving-video-captioning-by","slug":"icocap-improving-video-captioning-by","title":"IcoCap: Improving Video Captioning by Compounding Images","date":"2023-10-05","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"human-centric-behavior-description-in-videos","title":"Human-centric Behavior Description in Videos: New Benchmark and Model","date":"2023-10-04","arxiv_id":"2310.02894","repositories_listed":0,"syntology":null},{"url":null,"slug":"encoder-decoder-based-long-short-term-memory","title":"Encoder-Decoder Based Long Short-Term Memory (LSTM) Model for Video Captioning","date":"2023-10-02","arxiv_id":"2401.02052","repositories_listed":0,"syntology":null},{"url":null,"slug":"ucf-crime-annotation-a-benchmark-for","title":"Towards Surveillance Video-and-Language Understanding: New Dataset, Baselines, and Challenges","date":"2023-09-25","arxiv_id":"2309.13925","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-three-stream-transformers-for-1","title":"Collaborative Three-Stream Transformers for Video Captioning","date":"2023-09-18","arxiv_id":"2309.09611","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-captioning-with-aggregated-features","title":"Video Captioning with Aggregated Features Based on Dual Graphs and Gated Fusion","date":"2023-08-13","arxiv_id":"2308.06685","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-dense-video-captioning-by-jointly","title":"Zero-Shot Dense Video Captioning by Jointly Optimizing Text and Moment","date":"2023-07-05","arxiv_id":"2307.02682","repositories_listed":0,"syntology":null},{"url":null,"slug":"style-transfer-based-speech-and-audio-visual","title":"Style-transfer based Speech and Audio-visual Scene Understanding for Robot Action Sequence Acquisition from Videos","date":"2023-06-27","arxiv_id":"2306.15644","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-role-of-audio-in-video","title":"Exploring the Role of Audio in Video Captioning","date":"2023-06-21","arxiv_id":"2306.12559","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-distillation-for-efficient-audio","title":"Knowledge Distillation for Efficient Audio-Visual Video Captioning","date":"2023-06-16","arxiv_id":"2306.09947","repositories_listed":0,"syntology":null},{"url":"/paper/vlab-enhancing-video-language-pre-training-by","slug":"vlab-enhancing-video-language-pre-training-by","title":"VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending","date":"2023-05-22","arxiv_id":"2305.13167","repositories_listed":0,"syntology":null},{"url":null,"slug":"videoofa-two-stage-pre-training-for-video-to","title":"VideoOFA: Two-Stage Pre-Training for Video-to-Text Generation","date":"2023-05-04","arxiv_id":"2305.03204","repositories_listed":0,"syntology":null},{"url":null,"slug":"tcr-short-video-title-generation-and-cover","title":"TCR: Short Video Title Generation and Cover Selection with Attention Refinement","date":"2023-04-25","arxiv_id":"2304.12561","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-deep-learning-for-video","title":"A Review of Deep Learning for Video Captioning","date":"2023-04-22","arxiv_id":"2304.11431","repositories_listed":0,"syntology":null},{"url":null,"slug":"laser-neuro-symbolic-learning-of-semantic","title":"LASER: A Neuro-Symbolic Framework for Learning Spatial-Temporal Scene Graphs with Weak Supervision","date":"2023-04-15","arxiv_id":"2304.07647","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-accurate-self-supervised","title":"Scalable and Accurate Self-supervised Multimodal Representation Learning without Aligned Video and Text Data","date":"2023-04-04","arxiv_id":"2304.02080","repositories_listed":0,"syntology":null},{"url":"/paper/sem-pos-grammatically-and-semantically","slug":"sem-pos-grammatically-and-semantically","title":"SEM-POS: Grammatically and Semantically Correct Video Captioning","date":"2023-03-26","arxiv_id":"2303.14829","repositories_listed":0,"syntology":null},{"url":"/paper/text-with-knowledge-graph-augmented","slug":"text-with-knowledge-graph-augmented","title":"Text with Knowledge Graph Augmented Transformer for Video Captioning","date":"2023-03-22","arxiv_id":"2303.12423","repositories_listed":0,"syntology":null},{"url":null,"slug":"implicit-and-explicit-commonsense-for-multi","title":"Implicit and Explicit Commonsense for Multi-sentence Video Captioning","date":"2023-03-14","arxiv_id":"2303.07545","repositories_listed":0,"syntology":null},{"url":null,"slug":"models-see-hallucinations-evaluating-the","title":"Models See Hallucinations: Evaluating the Factuality in Video Captioning","date":"2023-03-06","arxiv_id":"2303.02961","repositories_listed":0,"syntology":null},{"url":null,"slug":"stoa-vlp-spatial-temporal-modeling-of-object","title":"STOA-VLP: Spatial-Temporal Modeling of Object and Action for Video-Language Pre-training","date":"2023-02-20","arxiv_id":"2302.09736","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-perceiving-video-language-pre","title":"Temporal Perceiving Video-Language Pre-training","date":"2023-01-18","arxiv_id":"2301.07463","repositories_listed":0,"syntology":null}],"record_sha256":"49e9f5380a3fef604b183dcb183e86ac57c0dfbef651fe6ede57aa65bfb58f6a","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}