{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/video-understanding/papers/11","list_of":"/task/video-understanding","task":"Video Understanding","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":11,"pages_in_order":12,"rows_per_page":100,"rows":[1001,1100],"of":1149,"counts":{"archive_papers_tagged":1149,"with_a_code_link":542,"where_syntology_ran_a_sample":218,"not_listed_spam_title":0,"listed":1149,"listed_where_code_ran":218,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":182,"every_run_a_failure_of_syntologys_instrument":36,"listed_with_a_run_with_no_instrument_failure":182,"listed_every_run_a_failure_of_syntologys_instrument":36,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/video-understanding","prev":"/task/video-understanding/papers/10","next":"/task/video-understanding/papers/12","papers":[{"url":null,"slug":"gradient-frequency-modulation-for-visually","title":"Gradient Frequency Modulation for Visually Explaining Video Understanding Models","date":"2021-11-01","arxiv_id":"2111.01215","repositories_listed":0,"syntology":null},{"url":null,"slug":"distantly-supervised-semantic-text-detection","title":"Distantly Supervised Semantic Text Detection and Recognition for Broadcast Sports Videos Understanding","date":"2021-10-31","arxiv_id":"2111.00629","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-t-fool-me-adversarially-robust","title":"Can't Fool Me: Adversarially Robust Transformer for Video Understanding","date":"2021-10-26","arxiv_id":"2110.13950","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-local-temporal-information-for","title":"Leveraging Local Temporal Information for Multimodal Scene Classification","date":"2021-10-26","arxiv_id":"2110.13992","repositories_listed":0,"syntology":null},{"url":null,"slug":"clip4caption-clip-for-video-caption","title":"CLIP4Caption: CLIP for Video Caption","date":"2021-10-13","arxiv_id":"2110.06615","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-a-human-level-video-understanding","title":"Toward a Human-Level Video Understanding Intelligence","date":"2021-10-08","arxiv_id":"2110.04203","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-modelling-across-time-of-human","title":"Efficient Modelling Across Time of Human Actions and Interactions","date":"2021-10-05","arxiv_id":"2110.02120","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatio-temporal-video-representation-learning","title":"Spatio-Temporal Video Representation Learning for AI Based Video Playback Style Prediction","date":"2021-10-03","arxiv_id":"2110.01015","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-dynamics-distillation-for-scene","title":"OBJECT DYNAMICS DISTILLATION FOR SCENE DECOMPOSITION AND REPRESENTATION","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multimodal-sentiment-dataset-for-video","title":"A Multimodal Sentiment Dataset for Video Recommendation","date":"2021-09-17","arxiv_id":"2109.08333","repositories_listed":0,"syntology":null},{"url":null,"slug":"overview-of-tencent-multi-modal-ads-video","title":"Overview of Tencent Multi-modal Ads Video Understanding Challenge","date":"2021-09-16","arxiv_id":"2109.07951","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-representation-learning-for-video","title":"Multi-modal Representation Learning for Video Advertisement Content Structuring","date":"2021-09-04","arxiv_id":"2109.06637","repositories_listed":0,"syntology":null},{"url":null,"slug":"identity-aware-graph-memory-network-for","title":"Identity-aware Graph Memory Network for Action Detection","date":"2021-08-26","arxiv_id":"2108.11559","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-an-augmented-rgb-representation-with","title":"Learning an Augmented RGB Representation with Cross-Modal Knowledge Distillation for Action Detection","date":"2021-08-08","arxiv_id":"2108.03619","repositories_listed":0,"syntology":null},{"url":null,"slug":"o2na-an-object-oriented-non-autoregressive","title":"O2NA: An Object-Oriented Non-Autoregressive Approach for Controllable Video Captioning","date":"2021-08-05","arxiv_id":"2108.02359","repositories_listed":0,"syntology":null},{"url":null,"slug":"cogme-a-novel-evaluation-metric-for-video","title":"CogME: A Cognition-Inspired Multi-Dimensional Evaluation Metric for Story Understanding","date":"2021-07-21","arxiv_id":"2107.09847","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatio-temporal-context-for-action-detection","title":"Spatio-Temporal Context for Action Detection","date":"2021-06-29","arxiv_id":"2106.15171","repositories_listed":0,"syntology":null},{"url":null,"slug":"discerning-generic-event-boundaries-in-long","title":"Discerning Generic Event Boundaries in Long-Form Wild Videos","date":"2021-06-18","arxiv_id":"2106.10090","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-short-temporal-contrastive-learning-of","title":"Long-Short Temporal Contrastive Learning of Video Transformers","date":"2021-06-17","arxiv_id":"2106.09212","repositories_listed":0,"syntology":null},{"url":null,"slug":"c-3-compositional-counterfactual-constrastive","title":"$C^3$: Compositional Counterfactual Contrastive Learning for Video-grounded Dialogues","date":"2021-06-16","arxiv_id":"2106.08914","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamics-via-graph-neural-networks","title":"Learning Dynamics via Graph Neural Networks for Human Pose Estimation and Tracking","date":"2021-06-07","arxiv_id":"2106.03772","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformed-rois-for-capturing-visual","title":"Transformed ROIs for Capturing Visual Transformations in Videos","date":"2021-06-06","arxiv_id":"2106.03162","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-the-effects-of-pre-processing-on","title":"A Study On the Effects of Pre-processing On Spatio-temporal Action Recognition Using Spiking Neural Networks Trained with STDP","date":"2021-05-31","arxiv_id":"2105.14740","repositories_listed":0,"syntology":null},{"url":null,"slug":"highlight-timestamp-detection-model-for","title":"Highlight Timestamp Detection Model for Comedy Videos via Multimodal Sentiment Analysis","date":"2021-05-28","arxiv_id":"2106.00451","repositories_listed":0,"syntology":null},{"url":null,"slug":"spoken-moments-learning-joint-audio-visual","title":"Spoken Moments: Learning Joint Audio-Visual Representations from Video Descriptions","date":"2021-05-10","arxiv_id":"2105.04489","repositories_listed":0,"syntology":null},{"url":null,"slug":"skimming-and-scanning-for-untrimmed-video","title":"Skimming and Scanning for Untrimmed Video Action Recognition","date":"2021-04-21","arxiv_id":"2104.10492","repositories_listed":0,"syntology":null},{"url":null,"slug":"camera-calibration-and-player-localization-in","title":"Camera Calibration and Player Localization in SoccerNet-v2 and Investigation of their Representations for Action Spotting","date":"2021-04-19","arxiv_id":"2104.09333","repositories_listed":0,"syntology":null},{"url":"/paper/temporal-query-networks-for-fine-grained","slug":"temporal-query-networks-for-fine-grained","title":"Temporal Query Networks for Fine-grained Video Understanding","date":"2021-04-19","arxiv_id":"2104.09496","repositories_listed":0,"syntology":null},{"url":"/paper/adaptive-intermediate-representations-for","slug":"adaptive-intermediate-representations-for","title":"Adaptive Intermediate Representations for Video Understanding","date":"2021-04-14","arxiv_id":"2104.07135","repositories_listed":0,"syntology":null},{"url":"/paper/unidentified-video-objects-a-benchmark-for","slug":"unidentified-video-objects-a-benchmark-for","title":"Unidentified Video Objects: A Benchmark for Dense, Open-World Segmentation","date":"2021-04-10","arxiv_id":"2104.04691","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-based-video-editing-via-multi-modal","title":"M3L: Language-based Video Editing via Multi-Modal Multi-Level Transformers","date":"2021-04-02","arxiv_id":"2104.01122","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-transformer-with-adaptive-graph-for","title":"Augmented Transformer with Adaptive Graph for Temporal Action Proposal Generation","date":"2021-03-30","arxiv_id":"2103.16024","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-graph-structured-models-for-video","title":"Unified Graph Structured Models for Video Understanding","date":"2021-03-29","arxiv_id":"2103.15662","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-fidelity-end-to-end-video-encoder-pre","title":"Low-Fidelity End-to-End Video Encoder Pre-training for Temporal Action Localization","date":"2021-03-28","arxiv_id":"2103.15233","repositories_listed":0,"syntology":null},{"url":"/paper/clawcranenet-leveraging-object-level-relation","slug":"clawcranenet-leveraging-object-level-relation","title":"ClawCraneNet: Leveraging Object-level Relation for Text-based Video Segmentation","date":"2021-03-19","arxiv_id":"2103.10702","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-transformer-for-video-understanding","title":"Enhancing Transformer for Video Understanding Using Gated Multi-Level Attention and Temporal Adversarial Training","date":"2021-03-18","arxiv_id":"2103.10043","repositories_listed":0,"syntology":null},{"url":null,"slug":"pcmnet-position-sensitive-context-modeling","title":"PcmNet: Position-Sensitive Context Modeling Network for Temporal Action Localization","date":"2021-03-09","arxiv_id":"2103.05270","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-motion-representation-enhanced","title":"Unsupervised Motion Representation Enhanced Network for Action Recognition","date":"2021-03-05","arxiv_id":"2103.03465","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-is-not-enough-mitigating-the","title":"Attention Is Not Enough: Mitigating the Distribution Discrepancy in Asynchronous Multimodal Sequence Fusion","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cag-qil-context-aware-actionness-grouping-via","title":"CAG-QIL: Context-Aware Actionness Grouping via Q Imitation Learning for Online Temporal Action Localization","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-attentional-audio-visual-fusion-for","title":"Cross-Attentional Audio-Visual Fusion for Weakly-Supervised Action Localization","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"global-self-attention-networks","title":"Global Self-Attention Networks","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-action-sequences-based-on-video","title":"Understanding Action Sequences based on Video Captioning for Learning-from-Observation","date":"2020-12-09","arxiv_id":"2101.05061","repositories_listed":0,"syntology":null},{"url":null,"slug":"t-eva-time-efficient-t-sne-video-annotation","title":"t-EVA: Time-Efficient t-SNE Video Annotation","date":"2020-11-26","arxiv_id":"2011.13202","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-temporal-information-help-with","title":"Can Temporal Information Help with Contrastive Self-Supervised Learning?","date":"2020-11-25","arxiv_id":"2011.13046","repositories_listed":0,"syntology":null},{"url":null,"slug":"cycle-contrast-for-self-supervised-video","title":"Cycle-Contrast for Self-Supervised Video Representation Learning","date":"2020-10-28","arxiv_id":"2010.14810","repositories_listed":0,"syntology":null},{"url":null,"slug":"co-attentional-transformers-for-story-based","title":"Co-attentional Transformers for Story-Based Video Understanding","date":"2020-10-27","arxiv_id":"2010.14104","repositories_listed":0,"syntology":null},{"url":"/paper/egok360-a-360-egocentric-kinetic-human","slug":"egok360-a-360-egocentric-kinetic-human","title":"Egok360: A 360 Egocentric Kinetic Human Activity Video Dataset","date":"2020-10-15","arxiv_id":"2010.08055","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-self-attention-networks-for-image","title":"Global Self-Attention Networks for Image Recognition","date":"2020-10-06","arxiv_id":"2010.03019","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-frames-with-efficient-pseudo-3d-cnn","title":"Residual Frames with Efficient Pseudo-3D CNN for Human Action Recognition","date":"2020-08-03","arxiv_id":"2008.01057","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-motion-representation-via","title":"Self-supervised Motion Representation via Scattering Local Motion Cues","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"detection-and-localization-of-robotic-tools","title":"Detection and Localization of Robotic Tools in Robot-Assisted Surgery Videos Using Deep Neural Networks for Region Proposal and Detection","date":"2020-07-29","arxiv_id":"2008.00936","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-ception-network-towards-multi-scale","title":"Perceptron Synthesis Network: Rethinking the Action Scale Variances in Videos","date":"2020-07-22","arxiv_id":"2007.11460","repositories_listed":0,"syntology":null},{"url":"/paper/movienet-a-holistic-dataset-for-movie","slug":"movienet-a-holistic-dataset-for-movie","title":"MovieNet: A Holistic Dataset for Movie Understanding","date":"2020-07-21","arxiv_id":"2007.10937","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-captions-on-gif-a-large-scale-video","title":"Auto-captions on GIF: A Large-scale Video-sentence Dataset for Vision-language Pre-training","date":"2020-07-05","arxiv_id":"2007.02375","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-understanding-as-machine-translation","title":"Video Understanding as Machine Translation","date":"2020-06-12","arxiv_id":"2006.07203","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-video-representation-learning-via","title":"Large Scale Video Representation Learning via Relational Graph Clustering","date":"2020-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cater-a-diagnostic-dataset-for-compositional-1","title":"CATER: A diagnostic dataset for Compositional Actions & TEmporal Reasoning","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hlvu-a-new-challenge-to-test-deep","title":"HLVU : A New Challenge to Test Deep Understanding of Movies the Way Humans do","date":"2020-05-01","arxiv_id":"2005.00463","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-based-visual-question-answering-in","title":"Knowledge-Based Visual Question Answering in Videos","date":"2020-04-17","arxiv_id":"2004.08385","repositories_listed":0,"syntology":null},{"url":null,"slug":"fair-latency-aware-metric-for-real-time-video","title":"Real-Time Segmentation Networks should be Latency Aware","date":"2020-04-06","arxiv_id":"2004.02574","repositories_listed":0,"syntology":null},{"url":"/paper/context-modulated-dynamic-networks-for-actor","slug":"context-modulated-dynamic-networks-for-actor","title":"Context Modulated Dynamic Networks for Actor and Action Video Segmentation with Language Queries","date":"2020-04-03","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-automated-hand-hygiene-monitoringin","title":"Fully Automated Hand Hygiene Monitoring\\\\in Operating Room using 3D Convolutional Neural Network","date":"2020-03-20","arxiv_id":"2003.09087","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-the-camera-neural-networks-in-world","title":"Beyond the Camera: Neural Networks in World Coordinates","date":"2020-03-12","arxiv_id":"2003.05614","repositories_listed":0,"syntology":null},{"url":null,"slug":"ctm-collaborative-temporal-modeling-for","title":"CTM: Collaborative Temporal Modeling for Action Recognition","date":"2020-02-08","arxiv_id":"2002.03152","repositories_listed":0,"syntology":null},{"url":null,"slug":"cut-based-graph-learning-networks-to-discover","title":"Cut-Based Graph Learning Networks to Discover Compositional Structure of Sequential Video Data","date":"2020-01-17","arxiv_id":"2001.07613","repositories_listed":0,"syntology":null},{"url":null,"slug":"bert-for-large-scale-video-segment","title":"BERT for Large-scale Video Segment Classification with Test-time Augmentation","date":"2019-12-02","arxiv_id":"1912.01127","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapnet-adaptability-decomposing-encoder","title":"AdapNet: Adaptability Decomposing Encoder-Decoder Network for Weakly Supervised Action Recognition and Localization","date":"2019-11-27","arxiv_id":"1911.11961","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-class-relevance-learning-for-temporal","title":"Cross-Class Relevance Learning for Temporal Concept Localization","date":"2019-11-19","arxiv_id":"1911.08548","repositories_listed":0,"syntology":null},{"url":null,"slug":"mimic-the-raw-domain-accelerating-action","title":"Mimic The Raw Domain: Accelerating Action Recognition in the Compressed Domain","date":"2019-11-19","arxiv_id":"1911.08206","repositories_listed":0,"syntology":null},{"url":null,"slug":"comprehensive-video-understanding-video","title":"Comprehensive Video Understanding: Video summarization with content-based video recommender design","date":"2019-10-30","arxiv_id":"1910.13888","repositories_listed":0,"syntology":null},{"url":"/paper/knowit-vqa-answering-knowledge-based","slug":"knowit-vqa-answering-knowledge-based","title":"KnowIT VQA: Answering Knowledge-Based Questions about Videos","date":"2019-10-23","arxiv_id":"1910.10706","repositories_listed":0,"syntology":null},{"url":null,"slug":"afo-tad-anchor-free-one-stage-detector-for","title":"AFO-TAD: Anchor-free One-Stage Detector for Temporal Action Detection","date":"2019-10-18","arxiv_id":"1910.08250","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnitrack-real-time-detection-and-tracking-of","title":"OmniTrack: Real-time detection and tracking of objects, text and logos in video","date":"2019-10-14","arxiv_id":"1910.06017","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-spiking-sequential-model-recurrent-leaky","title":"A SPIKING SEQUENTIAL MODEL: RECURRENT LEAKY INTEGRATE-AND-FIRE","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"question-answering-is-a-format-when-is-it","title":"Question Answering is a Format; When is it Useful?","date":"2019-09-25","arxiv_id":"1909.11291","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-action-recognition-in-videos-a","title":"Zero-Shot Action Recognition in Videos: A Survey","date":"2019-09-13","arxiv_id":"1909.06423","repositories_listed":0,"syntology":null},{"url":null,"slug":"only-time-can-tell-discovering-temporal-data","title":"Only Time Can Tell: Discovering Temporal Data for Temporal Modeling","date":"2019-07-19","arxiv_id":"1907.08340","repositories_listed":0,"syntology":null},{"url":null,"slug":"localizing-unseen-activities-in-video-via","title":"Localizing Unseen Activities in Video via Image Query","date":"2019-06-28","arxiv_id":"1906.12165","repositories_listed":0,"syntology":null},{"url":null,"slug":"unidual-a-unified-model-for-image-and-video","title":"UniDual: A Unified Model for Image and Video Understanding","date":"2019-06-10","arxiv_id":"1906.03857","repositories_listed":0,"syntology":null},{"url":"/paper/190600377","slug":"190600377","title":"Hierarchical Video Frame Sequence Representation with Deep Convolutional Graph Network","date":"2019-06-02","arxiv_id":"1906.00377","repositories_listed":0,"syntology":null},{"url":"/paper/neural-message-passing-on-hybrid-spatio","slug":"neural-message-passing-on-hybrid-spatio","title":"Representation Learning on Visual-Symbolic Graphs for Video Understanding","date":"2019-05-17","arxiv_id":"1905.07385","repositories_listed":0,"syntology":null},{"url":null,"slug":"constructing-hierarchical-qa-datasets-for","title":"Constructing Hierarchical Q&A Datasets for Video Story Understanding","date":"2019-04-01","arxiv_id":"1904.00623","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-dependency-measure-for","title":"Wasserstein Dependency Measure for Representation Learning","date":"2019-03-28","arxiv_id":"1903.11780","repositories_listed":0,"syntology":null},{"url":"/paper/dmc-net-generating-discriminative-motion-cues","slug":"dmc-net-generating-discriminative-motion-cues","title":"DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition","date":"2019-01-11","arxiv_id":"1901.03460","repositories_listed":0,"syntology":null},{"url":null,"slug":"future-semantic-segmentation-of-time-lapsed","title":"Future semantic segmentation of time-lapsed videos with large temporal displacement","date":"2018-12-27","arxiv_id":"1812.10786","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-graph-modules-for-modeling-higher","title":"Dynamic Graph Modules for Modeling Object-Object Interactions in Activity Recognition","date":"2018-12-13","arxiv_id":"1812.05637","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-structured-model-for-action-detection","title":"A Structured Model For Action Detection","date":"2018-12-09","arxiv_id":"1812.03544","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-attempt-towards-interpretable-audio-visual","title":"An Attempt towards Interpretable Audio-Visual Video Captioning","date":"2018-12-07","arxiv_id":"1812.02872","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-make-a-blt-sandwich-learning-to-reason","title":"How to Make a BLT Sandwich? Learning to Reason towards Understanding Web Instructional Videos","date":"2018-12-02","arxiv_id":"1812.00344","repositories_listed":0,"syntology":null},{"url":"/paper/self-supervised-spatiotemporal-feature","slug":"self-supervised-spatiotemporal-feature","title":"Self-Supervised Spatiotemporal Feature Learning via Video Rotation Prediction","date":"2018-11-28","arxiv_id":"1811.11387","repositories_listed":0,"syntology":null},{"url":"/paper/integrated-object-detection-and-tracking-with","slug":"integrated-object-detection-and-tracking-with","title":"Integrated Object Detection and Tracking with Tracklet-Conditioned Detection","date":"2018-11-27","arxiv_id":"1811.11167","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-video-understanding-via-layered","title":"Efficient Video Understanding via Layered Multi Frame-Rate Analysis","date":"2018-11-24","arxiv_id":"1811.09834","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-temporal-skipping-for-multirate-video","title":"Random Temporal Skipping for Multirate Video Analysis","date":"2018-10-30","arxiv_id":"1810.12522","repositories_listed":0,"syntology":null},{"url":null,"slug":"morph-flexible-acceleration-for-3d-cnn-based","title":"Morph: Flexible Acceleration for 3D CNN-based Video Understanding","date":"2018-10-16","arxiv_id":"1810.06807","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-local-netvlad-encoding-for-video","title":"Non-local NetVLAD Encoding for Video Classification","date":"2018-09-29","arxiv_id":"1810.00207","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-video-classification-with-feature","title":"Large-Scale Video Classification with Feature Space Augmentation coupled with Learned Label Relations and Ensembling","date":"2018-09-21","arxiv_id":"1809.07895","repositories_listed":0,"syntology":null},{"url":null,"slug":"label-denoising-with-large-ensembles-of","title":"Label Denoising with Large Ensembles of Heterogeneous Neural Networks","date":"2018-09-12","arxiv_id":"1809.04403","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-joint-semantic-segmentation-of","title":"End-to-End Joint Semantic Segmentation of Actors and Actions in Video","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"teaching-machines-to-understand-baseball","title":"Teaching Machines to Understand Baseball Games: Large-Scale Baseball Video Database for Multiple Video Understanding Tasks","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"ba34f6ec06d4691c7cf7cbde1b959e4382dbbe23f7ac07bb608346f71a204c2e","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}