{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/video-understanding/papers/10","list_of":"/task/video-understanding","task":"Video Understanding","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":10,"pages_in_order":12,"rows_per_page":100,"rows":[901,1000],"of":1149,"counts":{"archive_papers_tagged":1149,"with_a_code_link":542,"where_syntology_ran_a_sample":218,"not_listed_spam_title":0,"listed":1149,"listed_where_code_ran":218,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":182,"every_run_a_failure_of_syntologys_instrument":36,"listed_with_a_run_with_no_instrument_failure":182,"listed_every_run_a_failure_of_syntologys_instrument":36,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/video-understanding","prev":"/task/video-understanding/papers/9","next":"/task/video-understanding/papers/11","papers":[{"url":null,"slug":"ucf-crime-annotation-a-benchmark-for","title":"Towards Surveillance Video-and-Language Understanding: New Dataset, Baselines, and Challenges","date":"2023-09-25","arxiv_id":"2309.13925","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-kernel-temporal-segmentation-as-an","title":"Revisiting Kernel Temporal Segmentation as an Adaptive Tokenizer for Long-form Video Understanding","date":"2023-09-20","arxiv_id":"2309.11569","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-as-the-medium-multimodal-video","title":"Language as the Medium: Multimodal Video Classification through text only","date":"2023-09-19","arxiv_id":"2309.10783","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamic-mri-reconstruction-with","title":"Learning Dynamic MRI Reconstruction with Convolutional Network Assisted Reconstruction Swin Transformer","date":"2023-09-19","arxiv_id":"2309.10227","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-guided-masking-for-spatiotemporal","title":"Motion-Guided Masking for Spatiotemporal Representation Learning","date":"2023-08-24","arxiv_id":"2308.12962","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-visual-glance-network-for-efficient","title":"Audio-Visual Glance Network for Efficient Video Recognition","date":"2023-08-18","arxiv_id":"2308.09322","repositories_listed":0,"syntology":null},{"url":null,"slug":"m-3-net-multi-view-encoding-matching-and","title":"M$^3$Net: Multi-view Encoding, Matching, and Fusion for Few-shot Fine-grained Action Recognition","date":"2023-08-06","arxiv_id":"2308.03063","repositories_listed":0,"syntology":null},{"url":null,"slug":"dpmix-mixture-of-depth-and-point-cloud-video","title":"DPMix: Mixture of Depth and Point Cloud Video Experts for 4D Action Segmentation","date":"2023-07-31","arxiv_id":"2307.16803","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-space-time-semantic-correspondences","title":"Learning Space-Time Semantic Correspondences","date":"2023-06-16","arxiv_id":"2306.10208","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-fine-grained-view-invariant","title":"Learning Fine-grained View-Invariant Representations from Unpaired Ego-Exo Videos via Temporal Alignment","date":"2023-06-08","arxiv_id":"2306.05526","repositories_listed":0,"syntology":null},{"url":null,"slug":"moviepuzzle-visual-narrative-reasoning","title":"MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning","date":"2023-06-04","arxiv_id":"2306.02252","repositories_listed":0,"syntology":null},{"url":"/paper/action-sensitivity-learning-for-temporal","slug":"action-sensitivity-learning-for-temporal","title":"Action Sensitivity Learning for Temporal Action Localization","date":"2023-05-25","arxiv_id":"2305.15701","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-higher-order-object-interactions-for","title":"Learning Higher-order Object Interactions for Keypoint-based Video Understanding","date":"2023-05-16","arxiv_id":"2305.09539","repositories_listed":0,"syntology":null},{"url":null,"slug":"vehicle-detection-and-classification-without","title":"Vehicle Detection and Classification without Residual Calculation: Accelerating HEVC Image Decoding with Random Perturbation Injection","date":"2023-05-14","arxiv_id":"2305.08265","repositories_listed":0,"syntology":null},{"url":null,"slug":"chatvideo-a-tracklet-centric-multimodal-and","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","date":"2023-04-27","arxiv_id":"2304.14407","repositories_listed":0,"syntology":null},{"url":null,"slug":"mrsn-multi-relation-support-network-for-video","title":"MRSN: Multi-Relation Support Network for Video Action Detection","date":"2023-04-24","arxiv_id":"2304.11975","repositories_listed":0,"syntology":null},{"url":null,"slug":"search-map-search-a-frame-selection-paradigm","title":"Search-Map-Search: A Frame Selection Paradigm for Action Recognition","date":"2023-04-20","arxiv_id":"2304.10316","repositories_listed":0,"syntology":null},{"url":null,"slug":"laser-neuro-symbolic-learning-of-semantic","title":"LASER: A Neuro-Symbolic Framework for Learning Spatial-Temporal Scene Graphs with Weak Supervision","date":"2023-04-15","arxiv_id":"2304.07647","repositories_listed":0,"syntology":null},{"url":null,"slug":"therbligs-in-action-video-understanding","title":"Therbligs in Action: Video Understanding through Motion Primitives","date":"2023-04-06","arxiv_id":"2304.03631","repositories_listed":0,"syntology":null},{"url":null,"slug":"doad-decoupled-one-stage-action-detection","title":"DOAD: Decoupled One Stage Action Detection Network","date":"2023-04-01","arxiv_id":"2304.00254","repositories_listed":0,"syntology":null},{"url":null,"slug":"svt-supertoken-video-transformer-for","title":"SVT: Supertoken Video Transformer for Efficient Video Understanding","date":"2023-04-01","arxiv_id":"2304.00325","repositories_listed":0,"syntology":null},{"url":null,"slug":"system-status-aware-adaptive-network-for","title":"System-status-aware Adaptive Network for Online Streaming Video Understanding","date":"2023-03-28","arxiv_id":"2303.15742","repositories_listed":0,"syntology":null},{"url":"/paper/selective-structured-state-spaces-for-long","slug":"selective-structured-state-spaces-for-long","title":"Selective Structured State-Spaces for Long-Form Video Understanding","date":"2023-03-25","arxiv_id":"2303.14526","repositories_listed":0,"syntology":null},{"url":null,"slug":"video4mri-an-empirical-study-on-brain","title":"Video4MRI: An Empirical Study on Brain Magnetic Resonance Image Analytics with CNN-based Video Classification Frameworks","date":"2023-02-24","arxiv_id":"2302.12688","repositories_listed":0,"syntology":null},{"url":"/paper/semi-parametric-video-grounded-text","slug":"semi-parametric-video-grounded-text","title":"Semi-Parametric Video-Grounded Text Generation","date":"2023-01-27","arxiv_id":"2301.11507","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-scalable-video-understanding","title":"Building Scalable Video Understanding Benchmarks through Sports","date":"2023-01-17","arxiv_id":"2301.06866","repositories_listed":0,"syntology":null},{"url":null,"slug":"stprivacy-spatio-temporal-tubelet","title":"STPrivacy: Spatio-Temporal Privacy-Preserving Action Recognition","date":"2023-01-08","arxiv_id":"2301.03046","repositories_listed":0,"syntology":null},{"url":null,"slug":"egodistill-egocentric-head-motion","title":"EgoDistill: Egocentric Head Motion Distillation for Efficient Video Understanding","date":"2023-01-05","arxiv_id":"2301.02217","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-compositional-learning-for-weakly","title":"Inverse Compositional Learning for Weakly-supervised Relation Grounding","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-high-order-relation-transformer","title":"Multimodal High-order Relation Transformer for Scene Boundary Detection","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/pidro-parallel-isomeric-attention-with","slug":"pidro-parallel-isomeric-attention-with","title":"PIDRo: Parallel Isomeric Attention with Dynamic Routing for Text-Video Retrieval","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"relational-space-time-query-in-long-form","title":"Relational Space-Time Query in Long-Form Videos","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-object-detection-from","title":"Self-Supervised Object Detection from Egocentric Videos","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uniformerv2-unlocking-the-potential-of-image","title":"UniFormerV2: Unlocking the Potential of Image ViTs for Video Understanding","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-engagement-classification-using-video","title":"Joint Engagement Classification using Video Augmentation Techniques for Multi-person Human-robot Interaction","date":"2022-12-28","arxiv_id":"2212.14128","repositories_listed":0,"syntology":null},{"url":null,"slug":"inductive-attention-for-video-action","title":"Inductive Attention for Video Action Anticipation","date":"2022-12-17","arxiv_id":"2212.08830","repositories_listed":0,"syntology":null},{"url":null,"slug":"egocentric-video-task-translation","title":"Egocentric Video Task Translation","date":"2022-12-13","arxiv_id":"2212.06301","repositories_listed":0,"syntology":null},{"url":null,"slug":"promptonomyvit-multi-task-prompt-learning","title":"PromptonomyViT: Multi-Task Prompt Learning Improves Video Transformers using Synthetic Scene Data","date":"2022-12-08","arxiv_id":"2212.04821","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatio-temporal-crop-aggregation-for-video","title":"Spatio-Temporal Crop Aggregation for Video Representation Learning","date":"2022-11-30","arxiv_id":"2211.17042","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-appearance-a-video-representation-for","title":"Dynamic Appearance: A Video Representation for Action Recognition with Joint Training","date":"2022-11-23","arxiv_id":"2211.12748","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-model-for-video-understanding-and","title":"A Unified Model for Video Understanding and Knowledge Embedding with Heterogeneous Knowledge Graph Dataset","date":"2022-11-19","arxiv_id":"2211.10624","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-state-change-capture-of","title":"Exploring State Change Capture of Heterogeneous Backbones @ Ego4D Hands and Objects Challenge 2022","date":"2022-11-16","arxiv_id":"2211.08728","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounded-video-situation-recognition","title":"Grounded Video Situation Recognition","date":"2022-10-19","arxiv_id":"2210.10828","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-video-pretraining-yields","title":"Self-supervised video pretraining yields robust and more human-aligned visual representations","date":"2022-10-12","arxiv_id":"2210.06433","repositories_listed":0,"syntology":null},{"url":null,"slug":"students-taught-by-multimodal-teachers-are","title":"Students taught by multimodal teachers are superior action recognizers","date":"2022-10-09","arxiv_id":"2210.04331","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressed-vision-for-efficient-video","title":"Compressed Vision for Efficient Video Understanding","date":"2022-10-06","arxiv_id":"2210.02995","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-the-wild-video-question-answering","title":"In-the-Wild Video Question Answering","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-focus-on-the-foreground-for","title":"Learning to Focus on the Foreground for Temporal Sentence Grounding","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"speeding-up-action-recognition-using-dynamic","title":"Speeding Up Action Recognition Using Dynamic Accumulation of Residuals in Compressed Domain","date":"2022-09-29","arxiv_id":"2209.14757","repositories_listed":0,"syntology":null},{"url":"/paper/avt-audio-video-transformer-for-multimodal","slug":"avt-audio-video-transformer-for-multimodal","title":"AVT: Audio-Video Transformer for Multimodal Action Recognition","date":"2022-09-22","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/wildqa-in-the-wild-video-question-answering","slug":"wildqa-in-the-wild-video-question-answering","title":"WildQA: In-the-Wild Video Question Answering","date":"2022-09-14","arxiv_id":"2209.06650","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundations-and-recent-trends-in-multimodal","title":"Foundations and Trends in Multimodal Machine Learning: Principles, Challenges, and Open Questions","date":"2022-09-07","arxiv_id":"2209.03430","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-subtitle-feature-enhanced-video","title":"Visual Subtitle Feature Enhanced Video Outline Generation","date":"2022-08-24","arxiv_id":"2208.11307","repositories_listed":0,"syntology":null},{"url":null,"slug":"identifying-auxiliary-or-adversarial-tasks","title":"Identifying Auxiliary or Adversarial Tasks Using Necessary Condition Analysis for Adversarial Multi-task Video Understanding","date":"2022-08-22","arxiv_id":"2208.10077","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-sensitive-contrastive-learning-for","title":"Motion Sensitive Contrastive Learning for Self-supervised Video Representation","date":"2022-08-12","arxiv_id":"2208.06105","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-anchor-based-detection-for-ego4d","title":"Exploring Anchor-based Detection for Ego4D Natural Language Query","date":"2022-08-10","arxiv_id":"2208.05375","repositories_listed":0,"syntology":null},{"url":null,"slug":"sa-net-v2-real-time-vehicle-detection-from","title":"SA-NET.v2: Real-time vehicle detection from oblique UAV images with use of uncertainty estimation in deep meta-learning","date":"2022-08-04","arxiv_id":"2208.04190","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stream-transformer-architecture-for-long","title":"Two-Stream Transformer Architecture for Long Video Understanding","date":"2022-08-02","arxiv_id":"2208.01753","repositories_listed":0,"syntology":null},{"url":"/paper/batman-bilateral-attention-transformer-in","slug":"batman-bilateral-attention-transformer-in","title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","date":"2022-08-01","arxiv_id":"2208.01159","repositories_listed":0,"syntology":null},{"url":null,"slug":"egocentric-scene-context-for-human-centric","title":"EgoEnv: Human-centric environment representations from egocentric video","date":"2022-07-22","arxiv_id":"2207.11365","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-swin-transformers-for-egocentric-video","title":"Video Swin Transformers for Egocentric Video Understanding @ Ego4D Challenges 2022","date":"2022-07-22","arxiv_id":"2207.11329","repositories_listed":0,"syntology":null},{"url":"/paper/ae-net-adjoint-enhancement-network-for","slug":"ae-net-adjoint-enhancement-network-for","title":"AE-Net:Adjoint Enhancement Network for Efficient Action Recognition in Video Understanding","date":"2022-07-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-efficient-spatio-temporal-pyramid","title":"An Efficient Spatio-Temporal Pyramid Transformer for Action Detection","date":"2022-07-21","arxiv_id":"2207.10448","repositories_listed":0,"syntology":null},{"url":null,"slug":"svgraph-learning-semantic-graphs-from","title":"SVGraph: Learning Semantic Graphs from Instructional Videos","date":"2022-07-16","arxiv_id":"2207.08001","repositories_listed":0,"syntology":null},{"url":null,"slug":"graphvid-it-only-takes-a-few-nodes-to","title":"GraphVid: It Only Takes a Few Nodes to Understand a Video","date":"2022-07-04","arxiv_id":"2207.01375","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-multistep-reasoning-based-on-video","title":"Dynamic Multistep Reasoning based on Video Scene Graph for Video Question Answering","date":"2022-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-intent-discovery-from-livestream","title":"Multimodal Intent Discovery from Livestream Videos","date":"2022-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"submission-to-generic-event-boundary","title":"Submission to Generic Event Boundary Detection Challenge@CVPR 2022: Local Context Modeling and Global Boundary Decoding Approach","date":"2022-06-30","arxiv_id":"2206.15268","repositories_listed":0,"syntology":null},{"url":null,"slug":"bringing-image-scene-structure-to-video-via","title":"Bringing Image Scene Structure to Video via Frame-Clip Consistency of Object Tokens","date":"2022-06-13","arxiv_id":"2206.06346","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-annotation-and-learning-for-3d-hand","title":"Efficient Annotation and Learning for 3D Hand Pose Estimation: A Survey","date":"2022-06-05","arxiv_id":"2206.02257","repositories_listed":0,"syntology":null},{"url":null,"slug":"development-of-a-multimodal-annotation","title":"Development of a MultiModal Annotation Framework and Dataset for Deep Video Understanding","date":"2022-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"i-code-an-integrative-and-composable","title":"i-Code: An Integrative and Composable Multimodal Learning Framework","date":"2022-05-03","arxiv_id":"2205.01818","repositories_listed":0,"syntology":null},{"url":null,"slug":"overview-of-the-medvidqa-2022-shared-task-on","title":"Overview of the MedVidQA 2022 Shared Task on Medical Video Question-Answering","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-reasoning-with-spatial-temporal","title":"Causal Reasoning Meets Visual Representation Learning: A Prospective Study","date":"2022-04-26","arxiv_id":"2204.12037","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-language-action-pre-training-for","title":"Contrastive Language-Action Pre-training for Temporal Localization","date":"2022-04-26","arxiv_id":"2204.12293","repositories_listed":0,"syntology":null},{"url":null,"slug":"revealing-occlusions-with-4d-neural-fields","title":"Revealing Occlusions with 4D Neural Fields","date":"2022-04-22","arxiv_id":"2204.10916","repositories_listed":0,"syntology":null},{"url":null,"slug":"actar-actor-driven-pose-embeddings-for-video","title":"ActAR: Actor-Driven Pose Embeddings for Video Action Recognition","date":"2022-04-19","arxiv_id":"2204.08671","repositories_listed":0,"syntology":null},{"url":null,"slug":"less-than-few-self-shot-video-instance","title":"Less than Few: Self-Shot Video Instance Segmentation","date":"2022-04-19","arxiv_id":"2204.08874","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-machine-learning-attacks-against","title":"Adversarial Machine Learning Attacks Against Video Anomaly Detection Systems","date":"2022-04-07","arxiv_id":"2204.03141","repositories_listed":0,"syntology":null},{"url":null,"slug":"seal-a-large-scale-video-dataset-of-multi","title":"MM-SEAL: A Large-scale Video Dataset of Multi-person Multi-grained Spatio-temporally Action Localization","date":"2022-04-06","arxiv_id":"2204.02688","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-human-gaze-for-surgical-activity","title":"Human Gaze Guided Attention for Surgical Activity Recognition","date":"2022-03-09","arxiv_id":"2203.04752","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-scale-self-contrastive-learning-with","title":"Multi-Scale Self-Contrastive Learning with Hard Negative Mining for Weakly-Supervised Query-based Video Grounding","date":"2022-03-08","arxiv_id":"2203.03838","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-perceiver-a-general-architecture-for","title":"Temporal Perceiver: A General Architecture for Arbitrary Boundary Detection","date":"2022-03-01","arxiv_id":"2203.00307","repositories_listed":0,"syntology":null},{"url":null,"slug":"concept-graph-neural-networks-for-surgical","title":"Concept Graph Neural Networks for Surgical Video Understanding","date":"2022-02-27","arxiv_id":"2202.13402","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-visual-scene-aware-dialog-generation","title":"Audio Visual Scene-Aware Dialog Generation with Transformer-based Video Representations","date":"2022-02-21","arxiv_id":"2202.09979","repositories_listed":0,"syntology":null},{"url":"/paper/end-to-end-generative-pretraining-for","slug":"end-to-end-generative-pretraining-for","title":"End-to-end Generative Pretraining for Multimodal Video Captioning","date":"2022-01-20","arxiv_id":"2201.08264","repositories_listed":0,"syntology":null},{"url":"/paper/merlot-reserve-neural-script-knowledge","slug":"merlot-reserve-neural-script-knowledge","title":"MERLOT Reserve: Neural Script Knowledge through Vision and Language and Sound","date":"2022-01-07","arxiv_id":"2201.02639","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-guided-semantic-learning-network-for","title":"Memory-Guided Semantic Learning Network for Temporal Sentence Grounding","date":"2022-01-03","arxiv_id":"2201.00454","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-video-model-transfer-with-dynamic","title":"Improving Video Model Transfer With Dynamic Representation Learning","date":"2022-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"recurring-the-transformer-for-video-action","title":"Recurring the Transformer for Video Action Recognition","date":"2022-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uboco-unsupervised-boundary-contrastive-1","title":"UBoCo: Unsupervised Boundary Contrastive Learning for Generic Event Boundary Detection","date":"2022-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vrdformer-end-to-end-video-visual-relation","title":"VRDFormer: End-to-End Video Visual Relation Detection With Transformers","date":"2022-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"youmvos-an-actor-centric-multi-shot-video","title":"YouMVOS: An Actor-Centric Multi-Shot Video Object Segmentation Dataset","date":"2022-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-neural-representations-for","title":"Discrete neural representations for explainable anomaly detection","date":"2021-12-10","arxiv_id":"2112.05585","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-x3d-ultra-efficient-video-understanding","title":"Auto-X3D: Ultra-Efficient Video Understanding via Finer-Grained Neural Architecture Search","date":"2021-12-09","arxiv_id":"2112.04710","repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-temporal-attention-improving-first","title":"Stacked Temporal Attention: Improving First-person Action Recognition by Emphasizing Discriminative Clips","date":"2021-12-02","arxiv_id":"2112.01038","repositories_listed":0,"syntology":null},{"url":null,"slug":"livlr-a-lightweight-visual-linguistic","title":"LiVLR: A Lightweight Visual-Linguistic Reasoning Framework for Video Question Answering","date":"2021-11-29","arxiv_id":"2111.14547","repositories_listed":0,"syntology":null},{"url":null,"slug":"uboco-unsupervised-boundary-contrastive","title":"UBoCo : Unsupervised Boundary Contrastive Learning for Generic Event Boundary Detection","date":"2021-11-29","arxiv_id":"2111.14799","repositories_listed":0,"syntology":null},{"url":null,"slug":"fill-in-the-blank-a-challenging-video","title":"Fill-in-the-Blank: A Challenging Video Understanding Evaluation Framework","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"occluded-video-instance-segmentation-dataset","title":"Occluded Video Instance Segmentation: Dataset and ICCV 2021 Challenge","date":"2021-11-15","arxiv_id":"2111.07950","repositories_listed":0,"syntology":null}],"record_sha256":"6ffb3090bf02f02f91dca929afd476c8b7fea59bf9ab7abccad386644da6a316","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}