{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/video-classification/papers/3","list_of":"/task/video-classification","task":"Video Classification","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":5,"rows_per_page":100,"rows":[201,300],"of":455,"counts":{"archive_papers_tagged":455,"with_a_code_link":206,"where_syntology_ran_a_sample":50,"not_listed_spam_title":0,"listed":455,"listed_where_code_ran":50,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":40,"every_run_a_failure_of_syntologys_instrument":10,"listed_with_a_run_with_no_instrument_failure":40,"listed_every_run_a_failure_of_syntologys_instrument":10,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/video-classification","prev":"/task/video-classification/papers/2","next":"/task/video-classification/papers/4","papers":[{"url":"/paper/untrimmed-video-classification-for-activity","slug":"untrimmed-video-classification-for-activity","title":"Untrimmed Video Classification for Activity Detection: submission to ActivityNet Challenge","date":"2016-07-07","arxiv_id":"1607.01979","repositories_listed":1,"syntology":null},{"url":"/paper/beyond-temporal-pooling-recurrence-and","slug":"beyond-temporal-pooling-recurrence-and","title":"Beyond Temporal Pooling: Recurrence and Temporal Convolutions for Gesture Recognition in Video","date":"2015-06-05","arxiv_id":"1506.01911","repositories_listed":1,"syntology":null},{"url":"/paper/activitynet-a-large-scale-video-benchmark-for","slug":"activitynet-a-large-scale-video-benchmark-for","title":"ActivityNet: A Large-Scale Video Benchmark for Human Activity Understanding","date":"2015-06-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/modeling-spatial-temporal-clues-in-a-hybrid","slug":"modeling-spatial-temporal-clues-in-a-hybrid","title":"Modeling Spatial-Temporal Clues in a Hybrid Deep Learning Framework for Video Classification","date":"2015-04-07","arxiv_id":"1504.01561","repositories_listed":1,"syntology":null},{"url":"/paper/beyond-short-snippets-deep-networks-for-video","slug":"beyond-short-snippets-deep-networks-for-video","title":"Beyond Short Snippets: Deep Networks for Video Classification","date":"2015-03-31","arxiv_id":"1503.08909","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/beyond-short-snippets-deep-networks-for-video#ran","syntology_url":"https://syntology.ai/paper/1503.08909","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1503.08909"}},"official":null}},{"url":"/paper/large-scale-video-classification-with-1","slug":"large-scale-video-classification-with-1","title":"Large-Scale Video Classification with Convolutional Neural Networks","date":"2014-06-23","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":null,"slug":"exploring-audio-cues-for-enhanced-test-time","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","date":"2025-06-14","arxiv_id":"2506.12481","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatiotemporal-analysis-of-forest-machine","title":"Spatiotemporal Analysis of Forest Machine Operations Using 3D Video Classification","date":"2025-05-30","arxiv_id":"2505.24375","repositories_listed":0,"syntology":null},{"url":null,"slug":"tenad-a-tensor-based-low-rank-black-box","title":"TenAd: A Tensor-based Low-rank Black Box Adversarial Attack for Video Classification","date":"2025-04-01","arxiv_id":"2504.01228","repositories_listed":0,"syntology":null},{"url":null,"slug":"unbiasing-through-textual-descriptions","title":"Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks","date":"2025-03-24","arxiv_id":"2503.18637","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatiotemporal-learning-with-context-aware","title":"Spatiotemporal Learning with Context-aware Video Tubelets for Ultrasound Video Analysis","date":"2025-03-21","arxiv_id":"2503.17475","repositories_listed":0,"syntology":null},{"url":null,"slug":"accurate-and-efficient-two-stage-gun","title":"Accurate and Efficient Two-Stage Gun Detection in Video","date":"2025-03-08","arxiv_id":"2503.06317","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-meta-learning-for-automl-in-real-time","title":"Online Meta-learning for AutoML in Real-time (OnMAR)","date":"2025-02-27","arxiv_id":"2502.20279","repositories_listed":0,"syntology":null},{"url":null,"slug":"variable-frame-cnnlstm-for-breast-nodule","title":"Variable-frame CNNLSTM for Breast Nodule Classification using Ultrasound Videos","date":"2025-02-17","arxiv_id":"2502.11481","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-gpt-for-video-understanding-zero","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","date":"2025-02-13","arxiv_id":"2502.09573","repositories_listed":0,"syntology":null},{"url":null,"slug":"document-level-sentiment-analysis-of-urdu","title":"Document-Level Sentiment Analysis of Urdu Text Using Deep Learning Techniques","date":"2025-01-23","arxiv_id":"2501.17175","repositories_listed":0,"syntology":null},{"url":null,"slug":"genvidbench-a-challenging-benchmark-for","title":"GenVidBench: A Challenging Benchmark for Detecting AI-Generated Video","date":"2025-01-20","arxiv_id":"2501.11340","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-zero-shot-explainable-video","title":"Towards Zero-Shot & Explainable Video Description by Reasoning over Graphs of Events in Space and Time","date":"2025-01-14","arxiv_id":"2501.08460","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-of-autoregressive-pre","title":"An Empirical Study of Autoregressive Pre-training from Videos","date":"2025-01-09","arxiv_id":"2501.05453","repositories_listed":0,"syntology":null},{"url":null,"slug":"cm3t-framework-for-efficient-multimodal","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","date":"2025-01-06","arxiv_id":"2501.03332","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-video-feature-extraction-for","title":"Multi-Modal Video Feature Extraction for Popularity Prediction","date":"2025-01-02","arxiv_id":"2501.01422","repositories_listed":0,"syntology":null},{"url":null,"slug":"adacm-2-on-understanding-extremely-long-term-1","title":"AdaCM^2: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"discrepancy-aware-attention-network-for","title":"Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning","date":"2024-12-16","arxiv_id":"2412.11715","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-detection-of-mixed-critical","title":"Context-Aware Detection of Mixed Critical Events using Video Classification","date":"2024-11-24","arxiv_id":"2411.15773","repositories_listed":0,"syntology":null},{"url":null,"slug":"adacm-2-on-understanding-extremely-long-term","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","date":"2024-11-19","arxiv_id":"2411.12593","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-audio-visual-fusion-for-video","title":"Efficient Audio-Visual Fusion for Video Classification","date":"2024-11-08","arxiv_id":"2411.05603","repositories_listed":0,"syntology":null},{"url":"/paper/am-flow-adapters-for-temporal-processing-in","slug":"am-flow-adapters-for-temporal-processing-in","title":"AM Flow: Adapters for Temporal Processing in Action Recognition","date":"2024-11-04","arxiv_id":"2411.02065","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-violence-detection-in-video","title":"Optimizing Violence Detection in Video Classification Accuracy through 3D Convolutional Neural Networks","date":"2024-11-02","arxiv_id":"2411.01348","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-token-merging-for-long-form-video","title":"Video Token Merging for Long-form Video Understanding","date":"2024-10-31","arxiv_id":"2410.23782","repositories_listed":0,"syntology":null},{"url":null,"slug":"cpfd-confidence-aware-privileged-feature","title":"CPFD: Confidence-aware Privileged Feature Distillation for Short Video Classification","date":"2024-10-03","arxiv_id":"2410.03038","repositories_listed":0,"syntology":null},{"url":null,"slug":"tikguard-a-deep-learning-transformer-based","title":"TikGuard: A Deep Learning Transformer-Based Solution for Detecting Unsuitable TikTok Content for Kids","date":"2024-10-01","arxiv_id":"2410.00403","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-edge-ai-platforms-for-high","title":"Benchmarking Edge AI Platforms for High-Performance ML Inference","date":"2024-09-23","arxiv_id":"2409.14803","repositories_listed":0,"syntology":null},{"url":null,"slug":"attend-fusion-efficient-audio-visual-fusion","title":"Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification","date":"2024-08-26","arxiv_id":"2408.14441","repositories_listed":0,"syntology":null},{"url":null,"slug":"query-efficient-video-adversarial-attack-with","title":"Query-Efficient Video Adversarial Attack with Stylized Logo","date":"2024-08-22","arxiv_id":"2408.12099","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniforensics-face-forgery-detection-via","title":"UniForensics: Face Forgery Detection via General Facial Representation","date":"2024-07-26","arxiv_id":"2407.19079","repositories_listed":0,"syntology":null},{"url":null,"slug":"lookupvit-compressing-visual-information-to-a","title":"LookupViT: Compressing visual information to a limited number of tokens","date":"2024-07-17","arxiv_id":"2407.12753","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-natural-consistency-representation","title":"Learning Natural Consistency Representation for Face Forgery Video Detection","date":"2024-07-15","arxiv_id":"2407.10550","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-vocabulary-multi-label-video","title":"Open Vocabulary Multi-Label Video Classification","date":"2024-07-12","arxiv_id":"2407.09073","repositories_listed":0,"syntology":null},{"url":null,"slug":"pudd-towards-robust-multi-modal-prototype","title":"PUDD: Towards Robust Multi-modal Prototype-based Deepfake Detection","date":"2024-06-22","arxiv_id":"2406.15921","repositories_listed":0,"syntology":null},{"url":null,"slug":"pravic-probabilistic-adaptation-framework-for","title":"PrAViC: Probabilistic Adaptation Framework for Real-Time Video Classification","date":"2024-06-17","arxiv_id":"2406.11443","repositories_listed":0,"syntology":null},{"url":null,"slug":"dl-kdd-dual-light-knowledge-distillation-for","title":"DL-KDD: Dual-Light Knowledge Distillation for Action Recognition in the Dark","date":"2024-06-04","arxiv_id":"2406.02468","repositories_listed":0,"syntology":null},{"url":null,"slug":"toxvidllm-a-multimodal-llm-based-framework","title":"ToxVidLM: A Multimodal Framework for Toxicity Detection in Code-Mixed Videos","date":"2024-05-31","arxiv_id":"2405.20628","repositories_listed":0,"syntology":null},{"url":"/paper/learning-correlation-structures-for-vision","slug":"learning-correlation-structures-for-vision","title":"Learning Correlation Structures for Vision Transformers","date":"2024-04-05","arxiv_id":"2404.03924","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustness-and-visual-explanation-for-black","title":"Robustness and Visual Explanation for Black Box Image, Video, and ECG Signal Classification with Reinforcement Learning","date":"2024-03-27","arxiv_id":"2403.18985","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-compressed-frame-sizes-for-ultra","title":"Leveraging Compressed Frame Sizes For Ultra-Fast Video Classification","date":"2024-03-13","arxiv_id":"2403.08580","repositories_listed":0,"syntology":null},{"url":null,"slug":"pig-aggression-classification-using-cnn","title":"Pig aggression classification using CNN, Transformers and Recurrent Networks","date":"2024-03-13","arxiv_id":"2403.08528","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-expressive-and-generalizable-motion","title":"Learning Expressive And Generalizable Motion Features For Face Forgery Detection","date":"2024-03-08","arxiv_id":"2403.05172","repositories_listed":0,"syntology":null},{"url":"/paper/time-memory-and-parameter-efficient-visual","slug":"time-memory-and-parameter-efficient-visual","title":"Time-, Memory- and Parameter-Efficient Visual Adaptation","date":"2024-02-05","arxiv_id":"2402.02887","repositories_listed":0,"syntology":{"n":2,"n_ran":2,"n_constructed":1,"n_ran_checked":1,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"2 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/time-memory-and-parameter-efficient-visual#ran","syntology_url":"https://syntology.ai/paper/2402.02887","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2402.02887"}},"official":null}},{"url":null,"slug":"short-form-videos-and-mental-health-a","title":"Short-Form Videos and Mental Health: A Knowledge-Guided Neural Topic Model","date":"2024-01-11","arxiv_id":"2402.10045","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-multiscale-multimodal-bottleneck","title":"Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification","date":"2024-01-08","arxiv_id":"2401.04023","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-selective-audio-masked-multimodal","title":"Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification","date":"2024-01-08","arxiv_id":"2401.04154","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-memory-and-parameter-efficient-visual-1","title":"Time- Memory- and Parameter-Efficient Visual Adaptation","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-impact-on-identifying","title":"Neural architecture impact on identifying temporally extended Reinforcement Learning tasks","date":"2023-10-04","arxiv_id":"2310.03161","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-kernel-temporal-segmentation-as-an","title":"Revisiting Kernel Temporal Segmentation as an Adaptive Tokenizer for Long-form Video Understanding","date":"2023-09-20","arxiv_id":"2309.11569","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-as-the-medium-multimodal-video","title":"Language as the Medium: Multimodal Video Classification through text only","date":"2023-09-19","arxiv_id":"2309.10783","repositories_listed":0,"syntology":null},{"url":null,"slug":"av-maskenhancer-enhancing-video","title":"AV-MaskEnhancer: Enhancing Video Representations through Audio-Visual Masked Autoencoder","date":"2023-09-15","arxiv_id":"2309.08738","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-staged-knowledge-distillation-in-video","title":"The Staged Knowledge Distillation in Video Classification: Harmonizing Student Progress by a Complementary Weakly Supervised Framework","date":"2023-07-11","arxiv_id":"2307.05201","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-for-video-classification-with","title":"Active Learning for Video Classification with Frame Level Queries","date":"2023-07-10","arxiv_id":"2307.05587","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-breast-ultrasound-video","title":"Boosting Breast Ultrasound Video Classification by the Guidance of Keyframe Feature Centers","date":"2023-06-12","arxiv_id":"2306.06877","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-label-video-classification-for","title":"Multi-label Video Classification for Underwater Ship Inspection","date":"2023-05-27","arxiv_id":"2305.17338","repositories_listed":0,"syntology":null},{"url":"/paper/alternating-gradient-descent-and-mixture-of","slug":"alternating-gradient-descent-and-mixture-of","title":"Alternating Gradient Descent and Mixture-of-Experts for Integrated Multimodal Perception","date":"2023-05-10","arxiv_id":"2305.06324","repositories_listed":0,"syntology":null},{"url":null,"slug":"netflick-adversarial-flickering-attacks-on","title":"NetFlick: Adversarial Flickering Attacks on Deep Learning Based Video Compression","date":"2023-04-04","arxiv_id":"2304.01441","repositories_listed":0,"syntology":null},{"url":"/paper/unified-keypoint-based-action-recognition","slug":"unified-keypoint-based-action-recognition","title":"Unified Keypoint-based Action Recognition Framework via Structured Keypoint Pooling","date":"2023-03-27","arxiv_id":"2303.15270","repositories_listed":0,"syntology":null},{"url":"/paper/selective-structured-state-spaces-for-long","slug":"selective-structured-state-spaces-for-long","title":"Selective Structured State-Spaces for Long-Form Video Understanding","date":"2023-03-25","arxiv_id":"2303.14526","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-coherent-test-time-optimization-for","title":"Temporal Coherent Test-Time Optimization for Robust Video Classification","date":"2023-02-28","arxiv_id":"2302.14309","repositories_listed":0,"syntology":null},{"url":null,"slug":"video4mri-an-empirical-study-on-brain","title":"Video4MRI: An Empirical Study on Brain Magnetic Resonance Image Analytics with CNN-based Video Classification Frameworks","date":"2023-02-24","arxiv_id":"2302.12688","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-real-time-hostile-activitiy","title":"Analysis of Real-Time Hostile Activitiy Detection from Spatiotemporal Features Using Time Distributed Deep CNNs, RNNs and Attention-Based Mechanisms","date":"2023-02-21","arxiv_id":"2302.11027","repositories_listed":0,"syntology":null},{"url":"/paper/class-prototypes-based-contrastive-learning","slug":"class-prototypes-based-contrastive-learning","title":"Class Prototypes Based Contrastive Learning for Classifying Multi-Label and Fine-Grained Educational Videos","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-video-classification-via","title":"Few-Shot Video Classification via Representation Fusion and Promotion Learning","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"truncate-split-contrast-a-framework-for","title":"Truncate-Split-Contrast: A Framework for Learning from Mislabeled Videos","date":"2022-12-27","arxiv_id":"2212.13495","repositories_listed":0,"syntology":null},{"url":"/paper/video-text-modeling-with-zero-shot-transfer","slug":"video-text-modeling-with-zero-shot-transfer","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","date":"2022-12-09","arxiv_id":"2212.04979","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-unsupervised-key-frame-extraction-for","title":"Deep Unsupervised Key Frame Extraction for Efficient Video Classification","date":"2022-11-12","arxiv_id":"2211.06742","repositories_listed":0,"syntology":null},{"url":null,"slug":"borex-bayesian-optimization-based-refinement","title":"BOREx: Bayesian-Optimization--Based Refinement of Saliency Map for Image- and Video-Classification Models","date":"2022-10-31","arxiv_id":"2210.17130","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-for-video-classification","title":"Transfer-learning for video classification: Video Swin Transformer on multiple domains","date":"2022-10-18","arxiv_id":"2210.09969","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-video-transformer-with-feature","title":"Linear Video Transformer with Feature Fixation","date":"2022-10-15","arxiv_id":"2210.08164","repositories_listed":0,"syntology":null},{"url":null,"slug":"futh-net-fusing-temporal-relations-and","title":"FuTH-Net: Fusing Temporal Relations and Holistic Features for Aerial Video Classification","date":"2022-09-22","arxiv_id":"2209.11316","repositories_listed":0,"syntology":null},{"url":null,"slug":"traffic-congestion-prediction-using-deep","title":"Traffic Congestion Prediction using Deep Convolutional Neural Networks: A Color-coding Approach","date":"2022-09-16","arxiv_id":"2209.07943","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-surprising-effectiveness-of","title":"On the Surprising Effectiveness of Transformers in Low-Labeled Video Recognition","date":"2022-09-15","arxiv_id":"2209.07474","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-crowd-violent-and-non-violent-crowd","title":"UAV-CROWD: Violent and non-violent crowd activity simulator from the perspective of UAV","date":"2022-08-13","arxiv_id":"2208.06702","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-sensitive-contrastive-learning-for","title":"Motion Sensitive Contrastive Learning for Self-supervised Video Representation","date":"2022-08-12","arxiv_id":"2208.06105","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stream-transformer-architecture-for-long","title":"Two-Stream Transformer Architecture for Long Video Understanding","date":"2022-08-02","arxiv_id":"2208.01753","repositories_listed":0,"syntology":null},{"url":null,"slug":"textbf-p-2-a-a-dataset-and-benchmark-for","title":"P2ANet: A Dataset and Benchmark for Dense Action Detection from Table Tennis Match Broadcasting Videos","date":"2022-07-26","arxiv_id":"2207.12730","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-3d-network-protocol-for","title":"Intelligent 3D Network Protocol for Multimedia Data Classification using Deep Learning","date":"2022-07-23","arxiv_id":"2207.11504","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-higher-adversarial-susceptibility-of","title":"Contrastive Self-Supervised Learning Leads to Higher Adversarial Susceptibility","date":"2022-07-22","arxiv_id":"2207.10862","repositories_listed":0,"syntology":null},{"url":"/paper/nsnet-non-saliency-suppression-sampler-for","slug":"nsnet-non-saliency-suppression-sampler-for","title":"NSNet: Non-saliency Suppression Sampler for Efficient Video Recognition","date":"2022-07-21","arxiv_id":"2207.10388","repositories_listed":0,"syntology":null},{"url":"/paper/multimodal-open-vocabulary-video","slug":"multimodal-open-vocabulary-video","title":"Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models","date":"2022-07-15","arxiv_id":"2207.07646","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-transfer-learning-co-finetuning-for","title":"Beyond Transfer Learning: Co-finetuning for Action Localisation","date":"2022-07-08","arxiv_id":"2207.03807","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-agnostic-defense-against-adversarial","title":"PatchZero: Defending against Adversarial Patch Attacks by Detecting and Zeroing the Patch","date":"2022-07-05","arxiv_id":"2207.01795","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-concept-extraction-for-concept-1","title":"Automatic Concept Extraction for Concept Bottleneck-based Video Classification","date":"2022-06-21","arxiv_id":"2206.10129","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-muti-expert-distribution-calibration","title":"Learning Muti-expert Distribution Calibration for Long-tailed Video Classification","date":"2022-05-22","arxiv_id":"2205.10788","repositories_listed":0,"syntology":null},{"url":null,"slug":"overview-of-the-medvidqa-2022-shared-task-on","title":"Overview of the MedVidQA 2022 Shared Task on Medical Video Question-Answering","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"calibrating-class-weights-with-multi-modal","title":"Calibrating Class Weights with Multi-Modal Information for Partial Video Domain Adaptation","date":"2022-04-13","arxiv_id":"2204.06187","repositories_listed":0,"syntology":null},{"url":null,"slug":"sos-self-supervised-learning-over-sets-of","title":"SOS! Self-supervised Learning Over Sets Of Handled Objects In Egocentric Action Recognition","date":"2022-04-10","arxiv_id":"2204.04796","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-and-deep-learning-frameworks","title":"Semi-supervised and Deep learning Frameworks for Video Classification and Key-frame Identification","date":"2022-03-25","arxiv_id":"2203.13459","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformers-meet-visual-learning","title":"Transformers Meet Visual Learning Understanding: A Comprehensive Review","date":"2022-03-24","arxiv_id":"2203.12944","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-on-deep-learning-based-3","title":"RoVISQ: Reduction of Video Service Quality via Adversarial Attacks on Deep Learning-based Video Compression","date":"2022-03-18","arxiv_id":"2203.10183","repositories_listed":0,"syntology":null},{"url":"/paper/tfcnet-temporal-fully-connected-networks-for","slug":"tfcnet-temporal-fully-connected-networks-for","title":"TFCNet: Temporal Fully Connected Networks for Static Unbiased Temporal Reasoning","date":"2022-03-11","arxiv_id":"2203.05928","repositories_listed":0,"syntology":null},{"url":null,"slug":"recent-trends-in-2d-object-detection-and","title":"Recent Trends in 2D Object Detection and Applications in Video Event Recognition","date":"2022-02-07","arxiv_id":"2202.03206","repositories_listed":0,"syntology":null},{"url":"/paper/co-training-transformer-with-videos-and","slug":"co-training-transformer-with-videos-and","title":"Co-training Transformer with Videos and Images Improves Action Recognition","date":"2021-12-14","arxiv_id":"2112.07175","repositories_listed":0,"syntology":null},{"url":null,"slug":"previts-contrastive-pretraining-with-video","title":"PreViTS: Contrastive Pretraining with Video Tracking Supervision","date":"2021-12-01","arxiv_id":"2112.00804","repositories_listed":0,"syntology":null}],"record_sha256":"25f5cb85cef905153223ef2256212b21a87929bcfffc4cd272c8c682416a3bd5","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}