{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/vision-transformer/papers/16","list_of":"/method/vision-transformer","method":"Vision Transformer","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":16,"pages_in_order":22,"rows_per_page":100,"rows":[1501,1600],"of":2144,"counts":{"archive_papers_tagged":2144,"with_a_code_link":1051,"where_syntology_ran_a_sample":328,"not_listed_spam_title":0,"listed":2144,"listed_where_code_ran":328,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":286,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":286,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/vision-transformer","prev":"/method/vision-transformer/papers/15","next":"/method/vision-transformer/papers/17","papers":[{"paper":null,"slug":"co-pilot-dynamic-top-down-point-cloud-with","title":"CO-PILOT: Dynamic Top-Down Point Cloud with Conditional Neighborhood Aggregation for Multi-Gigapixel Histopathology Image Representation","date":"2023-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"dropkey-for-vision-transformer","title":"DropKey for Vision Transformer","date":"2023-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"dynamic-inference-with-grounding-based-vision","title":"Dynamic Inference With Grounding Based Vision and Language Models","date":"2023-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"fdvit-improve-the-hierarchical-architecture","title":"FDViT: Improve the Hierarchical Architecture of Vision Transformer","date":"2023-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/goal-guided-transformer-enabled-reinforcement","slug":"goal-guided-transformer-enabled-reinforcement","title":"Goal-Guided Transformer-Enabled Reinforcement Learning for Efficient Autonomous Navigation","date":"2023-01-01","arxiv_id":"2301.00362","n_code_links":1,"syntology":null},{"paper":"/paper/improving-clip-fine-tuning-performance","slug":"improving-clip-fine-tuning-performance","title":"Improving CLIP Fine-tuning Performance","date":"2023-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/masked-auto-encoders-meet-generative","slug":"masked-auto-encoders-meet-generative","title":"Masked Auto-Encoders Meet Generative Adversarial Networks and Beyond","date":"2023-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/r2former-unified-retrieval-and-reranking","slug":"r2former-unified-retrieval-and-reranking","title":"R2Former: Unified Retrieval and Reranking Transformer for Place Recognition","date":"2023-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"selfme-self-supervised-motion-learning-for","title":"SelfME: Self-Supervised Motion Learning for Micro-Expression Recognition","date":"2023-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"sparse-multi-modal-graph-transformer-with","title":"Sparse Multi-Modal Graph Transformer With Shared-Context Processing for Representation Learning of Giga-Pixel Images","date":"2023-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"towards-stable-human-pose-estimation-via","title":"Towards Stable Human Pose Estimation via Cross-View Fusion and Foot Stabilization","date":"2023-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/trap-attention-monocular-depth-estimation","slug":"trap-attention-monocular-depth-estimation","title":"Trap Attention: Monocular Depth Estimation With Manual Traps","date":"2023-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"ovo-one-shot-vision-transformer-search-with","title":"OVO: One-shot Vision Transformer Search with Online distillation","date":"2022-12-28","arxiv_id":"2212.13766","n_code_links":0,"syntology":null},{"paper":null,"slug":"revealed-uncovering-pro-eating-disorder","title":"RevealED: Uncovering Pro-Eating Disorder Content on Twitter Using Deep Learning","date":"2022-12-28","arxiv_id":"2212.13949","n_code_links":0,"syntology":null},{"paper":"/paper/exploring-efficiency-of-vision-transformers","slug":"exploring-efficiency-of-vision-transformers","title":"Exploring Efficiency of Vision Transformers for Self-Supervised Monocular Depth Estimation","date":"2022-12-27","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/a-close-look-at-spatial-modeling-from","slug":"a-close-look-at-spatial-modeling-from","title":"A Close Look at Spatial Modeling: From Attention to Convolution","date":"2022-12-23","arxiv_id":"2212.12552","n_code_links":1,"syntology":null},{"paper":null,"slug":"panovit-vision-transformer-for-room-layout","title":"PanoViT: Vision Transformer for Room Layout Estimation from a Single Panoramic Image","date":"2022-12-23","arxiv_id":"2212.12156","n_code_links":0,"syntology":null},{"paper":"/paper/supergb-d-zero-shot-instance-segmentation-in","slug":"supergb-d-zero-shot-instance-segmentation-in","title":"SupeRGB-D: Zero-shot Instance Segmentation in Cluttered Indoor Environments","date":"2022-12-22","arxiv_id":"2212.11922","n_code_links":1,"syntology":null},{"paper":null,"slug":"investigation-of-network-architecture-for","title":"Investigation of Network Architecture for Multimodal Head-and-Neck Tumor Segmentation","date":"2022-12-21","arxiv_id":"2212.10724","n_code_links":0,"syntology":null},{"paper":null,"slug":"conditioned-generative-transformers-for","title":"Unified Framework for Histopathology Image Augmentation and Classification via Generative Models","date":"2022-12-20","arxiv_id":"2212.09977","n_code_links":0,"syntology":null},{"paper":"/paper/beats-audio-pre-training-with-acoustic","slug":"beats-audio-pre-training-with-acoustic","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","date":"2022-12-18","arxiv_id":"2212.09058","n_code_links":4,"syntology":{"ran":16,"of":18,"n_ran_checked":13,"n_instrument":3,"unverified":2,"pointer_only":4,"phrase":"16 ran (of which 0 constructed an object rather than computing a result; 13 with no instrument failure: 0 honoured, 0 violated, 13 with no contract checked; 3 where Syntology's instrument failed) · 2 unverified","official":{"repos":["microsoft/unilm"],"state":"community repositories only","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["listed"]}}},{"paper":"/paper/rethinking-cooking-state-recognition-with","slug":"rethinking-cooking-state-recognition-with","title":"Rethinking Cooking State Recognition with Vision Transformers","date":"2022-12-16","arxiv_id":"2212.08586","n_code_links":1,"syntology":null},{"paper":null,"slug":"detecting-bone-lesions-in-x-ray-under-diverse","title":"Detecting Bone Lesions in X-Ray Under Diverse Acquisition Conditions","date":"2022-12-15","arxiv_id":"2212.07792","n_code_links":0,"syntology":null},{"paper":"/paper/gpvit-a-high-resolution-non-hierarchical","slug":"gpvit-a-high-resolution-non-hierarchical","title":"GPViT: A High Resolution Non-Hierarchical Vision Transformer with Group Propagation","date":"2022-12-13","arxiv_id":"2212.06795","n_code_links":2,"syntology":null},{"paper":"/paper/promptcal-contrastive-affinity-learning-via","slug":"promptcal-contrastive-affinity-learning-via","title":"PromptCAL: Contrastive Affinity Learning via Auxiliary Prompts for Generalized Novel Category Discovery","date":"2022-12-11","arxiv_id":"2212.05590","n_code_links":1,"syntology":{"ran":2,"of":7,"n_ran_checked":1,"n_instrument":1,"unverified":5,"pointer_only":1,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 5 unverified","official":{"repos":["sheng-eatamath/promptcal"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":5,"ran_from_kinds":["official"]}}},{"paper":"/paper/augnet-dynamic-test-time-augmentation-via","slug":"augnet-dynamic-test-time-augmentation-via","title":"Dynamic Test-Time Augmentation via Differentiable Functions","date":"2022-12-09","arxiv_id":"2212.04681","n_code_links":1,"syntology":null},{"paper":"/paper/sparse-upcycling-training-mixture-of-experts","slug":"sparse-upcycling-training-mixture-of-experts","title":"Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints","date":"2022-12-09","arxiv_id":"2212.05055","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":1,"n_instrument":0,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["google-research/vmoe"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/vitpose-vision-transformer-foundation-model","slug":"vitpose-vision-transformer-foundation-model","title":"ViTPose++: Vision Transformer for Generic Body Pose Estimation","date":"2022-12-07","arxiv_id":"2212.04246","n_code_links":2,"syntology":{"ran":3,"of":3,"n_ran_checked":3,"n_instrument":0,"unverified":0,"pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["vitae-transformer/vitpose"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"event-based-monocular-dense-depth-estimation","title":"Event-based Monocular Dense Depth Estimation with Recurrent Transformers","date":"2022-12-06","arxiv_id":"2212.02791","n_code_links":0,"syntology":null},{"paper":"/paper/fact-factor-tuning-for-lightweight-adaptation","slug":"fact-factor-tuning-for-lightweight-adaptation","title":"FacT: Factor-Tuning for Lightweight Adaptation on Vision Transformer","date":"2022-12-06","arxiv_id":"2212.03145","n_code_links":1,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":1,"phrase":"0 ran · 1 unverified","official":{"repos":["jieshibo/petl-vit"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"paper":"/paper/semantic-aware-message-broadcasting-for","slug":"semantic-aware-message-broadcasting-for","title":"Semantic-aware Message Broadcasting for Efficient Unsupervised Domain Adaptation","date":"2022-12-06","arxiv_id":"2212.02739","n_code_links":1,"syntology":null},{"paper":null,"slug":"3d-latentmapper-view-agnostic-single-view","title":"3D-LatentMapper: View Agnostic Single-View Reconstruction of 3D Shapes","date":"2022-12-05","arxiv_id":"2212.02184","n_code_links":0,"syntology":null},{"paper":"/paper/exploring-stochastic-autoregressive-image","slug":"exploring-stochastic-autoregressive-image","title":"Exploring Stochastic Autoregressive Image Modeling for Visual Representation","date":"2022-12-03","arxiv_id":"2212.01610","n_code_links":1,"syntology":null},{"paper":"/paper/part-based-face-recognition-with-vision","slug":"part-based-face-recognition-with-vision","title":"Part-based Face Recognition with Vision Transformers","date":"2022-11-30","arxiv_id":"2212.00057","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":0,"n_instrument":1,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["szlbiubiubiu/Part_fViT"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/attribute-de-biased-vision-transformer-ad-vit","slug":"attribute-de-biased-vision-transformer-ad-vit","title":"Attribute De-biased Vision Transformer (AD-ViT) for Long-Term Person Re-identification","date":"2022-11-29","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"metal-conscious-embedding-for-cbct-projection","title":"Metal-conscious Embedding for CBCT Projection Inpainting","date":"2022-11-29","arxiv_id":"2211.16219","n_code_links":0,"syntology":null},{"paper":"/paper/noisyquant-noisy-bias-enhanced-post-training","slug":"noisyquant-noisy-bias-enhanced-post-training","title":"NoisyQuant: Noisy Bias-Enhanced Post-Training Activation Quantization for Vision Transformers","date":"2022-11-29","arxiv_id":"2211.16056","n_code_links":1,"syntology":{"ran":3,"of":3,"n_ran_checked":3,"n_instrument":0,"unverified":0,"pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["kriskrisliu/NoisyQuant"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/transformer-based-hand-gesture-recognition","slug":"transformer-based-hand-gesture-recognition","title":"Transformer-based Hand Gesture Recognition via High-Density EMG Signals: From Instantaneous Recognition to Fusion of Motor Unit Spike Trains","date":"2022-11-29","arxiv_id":"2212.00743","n_code_links":1,"syntology":null},{"paper":"/paper/semantic-aware-local-global-vision","slug":"semantic-aware-local-global-vision","title":"Semantic-Aware Local-Global Vision Transformer","date":"2022-11-27","arxiv_id":"2211.14705","n_code_links":0,"syntology":null},{"paper":null,"slug":"degenerate-swin-to-win-plain-window-based","title":"Degenerate Swin to Win: Plain Window-based Transformer without Sophisticated Operations","date":"2022-11-25","arxiv_id":"2211.14255","n_code_links":0,"syntology":null},{"paper":null,"slug":"spatial-temporal-attention-network-for-open","title":"Spatial-Temporal Attention Network for Open-Set Fine-Grained Image Recognition","date":"2022-11-25","arxiv_id":"2211.13940","n_code_links":0,"syntology":null},{"paper":null,"slug":"taotf-a-two-stage-approximately-orthogonal","title":"TAOTF: A Two-stage Approximately Orthogonal Training Framework in Deep Neural Networks","date":"2022-11-25","arxiv_id":"2211.13902","n_code_links":0,"syntology":null},{"paper":null,"slug":"efficient-zero-shot-visual-search-via-target","title":"Efficient Zero-shot Visual Search via Target and Context-aware Transformer","date":"2022-11-24","arxiv_id":"2211.13470","n_code_links":0,"syntology":null},{"paper":"/paper/coda-prompt-continual-decomposed-attention","slug":"coda-prompt-continual-decomposed-attention","title":"CODA-Prompt: COntinual Decomposed Attention-based Prompting for Rehearsal-Free Continual Learning","date":"2022-11-23","arxiv_id":"2211.13218","n_code_links":2,"syntology":{"ran":2,"of":3,"n_ran_checked":1,"n_instrument":1,"unverified":1,"pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","official":{"repos":["gt-ripl/coda-prompt"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"data-augmentation-vision-transformer-for-fine","title":"Data Augmentation Vision Transformer for Fine-grained Image Classification","date":"2022-11-23","arxiv_id":"2211.12879","n_code_links":0,"syntology":null},{"paper":null,"slug":"identification-of-surface-defects-on-solar-pv","title":"Identification of Surface Defects on Solar PV Panels and Wind Turbine Blades using Attention based Deep Learning Model","date":"2022-11-23","arxiv_id":"2211.15374","n_code_links":0,"syntology":null},{"paper":"/paper/svformer-semi-supervised-video-transformer","slug":"svformer-semi-supervised-video-transformer","title":"SVFormer: Semi-supervised Video Transformer for Action Recognition","date":"2022-11-23","arxiv_id":"2211.13222","n_code_links":1,"syntology":null},{"paper":null,"slug":"generalizable-industrial-visual-anomaly","title":"Generalizable Industrial Visual Anomaly Detection with Self-Induction Vision Transformer","date":"2022-11-22","arxiv_id":"2211.12311","n_code_links":0,"syntology":null},{"paper":null,"slug":"magicpony-learning-articulated-3d-animals-in","title":"MagicPony: Learning Articulated 3D Animals in the Wild","date":"2022-11-22","arxiv_id":"2211.12497","n_code_links":0,"syntology":null},{"paper":"/paper/teach-detr-better-training-detr-with-teachers","slug":"teach-detr-better-training-detr-with-teachers","title":"Teach-DETR: Better Training DETR with Teachers","date":"2022-11-22","arxiv_id":"2211.11953","n_code_links":1,"syntology":{"ran":10,"of":11,"n_ran_checked":7,"n_instrument":3,"unverified":1,"pointer_only":3,"phrase":"10 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 1 honoured, 1 violated, 5 with no contract checked; 3 where Syntology's instrument failed) · 1 unverified","official":{"repos":["leonhlj/teach-detr"],"state":"official (archive's flag): 10 ran","n_ran":10,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/transformer-based-multi-grained-features-for","slug":"transformer-based-multi-grained-features-for","title":"Transformer Based Multi-Grained Features for Unsupervised Person Re-Identification","date":"2022-11-22","arxiv_id":"2211.12280","n_code_links":1,"syntology":null},{"paper":null,"slug":"tranvit-an-integrated-vision-transformer","title":"Computer Vision for Transit Travel Time Prediction: An End-to-End Framework Using Roadside Urban Imagery","date":"2022-11-22","arxiv_id":"2211.12322","n_code_links":0,"syntology":null},{"paper":null,"slug":"overfreezing-meets-overparameterization-a","title":"Frozen Overparameterization: A Double Descent Perspective on Transfer Learning of Deep Neural Networks","date":"2022-11-20","arxiv_id":"2211.11074","n_code_links":0,"syntology":null},{"paper":"/paper/improved-cross-view-completion-pre-training","slug":"improved-cross-view-completion-pre-training","title":"CroCo v2: Improved Cross-view Completion Pre-training for Stereo Matching and Optical Flow","date":"2022-11-18","arxiv_id":"2211.10408","n_code_links":1,"syntology":null},{"paper":null,"slug":"weighted-ensemble-self-supervised-learning","title":"Weighted Ensemble Self-Supervised Learning","date":"2022-11-18","arxiv_id":"2211.09981","n_code_links":0,"syntology":null},{"paper":null,"slug":"cpt-v-a-contrastive-approach-to-post-training","title":"CPT-V: A Contrastive Approach to Post-Training Quantization of Vision Transformers","date":"2022-11-17","arxiv_id":"2211.09643","n_code_links":0,"syntology":null},{"paper":null,"slug":"data-centric-debugging-mitigating-model","title":"Data-Centric Debugging: mitigating model failures via targeted data collection","date":"2022-11-17","arxiv_id":"2211.09859","n_code_links":0,"syntology":null},{"paper":"/paper/detecting-arbitrary-keypoints-on-limbs-and","slug":"detecting-arbitrary-keypoints-on-limbs-and","title":"Detecting Arbitrary Keypoints on Limbs and Skis with Sparse Partly Correct Segmentation Masks","date":"2022-11-17","arxiv_id":"2211.09446","n_code_links":1,"syntology":null},{"paper":null,"slug":"how-to-fine-tune-vision-models-with-sgd","title":"How to Fine-Tune Vision Models with SGD","date":"2022-11-17","arxiv_id":"2211.09359","n_code_links":0,"syntology":null},{"paper":null,"slug":"differentially-private-optimizers-can-learn","title":"Differentially Private Optimizers Can Learn Adversarially Robust Models","date":"2022-11-16","arxiv_id":"2211.08942","n_code_links":0,"syntology":null},{"paper":"/paper/shadowdiffusion-diffusion-based-shadow","slug":"shadowdiffusion-diffusion-based-shadow","title":"DeS3: Adaptive Attention-driven Self and Soft Shadow Removal using ViT Similarity","date":"2022-11-15","arxiv_id":"2211.08089","n_code_links":1,"syntology":null},{"paper":"/paper/cabvit-cross-attention-among-blocks-for","slug":"cabvit-cross-attention-among-blocks-for","title":"Fcaformer: Forward Cross Attention in Hybrid Vision Transformer","date":"2022-11-14","arxiv_id":"2211.07198","n_code_links":2,"syntology":null},{"paper":null,"slug":"demystify-self-attention-in-vision","title":"Demystify Self-Attention in Vision Transformers from a Semantic Perspective: Analysis and Application","date":"2022-11-13","arxiv_id":"2211.08543","n_code_links":0,"syntology":null},{"paper":"/paper/ssl4eo-s12-a-large-scale-multi-modal-multi","slug":"ssl4eo-s12-a-large-scale-multi-modal-multi","title":"SSL4EO-S12: A Large-Scale Multi-Modal, Multi-Temporal Dataset for Self-Supervised Learning in Earth Observation","date":"2022-11-13","arxiv_id":"2211.07044","n_code_links":4,"syntology":null},{"paper":null,"slug":"au-aware-vision-transformers-for-biased","title":"AU-Aware Vision Transformers for Biased Facial Expression Recognition","date":"2022-11-12","arxiv_id":"2211.06609","n_code_links":0,"syntology":null},{"paper":null,"slug":"deyo-detr-with-yolo-for-step-by-step-object","title":"DEYO: DETR with YOLO for Step-by-Step Object Detection","date":"2022-11-12","arxiv_id":"2211.06588","n_code_links":0,"syntology":null},{"paper":null,"slug":"end-to-end-machine-learning-framework-for","title":"End-to-End Machine Learning Framework for Facial AU Detection in Intensive Care Units","date":"2022-11-12","arxiv_id":"2211.06570","n_code_links":0,"syntology":null},{"paper":"/paper/masked-vision-language-transformers-for-scene","slug":"masked-vision-language-transformers-for-scene","title":"Masked Vision-Language Transformers for Scene Text Recognition","date":"2022-11-09","arxiv_id":"2211.04785","n_code_links":1,"syntology":null},{"paper":null,"slug":"pure-transformer-with-integrated-experts-for","title":"Pure Transformer with Integrated Experts for Scene Text Recognition","date":"2022-11-09","arxiv_id":"2211.04963","n_code_links":0,"syntology":null},{"paper":"/paper/training-a-vision-transformer-from-scratch-in","slug":"training-a-vision-transformer-from-scratch-in","title":"Training a Vision Transformer from scratch in less than 24 hours with 1 GPU","date":"2022-11-09","arxiv_id":"2211.05187","n_code_links":1,"syntology":{"ran":4,"of":6,"n_ran_checked":4,"n_instrument":0,"unverified":2,"pointer_only":6,"phrase":"4 ran (of which 4 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified; every one of the 4 samples that ran constructed an object rather than computing a result","official":null}},{"paper":null,"slug":"transformers-meet-small-datasets","title":"Transformers Meet Small Datasets","date":"2022-11-09","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/pushing-the-limits-of-self-supervised-speaker","slug":"pushing-the-limits-of-self-supervised-speaker","title":"Pushing the limits of self-supervised speaker verification using regularized distillation framework","date":"2022-11-08","arxiv_id":"2211.04168","n_code_links":1,"syntology":null},{"paper":null,"slug":"splitting-expands-the-application-range-of","title":"Splitting expands the application range of Vision Transformer -- variable Vision Transformer (vViT)","date":"2022-11-08","arxiv_id":"2211.03992","n_code_links":0,"syntology":null},{"paper":"/paper/conmix-for-source-free-single-and-multi","slug":"conmix-for-source-free-single-and-multi","title":"CoNMix for Source-free Single and Multi-target Domain Adaptation","date":"2022-11-07","arxiv_id":"2211.03876","n_code_links":1,"syntology":{"ran":2,"of":4,"n_ran_checked":0,"n_instrument":2,"unverified":2,"pointer_only":4,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 2 unverified","official":{"repos":["vcl-iisc/CoNMix"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":2,"ran_from_kinds":["unlocated"]}}},{"paper":"/paper/efficient-multi-order-gated-aggregation","slug":"efficient-multi-order-gated-aggregation","title":"MogaNet: Multi-order Gated Aggregation Network","date":"2022-11-07","arxiv_id":"2211.03295","n_code_links":7,"syntology":{"ran":12,"of":15,"n_ran_checked":10,"n_instrument":2,"unverified":3,"pointer_only":0,"phrase":"12 ran (of which 7 constructed an object rather than computing a result; 10 with no instrument failure: 0 honoured, 0 violated, 10 with no contract checked; 2 where Syntology's instrument failed) · 3 unverified","official":{"repos":["Westlake-AI/MogaNet","Westlake-AI/openmixup","chengtan9907/OpenSTL"],"state":"official (archive's flag): 12 ran","n_ran":12,"n_constructed":7,"n_ran_no_instrument_failure":10,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":"/paper/group-detr-v2-strong-object-detector-with-1","slug":"group-detr-v2-strong-object-detector-with-1","title":"Group DETR v2: Strong Object Detector with Encoder-Decoder Pretraining","date":"2022-11-07","arxiv_id":"2211.03594","n_code_links":0,"syntology":null},{"paper":"/paper/rcdpt-radar-camera-fusion-dense-prediction","slug":"rcdpt-radar-camera-fusion-dense-prediction","title":"RCDPT: Radar-Camera fusion Dense Prediction Transformer","date":"2022-11-04","arxiv_id":"2211.02432","n_code_links":1,"syntology":null},{"paper":null,"slug":"evaluating-a-synthetic-image-dataset","title":"Evaluating a Synthetic Image Dataset Generated with Stable Diffusion","date":"2022-11-03","arxiv_id":"2211.01777","n_code_links":0,"syntology":null},{"paper":null,"slug":"rethinking-hierarchicies-in-pre-trained-plain","title":"Rethinking Hierarchies in Pre-trained Plain Vision Transformer","date":"2022-11-03","arxiv_id":"2211.01785","n_code_links":0,"syntology":null},{"paper":null,"slug":"scaling-multimodal-pre-training-via-cross","title":"Scaling Multimodal Pre-Training via Cross-Modality Gradient Harmonization","date":"2022-11-03","arxiv_id":"2211.02077","n_code_links":0,"syntology":null},{"paper":null,"slug":"attention-based-neural-cellular-automata","title":"Attention-based Neural Cellular Automata","date":"2022-11-02","arxiv_id":"2211.01233","n_code_links":0,"syntology":null},{"paper":null,"slug":"regclr-a-self-supervised-framework-for","title":"RegCLR: A Self-Supervised Framework for Tabular Representation Learning in the Wild","date":"2022-11-02","arxiv_id":"2211.01165","n_code_links":0,"syntology":null},{"paper":"/paper/witt-a-wireless-image-transmission","slug":"witt-a-wireless-image-transmission","title":"WITT: A Wireless Image Transmission Transformer for Semantic Communications","date":"2022-11-02","arxiv_id":"2211.00937","n_code_links":2,"syntology":null},{"paper":"/paper/vid-trans-reid-enhanced-video-transformers","slug":"vid-trans-reid-enhanced-video-transformers","title":"VID-Trans-ReID: Enhanced Video Transformers for Person Re-identification","date":"2022-11-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"vit-deit-an-ensemble-model-for-breast-cancer","title":"ViT-DeiT: An Ensemble Model for Breast Cancer Histopathological Images Classification","date":"2022-11-01","arxiv_id":"2211.00749","n_code_links":0,"syntology":null},{"paper":null,"slug":"vit-lsla-vision-transformer-with-light-self","title":"ViT-LSLA: Vision Transformer with Light Self-Limited-Attention","date":"2022-10-31","arxiv_id":"2210.17115","n_code_links":0,"syntology":null},{"paper":"/paper/exemplar-guided-deep-neural-network-for","slug":"exemplar-guided-deep-neural-network-for","title":"Exemplar Guided Deep Neural Network for Spatial Transcriptomics Analysis of Gene Expression Prediction","date":"2022-10-30","arxiv_id":"2210.16721","n_code_links":1,"syntology":null},{"paper":"/paper/foreign-object-debris-detection-for-airport","slug":"foreign-object-debris-detection-for-airport","title":"Foreign Object Debris Detection for Airport Pavement Images based on Self-supervised Localization and Vision Transformer","date":"2022-10-30","arxiv_id":"2210.16901","n_code_links":1,"syntology":null},{"paper":"/paper/vitasd-robust-vision-transformer-baselines","slug":"vitasd-robust-vision-transformer-baselines","title":"ViTASD: Robust Vision Transformer Baselines for Autism Spectrum Disorder Facial Diagnosis","date":"2022-10-30","arxiv_id":"2210.16943","n_code_links":1,"syntology":null},{"paper":null,"slug":"differentially-private-cutmix-for-split","title":"Differentially Private CutMix for Split Learning with Vision Transformer","date":"2022-10-28","arxiv_id":"2210.15986","n_code_links":0,"syntology":null},{"paper":null,"slug":"elastic-weight-consolidation-improves-the","title":"Elastic Weight Consolidation Improves the Robustness of Self-Supervised Learning Methods under Transfer","date":"2022-10-28","arxiv_id":"2210.16365","n_code_links":0,"syntology":null},{"paper":null,"slug":"federated-learning-for-chronic-obstructive","title":"Federated Learning for Chronic Obstructive Pulmonary Disease Classification with Partial Personalized Attention Mechanism","date":"2022-10-28","arxiv_id":"2210.16142","n_code_links":0,"syntology":null},{"paper":null,"slug":"hydra-hgr-a-hybrid-transformer-based","title":"HYDRA-HGR: A Hybrid Transformer-based Architecture for Fusion of Macroscopic and Microscopic Neural Drive Information","date":"2022-10-27","arxiv_id":"2211.02619","n_code_links":0,"syntology":null},{"paper":null,"slug":"masked-transformer-for-image-anomaly","title":"Masked Transformer for image Anomaly Localization","date":"2022-10-27","arxiv_id":"2210.15540","n_code_links":0,"syntology":null},{"paper":"/paper/masked-vision-language-transformer-in-fashion","slug":"masked-vision-language-transformer-in-fashion","title":"Masked Vision-Language Transformer in Fashion","date":"2022-10-27","arxiv_id":"2210.15110","n_code_links":1,"syntology":null},{"paper":null,"slug":"spatio-temporal-hybrid-fusion-of-cae-and-swin","title":"Spatio-Temporal Hybrid Fusion of CAE and SWIn Transformers for Lung Cancer Malignancy Prediction","date":"2022-10-27","arxiv_id":"2210.15297","n_code_links":0,"syntology":null},{"paper":"/paper/m-3-vit-mixture-of-experts-vision-transformer","slug":"m-3-vit-mixture-of-experts-vision-transformer","title":"M$^3$ViT: Mixture-of-Experts Vision Transformer for Efficient Multi-task Learning with Model-Accelerator Co-design","date":"2022-10-26","arxiv_id":"2210.14793","n_code_links":1,"syntology":{"ran":3,"of":3,"n_ran_checked":2,"n_instrument":1,"unverified":0,"pointer_only":1,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 2 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["vita-group/m3vit"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official","unlocated"]}}},{"paper":"/paper/explicitly-increasing-input-information","slug":"explicitly-increasing-input-information","title":"Explicitly Increasing Input Information Density for Vision Transformers on Small Datasets","date":"2022-10-25","arxiv_id":"2210.14319","n_code_links":1,"syntology":{"ran":4,"of":7,"n_ran_checked":2,"n_instrument":2,"unverified":3,"pointer_only":7,"phrase":"4 ran (of which 2 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 2 where Syntology's instrument failed) · 3 unverified","official":{"repos":["xiangyu8/densevt"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":2,"n_ran_no_instrument_failure":2,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"minutiae-guided-fingerprint-embeddings-via","title":"Minutiae-Guided Fingerprint Embeddings via Vision Transformers","date":"2022-10-25","arxiv_id":"2210.13994","n_code_links":0,"syntology":null},{"paper":null,"slug":"uia-vit-unsupervised-inconsistency-aware","title":"UIA-ViT: Unsupervised Inconsistency-Aware Method based on Vision Transformer for Face Forgery Detection","date":"2022-10-23","arxiv_id":"2210.12752","n_code_links":0,"syntology":null}],"record_sha256":"62bd987e1626b275d22b712dc62d0d5278f86be9d448a35e6eff7a9f18f16b6c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}