{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/vision-transformer/papers/18","list_of":"/method/vision-transformer","method":"Vision Transformer","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":18,"pages_in_order":22,"rows_per_page":100,"rows":[1701,1800],"of":2144,"counts":{"archive_papers_tagged":2144,"with_a_code_link":1051,"where_syntology_ran_a_sample":328,"not_listed_spam_title":0,"listed":2144,"listed_where_code_ran":328,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":286,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":286,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/vision-transformer","prev":"/method/vision-transformer/papers/17","next":"/method/vision-transformer/papers/19","papers":[{"paper":"/paper/non-contrastive-self-supervised-learning-of","slug":"non-contrastive-self-supervised-learning-of","title":"Non-Contrastive Self-Supervised Learning of Utterance-Level Speech Representations","date":"2022-08-10","arxiv_id":"2208.05413","n_code_links":1,"syntology":null},{"paper":"/paper/covit-real-time-phylogenetics-for-the-sars","slug":"covit-real-time-phylogenetics-for-the-sars","title":"CoViT: Real-time phylogenetics for the SARS-CoV-2 pandemic using Vision Transformers","date":"2022-08-09","arxiv_id":"2208.05004","n_code_links":1,"syntology":null},{"paper":"/paper/occlusion-aware-instance-segmentation-via","slug":"occlusion-aware-instance-segmentation-via","title":"Occlusion-Aware Instance Segmentation via BiLayer Network Architectures","date":"2022-08-08","arxiv_id":"2208.04438","n_code_links":1,"syntology":null},{"paper":null,"slug":"analysing-the-memorability-of-a-procedural","title":"Analysing the Memorability of a Procedural Crime-Drama TV Series, CSI","date":"2022-08-06","arxiv_id":"2208.03479","n_code_links":0,"syntology":null},{"paper":null,"slug":"dropkey","title":"DropKey","date":"2022-08-04","arxiv_id":"2208.02646","n_code_links":0,"syntology":null},{"paper":"/paper/self-ensembling-vision-transformer-sevit-for","slug":"self-ensembling-vision-transformer-sevit-for","title":"Self-Ensembling Vision Transformer (SEViT) for Robust Medical Image Classification","date":"2022-08-04","arxiv_id":"2208.02851","n_code_links":1,"syntology":null},{"paper":"/paper/multi-feature-vision-transformer-via-self","slug":"multi-feature-vision-transformer-via-self","title":"Multi-Feature Vision Transformer via Self-Supervised Representation Learning for Improvement of COVID-19 Diagnosis","date":"2022-08-03","arxiv_id":"2208.01843","n_code_links":1,"syntology":null},{"paper":"/paper/ssformer-a-lightweight-transformer-for","slug":"ssformer-a-lightweight-transformer-for","title":"SSformer: A Lightweight Transformer for Semantic Segmentation","date":"2022-08-03","arxiv_id":"2208.02034","n_code_links":1,"syntology":null},{"paper":null,"slug":"a-novel-transformer-network-with-shifted","title":"A Novel Transformer Network with Shifted Window Cross-Attention for Spatiotemporal Weather Forecasting","date":"2022-08-02","arxiv_id":"2208.01252","n_code_links":0,"syntology":null},{"paper":null,"slug":"two-stream-transformer-architecture-for-long","title":"Two-Stream Transformer Architecture for Long Video Understanding","date":"2022-08-02","arxiv_id":"2208.01753","n_code_links":0,"syntology":null},{"paper":"/paper/transdeeplab-convolution-free-transformer","slug":"transdeeplab-convolution-free-transformer","title":"TransDeepLab: Convolution-Free Transformer-based DeepLab v3+ for Medical Image Segmentation","date":"2022-08-01","arxiv_id":"2208.00713","n_code_links":1,"syntology":null},{"paper":"/paper/dnswin-toward-real-world-denoising-via","slug":"dnswin-toward-real-world-denoising-via","title":"DnSwin: Toward Real-World Denoising via Continuous Wavelet Sliding-Transformer","date":"2022-07-28","arxiv_id":"2207.13861","n_code_links":1,"syntology":null},{"paper":null,"slug":"deep-clustering-with-features-from-self","title":"Deep Clustering with Features from Self-Supervised Pretraining","date":"2022-07-27","arxiv_id":"2207.13364","n_code_links":0,"syntology":null},{"paper":"/paper/group-detr-fast-training-convergence-with","slug":"group-detr-fast-training-convergence-with","title":"Group DETR: Fast DETR Training with Group-Wise One-to-Many Assignment","date":"2022-07-26","arxiv_id":"2207.13085","n_code_links":2,"syntology":null},{"paper":"/paper/v-2-l-leveraging-vision-and-vision-language","slug":"v-2-l-leveraging-vision-and-vision-language","title":"V$^2$L: Leveraging Vision and Vision-language Models into Large-scale Product Retrieval","date":"2022-07-26","arxiv_id":"2207.12994","n_code_links":1,"syntology":null},{"paper":"/paper/jigsaw-vit-learning-jigsaw-puzzles-in-vision","slug":"jigsaw-vit-learning-jigsaw-puzzles-in-vision","title":"Jigsaw-ViT: Learning Jigsaw Puzzles in Vision Transformer","date":"2022-07-25","arxiv_id":"2207.11971","n_code_links":1,"syntology":null},{"paper":"/paper/affective-behaviour-analysis-using-pretrained","slug":"affective-behaviour-analysis-using-pretrained","title":"Affective Behaviour Analysis Using Pretrained Model with Facial Priori","date":"2022-07-24","arxiv_id":"2207.11679","n_code_links":1,"syntology":null},{"paper":null,"slug":"online-continual-learning-with-contrastive","title":"Online Continual Learning with Contrastive Vision Transformer","date":"2022-07-24","arxiv_id":"2207.13516","n_code_links":0,"syntology":null},{"paper":null,"slug":"applying-spatiotemporal-attention-to-identify","title":"Applying Spatiotemporal Attention to Identify Distracted and Drowsy Driving with Vision Transformers","date":"2022-07-22","arxiv_id":"2207.12148","n_code_links":0,"syntology":null},{"paper":"/paper/facial-expression-recognition-using-vanilla","slug":"facial-expression-recognition-using-vanilla","title":"Emotion Separation and Recognition from a Facial Expression by Generating the Poker Face with Vision Transformers","date":"2022-07-22","arxiv_id":"2207.11081","n_code_links":0,"syntology":null},{"paper":"/paper/focused-decoding-enables-3d-anatomical","slug":"focused-decoding-enables-3d-anatomical","title":"Focused Decoding Enables 3D Anatomical Detection by Transformers","date":"2022-07-21","arxiv_id":"2207.10774","n_code_links":1,"syntology":null},{"paper":"/paper/locality-guidance-for-improving-vision","slug":"locality-guidance-for-improving-vision","title":"Locality Guidance for Improving Vision Transformers on Tiny Datasets","date":"2022-07-20","arxiv_id":"2207.10026","n_code_links":1,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"0 ran · 1 unverified","official":{"repos":["lkhl/tiny-transformers"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"paper":null,"slug":"meshmae-masked-autoencoders-for-3d-mesh-data","title":"MeshMAE: Masked Autoencoders for 3D Mesh Data Analysis","date":"2022-07-20","arxiv_id":"2207.10228","n_code_links":0,"syntology":null},{"paper":null,"slug":"unsupervised-industrial-anomaly-detection-via","title":"Unsupervised Industrial Anomaly Detection via Pattern Generative and Contrastive Networks","date":"2022-07-20","arxiv_id":"2207.09792","n_code_links":0,"syntology":null},{"paper":"/paper/vigat-bottom-up-event-recognition-and","slug":"vigat-bottom-up-event-recognition-and","title":"ViGAT: Bottom-up event recognition and explanation in video using factorized graph attention network","date":"2022-07-20","arxiv_id":"2207.09927","n_code_links":1,"syntology":null},{"paper":"/paper/multi-manifold-attention-for-vision","slug":"multi-manifold-attention-for-vision","title":"Multi-manifold Attention for Vision Transformers","date":"2022-07-18","arxiv_id":"2207.08569","n_code_links":0,"syntology":null},{"paper":"/paper/tokenmix-rethinking-image-mixing-for-data","slug":"tokenmix-rethinking-image-mixing-for-data","title":"TokenMix: Rethinking Image Mixing for Data Augmentation in Vision Transformers","date":"2022-07-18","arxiv_id":"2207.08409","n_code_links":1,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"0 ran · 1 unverified","official":{"repos":["sense-x/tokenmix"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"paper":null,"slug":"explainable-vision-transformer-enabled","title":"Explainable vision transformer enabled convolutional neural network for plant disease identification: PlantXViT","date":"2022-07-16","arxiv_id":"2207.07919","n_code_links":0,"syntology":null},{"paper":"/paper/ssmtl-revisiting-self-supervised-multi-task","slug":"ssmtl-revisiting-self-supervised-multi-task","title":"SSMTL++: Revisiting Self-Supervised Multi-Task Learning for Video Anomaly Detection","date":"2022-07-16","arxiv_id":"2207.08003","n_code_links":0,"syntology":null},{"paper":"/paper/convolutional-bypasses-are-better-vision","slug":"convolutional-bypasses-are-better-vision","title":"Convolutional Bypasses Are Better Vision Transformer Adapters","date":"2022-07-14","arxiv_id":"2207.07039","n_code_links":1,"syntology":{"ran":3,"of":4,"n_ran_checked":0,"n_instrument":3,"unverified":1,"pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 1 unverified","official":{"repos":["jieshibo/petl-vit"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/current-trends-in-deep-learning-for-earth","slug":"current-trends-in-deep-learning-for-earth","title":"Current Trends in Deep Learning for Earth Observation: An Open-source Benchmark Arena for Image Classification","date":"2022-07-14","arxiv_id":"2207.07189","n_code_links":2,"syntology":null},{"paper":null,"slug":"deepfake-video-detection-with-spatiotemporal","title":"Deepfake Video Detection with Spatiotemporal Dropout Transformer","date":"2022-07-14","arxiv_id":"2207.06612","n_code_links":0,"syntology":null},{"paper":"/paper/icolorit-towards-propagating-local-hint-to","slug":"icolorit-towards-propagating-local-hint-to","title":"iColoriT: Towards Propagating Local Hint to the Right Region in Interactive Colorization by Leveraging Vision Transformer","date":"2022-07-14","arxiv_id":"2207.06831","n_code_links":1,"syntology":null},{"paper":"/paper/scene-text-recognition-with-permuted","slug":"scene-text-recognition-with-permuted","title":"Scene Text Recognition with Permuted Autoregressive Sequence Models","date":"2022-07-14","arxiv_id":"2207.06966","n_code_links":2,"syntology":{"ran":5,"of":8,"n_ran_checked":5,"n_instrument":0,"unverified":3,"pointer_only":0,"phrase":"5 ran (of which 5 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified; every one of the 5 samples that ran constructed an object rather than computing a result","official":{"repos":["baudm/parseq"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":5,"n_ran_no_instrument_failure":5,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"ex-vit-a-novel-explainable-vision-transformer","title":"eX-ViT: A Novel eXplainable Vision Transformer for Weakly Supervised Semantic Segmentation","date":"2022-07-12","arxiv_id":"2207.05358","n_code_links":0,"syntology":null},{"paper":null,"slug":"image-and-model-transformation-with-secret","title":"Image and Model Transformation with Secret Key for Vision Transformer","date":"2022-07-12","arxiv_id":"2207.05366","n_code_links":0,"syntology":null},{"paper":null,"slug":"msp-former-multi-scale-projection-transformer","title":"MSP-Former: Multi-Scale Projection Transformer for Single Image Desnowing","date":"2022-07-12","arxiv_id":"2207.05621","n_code_links":0,"syntology":null},{"paper":"/paper/next-vit-next-generation-vision-transformer","slug":"next-vit-next-generation-vision-transformer","title":"Next-ViT: Next Generation Vision Transformer for Efficient Deployment in Realistic Industrial Scenarios","date":"2022-07-12","arxiv_id":"2207.05501","n_code_links":5,"syntology":{"ran":1,"of":2,"n_ran_checked":1,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["bytedance/next-vit"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"trusted-multi-scale-classification-framework","title":"Trusted Multi-Scale Classification Framework for Whole Slide Image","date":"2022-07-12","arxiv_id":"2207.05290","n_code_links":0,"syntology":null},{"paper":"/paper/dual-vision-transformer","slug":"dual-vision-transformer","title":"Dual Vision Transformer","date":"2022-07-11","arxiv_id":"2207.04976","n_code_links":1,"syntology":null},{"paper":"/paper/wave-vit-unifying-wavelet-and-transformers","slug":"wave-vit-unifying-wavelet-and-transformers","title":"Wave-ViT: Unifying Wavelet and Transformers for Visual Representation Learning","date":"2022-07-11","arxiv_id":"2207.04978","n_code_links":3,"syntology":{"ran":2,"of":3,"n_ran_checked":2,"n_instrument":0,"unverified":1,"pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["yehli/imagenetmodel"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/consecutive-pretraining-a-knowledge-transfer","slug":"consecutive-pretraining-a-knowledge-transfer","title":"Consecutive Pretraining: A Knowledge Transfer Learning Strategy with Relevant Unlabeled Data for Remote Sensing Domain","date":"2022-07-08","arxiv_id":"2207.03860","n_code_links":1,"syntology":null},{"paper":"/paper/cross-attention-transformer-for-video","slug":"cross-attention-transformer-for-video","title":"Cross-Attention Transformer for Video Interpolation","date":"2022-07-08","arxiv_id":"2207.04132","n_code_links":1,"syntology":null},{"paper":null,"slug":"design-of-human-machine-interface-through","title":"Deep learning based Hand gesture recognition system and design of a Human-Machine Interface","date":"2022-07-07","arxiv_id":"2207.03112","n_code_links":0,"syntology":null},{"paper":null,"slug":"cnn-based-local-vision-transformer-for-covid","title":"CNN-based Local Vision Transformer for COVID-19 Diagnosis","date":"2022-07-05","arxiv_id":"2207.02027","n_code_links":0,"syntology":null},{"paper":null,"slug":"improving-semantic-segmentation-in","title":"Improving Semantic Segmentation in Transformers using Hierarchical Inter-Level Attention","date":"2022-07-05","arxiv_id":"2207.02126","n_code_links":0,"syntology":null},{"paper":"/paper/you-only-need-one-detector-unified-object","slug":"you-only-need-one-detector-unified-object","title":"Unified Object Detector for Different Modalities based on Vision Transformers","date":"2022-07-03","arxiv_id":"2207.01071","n_code_links":1,"syntology":null},{"paper":"/paper/dissecting-self-supervised-learning-methods","slug":"dissecting-self-supervised-learning-methods","title":"Dissecting Self-Supervised Learning Methods for Surgical Computer Vision","date":"2022-07-01","arxiv_id":"2207.00449","n_code_links":1,"syntology":null},{"paper":null,"slug":"polarized-color-image-denoising-using","title":"Polarized Color Image Denoising using Pocoformer","date":"2022-07-01","arxiv_id":"2207.00215","n_code_links":0,"syntology":null},{"paper":"/paper/improving-the-generalization-of-supervised","slug":"improving-the-generalization-of-supervised","title":"No Reason for No Supervision: Improved Generalization in Supervised Models","date":"2022-06-30","arxiv_id":"2206.15369","n_code_links":1,"syntology":{"ran":7,"of":9,"n_ran_checked":6,"n_instrument":1,"unverified":2,"pointer_only":9,"phrase":"7 ran (of which 6 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","official":null}},{"paper":null,"slug":"multi-channel-vision-transformer-for","title":"Multi-Channel Vision Transformer for Epileptic Seizure Prediction","date":"2022-06-29","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/cross-forgery-analysis-of-vision-transformers","slug":"cross-forgery-analysis-of-vision-transformers","title":"Cross-Forgery Analysis of Vision Transformers and CNNs for Deepfake Image Detection","date":"2022-06-28","arxiv_id":"2206.13829","n_code_links":2,"syntology":null},{"paper":"/paper/vision-transformer-for-contrastive-clustering","slug":"vision-transformer-for-contrastive-clustering","title":"Vision Transformer for Contrastive Clustering","date":"2022-06-26","arxiv_id":"2206.12925","n_code_links":1,"syntology":null},{"paper":"/paper/derivate-informed-neural-operator-an","slug":"derivate-informed-neural-operator-an","title":"Derivative-Informed Neural Operator: An Efficient Framework for High-Dimensional Parametric Derivative Learning","date":"2022-06-21","arxiv_id":"2206.10745","n_code_links":2,"syntology":null},{"paper":"/paper/vicinity-vision-transformer","slug":"vicinity-vision-transformer","title":"Vicinity Vision Transformer","date":"2022-06-21","arxiv_id":"2206.10552","n_code_links":1,"syntology":{"ran":5,"of":5,"n_ran_checked":4,"n_instrument":1,"unverified":0,"pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["opennlplab/vicinity-vision-transformer"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/global-context-vision-transformers","slug":"global-context-vision-transformers","title":"Global Context Vision Transformers","date":"2022-06-20","arxiv_id":"2206.09959","n_code_links":8,"syntology":{"ran":21,"of":36,"n_ran_checked":17,"n_instrument":4,"unverified":15,"pointer_only":15,"phrase":"21 ran (of which 8 constructed an object rather than computing a result; 17 with no instrument failure: 0 honoured, 0 violated, 17 with no contract checked; 4 where Syntology's instrument failed) · 15 unverified","official":{"repos":["nvlabs/gcvit"],"state":"official (archive's flag): 12 ran","n_ran":12,"n_constructed":8,"n_ran_no_instrument_failure":8,"n_unverified":3,"ran_from_kinds":["listed","official"]}}},{"paper":"/paper/eatformer-improving-vision-transformer","slug":"eatformer-improving-vision-transformer","title":"EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm","date":"2022-06-19","arxiv_id":"2206.09325","n_code_links":1,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":1,"phrase":"0 ran · 1 unverified","official":{"repos":["zhangzjn/eatformer"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"paper":null,"slug":"rectify-vit-shortcut-learning-by-visual","title":"Rectify ViT Shortcut Learning by Visual Saliency","date":"2022-06-17","arxiv_id":"2206.08567","n_code_links":0,"syntology":null},{"paper":"/paper/adapting-self-supervised-vision-transformers","slug":"adapting-self-supervised-vision-transformers","title":"Adapting Self-Supervised Vision Transformers by Probing Attention-Conditioned Masking Consistency","date":"2022-06-16","arxiv_id":"2206.08222","n_code_links":1,"syntology":null},{"paper":"/paper/omnimae-single-model-masked-pretraining-on","slug":"omnimae-single-model-masked-pretraining-on","title":"OmniMAE: Single Model Masked Pretraining on Images and Videos","date":"2022-06-16","arxiv_id":"2206.08356","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":0,"n_instrument":1,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["facebookresearch/omnivore"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/patch-level-representation-learning-for-self-1","slug":"patch-level-representation-learning-for-self-1","title":"Patch-level Representation Learning for Self-supervised Vision Transformers","date":"2022-06-16","arxiv_id":"2206.07990","n_code_links":1,"syntology":{"ran":1,"of":3,"n_ran_checked":1,"n_instrument":0,"unverified":2,"pointer_only":0,"phrase":"1 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified; the one sample that ran constructed an object rather than computing a result","official":{"repos":["alinlab/selfpatch"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":1,"n_ran_no_instrument_failure":1,"n_unverified":2,"ran_from_kinds":["official"]}}},{"paper":"/paper/rethinking-generalization-in-few-shot-1","slug":"rethinking-generalization-in-few-shot-1","title":"Rethinking Generalization in Few-Shot Classification","date":"2022-06-15","arxiv_id":"2206.07267","n_code_links":1,"syntology":{"ran":2,"of":3,"n_ran_checked":1,"n_instrument":1,"unverified":1,"pointer_only":3,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","official":{"repos":["mrkshllr/FewTURE"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/what-makes-domain-generalization-hard","slug":"what-makes-domain-generalization-hard","title":"Improving generalization by mimicking the human visual diet","date":"2022-06-15","arxiv_id":"2206.07802","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":0,"n_instrument":1,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["spandan-madan/human_visual_diet"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/exploring-adversarial-attacks-and-defenses-in","slug":"exploring-adversarial-attacks-and-defenses-in","title":"Exploring Adversarial Attacks and Defenses in Vision Transformers trained with DINO","date":"2022-06-14","arxiv_id":"2206.06761","n_code_links":1,"syntology":null},{"paper":"/paper/stand-alone-inter-frame-attention-in-video-1","slug":"stand-alone-inter-frame-attention-in-video-1","title":"Stand-Alone Inter-Frame Attention in Video Models","date":"2022-06-14","arxiv_id":"2206.06931","n_code_links":1,"syntology":null},{"paper":"/paper/transvg-end-to-end-visual-grounding-with-1","slug":"transvg-end-to-end-visual-grounding-with-1","title":"TransVG++: End-to-End Visual Grounding with Language Conditioned Vision Transformer","date":"2022-06-14","arxiv_id":"2206.06619","n_code_links":1,"syntology":null},{"paper":null,"slug":"multimodal-learning-with-transformers-a","title":"Multimodal Learning with Transformers: A Survey","date":"2022-06-13","arxiv_id":"2206.06488","n_code_links":0,"syntology":null},{"paper":null,"slug":"seatrans-learning-segmentation-assisted","title":"SeATrans: Learning Segmentation-Assisted diagnosis model via Transformer","date":"2022-06-12","arxiv_id":"2206.05763","n_code_links":0,"syntology":null},{"paper":null,"slug":"kaggle-kinship-recognition-challenge","title":"Kaggle Kinship Recognition Challenge: Introduction of Convolution-Free Model to boost conventional","date":"2022-06-11","arxiv_id":"2206.05488","n_code_links":0,"syntology":null},{"paper":null,"slug":"position-labels-for-self-supervised-vision","title":"Positional Label for Self-Supervised Vision Transformer","date":"2022-06-10","arxiv_id":"2206.04981","n_code_links":0,"syntology":null},{"paper":"/paper/neural-prompt-search","slug":"neural-prompt-search","title":"Neural Prompt Search","date":"2022-06-09","arxiv_id":"2206.04673","n_code_links":1,"syntology":{"ran":8,"of":9,"n_ran_checked":5,"n_instrument":3,"unverified":1,"pointer_only":2,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 2 honoured, 0 violated, 3 with no contract checked; 3 where Syntology's instrument failed) · 1 unverified","official":{"repos":["ZhangYuanhan-AI/NOAH"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/mask-dino-towards-a-unified-transformer-based-1","slug":"mask-dino-towards-a-unified-transformer-based-1","title":"Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation","date":"2022-06-06","arxiv_id":"2206.02777","n_code_links":10,"syntology":{"ran":11,"of":13,"n_ran_checked":3,"n_instrument":8,"unverified":2,"pointer_only":13,"phrase":"11 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 1 violated, 2 with no contract checked; 8 where Syntology's instrument failed) · 2 unverified","official":{"repos":["idea-research/maskdino"],"state":"community repositories only","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["listed"]}}},{"paper":"/paper/sports-re-id-improving-re-identification-of","slug":"sports-re-id-improving-re-identification-of","title":"Sports Re-ID: Improving Re-Identification Of Players In Broadcast Videos Of Team Sports","date":"2022-06-06","arxiv_id":"2206.02373","n_code_links":1,"syntology":null},{"paper":null,"slug":"federated-adversarial-training-with","title":"Federated Adversarial Training with Transformers","date":"2022-06-05","arxiv_id":"2206.02131","n_code_links":0,"syntology":null},{"paper":"/paper/patcher-patch-transformers-with-mixture-of","slug":"patcher-patch-transformers-with-mixture-of","title":"Patcher: Patch Transformers with Mixture of Experts for Precise Medical Image Segmentation","date":"2022-06-03","arxiv_id":"2206.01741","n_code_links":1,"syntology":null},{"paper":"/paper/optimizing-relevance-maps-of-vision","slug":"optimizing-relevance-maps-of-vision","title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","date":"2022-06-02","arxiv_id":"2206.01161","n_code_links":1,"syntology":null},{"paper":null,"slug":"a-comparative-study-between-vision","title":"A comparative study between vision transformers and CNNs in digital pathology","date":"2022-06-01","arxiv_id":"2206.00389","n_code_links":0,"syntology":null},{"paper":"/paper/stargazer-a-transformer-based-driver-action","slug":"stargazer-a-transformer-based-driver-action","title":"Stargazer: A transformer-based driver action detection system for intelligent transportation","date":"2022-06-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/decomposing-nerf-for-editing-via-feature","slug":"decomposing-nerf-for-editing-via-feature","title":"Decomposing NeRF for Editing via Feature Field Distillation","date":"2022-05-31","arxiv_id":"2205.15585","n_code_links":1,"syntology":{"ran":10,"of":10,"n_ran_checked":9,"n_instrument":1,"unverified":0,"pointer_only":1,"phrase":"10 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 1 honoured, 0 violated, 8 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":null}},{"paper":"/paper/surface-analysis-with-vision-transformers","slug":"surface-analysis-with-vision-transformers","title":"Surface Analysis with Vision Transformers","date":"2022-05-31","arxiv_id":"2205.15836","n_code_links":1,"syntology":{"ran":2,"of":2,"n_ran_checked":0,"n_instrument":2,"unverified":0,"pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","official":{"repos":["metrics-lab/surface-vision-transformers"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/few-shot-diffusion-models","slug":"few-shot-diffusion-models","title":"Few-Shot Diffusion Models","date":"2022-05-30","arxiv_id":"2205.15463","n_code_links":1,"syntology":null},{"paper":"/paper/hivit-hierarchical-vision-transformer-meets","slug":"hivit-hierarchical-vision-transformer-meets","title":"HiViT: Hierarchical Vision Transformer Meets Masked Image Modeling","date":"2022-05-30","arxiv_id":"2205.14949","n_code_links":1,"syntology":null},{"paper":null,"slug":"zero-shot-and-few-shot-learning-for-lung","title":"Zero-Shot and Few-Shot Learning for Lung Cancer Multi-Label Classification using Vision Transformer","date":"2022-05-30","arxiv_id":"2205.15290","n_code_links":0,"syntology":null},{"paper":"/paper/mdmlp-image-classification-from-scratch-on","slug":"mdmlp-image-classification-from-scratch-on","title":"MDMLP: Image Classification from Scratch on Small Datasets with MLP","date":"2022-05-28","arxiv_id":"2205.14477","n_code_links":2,"syntology":null},{"paper":"/paper/momentum-stiefel-optimizer-with-applications","slug":"momentum-stiefel-optimizer-with-applications","title":"Momentum Stiefel Optimizer, with Applications to Suitably-Orthogonal Attention, and Optimal Transport","date":"2022-05-27","arxiv_id":"2205.14173","n_code_links":1,"syntology":{"ran":7,"of":7,"n_ran_checked":7,"n_instrument":0,"unverified":0,"pointer_only":0,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 1 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["konglk1203/variationalstiefeloptimizer"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/vidi-a-video-dataset-of-incidents","slug":"vidi-a-video-dataset-of-incidents","title":"VIDI: A Video Dataset of Incidents","date":"2022-05-26","arxiv_id":"2205.13277","n_code_links":1,"syntology":null},{"paper":null,"slug":"eye-gaze-guided-vision-transformer-for","title":"Eye-gaze-guided Vision Transformer for Rectifying Shortcut Learning","date":"2022-05-25","arxiv_id":"2205.12466","n_code_links":0,"syntology":null},{"paper":"/paper/mocovit-mobile-convolutional-vision","slug":"mocovit-mobile-convolutional-vision","title":"MoCoViT: Mobile Convolutional Vision Transformer","date":"2022-05-25","arxiv_id":"2205.12635","n_code_links":1,"syntology":null},{"paper":null,"slug":"privacy-preserving-image-classification-using-1","title":"Privacy-Preserving Image Classification Using Vision Transformer","date":"2022-05-24","arxiv_id":"2205.12041","n_code_links":0,"syntology":null},{"paper":"/paper/super-vision-transformer","slug":"super-vision-transformer","title":"Super Vision Transformer","date":"2022-05-23","arxiv_id":"2205.11397","n_code_links":1,"syntology":null},{"paper":"/paper/vision-transformers-in-2022-an-update-on-tiny","slug":"vision-transformers-in-2022-an-update-on-tiny","title":"Vision Transformers in 2022: An Update on Tiny ImageNet","date":"2022-05-21","arxiv_id":"2205.10660","n_code_links":1,"syntology":{"ran":4,"of":5,"n_ran_checked":4,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["ehuynh1106/TinyImageNet-Transformers"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/learning-to-count-anything-reference-less","slug":"learning-to-count-anything-reference-less","title":"Learning to Count Anything: Reference-less Class-agnostic Counting with Weak Supervision","date":"2022-05-20","arxiv_id":"2205.10203","n_code_links":2,"syntology":{"ran":3,"of":5,"n_ran_checked":2,"n_instrument":1,"unverified":2,"pointer_only":2,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","official":{"repos":["activevisionlab/learningtocountanything"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":2,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"mask-guided-vision-transformer-mg-vit-for-few","title":"Mask-guided Vision Transformer (MG-ViT) for Few-Shot Learning","date":"2022-05-20","arxiv_id":"2205.09995","n_code_links":0,"syntology":null},{"paper":"/paper/uniform-masking-enabling-mae-pre-training-for","slug":"uniform-masking-enabling-mae-pre-training-for","title":"Uniform Masking: Enabling MAE Pre-training for Pyramid-based Vision Transformers with Locality","date":"2022-05-20","arxiv_id":"2205.10063","n_code_links":1,"syntology":null},{"paper":"/paper/a-graph-transformer-for-whole-slide-image","slug":"a-graph-transformer-for-whole-slide-image","title":"A graph-transformer for whole slide image classification","date":"2022-05-19","arxiv_id":"2205.09671","n_code_links":1,"syntology":{"ran":10,"of":10,"n_ran_checked":9,"n_instrument":1,"unverified":0,"pointer_only":1,"phrase":"10 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 1 honoured, 0 violated, 8 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["vkola-lab/tmi2022"],"state":"official (archive's flag): 10 ran","n_ran":10,"n_constructed":0,"n_ran_no_instrument_failure":9,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"hover-trans-anatomy-aware-hover-transformer","title":"HoVer-Trans: Anatomy-aware HoVer-Transformer for ROI-free Breast Cancer Diagnosis in Ultrasound Images","date":"2022-05-17","arxiv_id":"2205.08390","n_code_links":0,"syntology":null},{"paper":null,"slug":"povit-vision-transformer-for-multi-objective","title":"POViT: Vision Transformer for Multi-objective Design and Characterization of Nanophotonic Devices","date":"2022-05-17","arxiv_id":"2205.09045","n_code_links":0,"syntology":null},{"paper":"/paper/vision-transformer-adapter-for-dense","slug":"vision-transformer-adapter-for-dense","title":"Vision Transformer Adapter for Dense Predictions","date":"2022-05-17","arxiv_id":"2205.08534","n_code_links":2,"syntology":null},{"paper":null,"slug":"transformer-scale-gate-for-semantic","title":"Transformer Scale Gate for Semantic Segmentation","date":"2022-05-14","arxiv_id":"2205.07056","n_code_links":0,"syntology":null},{"paper":"/paper/simple-open-vocabulary-object-detection-with","slug":"simple-open-vocabulary-object-detection-with","title":"Simple Open-Vocabulary Object Detection with Vision Transformers","date":"2022-05-12","arxiv_id":"2205.06230","n_code_links":2,"syntology":null}],"record_sha256":"4d3b0a314aed0afa0860d7a52c5b41ceca7fd2b1692d7227884ef4a54f180b78","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}