{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/vision-transformer/papers/17","list_of":"/method/vision-transformer","method":"Vision Transformer","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":17,"pages_in_order":22,"rows_per_page":100,"rows":[1601,1700],"of":2144,"counts":{"archive_papers_tagged":2144,"with_a_code_link":1051,"where_syntology_ran_a_sample":328,"not_listed_spam_title":0,"listed":2144,"listed_where_code_ran":328,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":286,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":286,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/vision-transformer","prev":"/method/vision-transformer/papers/16","next":"/method/vision-transformer/papers/18","papers":[{"paper":"/paper/s2wat-image-style-transfer-via-hierarchical","slug":"s2wat-image-style-transfer-via-hierarchical","title":"S2WAT: Image Style Transfer via Hierarchical Vision Transformer using Strips Window Attention","date":"2022-10-22","arxiv_id":"2210.12381","n_code_links":1,"syntology":null},{"paper":"/paper/face-pyramid-vision-transformer","slug":"face-pyramid-vision-transformer","title":"Face Pyramid Vision Transformer","date":"2022-10-21","arxiv_id":"2210.11974","n_code_links":1,"syntology":null},{"paper":null,"slug":"gpr-net-multi-view-layout-estimation-via-a","title":"GPR-Net: Multi-view Layout Estimation via a Geometry-aware Panorama Registration Network","date":"2022-10-20","arxiv_id":"2210.11419","n_code_links":0,"syntology":null},{"paper":"/paper/simpleclick-interactive-image-segmentation","slug":"simpleclick-interactive-image-segmentation","title":"SimpleClick: Interactive Image Segmentation with Simple Vision Transformers","date":"2022-10-20","arxiv_id":"2210.11006","n_code_links":2,"syntology":{"ran":2,"of":3,"n_ran_checked":1,"n_instrument":1,"unverified":1,"pointer_only":1,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","official":{"repos":["uncbiag/simpleclick"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official","unlocated"]}}},{"paper":"/paper/a-unified-view-of-masked-image-modeling","slug":"a-unified-view-of-masked-image-modeling","title":"A Unified View of Masked Image Modeling","date":"2022-10-19","arxiv_id":"2210.10615","n_code_links":1,"syntology":null},{"paper":null,"slug":"multi-view-gait-recognition-based-on-siamese","title":"Multi-view Gait Recognition based on Siamese Vision Transformer","date":"2022-10-19","arxiv_id":"2210.10421","n_code_links":0,"syntology":null},{"paper":null,"slug":"sequence-and-circle-exploring-the","title":"Sequence and Circle: Exploring the Relationship Between Patches","date":"2022-10-18","arxiv_id":"2210.09871","n_code_links":0,"syntology":null},{"paper":"/paper/histopathological-image-classification-based","slug":"histopathological-image-classification-based","title":"Histopathological Image Classification based on Self-Supervised Vision Transformer and Weak Labels","date":"2022-10-17","arxiv_id":"2210.09021","n_code_links":1,"syntology":null},{"paper":null,"slug":"distributionally-robust-multiclass-1","title":"Distributionally Robust Multiclass Classification and Applications in Deep Image Classifiers","date":"2022-10-15","arxiv_id":"2210.08198","n_code_links":0,"syntology":null},{"paper":null,"slug":"transformer-based-dimensionality-reduction","title":"Transformer-based dimensionality reduction","date":"2022-10-15","arxiv_id":"2210.08288","n_code_links":0,"syntology":null},{"paper":"/paper/move-unsupervised-movable-object-segmentation","slug":"move-unsupervised-movable-object-segmentation","title":"MOVE: Unsupervised Movable Object Segmentation and Detection","date":"2022-10-14","arxiv_id":"2210.07920","n_code_links":1,"syntology":{"ran":3,"of":6,"n_ran_checked":2,"n_instrument":1,"unverified":3,"pointer_only":6,"phrase":"3 ran (of which 1 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 1 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 3 unverified","official":{"repos":["adambielski/move-seg"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":1,"n_ran_no_instrument_failure":2,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":"/paper/optimizing-vision-transformers-for-medical","slug":"optimizing-vision-transformers-for-medical","title":"Optimizing Vision Transformers for Medical Image Segmentation","date":"2022-10-14","arxiv_id":"2210.08066","n_code_links":1,"syntology":null},{"paper":null,"slug":"ovit-an-accurate-second-order-pruning","title":"CAP: Correlation-Aware Pruning for Highly-Accurate Sparse Vision Models","date":"2022-10-14","arxiv_id":"2210.09223","n_code_links":0,"syntology":null},{"paper":"/paper/feature-proxy-transformer-for-few-shot","slug":"feature-proxy-transformer-for-few-shot","title":"Feature-Proxy Transformer for Few-Shot Segmentation","date":"2022-10-13","arxiv_id":"2210.06908","n_code_links":2,"syntology":null},{"paper":"/paper/how-to-train-vision-transformer-on-small","slug":"how-to-train-vision-transformer-on-small","title":"How to Train Vision Transformer on Small-scale Datasets?","date":"2022-10-13","arxiv_id":"2210.07240","n_code_links":2,"syntology":null},{"paper":"/paper/bridging-the-gap-between-vision-transformers","slug":"bridging-the-gap-between-vision-transformers","title":"Bridging the Gap Between Vision Transformers and Convolutional Neural Networks on Small Datasets","date":"2022-10-12","arxiv_id":"2210.05958","n_code_links":1,"syntology":{"ran":8,"of":10,"n_ran_checked":6,"n_instrument":2,"unverified":2,"pointer_only":5,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 2 where Syntology's instrument failed) · 2 unverified","official":{"repos":["arieseirack/dhvt"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":2,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"dynamic-clustering-network-for-unsupervised","title":"ACSeg: Adaptive Conceptualization for Unsupervised Semantic Segmentation","date":"2022-10-12","arxiv_id":"2210.05944","n_code_links":0,"syntology":null},{"paper":"/paper/s4nd-modeling-images-and-videos-as","slug":"s4nd-modeling-images-and-videos-as","title":"S4ND: Modeling Images and Videos as Multidimensional Signals Using State Spaces","date":"2022-10-12","arxiv_id":"2210.06583","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":0,"n_instrument":1,"unverified":0,"pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["hazyresearch/state-spaces"],"state":"community repositories only","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["community"]}}},{"paper":"/paper/towards-theoretically-inspired-neural","slug":"towards-theoretically-inspired-neural","title":"Towards Theoretically Inspired Neural Initialization Optimization","date":"2022-10-12","arxiv_id":"2210.05956","n_code_links":1,"syntology":null},{"paper":"/paper/sait-sparse-vision-transformers-through","slug":"sait-sparse-vision-transformers-through","title":"SaiT: Sparse Vision Transformers through Adaptive Token Pruning","date":"2022-10-11","arxiv_id":"2210.05832","n_code_links":1,"syntology":null},{"paper":null,"slug":"revisiting-adapters-with-adversarial-training","title":"Revisiting adapters with adversarial training","date":"2022-10-10","arxiv_id":"2210.04886","n_code_links":0,"syntology":null},{"paper":"/paper/visual-prompt-tuning-for-test-time-domain","slug":"visual-prompt-tuning-for-test-time-domain","title":"Visual Prompt Tuning for Test-time Domain Adaptation","date":"2022-10-10","arxiv_id":"2210.04831","n_code_links":0,"syntology":null},{"paper":"/paper/strong-gravitational-lensing-parameter","slug":"strong-gravitational-lensing-parameter","title":"Strong Gravitational Lensing Parameter Estimation with Vision Transformer","date":"2022-10-09","arxiv_id":"2210.04143","n_code_links":1,"syntology":{"ran":4,"of":5,"n_ran_checked":4,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["kuanweih/strong_lensing_vit_resnet"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/transformer-based-flood-scene-segmentation","slug":"transformer-based-flood-scene-segmentation","title":"Transformer-based Flood Scene Segmentation for Developing Countries","date":"2022-10-09","arxiv_id":"2210.04218","n_code_links":0,"syntology":null},{"paper":null,"slug":"gastrointestinal-disorder-detection-with-a","title":"Gastrointestinal Disorder Detection with a Transformer Based Approach","date":"2022-10-06","arxiv_id":"2210.03168","n_code_links":0,"syntology":null},{"paper":null,"slug":"lung2lung-volumetric-style-transfer-with-self","title":"LungViT: Ensembling Cascade of Texture Sensitive Hierarchical Vision Transformers for Cross-Volume Chest CT Image-to-Image Translation","date":"2022-10-06","arxiv_id":"2210.02625","n_code_links":0,"syntology":null},{"paper":"/paper/real-world-robot-learning-with-masked-visual","slug":"real-world-robot-learning-with-masked-visual","title":"Real-World Robot Learning with Masked Visual Pre-training","date":"2022-10-06","arxiv_id":"2210.03109","n_code_links":1,"syntology":null},{"paper":"/paper/structure-representation-network-and","slug":"structure-representation-network-and","title":"Structure Representation Network and Uncertainty Feedback Learning for Dense Non-Uniform Fog Removal","date":"2022-10-06","arxiv_id":"2210.03061","n_code_links":1,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":1,"phrase":"0 ran · 1 unverified","official":{"repos":["jinyeying/fogremoval"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"paper":null,"slug":"synbench-task-agnostic-benchmarking-of","title":"SynBench: Task-Agnostic Benchmarking of Pretrained Representations using Synthetic Data","date":"2022-10-06","arxiv_id":"2210.02989","n_code_links":0,"syntology":null},{"paper":"/paper/vision-transformer-based-model-for-describing","slug":"vision-transformer-based-model-for-describing","title":"Vision Transformer Based Model for Describing a Set of Images as a Story","date":"2022-10-06","arxiv_id":"2210.02762","n_code_links":0,"syntology":null},{"paper":"/paper/exploring-the-role-of-mean-teachers-in-self","slug":"exploring-the-role-of-mean-teachers-in-self","title":"Exploring The Role of Mean Teachers in Self-supervised Masked Auto-Encoders","date":"2022-10-05","arxiv_id":"2210.02077","n_code_links":1,"syntology":null},{"paper":"/paper/k-means-for-unsupervised-instance","slug":"k-means-for-unsupervised-instance","title":"K-means for unsupervised instance segmentation using a self-supervised transformer","date":"2022-10-04","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"a-strong-transfer-baseline-for-rgb-d-fusion","title":"Early or Late Fusion Matters: Efficient RGB-D Fusion in Vision Transformers for 3D Object Recognition","date":"2022-10-03","arxiv_id":"2210.00843","n_code_links":0,"syntology":null},{"paper":"/paper/fine-grained-object-categorization-for","slug":"fine-grained-object-categorization-for","title":"Enhancing Fine-Grained 3D Object Recognition using Hybrid Multi-Modal Vision Transformer-CNN Models","date":"2022-10-03","arxiv_id":"2210.04613","n_code_links":1,"syntology":null},{"paper":null,"slug":"introducing-vision-transformer-for-alzheimer","title":"Introducing Vision Transformer for Alzheimer's Disease classification task with 3D input","date":"2022-10-03","arxiv_id":"2210.01177","n_code_links":0,"syntology":null},{"paper":"/paper/deep-octa-ensemble-deep-learning-approaches","slug":"deep-octa-ensemble-deep-learning-approaches","title":"Deep-OCTA: Ensemble Deep Learning Approaches for Diabetic Retinopathy Analysis on OCTA Images","date":"2022-10-02","arxiv_id":"2210.00515","n_code_links":1,"syntology":null},{"paper":"/paper/diffusion-based-image-translation-using","slug":"diffusion-based-image-translation-using","title":"Diffusion-based Image Translation using Disentangled Style and Content Representation","date":"2022-09-30","arxiv_id":"2209.15264","n_code_links":1,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"0 ran · 1 unverified","official":{"repos":["anon294384/diffuseit"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"paper":"/paper/dual-progressive-transformations-for-weakly","slug":"dual-progressive-transformations-for-weakly","title":"Dual Progressive Transformations for Weakly Supervised Semantic Segmentation","date":"2022-09-30","arxiv_id":"2209.15211","n_code_links":1,"syntology":null},{"paper":null,"slug":"impact-of-face-image-quality-estimation-on","title":"Impact of Face Image Quality Estimation on Presentation Attack Detection","date":"2022-09-30","arxiv_id":"2209.15489","n_code_links":0,"syntology":null},{"paper":"/paper/mobilevitv3-mobile-friendly-vision","slug":"mobilevitv3-mobile-friendly-vision","title":"MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features","date":"2022-09-30","arxiv_id":"2209.15159","n_code_links":2,"syntology":null},{"paper":null,"slug":"self-distillation-for-further-pre-training-of","title":"Self-Distillation for Further Pre-training of Transformers","date":"2022-09-30","arxiv_id":"2210.02871","n_code_links":0,"syntology":null},{"paper":null,"slug":"where-should-i-spend-my-flops-efficiency","title":"Where Should I Spend My FLOPS? Efficiency Evaluations of Visual Pre-training Methods","date":"2022-09-30","arxiv_id":"2209.15589","n_code_links":0,"syntology":null},{"paper":"/paper/continuous-pde-dynamics-forecasting-with","slug":"continuous-pde-dynamics-forecasting-with","title":"Continuous PDE Dynamics Forecasting with Implicit Neural Representations","date":"2022-09-29","arxiv_id":"2209.14855","n_code_links":1,"syntology":{"ran":4,"of":5,"n_ran_checked":4,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["mkirchmeyer/DINo"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/360fusionnerf-panoramic-neural-radiance","slug":"360fusionnerf-panoramic-neural-radiance","title":"360FusionNeRF: Panoramic Neural Radiance Fields with Joint Guidance","date":"2022-09-28","arxiv_id":"2209.14265","n_code_links":1,"syntology":null},{"paper":"/paper/attacking-compressed-vision-transformers","slug":"attacking-compressed-vision-transformers","title":"Attacking Compressed Vision Transformers","date":"2022-09-28","arxiv_id":"2209.13785","n_code_links":1,"syntology":null},{"paper":"/paper/mtu-net-multi-level-transunet-for-space-based","slug":"mtu-net-multi-level-transunet-for-space-based","title":"MTU-Net: Multi-level TransUNet for Space-based Infrared Tiny Ship Detection","date":"2022-09-28","arxiv_id":"2209.13756","n_code_links":1,"syntology":null},{"paper":null,"slug":"collaboration-of-pre-trained-models-makes","title":"Collaboration of Pre-trained Models Makes Better Few-shot Learner","date":"2022-09-25","arxiv_id":"2209.12255","n_code_links":0,"syntology":null},{"paper":null,"slug":"nashd-efficient-vit-architecture-performance","title":"NasHD: Efficient ViT Architecture Performance Ranking using Hyperdimensional Computing","date":"2022-09-23","arxiv_id":"2209.11356","n_code_links":0,"syntology":null},{"paper":null,"slug":"wide-area-geolocalization-with-a-limited","title":"Wide-Area Geolocalization with a Limited Field of View Camera","date":"2022-09-23","arxiv_id":"2209.11854","n_code_links":0,"syntology":null},{"paper":null,"slug":"colonoscopy-landmark-detection-using-vision","title":"Colonoscopy Landmark Detection using Vision Transformers","date":"2022-09-22","arxiv_id":"2209.11304","n_code_links":0,"syntology":null},{"paper":"/paper/namedmask-distilling-segmenters-from","slug":"namedmask-distilling-segmenters-from","title":"NamedMask: Distilling Segmenters from Complementary Foundation Models","date":"2022-09-22","arxiv_id":"2209.11228","n_code_links":1,"syntology":{"ran":2,"of":3,"n_ran_checked":2,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["noelshin/namedmask"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/pretraining-the-vision-transformer-using-self","slug":"pretraining-the-vision-transformer-using-self","title":"Pretraining the Vision Transformer using self-supervised methods for vision based Deep Reinforcement Learning","date":"2022-09-22","arxiv_id":"2209.10901","n_code_links":1,"syntology":null},{"paper":"/paper/pict-a-slim-weakly-supervised-vision","slug":"pict-a-slim-weakly-supervised-vision","title":"PicT: A Slim Weakly Supervised Vision Transformer for Pavement Distress Classification","date":"2022-09-21","arxiv_id":"2209.10074","n_code_links":1,"syntology":null},{"paper":"/paper/revisiting-image-pyramid-structure-for-high","slug":"revisiting-image-pyramid-structure-for-high","title":"Revisiting Image Pyramid Structure for High Resolution Salient Object Detection","date":"2022-09-20","arxiv_id":"2209.09475","n_code_links":3,"syntology":{"ran":10,"of":11,"n_ran_checked":7,"n_instrument":3,"unverified":1,"pointer_only":0,"phrase":"10 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 3 where Syntology's instrument failed) · 1 unverified","official":{"repos":["plemeri/inspyrenet","plemeri/transparent-background"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":1,"ran_from_kinds":["listed","official"]}}},{"paper":"/paper/attentive-symmetric-autoencoder-for-brain-mri","slug":"attentive-symmetric-autoencoder-for-brain-mri","title":"Attentive Symmetric Autoencoder for Brain MRI Segmentation","date":"2022-09-19","arxiv_id":"2209.08887","n_code_links":1,"syntology":null},{"paper":null,"slug":"himfr-a-hybrid-masked-face-recognition","title":"HiMFR: A Hybrid Masked Face Recognition Through Face Inpainting","date":"2022-09-19","arxiv_id":"2209.08930","n_code_links":0,"syntology":null},{"paper":"/paper/multi-task-vision-transformer-for-semi","slug":"multi-task-vision-transformer-for-semi","title":"ViT-DD: Multi-Task Vision Transformer for Semi-Supervised Driver Distraction Detection","date":"2022-09-19","arxiv_id":"2209.09178","n_code_links":1,"syntology":null},{"paper":"/paper/panoramic-vision-transformer-for-saliency","slug":"panoramic-vision-transformer-for-saliency","title":"Panoramic Vision Transformer for Saliency Detection in 360° Videos","date":"2022-09-19","arxiv_id":"2209.08956","n_code_links":1,"syntology":{"ran":5,"of":7,"n_ran_checked":4,"n_instrument":1,"unverified":2,"pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 1 violated, 3 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","official":{"repos":["hs-yn/paver"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":2,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"uncertainty-aware-multitask-pyramid-vision","title":"Uncertainty Aware Multitask Pyramid Vision Transformer For UAV-Based Object Re-Identification","date":"2022-09-19","arxiv_id":"2209.08686","n_code_links":0,"syntology":null},{"paper":null,"slug":"eeg-based-epileptic-seizure-prediction-using","title":"EEG-Based Epileptic Seizure Prediction Using Temporal Multi-Channel Transformers","date":"2022-09-18","arxiv_id":"2209.11172","n_code_links":0,"syntology":null},{"paper":"/paper/a-mosquito-is-worth-16x16-larvae-evaluation","slug":"a-mosquito-is-worth-16x16-larvae-evaluation","title":"A Mosquito is Worth 16x16 Larvae: Evaluation of Deep Learning Architectures for Mosquito Larvae Classification","date":"2022-09-16","arxiv_id":"2209.07718","n_code_links":1,"syntology":null},{"paper":"/paper/hybrid-window-attention-based-transformer","slug":"hybrid-window-attention-based-transformer","title":"Hybrid Window Attention Based Transformer Architecture for Brain Tumor Segmentation","date":"2022-09-16","arxiv_id":"2209.07704","n_code_links":1,"syntology":null},{"paper":"/paper/ppt-token-pruned-pose-transformer-for","slug":"ppt-token-pruned-pose-transformer-for","title":"PPT: token-Pruned Pose Transformer for monocular and multi-view human pose estimation","date":"2022-09-16","arxiv_id":"2209.08194","n_code_links":2,"syntology":null},{"paper":"/paper/self-supervised-learning-of-phenotypic","slug":"self-supervised-learning-of-phenotypic","title":"Self-Supervised Learning of Phenotypic Representations from Cell Images with Weak Labels","date":"2022-09-16","arxiv_id":"2209.07819","n_code_links":1,"syntology":null},{"paper":"/paper/priorlane-a-prior-knowledge-enhanced-lane","slug":"priorlane-a-prior-knowledge-enhanced-lane","title":"PriorLane: A Prior Knowledge Enhanced Lane Detection Approach Based on Transformer","date":"2022-09-15","arxiv_id":"2209.06994","n_code_links":1,"syntology":null},{"paper":null,"slug":"a-lightweight-transformer-based-model-for","title":"A lightweight Transformer-based model for fish landmark detection","date":"2022-09-13","arxiv_id":"2209.05777","n_code_links":0,"syntology":null},{"paper":null,"slug":"dmtnet-dynamic-multi-scale-network-for-dual","title":"DMTNet: Dynamic Multi-scale Network for Dual-pixel Images Defocus Deblurring with Transformer","date":"2022-09-13","arxiv_id":"2209.06040","n_code_links":0,"syntology":null},{"paper":null,"slug":"vision-transformers-for-action-recognition-a","title":"Vision Transformers for Action Recognition: A Survey","date":"2022-09-13","arxiv_id":"2209.05700","n_code_links":0,"syntology":null},{"paper":"/paper/openmixup-open-mixup-toolbox-and-benchmark","slug":"openmixup-open-mixup-toolbox-and-benchmark","title":"OpenMixup: Open Mixup Toolbox and Benchmark for Visual Representation Learning","date":"2022-09-11","arxiv_id":"2209.04851","n_code_links":1,"syntology":null},{"paper":"/paper/multi-granularity-prediction-for-scene-text","slug":"multi-granularity-prediction-for-scene-text","title":"Multi-Granularity Prediction for Scene Text Recognition","date":"2022-09-08","arxiv_id":"2209.03592","n_code_links":3,"syntology":null},{"paper":null,"slug":"video-vision-transformers-for-violence","title":"Video Vision Transformers for Violence Detection","date":"2022-09-08","arxiv_id":"2209.03561","n_code_links":0,"syntology":null},{"paper":null,"slug":"prior-knowledge-guided-attention-in-self","title":"Prior Knowledge-Guided Attention in Self-Supervised Vision Transformers","date":"2022-09-07","arxiv_id":"2209.03745","n_code_links":0,"syntology":null},{"paper":null,"slug":"transfer-learning-and-vision-transformer","title":"Transfer Learning and Vision Transformer based State-of-Health prediction of Lithium-Ion Batteries","date":"2022-09-07","arxiv_id":"2209.05253","n_code_links":0,"syntology":null},{"paper":null,"slug":"fusion-of-satellite-images-and-weather-data","title":"Fusion of Satellite Images and Weather Data with Transformer Networks for Downy Mildew Disease Detection","date":"2022-09-06","arxiv_id":"2209.02797","n_code_links":0,"syntology":null},{"paper":null,"slug":"transformer-cnn-cohort-semi-supervised","title":"Transformer-CNN Cohort: Semi-supervised Semantic Segmentation by the Best of Both Students","date":"2022-09-06","arxiv_id":"2209.02178","n_code_links":0,"syntology":null},{"paper":"/paper/vitkd-practical-guidelines-for-vit-feature","slug":"vitkd-practical-guidelines-for-vit-feature","title":"ViTKD: Practical Guidelines for ViT feature knowledge distillation","date":"2022-09-06","arxiv_id":"2209.02432","n_code_links":1,"syntology":null},{"paper":"/paper/time-distance-vision-transformers-in-lung","slug":"time-distance-vision-transformers-in-lung","title":"Time-distance vision transformers in lung cancer diagnosis from longitudinal computed tomography","date":"2022-09-04","arxiv_id":"2209.01676","n_code_links":1,"syntology":null},{"paper":"/paper/evit-privacy-preserving-image-retrieval-via","slug":"evit-privacy-preserving-image-retrieval-via","title":"EViT: Privacy-Preserving Image Retrieval via Encrypted Vision Transformer in Cloud Computing","date":"2022-08-31","arxiv_id":"2208.14657","n_code_links":1,"syntology":null},{"paper":"/paper/sim-trans-structure-information-modeling","slug":"sim-trans-structure-information-modeling","title":"SIM-Trans: Structure Information Modeling Transformer for Fine-grained Visual Categorization","date":"2022-08-31","arxiv_id":"2208.14607","n_code_links":1,"syntology":null},{"paper":null,"slug":"light-yolov5-a-lightweight-algorithm-for","title":"Light-YOLOv5: A Lightweight Algorithm for Improved YOLOv5 in Complex Fire Scenarios","date":"2022-08-29","arxiv_id":"2208.13422","n_code_links":0,"syntology":null},{"paper":null,"slug":"open-set-semi-supervised-object-detection","title":"Open-Set Semi-Supervised Object Detection","date":"2022-08-29","arxiv_id":"2208.13722","n_code_links":0,"syntology":null},{"paper":null,"slug":"an-access-control-method-with-secret-key-for","title":"An Access Control Method with Secret Key for Semantic Segmentation Models","date":"2022-08-28","arxiv_id":"2208.13135","n_code_links":0,"syntology":null},{"paper":"/paper/vmformer-end-to-end-video-matting-with","slug":"vmformer-end-to-end-video-matting-with","title":"VMFormer: End-to-End Video Matting with Transformer","date":"2022-08-26","arxiv_id":"2208.12801","n_code_links":1,"syntology":null},{"paper":"/paper/a-deep-learning-approach-using-masked-image","slug":"a-deep-learning-approach-using-masked-image","title":"A Deep Learning Approach Using Masked Image Modeling for Reconstruction of Undersampled K-spaces","date":"2022-08-24","arxiv_id":"2208.11472","n_code_links":1,"syntology":null},{"paper":null,"slug":"federated-self-supervised-contrastive-1","title":"Federated Self-Supervised Contrastive Learning and Masked Autoencoder for Dermatological Disease Diagnosis","date":"2022-08-24","arxiv_id":"2208.11278","n_code_links":0,"syntology":null},{"paper":null,"slug":"predicting-microsatellite-instability-and-key","title":"Predicting microsatellite instability and key biomarkers in colorectal cancer from H&E-stained images: Achieving SOTA predictive performance with fewer data using Swin Transformer","date":"2022-08-22","arxiv_id":"2208.10495","n_code_links":0,"syntology":null},{"paper":"/paper/protopformer-concentrating-on-prototypical","slug":"protopformer-concentrating-on-prototypical","title":"ProtoPFormer: Concentrating on Prototypical Parts in Vision Transformers for Interpretable Image Recognition","date":"2022-08-22","arxiv_id":"2208.10431","n_code_links":1,"syntology":{"ran":3,"of":4,"n_ran_checked":3,"n_instrument":0,"unverified":1,"pointer_only":1,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["zju-vipa/protopformer"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/accelerating-vision-transformer-training-via","slug":"accelerating-vision-transformer-training-via","title":"Accelerating Vision Transformer Training via a Patch Sampling Schedule","date":"2022-08-19","arxiv_id":"2208.09520","n_code_links":1,"syntology":null},{"paper":null,"slug":"the-8-point-algorithm-as-an-inductive-bias","title":"The 8-Point Algorithm as an Inductive Bias for Relative Pose Prediction by ViTs","date":"2022-08-18","arxiv_id":"2208.08988","n_code_links":0,"syntology":null},{"paper":"/paper/conviformers-convolutionally-guided-vision","slug":"conviformers-convolutionally-guided-vision","title":"Conviformers: Convolutionally guided Vision Transformer","date":"2022-08-17","arxiv_id":"2208.08900","n_code_links":1,"syntology":null},{"paper":"/paper/video-transunet-temporally-blended-vision","slug":"video-transunet-temporally-blended-vision","title":"Video-TransUNet: Temporally Blended Vision Transformer for CT VFSS Instance Segmentation","date":"2022-08-17","arxiv_id":"2208.08315","n_code_links":2,"syntology":null},{"paper":null,"slug":"vit-ret-vision-and-recurrent-transformer","title":"ViT-ReT: Vision and Recurrent Transformer Neural Networks for Human Activity Recognition in Videos","date":"2022-08-16","arxiv_id":"2208.07929","n_code_links":0,"syntology":null},{"paper":"/paper/your-vit-is-secretly-a-hybrid-discriminative","slug":"your-vit-is-secretly-a-hybrid-discriminative","title":"Your ViT is Secretly a Hybrid Discriminative-Generative Diffusion Model","date":"2022-08-16","arxiv_id":"2208.07791","n_code_links":2,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"0 ran · 1 unverified","official":{"repos":["sndnyang/Diffusion_ViT"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"paper":null,"slug":"a-vision-transformer-based-approach-to","title":"A Vision Transformer-Based Approach to Bearing Fault Classification via Vibration Signals","date":"2022-08-15","arxiv_id":"2208.07070","n_code_links":0,"syntology":null},{"paper":"/paper/self-supervised-vision-transformers-for","slug":"self-supervised-vision-transformers-for","title":"Self-Supervised Vision Transformers for Malware Detection","date":"2022-08-15","arxiv_id":"2208.07049","n_code_links":1,"syntology":{"ran":8,"of":8,"n_ran_checked":8,"n_instrument":0,"unverified":0,"pointer_only":4,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 1 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["sachith500/sherlock"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":8,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/shuffle-instances-based-vision-transformer","slug":"shuffle-instances-based-vision-transformer","title":"Shuffle Instances-based Vision Transformer for Pancreatic Cancer ROSE Image Classification","date":"2022-08-14","arxiv_id":"2208.06833","n_code_links":1,"syntology":null},{"paper":"/paper/beit-v2-masked-image-modeling-with-vector","slug":"beit-v2-masked-image-modeling-with-vector","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","date":"2022-08-12","arxiv_id":"2208.06366","n_code_links":3,"syntology":null},{"paper":null,"slug":"shifted-windows-transformers-for-medical","title":"Shifted Windows Transformers for Medical Image Quality Assessment","date":"2022-08-11","arxiv_id":"2208.06034","n_code_links":0,"syntology":null},{"paper":"/paper/ghost-free-high-dynamic-range-imaging-with","slug":"ghost-free-high-dynamic-range-imaging-with","title":"Ghost-free High Dynamic Range Imaging with Context-aware Transformer","date":"2022-08-10","arxiv_id":"2208.05114","n_code_links":3,"syntology":{"ran":5,"of":8,"n_ran_checked":5,"n_instrument":0,"unverified":3,"pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","official":{"repos":["megvii-research/hdr-transformer"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"non-contrastive-self-supervised-learning-for","title":"Non-Contrastive Self-supervised Learning for Utterance-Level Information Extraction from Speech","date":"2022-08-10","arxiv_id":"2208.05445","n_code_links":0,"syntology":null}],"record_sha256":"4e8dff7001b1b61e588f4acd32a284bcde476b1c62ff69fad3b657c41823a194","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}