{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/vision-transformer/papers/8","list_of":"/method/vision-transformer","method":"Vision Transformer","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":8,"pages_in_order":22,"rows_per_page":100,"rows":[701,800],"of":2144,"counts":{"archive_papers_tagged":2144,"with_a_code_link":1051,"where_syntology_ran_a_sample":328,"not_listed_spam_title":0,"listed":2144,"listed_where_code_ran":328,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":286,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":286,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/vision-transformer","prev":"/method/vision-transformer/papers/7","next":"/method/vision-transformer/papers/9","papers":[{"paper":"/paper/neural-operator-for-accelerating-coronal","slug":"neural-operator-for-accelerating-coronal","title":"Global-local Fourier Neural Operator for Accelerating Coronal Magnetic Field Model","date":"2024-05-21","arxiv_id":"2405.12754","n_code_links":1,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"0 ran · 1 unverified","official":{"repos":["yutao-0718/gl-fno"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"paper":null,"slug":"a-method-on-searching-better-activation","title":"A Method on Searching Better Activation Functions","date":"2024-05-19","arxiv_id":"2405.12954","n_code_links":0,"syntology":null},{"paper":"/paper/track-anything-rapter-tar","slug":"track-anything-rapter-tar","title":"Track Anything Rapter(TAR)","date":"2024-05-19","arxiv_id":"2405.11655","n_code_links":1,"syntology":null},{"paper":null,"slug":"towards-sar-automatic-target-recognition","title":"Towards SAR Automatic Target Recognition MultiCategory SAR Image Classification Based on Light Weight Vision Transformer","date":"2024-05-18","arxiv_id":"2407.06128","n_code_links":0,"syntology":null},{"paper":"/paper/dino-as-a-von-mises-fisher-mixture-model-1","slug":"dino-as-a-von-mises-fisher-mixture-model-1","title":"DINO as a von Mises-Fisher mixture model","date":"2024-05-17","arxiv_id":"2405.10939","n_code_links":0,"syntology":null},{"paper":"/paper/enhancing-the-analysis-of-murine-neonatal","slug":"enhancing-the-analysis-of-murine-neonatal","title":"Enhancing the analysis of murine neonatal ultrasonic vocalizations: Development, evaluation, and application of different mathematical models","date":"2024-05-17","arxiv_id":"2405.12957","n_code_links":1,"syntology":null},{"paper":"/paper/grounding-dino-1-5-advance-the-edge-of-open","slug":"grounding-dino-1-5-advance-the-edge-of-open","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","date":"2024-05-16","arxiv_id":"2405.10300","n_code_links":3,"syntology":{"ran":1,"of":2,"n_ran_checked":1,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["idea-research/grounding-dino-1.5-api"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/histopathology-foundation-models-enable","slug":"histopathology-foundation-models-enable","title":"A Comprehensive Evaluation of Histopathology Foundation Models for Ovarian Cancer Subtype Classification","date":"2024-05-16","arxiv_id":"2405.09990","n_code_links":1,"syntology":null},{"paper":"/paper/quantum-vision-transformers-for-quark-gluon","slug":"quantum-vision-transformers-for-quark-gluon","title":"Quantum Vision Transformers for Quark-Gluon Classification","date":"2024-05-16","arxiv_id":"2405.10284","n_code_links":1,"syntology":{"ran":3,"of":4,"n_ran_checked":3,"n_instrument":0,"unverified":1,"pointer_only":4,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["salcc/QuantumTransformers"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"vision-transformers-for-end-to-end-vision","title":"Vision Transformers for End-to-End Vision-Based Quadrotor Obstacle Avoidance","date":"2024-05-16","arxiv_id":"2405.10391","n_code_links":0,"syntology":null},{"paper":null,"slug":"perception-and-fidelity-aware-reduced","title":"Perception- and Fidelity-aware Reduced-Reference Super-Resolution Image Quality Assessment","date":"2024-05-15","arxiv_id":"2405.09472","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-timely-survey-on-vision-transformer-for","title":"A Timely Survey on Vision Transformer for Deepfake Detection","date":"2024-05-14","arxiv_id":"2405.08463","n_code_links":0,"syntology":null},{"paper":null,"slug":"abnormal-respiratory-sound-identification","title":"Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer","date":"2024-05-14","arxiv_id":"2405.08342","n_code_links":0,"syntology":null},{"paper":null,"slug":"rethinking-scanning-strategies-with-vision","title":"Rethinking Scanning Strategies with Vision Mamba in Semantic Segmentation of Remote Sensing Imagery: An Experimental Study","date":"2024-05-14","arxiv_id":"2405.08493","n_code_links":0,"syntology":null},{"paper":null,"slug":"nutritionverse-direct-exploring-deep-neural","title":"NutritionVerse-Direct: Exploring Deep Neural Networks for Multitask Nutrition Prediction from Food Images","date":"2024-05-13","arxiv_id":"2405.07814","n_code_links":0,"syntology":null},{"paper":"/paper/boq-a-place-is-worth-a-bag-of-learnable","slug":"boq-a-place-is-worth-a-bag-of-learnable","title":"BoQ: A Place is Worth a Bag of Learnable Queries","date":"2024-05-12","arxiv_id":"2405.07364","n_code_links":1,"syntology":{"ran":2,"of":2,"n_ran_checked":2,"n_instrument":0,"unverified":0,"pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["amaralibey/bag-of-queries"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"qmvit-a-mushroom-is-worth-16x16-words","title":"QMViT: A Mushroom is worth 16x16 Words","date":"2024-05-11","arxiv_id":"2407.04708","n_code_links":0,"syntology":null},{"paper":null,"slug":"dual-task-vision-transformer-for-rapid-and","title":"Dual-Task Vision Transformer for Rapid and Accurate Intracerebral Hemorrhage CT Image Classification","date":"2024-05-10","arxiv_id":"2405.06814","n_code_links":0,"syntology":null},{"paper":null,"slug":"an-advanced-features-extraction-module-for","title":"An Advanced Features Extraction Module for Remote Sensing Image Super-Resolution","date":"2024-05-07","arxiv_id":"2405.04595","n_code_links":0,"syntology":null},{"paper":"/paper/structured-click-control-in-transformer-based","slug":"structured-click-control-in-transformer-based","title":"Structured Click Control in Transformer-based Interactive Segmentation","date":"2024-05-07","arxiv_id":"2405.04009","n_code_links":1,"syntology":{"ran":8,"of":9,"n_ran_checked":6,"n_instrument":2,"unverified":1,"pointer_only":9,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 1 honoured, 0 violated, 5 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","official":{"repos":["hahamyt/scc"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"class-relevant-patch-embedding-selection-for","title":"Class-relevant Patch Embedding Selection for Few-Shot Image Classification","date":"2024-05-06","arxiv_id":"2405.03722","n_code_links":0,"syntology":null},{"paper":null,"slug":"deep-learning-classifier-of-locally-advanced","title":"Swin transformers are robust to distribution and concept drift in endoscopy-based longitudinal rectal cancer assessment","date":"2024-05-06","arxiv_id":"2405.03762","n_code_links":0,"syntology":null},{"paper":null,"slug":"intra-task-mutual-attention-based-vision","title":"Intra-task Mutual Attention based Vision Transformer for Few-Shot Learning","date":"2024-05-06","arxiv_id":"2405.03109","n_code_links":0,"syntology":null},{"paper":null,"slug":"boosting-3d-neuron-segmentation-with-2d","title":"Boosting 3D Neuron Segmentation with 2D Vision Transformer Pre-trained on Natural Images","date":"2024-05-04","arxiv_id":"2405.02686","n_code_links":0,"syntology":null},{"paper":"/paper/an-attention-based-pipeline-for-identifying","slug":"an-attention-based-pipeline-for-identifying","title":"An Attention Based Pipeline for Identifying Pre-Cancer Lesions in Head and Neck Clinical Images","date":"2024-05-03","arxiv_id":"2405.01937","n_code_links":1,"syntology":null},{"paper":null,"slug":"multi-method-integration-with-confidence","title":"Multi-method Integration with Confidence-based Weighting for Zero-shot Image Classification","date":"2024-05-03","arxiv_id":"2405.02155","n_code_links":0,"syntology":null},{"paper":"/paper/torch2chip-an-end-to-end-customizable-deep","slug":"torch2chip-an-end-to-end-customizable-deep","title":"Torch2Chip: An End-to-end Customizable Deep Neural Network Compression and Deployment Toolkit for Prototype Hardware Accelerator Design","date":"2024-05-02","arxiv_id":"2405.01775","n_code_links":1,"syntology":null},{"paper":"/paper/brighteye-glaucoma-screening-with-color","slug":"brighteye-glaucoma-screening-with-color","title":"Brighteye: Glaucoma Screening with Color Fundus Photographs based on Vision Transformer","date":"2024-05-01","arxiv_id":"2405.00857","n_code_links":1,"syntology":null},{"paper":"/paper/exploring-self-supervised-vision-transformers","slug":"exploring-self-supervised-vision-transformers","title":"Exploring Self-Supervised Vision Transformers for Deepfake Detection: A Comparative Analysis","date":"2024-05-01","arxiv_id":"2405.00355","n_code_links":1,"syntology":null},{"paper":null,"slug":"lotus-improving-transformer-efficiency-with","title":"LOTUS: Improving Transformer Efficiency with Sparsity Pruning and Data Lottery Tickets","date":"2024-05-01","arxiv_id":"2405.00906","n_code_links":0,"syntology":null},{"paper":null,"slug":"automatic-cardiac-pathology-recognition-in","title":"Automatic Cardiac Pathology Recognition in Echocardiography Images Using Higher Order Dynamic Mode Decomposition and a Vision Transformer for Small Datasets","date":"2024-04-30","arxiv_id":"2404.19579","n_code_links":0,"syntology":null},{"paper":"/paper/clip-mamba-clip-pretrained-mamba-models-with","slug":"clip-mamba-clip-pretrained-mamba-models-with","title":"CLIP-Mamba: CLIP Pretrained Mamba Models with OOD and Hessian Evaluation","date":"2024-04-30","arxiv_id":"2404.19394","n_code_links":1,"syntology":null},{"paper":"/paper/masked-multi-query-slot-attention-for","slug":"masked-multi-query-slot-attention-for","title":"Masked Multi-Query Slot Attention for Unsupervised Object Discovery","date":"2024-04-30","arxiv_id":"2404.19654","n_code_links":1,"syntology":null},{"paper":null,"slug":"neuro-vision-to-language-image-reconstruction","title":"Neuro-Vision to Language: Enhancing Brain Recording-based Visual Reconstruction and Language Interaction","date":"2024-04-30","arxiv_id":"2404.19438","n_code_links":0,"syntology":null},{"paper":"/paper/seeing-through-the-clouds-cloud-gap","slug":"seeing-through-the-clouds-cloud-gap","title":"Seeing Through the Clouds: Cloud Gap Imputation with Prithvi Foundation Model","date":"2024-04-30","arxiv_id":"2404.19609","n_code_links":1,"syntology":null},{"paper":null,"slug":"harmonic-machine-learning-models-are-robust","title":"Harmonic Machine Learning Models are Robust","date":"2024-04-29","arxiv_id":"2404.18825","n_code_links":0,"syntology":null},{"paper":"/paper/fashion-recommendation-outfit-compatibility","slug":"fashion-recommendation-outfit-compatibility","title":"Fashion Recommendation: Outfit Compatibility using GNN","date":"2024-04-28","arxiv_id":"2404.18040","n_code_links":1,"syntology":null},{"paper":"/paper/multimae-der-multimodal-masked-autoencoder","slug":"multimae-der-multimodal-masked-autoencoder","title":"MultiMAE-DER: Multimodal Masked Autoencoder for Dynamic Emotion Recognition","date":"2024-04-28","arxiv_id":"2404.18327","n_code_links":1,"syntology":null},{"paper":"/paper/clft-camera-lidar-fusion-transformer-for","slug":"clft-camera-lidar-fusion-transformer-for","title":"CLFT: Camera-LiDAR Fusion Transformer for Semantic Segmentation in Autonomous Driving","date":"2024-04-27","arxiv_id":"2404.17793","n_code_links":2,"syntology":null},{"paper":"/paper/binarizing-documents-by-leveraging-both-space","slug":"binarizing-documents-by-leveraging-both-space","title":"Binarizing Documents by Leveraging both Space and Frequency","date":"2024-04-26","arxiv_id":"2404.17243","n_code_links":1,"syntology":null},{"paper":"/paper/parameter-efficient-fine-tuning-of-self","slug":"parameter-efficient-fine-tuning-of-self","title":"Parameter Efficient Fine-tuning of Self-supervised ViTs without Catastrophic Forgetting","date":"2024-04-26","arxiv_id":"2404.17245","n_code_links":1,"syntology":null},{"paper":null,"slug":"s-iqa-image-quality-assessment-with","title":"Image Quality Assessment With Compressed Sampling","date":"2024-04-26","arxiv_id":"2404.17170","n_code_links":0,"syntology":null},{"paper":"/paper/saghog-self-supervised-autoencoder-for","slug":"saghog-self-supervised-autoencoder-for","title":"SAGHOG: Self-Supervised Autoencoder for Generating HOG Features for Writer Retrieval","date":"2024-04-26","arxiv_id":"2404.17221","n_code_links":1,"syntology":null},{"paper":"/paper/unirgb-ir-a-unified-framework-for-visible","slug":"unirgb-ir-a-unified-framework-for-visible","title":"UniRGB-IR: A Unified Framework for RGB-Infrared Semantic Tasks via Adapter Tuning","date":"2024-04-26","arxiv_id":"2404.17360","n_code_links":1,"syntology":null},{"paper":"/paper/boosting-unsupervised-semantic-segmentation","slug":"boosting-unsupervised-semantic-segmentation","title":"Boosting Unsupervised Semantic Segmentation with Principal Mask Proposals","date":"2024-04-25","arxiv_id":"2404.16818","n_code_links":1,"syntology":null},{"paper":"/paper/tinychart-efficient-chart-understanding-with","slug":"tinychart-efficient-chart-understanding-with","title":"TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning","date":"2024-04-25","arxiv_id":"2404.16635","n_code_links":1,"syntology":null},{"paper":null,"slug":"mim-mask-in-mask-self-supervised-pre-training","title":"MiM: Mask in Mask Self-Supervised Pre-Training for 3D Medical Image Analysis","date":"2024-04-24","arxiv_id":"2404.15580","n_code_links":0,"syntology":null},{"paper":"/paper/rethinking-model-prototyping-through-the","slug":"rethinking-model-prototyping-through-the","title":"Rethinking model prototyping through the MedMNIST+ dataset collection","date":"2024-04-24","arxiv_id":"2404.15786","n_code_links":1,"syntology":null},{"paper":"/paper/sparo-selective-attention-for-robust-and","slug":"sparo-selective-attention-for-robust-and","title":"SPARO: Selective Attention for Robust and Compositional Transformer Encodings for Vision","date":"2024-04-24","arxiv_id":"2404.15721","n_code_links":1,"syntology":null},{"paper":"/paper/vision-transformer-based-adversarial-domain","slug":"vision-transformer-based-adversarial-domain","title":"Vision Transformer-based Adversarial Domain Adaptation","date":"2024-04-24","arxiv_id":"2404.15817","n_code_links":1,"syntology":null},{"paper":null,"slug":"orbit-oak-ridge-base-foundation-model-for","title":"ORBIT: Oak Ridge Base Foundation Model for Earth System Predictability","date":"2024-04-23","arxiv_id":"2404.14712","n_code_links":0,"syntology":null},{"paper":null,"slug":"thermopore-predicting-part-porosity-based-on","title":"ThermoPore: Predicting Part Porosity Based on Thermal Images Using Deep Learning","date":"2024-04-23","arxiv_id":"2404.16882","n_code_links":0,"syntology":null},{"paper":null,"slug":"1st-place-solution-to-the-1st-skatingverse","title":"1st Place Solution to the 1st SkatingVerse Challenge","date":"2024-04-22","arxiv_id":"2404.14032","n_code_links":0,"syntology":null},{"paper":null,"slug":"cross-task-multi-branch-vision-transformer","title":"Cross-Task Multi-Branch Vision Transformer for Facial Expression and Mask Wearing Classification","date":"2024-04-22","arxiv_id":"2404.14606","n_code_links":0,"syntology":null},{"paper":"/paper/filo-zero-shot-anomaly-detection-by-fine","slug":"filo-zero-shot-anomaly-detection-by-fine","title":"FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization","date":"2024-04-21","arxiv_id":"2404.13671","n_code_links":1,"syntology":{"ran":7,"of":12,"n_ran_checked":5,"n_instrument":2,"unverified":5,"pointer_only":7,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 1 violated, 4 with no contract checked; 2 where Syntology's instrument failed) · 5 unverified","official":{"repos":["casia-iva-lab/filo"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":5,"ran_from_kinds":["official"]}}},{"paper":"/paper/lmfnet-an-efficient-multimodal-fusion","slug":"lmfnet-an-efficient-multimodal-fusion","title":"LMFNet: An Efficient Multimodal Fusion Approach for Semantic Segmentation in High-Resolution Remote Sensing","date":"2024-04-21","arxiv_id":"2404.13659","n_code_links":0,"syntology":null},{"paper":"/paper/masked-latent-transformer-with-the-random","slug":"masked-latent-transformer-with-the-random","title":"Masked Latent Transformer with the Random Masking Ratio to Advance the Diagnosis of Dental Fluorosis","date":"2024-04-21","arxiv_id":"2404.13564","n_code_links":1,"syntology":null},{"paper":"/paper/vim4path-self-supervised-vision-mamba-for","slug":"vim4path-self-supervised-vision-mamba-for","title":"Vim4Path: Self-Supervised Vision Mamba for Histopathology Images","date":"2024-04-20","arxiv_id":"2404.13222","n_code_links":1,"syntology":{"ran":2,"of":2,"n_ran_checked":0,"n_instrument":2,"unverified":0,"pointer_only":1,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","official":{"repos":["atlasanalyticslab/vim4path"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official","unlocated"]}}},{"paper":null,"slug":"towards-robust-ferrous-scrap-material","title":"Towards Robust Ferrous Scrap Material Classification with Deep Learning and Conformal Prediction","date":"2024-04-19","arxiv_id":"2404.13002","n_code_links":0,"syntology":null},{"paper":"/paper/the-devil-is-in-the-object-boundary-towards","slug":"the-devil-is-in-the-object-boundary-towards","title":"The devil is in the object boundary: towards annotation-free instance segmentation using Foundation Models","date":"2024-04-18","arxiv_id":"2404.11957","n_code_links":1,"syntology":{"ran":2,"of":2,"n_ran_checked":0,"n_instrument":2,"unverified":0,"pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","official":{"repos":["chengshiest/zip-your-clip"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/jointvit-modeling-oxygen-saturation-levels","slug":"jointvit-modeling-oxygen-saturation-levels","title":"JointViT: Modeling Oxygen Saturation Levels with Joint Supervision on Long-Tailed OCTA","date":"2024-04-17","arxiv_id":"2404.11525","n_code_links":1,"syntology":null},{"paper":null,"slug":"pretraining-billion-scale-geospatial","title":"Pretraining Billion-scale Geospatial Foundational Models on Frontier","date":"2024-04-17","arxiv_id":"2404.11706","n_code_links":0,"syntology":null},{"paper":null,"slug":"supervised-contrastive-vision-transformer-for","title":"Supervised Contrastive Vision Transformer for Breast Histopathological Image Classification","date":"2024-04-17","arxiv_id":"2404.11052","n_code_links":0,"syntology":null},{"paper":"/paper/gasformer-a-transformer-based-architecture","slug":"gasformer-a-transformer-based-architecture","title":"Gasformer: A Transformer-based Architecture for Segmenting Methane Emissions from Livestock in Optical Gas Imaging","date":"2024-04-16","arxiv_id":"2404.10841","n_code_links":1,"syntology":null},{"paper":null,"slug":"arena-a-patch-of-interest-vit-inference","title":"Arena: A Patch-of-Interest ViT Inference Acceleration System for Edge-Assisted Video Analytics","date":"2024-04-14","arxiv_id":"2404.09245","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-novel-vision-transformer-based-load-profile","title":"A Novel Vision Transformer based Load Profile Analysis using Load Images as Inputs","date":"2024-04-12","arxiv_id":"2404.08175","n_code_links":0,"syntology":null},{"paper":null,"slug":"ifvit-interpretable-fixed-length","title":"IFViT: Interpretable Fixed-Length Representation for Fingerprint Matching via Vision Transformer","date":"2024-04-12","arxiv_id":"2404.08237","n_code_links":0,"syntology":null},{"paper":"/paper/pay-attention-to-your-neighbours-training","slug":"pay-attention-to-your-neighbours-training","title":"Pay Attention to Your Neighbours: Training-Free Open-Vocabulary Semantic Segmentation","date":"2024-04-12","arxiv_id":"2404.08181","n_code_links":1,"syntology":{"ran":4,"of":6,"n_ran_checked":1,"n_instrument":3,"unverified":2,"pointer_only":2,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 3 where Syntology's instrument failed) · 2 unverified","official":{"repos":["sinahmr/naclip"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":2,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"single-image-driven-3d-viewpoint-training","title":"Single-image driven 3d viewpoint training data augmentation for effective wine label recognition","date":"2024-04-12","arxiv_id":"2404.08820","n_code_links":0,"syntology":null},{"paper":"/paper/progressive-semantic-guided-vision","slug":"progressive-semantic-guided-vision","title":"Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning","date":"2024-04-11","arxiv_id":"2404.07713","n_code_links":1,"syntology":{"ran":8,"of":8,"n_ran_checked":6,"n_instrument":2,"unverified":0,"pointer_only":8,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","official":{"repos":["shiming-chen/zslvit"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/internlm-xcomposer2-4khd-a-pioneering-large","slug":"internlm-xcomposer2-4khd-a-pioneering-large","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","date":"2024-04-09","arxiv_id":"2404.06512","n_code_links":2,"syntology":null},{"paper":null,"slug":"vision2ui-a-real-world-dataset-with-layout","title":"WebCode2M: A Real-World Dataset for Code Generation from Webpage Designs","date":"2024-04-09","arxiv_id":"2404.06369","n_code_links":0,"syntology":null},{"paper":"/paper/hsvit-horizontally-scalable-vision","slug":"hsvit-horizontally-scalable-vision","title":"HSViT: Horizontally Scalable Vision Transformer","date":"2024-04-08","arxiv_id":"2404.05196","n_code_links":1,"syntology":null},{"paper":null,"slug":"gvt-a-graph-based-vision-transformer-with","title":"GvT: A Graph-based Vision Transformer with Talking-Heads Utilizing Sparsity, Trained from Scratch on Small Datasets","date":"2024-04-07","arxiv_id":"2404.04924","n_code_links":0,"syntology":null},{"paper":null,"slug":"hyperbolic-learning-with-synthetic-captions","title":"Hyperbolic Learning with Synthetic Captions for Open-World Detection","date":"2024-04-07","arxiv_id":"2404.05016","n_code_links":0,"syntology":null},{"paper":"/paper/vmambamorph-a-visual-mamba-based-framework","slug":"vmambamorph-a-visual-mamba-based-framework","title":"VMambaMorph: a Multi-Modality Deformable Image Registration Framework based on Visual State Space Model with Cross-Scan Module","date":"2024-04-07","arxiv_id":"2404.05105","n_code_links":1,"syntology":null},{"paper":"/paper/cluster-based-video-summarization-with","slug":"cluster-based-video-summarization-with","title":"Cluster-based Video Summarization with Temporal Context Awareness","date":"2024-04-06","arxiv_id":"2404.04511","n_code_links":1,"syntology":null},{"paper":"/paper/learning-correlation-structures-for-vision","slug":"learning-correlation-structures-for-vision","title":"Learning Correlation Structures for Vision Transformers","date":"2024-04-05","arxiv_id":"2404.03924","n_code_links":0,"syntology":null},{"paper":null,"slug":"opennerf-open-set-3d-neural-scene","title":"OpenNeRF: Open Set 3D Neural Scene Segmentation with Pixel-Wise Features and Rendered Novel Views","date":"2024-04-04","arxiv_id":"2404.03650","n_code_links":0,"syntology":null},{"paper":"/paper/minimize-quantization-output-error-with-bias","slug":"minimize-quantization-output-error-with-bias","title":"Minimize Quantization Output Error with Bias Compensation","date":"2024-04-02","arxiv_id":"2404.01892","n_code_links":1,"syntology":null},{"paper":"/paper/prego-online-mistake-detection-in-procedural","slug":"prego-online-mistake-detection-in-procedural","title":"PREGO: online mistake detection in PRocedural EGOcentric videos","date":"2024-04-02","arxiv_id":"2404.01933","n_code_links":1,"syntology":{"ran":11,"of":11,"n_ran_checked":8,"n_instrument":3,"unverified":0,"pointer_only":3,"phrase":"11 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 1 violated, 7 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","official":{"repos":["aleflabo/prego"],"state":"official (archive's flag): 11 ran","n_ran":11,"n_constructed":0,"n_ran_no_instrument_failure":8,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/samba-semantic-segmentation-of-remotely","slug":"samba-semantic-segmentation-of-remotely","title":"Samba: Semantic Segmentation of Remotely Sensed Images with State Space Model","date":"2024-04-02","arxiv_id":"2404.01705","n_code_links":1,"syntology":{"ran":6,"of":8,"n_ran_checked":6,"n_instrument":0,"unverified":2,"pointer_only":7,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","official":{"repos":["zhuqinfeng1999/samba"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":2,"ran_from_kinds":["official"]}}},{"paper":"/paper/can-biases-in-imagenet-models-explain","slug":"can-biases-in-imagenet-models-explain","title":"Can Biases in ImageNet Models Explain Generalization?","date":"2024-04-01","arxiv_id":"2404.01509","n_code_links":1,"syntology":{"ran":6,"of":9,"n_ran_checked":6,"n_instrument":0,"unverified":3,"pointer_only":9,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","official":{"repos":["paulgavrikov/biases_vs_generalization"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":"/paper/flare-free-vision-empowering-uformer-with","slug":"flare-free-vision-empowering-uformer-with","title":"Flare-Free Vision: Empowering Uformer with Depth Insights","date":"2024-04-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"investigating-robustness-of-open-vocabulary","title":"Open-Vocabulary Object Detectors: Robustness Challenges under Distribution Shifts","date":"2024-04-01","arxiv_id":"2405.14874","n_code_links":0,"syntology":null},{"paper":null,"slug":"on-the-faithfulness-of-vision-transformer","title":"On the Faithfulness of Vision Transformer Explanations","date":"2024-04-01","arxiv_id":"2404.01415","n_code_links":0,"syntology":null},{"paper":"/paper/structured-initialization-for-attention-in","slug":"structured-initialization-for-attention-in","title":"Structured Initialization for Attention in Vision Transformers","date":"2024-04-01","arxiv_id":"2404.01139","n_code_links":1,"syntology":null},{"paper":null,"slug":"vision-language-models-for-decoding-provider","title":"Vision-language models for decoding provider attention during neonatal resuscitation","date":"2024-04-01","arxiv_id":"2404.01207","n_code_links":0,"syntology":null},{"paper":"/paper/agileformer-spatially-agile-transformer-unet","slug":"agileformer-spatially-agile-transformer-unet","title":"AgileFormer: Spatially Agile Transformer UNet for Medical Image Segmentation","date":"2024-03-29","arxiv_id":"2404.00122","n_code_links":1,"syntology":null},{"paper":null,"slug":"enhancing-efficiency-in-vision-transformer","title":"Enhancing Efficiency in Vision Transformer Networks: Design Techniques and Insights","date":"2024-03-28","arxiv_id":"2403.19882","n_code_links":0,"syntology":null},{"paper":null,"slug":"patch-spatio-temporal-relation-prediction-for","title":"Patch Spatio-Temporal Relation Prediction for Video Anomaly Detection","date":"2024-03-28","arxiv_id":"2403.19111","n_code_links":0,"syntology":null},{"paper":"/paper/siamese-vision-transformers-are-scalable","slug":"siamese-vision-transformers-are-scalable","title":"Siamese Vision Transformers are Scalable Audio-visual Learners","date":"2024-03-28","arxiv_id":"2403.19638","n_code_links":1,"syntology":{"ran":15,"of":19,"n_ran_checked":15,"n_instrument":0,"unverified":4,"pointer_only":19,"phrase":"15 ran (of which 3 constructed an object rather than computing a result; 15 with no instrument failure: 0 honoured, 0 violated, 15 with no contract checked; 0 where Syntology's instrument failed) · 4 unverified","official":{"repos":["genjib/avsiam"],"state":"official (archive's flag): 15 ran","n_ran":15,"n_constructed":3,"n_ran_no_instrument_failure":15,"n_unverified":4,"ran_from_kinds":["official"]}}},{"paper":"/paper/ecodepth-effective-conditioning-of-diffusion","slug":"ecodepth-effective-conditioning-of-diffusion","title":"ECoDepth: Effective Conditioning of Diffusion Models for Monocular Depth Estimation","date":"2024-03-27","arxiv_id":"2403.18807","n_code_links":1,"syntology":{"ran":11,"of":15,"n_ran_checked":6,"n_instrument":5,"unverified":4,"pointer_only":15,"phrase":"11 ran (of which 1 constructed an object rather than computing a result; 6 with no instrument failure: 2 honoured, 2 violated, 2 with no contract checked; 5 where Syntology's instrument failed) · 4 unverified","official":{"repos":["aradhye2002/ecodepth"],"state":"official (archive's flag): 11 ran","n_ran":11,"n_constructed":1,"n_ran_no_instrument_failure":6,"n_unverified":4,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"illicit-object-detection-in-x-ray-images","title":"Illicit object detection in X-ray images using Vision Transformers","date":"2024-03-27","arxiv_id":"2403.19043","n_code_links":0,"syntology":null},{"paper":null,"slug":"lift3d-zero-shot-lifting-of-any-2d-vision","title":"Lift3D: Zero-Shot Lifting of Any 2D Vision Model to 3D","date":"2024-03-27","arxiv_id":"2403.18922","n_code_links":0,"syntology":null},{"paper":null,"slug":"vitar-vision-transformer-with-any-resolution","title":"ViTAR: Vision Transformer with Any Resolution","date":"2024-03-27","arxiv_id":"2403.18361","n_code_links":0,"syntology":null},{"paper":"/paper/accuracy-enhancement-method-for-speech","slug":"accuracy-enhancement-method-for-speech","title":"Accuracy enhancement method for speech emotion recognition from spectrogram using temporal frequency correlation and positional information learning through knowledge transfer","date":"2024-03-26","arxiv_id":"2403.17327","n_code_links":1,"syntology":null},{"paper":null,"slug":"evaluating-the-efficacy-of-prompt-engineered","title":"Evaluating the Efficacy of Prompt-Engineered Large Multimodal Models Versus Fine-Tuned Vision Transformers in Image-Based Security Applications","date":"2024-03-26","arxiv_id":"2403.17787","n_code_links":0,"syntology":null},{"paper":"/paper/3d-effivitcaps-3d-efficient-vision","slug":"3d-effivitcaps-3d-efficient-vision","title":"3D-EffiViTCaps: 3D Efficient Vision Transformer with Capsule for Medical Image Segmentation","date":"2024-03-25","arxiv_id":"2403.16350","n_code_links":1,"syntology":null},{"paper":"/paper/dtf-at-decoupled-time-frequency-audio","slug":"dtf-at-decoupled-time-frequency-audio","title":"DTF-AT: Decoupled Time-Frequency Audio Transformer for Event Classification","date":"2024-03-24","arxiv_id":null,"n_code_links":1,"syntology":null}],"record_sha256":"9d89ed6a622e87e96dadbe3a2272d26fd7e0fe94ba43dddc56a512d09180d6b7","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}