{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/vision-transformer/papers/5","list_of":"/method/vision-transformer","method":"Vision Transformer","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":5,"pages_in_order":22,"rows_per_page":100,"rows":[401,500],"of":2144,"counts":{"archive_papers_tagged":2144,"with_a_code_link":1051,"where_syntology_ran_a_sample":328,"not_listed_spam_title":0,"listed":2144,"listed_where_code_ran":328,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":286,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":286,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/vision-transformer","prev":"/method/vision-transformer/papers/4","next":"/method/vision-transformer/papers/6","papers":[{"paper":null,"slug":"evidential-federated-learning-for-skin-lesion","title":"Evidential Federated Learning for Skin Lesion Image Classification","date":"2024-11-15","arxiv_id":"2411.10071","n_code_links":0,"syntology":null},{"paper":null,"slug":"assessing-the-performance-of-the-dinov2-self","title":"Assessing the Performance of the DINOv2 Self-supervised Learning Vision Transformer Model for the Segmentation of the Left Atrium from MRI Images","date":"2024-11-14","arxiv_id":"2411.09598","n_code_links":0,"syntology":null},{"paper":"/paper/harnessing-vision-foundation-models-for-high","slug":"harnessing-vision-foundation-models-for-high","title":"Harnessing Vision Foundation Models for High-Performance, Training-Free Open Vocabulary Segmentation","date":"2024-11-14","arxiv_id":"2411.09219","n_code_links":1,"syntology":null},{"paper":"/paper/learning-parameter-sharing-with-tensor","slug":"learning-parameter-sharing-with-tensor","title":"Learning Parameter Sharing with Tensor Decompositions and Sparsity","date":"2024-11-14","arxiv_id":"2411.09816","n_code_links":1,"syntology":null},{"paper":null,"slug":"partial-multi-view-clustering-via-meta","title":"Partial Multi-View Clustering via Meta-Learning and Contrastive Feature Alignment","date":"2024-11-14","arxiv_id":"2411.09758","n_code_links":0,"syntology":null},{"paper":"/paper/sag-vit-a-scale-aware-high-fidelity-patching","slug":"sag-vit-a-scale-aware-high-fidelity-patching","title":"SAG-ViT: A Scale-Aware, High-Fidelity Patching Approach with Graph Attention for Vision Transformers","date":"2024-11-14","arxiv_id":"2411.09420","n_code_links":1,"syntology":null},{"paper":null,"slug":"ad-dino-attention-dynamic-dino-for-distance","title":"AD-DINO: Attention-Dynamic DINO for Distance-Aware Embodied Reference Understanding","date":"2024-11-13","arxiv_id":"2411.08451","n_code_links":0,"syntology":null},{"paper":null,"slug":"dino-lg-a-task-specific-dino-model-for","title":"DINO-LG: A Task-Specific DINO Model for Coronary Calcium Scoring","date":"2024-11-12","arxiv_id":"2411.07976","n_code_links":0,"syntology":null},{"paper":"/paper/scalekd-strong-vision-transformers-could-be","slug":"scalekd-strong-vision-transformers-could-be","title":"ScaleKD: Strong Vision Transformers Could Be Excellent Teachers","date":"2024-11-11","arxiv_id":"2411.06786","n_code_links":1,"syntology":null},{"paper":null,"slug":"track-any-peppers-weakly-supervised-sweet","title":"Track Any Peppers: Weakly Supervised Sweet Pepper Tracking Using VLMs","date":"2024-11-11","arxiv_id":"2411.06702","n_code_links":0,"syntology":null},{"paper":null,"slug":"few-shot-semantic-learning-for-robust-multi","title":"Few-shot Semantic Learning for Robust Multi-Biome 3D Semantic Mapping in Off-Road Environments","date":"2024-11-10","arxiv_id":"2411.06632","n_code_links":0,"syntology":null},{"paper":"/paper/community-research-earth-digital-intelligence","slug":"community-research-earth-digital-intelligence","title":"Community Research Earth Digital Intelligence Twin (CREDIT)","date":"2024-11-09","arxiv_id":"2411.07814","n_code_links":2,"syntology":{"ran":22,"of":23,"n_ran_checked":21,"n_instrument":1,"unverified":1,"pointer_only":2,"phrase":"22 ran (of which 0 constructed an object rather than computing a result; 21 with no instrument failure: 1 honoured, 2 violated, 18 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","official":{"repos":["ncar/credit-arxiv","ncar/miles-credit"],"state":"official (archive's flag): 22 ran","n_ran":22,"n_constructed":0,"n_ran_no_instrument_failure":21,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"pattern-integration-and-enhancement-vision","title":"Pattern Integration and Enhancement Vision Transformer for Self-Supervised Learning in Remote Sensing","date":"2024-11-09","arxiv_id":"2411.06091","n_code_links":0,"syntology":null},{"paper":null,"slug":"vitoc-vision-transformer-and-object-aware","title":"ViTOC: Vision Transformer and Object-aware Captioner","date":"2024-11-09","arxiv_id":"2411.07265","n_code_links":0,"syntology":null},{"paper":"/paper/cascaded-dual-vision-transformer-for-accurate","slug":"cascaded-dual-vision-transformer-for-accurate","title":"Cascaded Dual Vision Transformer for Accurate Facial Landmark Detection","date":"2024-11-08","arxiv_id":"2411.07167","n_code_links":1,"syntology":null},{"paper":null,"slug":"classification-of-adventitious-sounds","title":"Classification of Adventitious Sounds Combining Cochleogram and Vision Transformers","date":"2024-11-08","arxiv_id":"2411.05955","n_code_links":0,"syntology":null},{"paper":null,"slug":"emotional-images-assessing-emotions-in-images","title":"Emotional Images: Assessing Emotions in Images and Potential Biases in Generative Models","date":"2024-11-08","arxiv_id":"2411.05985","n_code_links":0,"syntology":null},{"paper":null,"slug":"gci-vital-gradual-confidence-improvement-with","title":"GCI-ViTAL: Gradual Confidence Improvement with Vision Transformers for Active Learning on Label Noise","date":"2024-11-08","arxiv_id":"2411.05939","n_code_links":0,"syntology":null},{"paper":null,"slug":"image-inpainting-enhancement-by-replacing-the","title":"Image inpainting enhancement by replacing the original mask with a self-attended region from the input image","date":"2024-11-08","arxiv_id":"2411.05705","n_code_links":0,"syntology":null},{"paper":"/paper/online-lora-task-free-online-continual","slug":"online-lora-task-free-online-continual","title":"Online-LoRA: Task-free Online Continual Learning via Low Rank Adaptation","date":"2024-11-08","arxiv_id":"2411.05663","n_code_links":1,"syntology":null},{"paper":"/paper/tell-what-you-hear-from-what-you-see-video-to","slug":"tell-what-you-hear-from-what-you-see-video-to","title":"Tell What You Hear From What You See -- Video to Audio Generation Through Text","date":"2024-11-08","arxiv_id":"2411.05679","n_code_links":1,"syntology":{"ran":6,"of":6,"n_ran_checked":6,"n_instrument":0,"unverified":0,"pointer_only":6,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["DragonLiu1995/multimodal-llm-for-audio-gen"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"vit-enhanced-privacy-preserving-secure","title":"ViT Enhanced Privacy-Preserving Secure Medical Data Sharing and Classification","date":"2024-11-08","arxiv_id":"2411.05901","n_code_links":0,"syntology":null},{"paper":null,"slug":"dino-wm-world-models-on-pre-trained-visual","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","date":"2024-11-07","arxiv_id":"2411.04983","n_code_links":0,"syntology":null},{"paper":"/paper/prion-vit-prions-inspired-vision-transformers","slug":"prion-vit-prions-inspired-vision-transformers","title":"Prion-ViT: Prions-Inspired Vision Transformers for Temperature prediction with Specklegrams","date":"2024-11-06","arxiv_id":"2411.05836","n_code_links":0,"syntology":null},{"paper":null,"slug":"reducing-catastrophic-forgetting-of","title":"Reducing catastrophic forgetting of incremental learning in the absence of rehearsal memory with task-specific token","date":"2024-11-06","arxiv_id":"2411.05846","n_code_links":0,"syntology":null},{"paper":null,"slug":"laser-attention-with-exponential","title":"LASER: Attention with Exponential Transformation","date":"2024-11-05","arxiv_id":"2411.03493","n_code_links":0,"syntology":null},{"paper":null,"slug":"encoding-multi-level-dynamics-in-effect","title":"Optimizing Multi-Scale Representations to Detect Effect Heterogeneity Using Earth Observation and Computer Vision: Applications to Two Anti-Poverty RCTs","date":"2024-11-04","arxiv_id":"2411.02134","n_code_links":0,"syntology":null},{"paper":null,"slug":"v-cas-a-realtime-vehicle-anti-collision","title":"V-CAS: A Realtime Vehicle Anti Collision System Using Vision Transformer on Multi-Camera Streams","date":"2024-11-04","arxiv_id":"2411.01963","n_code_links":0,"syntology":null},{"paper":null,"slug":"aerial-flood-scene-classification-using-fine","title":"Aerial Flood Scene Classification Using Fine-Tuned Attention-based Architecture for Flood-Prone Countries in South Asia","date":"2024-10-31","arxiv_id":"2411.00169","n_code_links":0,"syntology":null},{"paper":null,"slug":"enhancing-brain-tumor-classification-using","title":"Enhancing Brain Tumor Classification Using TrAdaBoost and Multi-Classifier Deep Learning Approaches","date":"2024-10-31","arxiv_id":"2411.00875","n_code_links":0,"syntology":null},{"paper":null,"slug":"jema-a-joint-embedding-framework-for-scalable","title":"JEMA: A Joint Embedding Framework for Scalable Co-Learning with Multimodal Alignment","date":"2024-10-31","arxiv_id":"2410.23988","n_code_links":0,"syntology":null},{"paper":null,"slug":"vit-lca-a-neuromorphic-approach-for-vision","title":"ViT-LCA: A Neuromorphic Approach for Vision Transformers","date":"2024-10-31","arxiv_id":"2411.00140","n_code_links":0,"syntology":null},{"paper":"/paper/emergence-of-human-like-attention-in-self","slug":"emergence-of-human-like-attention-in-self","title":"Emergence of Human-Like Attention in Self-Supervised Vision Transformers: an eye-tracking study","date":"2024-10-30","arxiv_id":"2410.22768","n_code_links":1,"syntology":null},{"paper":null,"slug":"epipolar-free-3d-gaussian-splatting-for","title":"Epipolar-Free 3D Gaussian Splatting for Generalizable Novel View Synthesis","date":"2024-10-30","arxiv_id":"2410.22817","n_code_links":0,"syntology":null},{"paper":"/paper/nmformer-a-transformer-for-noisy-modulation","slug":"nmformer-a-transformer-for-noisy-modulation","title":"NMformer: A Transformer for Noisy Modulation Classification in Wireless Communication","date":"2024-10-30","arxiv_id":"2411.02428","n_code_links":1,"syntology":null},{"paper":null,"slug":"s3pt-scene-semantics-and-structure-guided","title":"S3PT: Scene Semantics and Structure Guided Clustering to Boost Self-Supervised Pre-Training for Autonomous Driving","date":"2024-10-30","arxiv_id":"2410.23085","n_code_links":0,"syntology":null},{"paper":null,"slug":"dineuro-distilling-knowledge-from-2d-natural","title":"DINeuro: Distilling Knowledge from 2D Natural Images via Deformable Tubular Transferring Strategy for 3D Neuron Reconstruction","date":"2024-10-29","arxiv_id":"2410.22078","n_code_links":0,"syntology":null},{"paper":"/paper/multi-step-feature-fusion-for-natural","slug":"multi-step-feature-fusion-for-natural","title":"Multi-step feature fusion for natural disaster damage assessment on satellite images","date":"2024-10-29","arxiv_id":"2410.21901","n_code_links":1,"syntology":null},{"paper":null,"slug":"spatio-temporal-transformers-for-action-unit","title":"Spatio-temporal Transformers for Action Unit Classification with Event Cameras","date":"2024-10-29","arxiv_id":"2410.21958","n_code_links":0,"syntology":null},{"paper":null,"slug":"explainability-in-ai-based-applications-a","title":"Explainability in AI Based Applications: A Framework for Comparing Different Techniques","date":"2024-10-28","arxiv_id":"2410.20873","n_code_links":0,"syntology":null},{"paper":"/paper/interpretable-image-classification-with-1","slug":"interpretable-image-classification-with-1","title":"Interpretable Image Classification with Adaptive Prototype-based Vision Transformers","date":"2024-10-28","arxiv_id":"2410.20722","n_code_links":1,"syntology":{"ran":6,"of":7,"n_ran_checked":6,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["Henrymachiyu/ProtoViT"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"multi-modal-ai-for-comprehensive-breast","title":"Multi-modal AI for comprehensive breast cancer prognostication","date":"2024-10-28","arxiv_id":"2410.21256","n_code_links":0,"syntology":null},{"paper":null,"slug":"accelerating-augmentation-invariance","title":"Accelerating Augmentation Invariance Pretraining","date":"2024-10-27","arxiv_id":"2410.22364","n_code_links":0,"syntology":null},{"paper":"/paper/pvit-prior-augmented-vision-transformer-for","slug":"pvit-prior-augmented-vision-transformer-for","title":"PViT: Prior-augmented Vision Transformer for Out-of-distribution Detection","date":"2024-10-27","arxiv_id":"2410.20631","n_code_links":1,"syntology":null},{"paper":null,"slug":"enhancing-lie-detection-accuracy-a","title":"Enhancing Lie Detection Accuracy: A Comparative Study of Classic ML, CNN, and GCN Models using Audio-Visual Features","date":"2024-10-26","arxiv_id":"2411.08885","n_code_links":0,"syntology":null},{"paper":null,"slug":"generative-adversarial-patches-for-physical","title":"Generative Adversarial Patches for Physical Attacks on Cross-Modal Pedestrian Re-Identification","date":"2024-10-26","arxiv_id":"2410.20097","n_code_links":0,"syntology":null},{"paper":null,"slug":"transforming-precision-a-comparative-analysis","title":"Transforming Precision: A Comparative Analysis of Vision Transformers, CNNs, and Traditional ML for Knee Osteoarthritis Severity Diagnosis","date":"2024-10-26","arxiv_id":"2410.20062","n_code_links":0,"syntology":null},{"paper":"/paper/a-multimodal-approach-for-endoscopic-vce","slug":"a-multimodal-approach-for-endoscopic-vce","title":"A Multimodal Approach For Endoscopic VCE Image Classification Using BiomedCLIP-PubMedBERT","date":"2024-10-25","arxiv_id":"2410.19944","n_code_links":1,"syntology":null},{"paper":null,"slug":"frozen-detr-enhancing-detr-with-image","title":"Frozen-DETR: Enhancing DETR with Image Understanding from Frozen Foundation Models","date":"2024-10-25","arxiv_id":"2410.19635","n_code_links":0,"syntology":null},{"paper":"/paper/multi-class-abnormality-classification-task","slug":"multi-class-abnormality-classification-task","title":"Multi-Class Abnormality Classification Task in Video Capsule Endoscopy","date":"2024-10-25","arxiv_id":"2410.19973","n_code_links":1,"syntology":null},{"paper":null,"slug":"fedbaf-federated-learning-aggregation-biased","title":"FedBaF: Federated Learning Aggregation Biased by a Foundation Model","date":"2024-10-24","arxiv_id":"2410.18352","n_code_links":0,"syntology":null},{"paper":null,"slug":"pesformer-boosting-macro-and-micro-expression","title":"PESFormer: Boosting Macro- and Micro-expression Spotting with Direct Timestamp Encoding","date":"2024-10-24","arxiv_id":"2410.18695","n_code_links":0,"syntology":null},{"paper":"/paper/multi-scale-feature-reconstruction-network","slug":"multi-scale-feature-reconstruction-network","title":"Multi-scale feature reconstruction network for industrial anomaly detection","date":"2024-10-23","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/di-maskdino-a-joint-object-detection-and","slug":"di-maskdino-a-joint-object-detection-and","title":"DI-MaskDINO: A Joint Object Detection and Instance Segmentation Model","date":"2024-10-22","arxiv_id":"2410.16707","n_code_links":1,"syntology":null},{"paper":"/paper/domain-adaptive-pre-training-of-self","slug":"domain-adaptive-pre-training-of-self","title":"Domain-Adaptive Pre-training of Self-Supervised Foundation Models for Medical Image Classification in Gastrointestinal Endoscopy","date":"2024-10-21","arxiv_id":"2410.21302","n_code_links":1,"syntology":null},{"paper":"/paper/generalizing-motion-planners-with-mixture-of","slug":"generalizing-motion-planners-with-mixture-of","title":"Generalizing Motion Planners with Mixture of Experts for Autonomous Driving","date":"2024-10-21","arxiv_id":"2410.15774","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":0,"n_instrument":1,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["tsinghua-mars-lab/statetransformer"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"vimoe-an-empirical-study-of-designing-vision","title":"ViMoE: An Empirical Study of Designing Vision Mixture-of-Experts","date":"2024-10-21","arxiv_id":"2410.15732","n_code_links":0,"syntology":null},{"paper":"/paper/evit-unet-u-net-like-efficient-vision","slug":"evit-unet-u-net-like-efficient-vision","title":"EViT-Unet: U-Net Like Efficient Vision Transformer for Medical Image Segmentation on Mobile and Edge Devices","date":"2024-10-19","arxiv_id":"2410.15036","n_code_links":1,"syntology":null},{"paper":"/paper/visual-navigation-of-digital-libraries","slug":"visual-navigation-of-digital-libraries","title":"Visual Navigation of Digital Libraries: Retrieval and Classification of Images in the National Library of Norway's Digitised Book Collection","date":"2024-10-19","arxiv_id":"2410.14969","n_code_links":1,"syntology":null},{"paper":null,"slug":"ludvig-learning-free-uplifting-of-2d-visual","title":"LUDVIG: Learning-free Uplifting of 2D Visual features to Gaussian Splatting scenes","date":"2024-10-18","arxiv_id":"2410.14462","n_code_links":0,"syntology":null},{"paper":null,"slug":"co-segmentation-without-any-pixel-level","title":"Co-Segmentation without any Pixel-level Supervision with Application to Large-Scale Sketch Classification","date":"2024-10-17","arxiv_id":"2410.13582","n_code_links":0,"syntology":null},{"paper":null,"slug":"on-partial-prototype-collapse-in-the-dino","title":"On Partial Prototype Collapse in the DINO Family of Self-Supervised Methods","date":"2024-10-17","arxiv_id":"2410.14060","n_code_links":0,"syntology":null},{"paper":null,"slug":"training-compute-optimal-vision-transformers","title":"Training Compute-Optimal Vision Transformers for Brain Encoding","date":"2024-10-17","arxiv_id":"2410.19810","n_code_links":0,"syntology":null},{"paper":null,"slug":"ed-vit-splitting-vision-transformer-for","title":"Efficient Partitioning Vision Transformer on Edge Devices for Distributed Inference","date":"2024-10-15","arxiv_id":"2410.11650","n_code_links":0,"syntology":null},{"paper":"/paper/pixology-probing-the-linguistic-and-visual","slug":"pixology-probing-the-linguistic-and-visual","title":"Pixology: Probing the Linguistic and Visual Capabilities of Pixel-based Language Models","date":"2024-10-15","arxiv_id":"2410.12011","n_code_links":1,"syntology":{"ran":8,"of":8,"n_ran_checked":8,"n_instrument":0,"unverified":0,"pointer_only":8,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 0 violated, 8 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["kushaltatariya/Pixology"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":8,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/unveiling-the-mystery-of-visual-attributes-of","slug":"unveiling-the-mystery-of-visual-attributes-of","title":"Unveiling the Mystery of Visual Attributes of Concrete and Abstract Concepts: Variability, Nearest Neighbors, and Challenging Categories","date":"2024-10-15","arxiv_id":"2410.11657","n_code_links":1,"syntology":null},{"paper":null,"slug":"visual-fixation-based-retinal-prosthetic","title":"Visual Fixation-Based Retinal Prosthetic Simulation","date":"2024-10-15","arxiv_id":"2410.11688","n_code_links":0,"syntology":null},{"paper":null,"slug":"big-little-vision-transformer-for-efficient","title":"big.LITTLE Vision Transformer for Efficient Visual Recognition","date":"2024-10-14","arxiv_id":"2410.10267","n_code_links":0,"syntology":null},{"paper":null,"slug":"performance-evaluation-of-deep-learning-and","title":"Performance Evaluation of Deep Learning and Transformer Models Using Multimodal Data for Breast Cancer Classification","date":"2024-10-14","arxiv_id":"2410.10146","n_code_links":0,"syntology":null},{"paper":null,"slug":"data-adaptive-few-shot-multi-label","title":"Data Adaptive Few-shot Multi Label Segmentation with Foundation Model","date":"2024-10-13","arxiv_id":"2410.09759","n_code_links":0,"syntology":null},{"paper":null,"slug":"token-pruning-using-a-lightweight-background","title":"Token Pruning using a Lightweight Background Aware Vision Transformer","date":"2024-10-12","arxiv_id":"2410.09324","n_code_links":0,"syntology":null},{"paper":"/paper/debiformer-vision-transformer-with-deformable","slug":"debiformer-vision-transformer-with-deformable","title":"DeBiFormer: Vision Transformer with Deformable Agent Bi-level Routing Attention","date":"2024-10-11","arxiv_id":"2410.08582","n_code_links":1,"syntology":null},{"paper":null,"slug":"vit3d-alignment-of-llama3-3d-medical-image","title":"ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation","date":"2024-10-11","arxiv_id":"2410.08588","n_code_links":0,"syntology":null},{"paper":null,"slug":"icediff-high-resolution-and-high-quality-sea","title":"IceDiff: High Resolution and High-Quality Sea Ice Forecasting with Generative Diffusion Prior","date":"2024-10-10","arxiv_id":"2410.09111","n_code_links":0,"syntology":null},{"paper":"/paper/spa-3d-spatial-awareness-enables-effective","slug":"spa-3d-spatial-awareness-enables-effective","title":"SPA: 3D Spatial-Awareness Enables Effective Embodied Representation","date":"2024-10-10","arxiv_id":"2410.08208","n_code_links":1,"syntology":{"ran":5,"of":6,"n_ran_checked":5,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["haoyizhu/realrobot"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/bridge-the-points-graph-based-few-shot","slug":"bridge-the-points-graph-based-few-shot","title":"Bridge the Points: Graph-based Few-shot Segment Anything Semantically","date":"2024-10-09","arxiv_id":"2410.06964","n_code_links":1,"syntology":{"ran":2,"of":4,"n_ran_checked":1,"n_instrument":1,"unverified":2,"pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","official":{"repos":["ANDYZAQ/GF-SAM"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":2,"ran_from_kinds":["official"]}}},{"paper":"/paper/pair-vpr-place-aware-pre-training-and","slug":"pair-vpr-place-aware-pre-training-and","title":"Pair-VPR: Place-Aware Pre-training and Contrastive Pair Classification for Visual Place Recognition with Vision Transformers","date":"2024-10-09","arxiv_id":"2410.06614","n_code_links":1,"syntology":null},{"paper":"/paper/incsar-a-dual-fusion-incremental-learning","slug":"incsar-a-dual-fusion-incremental-learning","title":"IncSAR: A Dual Fusion Incremental Learning Framework for SAR Target Recognition","date":"2024-10-08","arxiv_id":"2410.05820","n_code_links":1,"syntology":null},{"paper":"/paper/tackling-the-abstraction-and-reasoning-corpus-1","slug":"tackling-the-abstraction-and-reasoning-corpus-1","title":"Tackling the Abstraction and Reasoning Corpus with Vision Transformers: the Importance of 2D Representation, Positions, and Objects","date":"2024-10-08","arxiv_id":"2410.06405","n_code_links":1,"syntology":{"ran":4,"of":5,"n_ran_checked":4,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["khalil-research/ViTARC"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"vision-transformer-based-random-walk-for","title":"Vision Transformer based Random Walk for Group Re-Identification","date":"2024-10-08","arxiv_id":"2410.05808","n_code_links":0,"syntology":null},{"paper":"/paper/improving-image-clustering-with-artifacts","slug":"improving-image-clustering-with-artifacts","title":"Improving Image Clustering with Artifacts Attenuation via Inference-Time Attention Engineering","date":"2024-10-07","arxiv_id":"2410.04801","n_code_links":0,"syntology":null},{"paper":null,"slug":"low-rank-continual-pyramid-vision-transformer","title":"Low-Rank Continual Pyramid Vision Transformer: Incrementally Segment Whole-Body Organs in CT with Light-Weighted Adaptation","date":"2024-10-07","arxiv_id":"2410.04689","n_code_links":0,"syntology":null},{"paper":"/paper/optimizing-medical-image-segmentation-with","slug":"optimizing-medical-image-segmentation-with","title":"Optimizing Medical Image Segmentation with Advanced Decoder Design","date":"2024-10-05","arxiv_id":"2410.04128","n_code_links":1,"syntology":null},{"paper":null,"slug":"self-supervised-anomaly-detection-in-the-wild","title":"Self-Supervised Anomaly Detection in the Wild: Favor Joint Embeddings Methods","date":"2024-10-05","arxiv_id":"2410.04289","n_code_links":0,"syntology":null},{"paper":null,"slug":"an-x-ray-is-worth-15-features-sparse","title":"An X-Ray Is Worth 15 Features: Sparse Autoencoders for Interpretable Radiology Report Generation","date":"2024-10-04","arxiv_id":"2410.03334","n_code_links":0,"syntology":null},{"paper":null,"slug":"hifiseg-high-frequency-information-enhanced","title":"HiFiSeg: High-Frequency Information Enhanced Polyp Segmentation with Global-Local Vision Transformer","date":"2024-10-03","arxiv_id":"2410.02528","n_code_links":0,"syntology":null},{"paper":"/paper/a-versatile-machine-learning-workflow-for","slug":"a-versatile-machine-learning-workflow-for","title":"A versatile machine learning workflow for high-throughput analysis of supported metal catalyst particles","date":"2024-10-02","arxiv_id":"2410.01213","n_code_links":1,"syntology":null},{"paper":"/paper/depth-pro-sharp-monocular-metric-depth-in","slug":"depth-pro-sharp-monocular-metric-depth-in","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","date":"2024-10-02","arxiv_id":"2410.02073","n_code_links":1,"syntology":{"ran":3,"of":6,"n_ran_checked":3,"n_instrument":0,"unverified":3,"pointer_only":6,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","official":{"repos":["apple/ml-depth-pro"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":"/paper/deep-multimodal-fusion-for-semantic","slug":"deep-multimodal-fusion-for-semantic","title":"Deep Multimodal Fusion for Semantic Segmentation of Remote Sensing Earth Observation Data","date":"2024-10-01","arxiv_id":"2410.00469","n_code_links":0,"syntology":null},{"paper":null,"slug":"towards-open-vocabulary-semantic-segmentation","title":"Towards Open-Vocabulary Semantic Segmentation Without Semantic Labels","date":"2024-09-30","arxiv_id":"2409.19846","n_code_links":0,"syntology":null},{"paper":null,"slug":"discerning-the-chaos-detecting-adversarial","title":"Discerning the Chaos: Detecting Adversarial Perturbations while Disentangling Intentional from Unintentional Noises","date":"2024-09-29","arxiv_id":"2409.19619","n_code_links":0,"syntology":null},{"paper":null,"slug":"unveil-benign-overfitting-for-transformer-in","title":"Unveil Benign Overfitting for Transformer in Vision: Training Dynamics, Convergence, and Generalization","date":"2024-09-28","arxiv_id":"2409.19345","n_code_links":0,"syntology":null},{"paper":null,"slug":"how-effective-is-pre-training-of-large-masked","title":"How Effective is Pre-training of Large Masked Autoencoders for Downstream Earth Observation Tasks?","date":"2024-09-27","arxiv_id":"2409.18536","n_code_links":0,"syntology":null},{"paper":"/paper/improving-visual-object-tracking-through","slug":"improving-visual-object-tracking-through","title":"Improving Visual Object Tracking through Visual Prompting","date":"2024-09-27","arxiv_id":"2409.18901","n_code_links":1,"syntology":null},{"paper":null,"slug":"developing-a-dual-stage-vision-transformer","title":"Developing a Dual-Stage Vision Transformer Model for Lung Disease Classification","date":"2024-09-26","arxiv_id":"2409.18257","n_code_links":0,"syntology":null},{"paper":null,"slug":"ophthalmic-biomarker-detection-with-parallel","title":"Ophthalmic Biomarker Detection with Parallel Prediction of Transformer and Convolutional Architecture","date":"2024-09-26","arxiv_id":"2409.17788","n_code_links":0,"syntology":null},{"paper":"/paper/self-supervised-pretraining-for-1","slug":"self-supervised-pretraining-for-1","title":"Self-supervised Pretraining for Cardiovascular Magnetic Resonance Cine Segmentation","date":"2024-09-26","arxiv_id":"2409.18100","n_code_links":1,"syntology":null},{"paper":null,"slug":"block-expanded-dinoret-adapting-natural","title":"Block Expanded DINORET: Adapting Natural Domain Foundation Models for Retinal Imaging Without Catastrophic Forgetting","date":"2024-09-25","arxiv_id":"2409.17332","n_code_links":0,"syntology":null},{"paper":"/paper/hvt-a-comprehensive-vision-framework-for","slug":"hvt-a-comprehensive-vision-framework-for","title":"HVT: A Comprehensive Vision Framework for Learning in Non-Euclidean Space","date":"2024-09-25","arxiv_id":"2409.16897","n_code_links":1,"syntology":null},{"paper":"/paper/clinical-grade-multi-organ-pathology-report","slug":"clinical-grade-multi-organ-pathology-report","title":"Clinical-grade Multi-Organ Pathology Report Generation for Multi-scale Whole Slide Images via a Semantically Guided Medical Text Foundation Model","date":"2024-09-23","arxiv_id":"2409.15574","n_code_links":1,"syntology":null}],"record_sha256":"a9bae61fef537b25c02fa6875d32c6216c58294dfce0439def46a76e20ed3f58","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}