{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/vision-transformer/papers/4","list_of":"/method/vision-transformer","method":"Vision Transformer","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":4,"pages_in_order":22,"rows_per_page":100,"rows":[301,400],"of":2144,"counts":{"archive_papers_tagged":2144,"with_a_code_link":1051,"where_syntology_ran_a_sample":328,"not_listed_spam_title":0,"listed":2144,"listed_where_code_ran":328,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":286,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":286,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/vision-transformer","prev":"/method/vision-transformer/papers/3","next":"/method/vision-transformer/papers/5","papers":[{"paper":null,"slug":"efficient-and-accurate-tuberculosis-diagnosis","title":"Efficient and Accurate Tuberculosis Diagnosis: Attention Residual U-Net and Vision Transformer Based Detection Framework","date":"2025-01-07","arxiv_id":"2501.03538","n_code_links":0,"syntology":null},{"paper":null,"slug":"detrack-in-model-latent-denoising-learning","title":"DeTrack: In-model Latent Denoising Learning for Visual Object Tracking","date":"2025-01-05","arxiv_id":"2501.02467","n_code_links":0,"syntology":null},{"paper":null,"slug":"towards-hard-and-soft-shadow-removal-via-dual","title":"Towards Hard and Soft Shadow Removal via Dual-Branch Separation Network and Vision Transformer","date":"2025-01-03","arxiv_id":"2501.01864","n_code_links":0,"syntology":null},{"paper":null,"slug":"adaptive-part-learning-for-fine-grained","title":"Adaptive Part Learning for Fine-Grained Generalized Category Discovery: A Plug-and-Play Enhancement","date":"2025-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"boe-vit-boosting-orientation-estimation-with","title":"BOE-ViT: Boosting Orientation Estimation with Equivariance in Self-Supervised 3D Subtomogram Alignment","date":"2025-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/closest-neighbors-are-harmful-for-lightweight","slug":"closest-neighbors-are-harmful-for-lightweight","title":"Closest Neighbors are Harmful for Lightweight Masked Auto-encoders","date":"2025-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"correlative-and-discriminative-label-grouping","title":"Correlative and Discriminative Label Grouping for Multi-Label Visual Prompt Tuning","date":"2025-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"icediff-high-resolution-and-high-quality","title":"IceDiff: High Resolution and High-Quality Arctic Sea Ice Forecasting with Generative Diffusion Prior","date":"2025-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"less-attention-is-more-prompt-transformer-for","title":"Less Attention is More: Prompt Transformer for Generalized Category Discovery","date":"2025-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/prompt-cam-making-vision-transformers","slug":"prompt-cam-making-vision-transformers","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","date":"2025-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"radiov2-5-improved-baselines-for","title":"RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models","date":"2025-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"self-supervised-cross-view-correspondence","title":"Self-Supervised Cross-View Correspondence with Predictive Cycle Consistency","date":"2025-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"a-study-on-context-length-and-efficient","title":"A Study on Context Length and Efficient Transformers for Biomedical Image Analysis","date":"2024-12-31","arxiv_id":"2501.00619","n_code_links":0,"syntology":null},{"paper":null,"slug":"advanced-lung-nodule-segmentation-and","title":"Advanced Lung Nodule Segmentation and Classification for Early Detection of Lung Cancer using SAM and Transfer Learning","date":"2024-12-31","arxiv_id":"2501.00586","n_code_links":0,"syntology":null},{"paper":null,"slug":"matey-multiscale-adaptive-foundation-models","title":"MATEY: multiscale adaptive foundation models for spatiotemporal physical systems","date":"2024-12-29","arxiv_id":"2412.20601","n_code_links":0,"syntology":null},{"paper":null,"slug":"distilled-transformers-with-locally-enhanced","title":"Distilled Transformers with Locally Enhanced Global Representations for Face Forgery Detection","date":"2024-12-28","arxiv_id":"2412.20156","n_code_links":0,"syntology":null},{"paper":"/paper/segkan-high-resolution-medical-image","slug":"segkan-high-resolution-medical-image","title":"SegKAN: High-Resolution Medical Image Segmentation with Long-Distance Dependencies","date":"2024-12-28","arxiv_id":"2412.19990","n_code_links":1,"syntology":null},{"paper":"/paper/vistabnet-adapting-vision-transformers-for","slug":"vistabnet-adapting-vision-transformers-for","title":"VisTabNet: Adapting Vision Transformers for Tabular Data","date":"2024-12-28","arxiv_id":"2501.00057","n_code_links":1,"syntology":null},{"paper":null,"slug":"dual-channel-multi-attention-in-vit-for","title":"Dual Channel Multi-Attention in ViT for Biometric Authentication using Forehead Subcutaneous Vein Pattern and Periocular Pattern","date":"2024-12-26","arxiv_id":"2412.19160","n_code_links":0,"syntology":null},{"paper":"/paper/mtcae-dfer-multi-task-cascaded-autoencoder","slug":"mtcae-dfer-multi-task-cascaded-autoencoder","title":"MTCAE-DFER: Multi-Task Cascaded Autoencoder for Dynamic Facial Expression Recognition","date":"2024-12-25","arxiv_id":"2412.18988","n_code_links":1,"syntology":null},{"paper":null,"slug":"unified-local-and-global-attention","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","date":"2024-12-25","arxiv_id":"2412.18778","n_code_links":0,"syntology":null},{"paper":null,"slug":"autosculpt-a-pattern-based-model-auto-pruning","title":"AutoSculpt: A Pattern-based Model Auto-pruning Framework Using Reinforcement Learning and Graph Learning","date":"2024-12-24","arxiv_id":"2412.18091","n_code_links":0,"syntology":null},{"paper":"/paper/ervd-an-efficient-and-robust-vit-based","slug":"ervd-an-efficient-and-robust-vit-based","title":"ERVD: An Efficient and Robust ViT-Based Distillation Framework for Remote Sensing Image Retrieval","date":"2024-12-24","arxiv_id":"2412.18136","n_code_links":1,"syntology":null},{"paper":"/paper/comprehensive-multi-modal-prototypes-are","slug":"comprehensive-multi-modal-prototypes-are","title":"Comprehensive Multi-Modal Prototypes are Simple and Effective Classifiers for Vast-Vocabulary Object Detection","date":"2024-12-23","arxiv_id":"2412.17800","n_code_links":1,"syntology":null},{"paper":null,"slug":"edge-ai-for-agriculture-lightweight-vision","title":"Edge-AI for Agriculture: Lightweight Vision Models for Disease Detection in Resource-Limited Settings","date":"2024-12-23","arxiv_id":"2412.18635","n_code_links":0,"syntology":null},{"paper":"/paper/enhancing-contrastive-learning-inspired-by","slug":"enhancing-contrastive-learning-inspired-by","title":"Enhancing Contrastive Learning Inspired by the Philosophy of \"The Blind Men and the Elephant\"","date":"2024-12-21","arxiv_id":"2412.16522","n_code_links":1,"syntology":null},{"paper":null,"slug":"object-detection-approaches-to-identifying","title":"Object Detection Approaches to Identifying Hand Images with High Forensic Values","date":"2024-12-21","arxiv_id":"2412.16431","n_code_links":0,"syntology":null},{"paper":null,"slug":"sensitive-image-classification-by-vision","title":"Sensitive Image Classification by Vision Transformers","date":"2024-12-21","arxiv_id":"2412.16446","n_code_links":0,"syntology":null},{"paper":null,"slug":"seagrassfinder-deep-learning-for-eelgrass","title":"SeagrassFinder: Deep Learning for Eelgrass Detection and Coverage Estimation in the Wild","date":"2024-12-20","arxiv_id":"2412.16147","n_code_links":0,"syntology":null},{"paper":null,"slug":"adaptive-prompt-tuning-vision-guided-prompt","title":"Adaptive Prompt Tuning: Vision Guided Prompt Tuning with Cross-Attention for Fine-Grained Few-Shot Learning","date":"2024-12-19","arxiv_id":"2412.14640","n_code_links":0,"syntology":null},{"paper":"/paper/can-we-get-rid-of-handcrafted-feature","slug":"can-we-get-rid-of-handcrafted-feature","title":"Can We Get Rid of Handcrafted Feature Extractors? SparseViT: Nonsemantics-Centered, Parameter-Efficient Image Manipulation Localization through Spare-Coding Transformer","date":"2024-12-19","arxiv_id":"2412.14598","n_code_links":1,"syntology":{"ran":3,"of":3,"n_ran_checked":0,"n_instrument":3,"unverified":0,"pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","official":{"repos":["scu-zjz/sparsevit"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/diffsim-taming-diffusion-models-for","slug":"diffsim-taming-diffusion-models-for","title":"DiffSim: Taming Diffusion Models for Evaluating Visual Similarity","date":"2024-12-19","arxiv_id":"2412.14580","n_code_links":1,"syntology":null},{"paper":null,"slug":"jet-a-modern-transformer-based-normalizing","title":"Jet: A Modern Transformer-Based Normalizing Flow","date":"2024-12-19","arxiv_id":"2412.15129","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-lora-is-worth-a-thousand-pictures","title":"A LoRA is Worth a Thousand Pictures","date":"2024-12-16","arxiv_id":"2412.12048","n_code_links":0,"syntology":null},{"paper":"/paper/more-class-patch-attention-needs","slug":"more-class-patch-attention-needs","title":"MoRe: Class Patch Attention Needs Regularization for Weakly Supervised Semantic Segmentation","date":"2024-12-15","arxiv_id":"2412.11076","n_code_links":1,"syntology":null},{"paper":null,"slug":"one-shot-multilingual-font-generation-via-vit","title":"One-Shot Multilingual Font Generation Via ViT","date":"2024-12-15","arxiv_id":"2412.11342","n_code_links":0,"syntology":null},{"paper":null,"slug":"manipgpt-is-affordance-segmentation-by-large","title":"ManipGPT: Is Affordance Segmentation by Large Vision Models Enough for Articulated Object Manipulation?","date":"2024-12-13","arxiv_id":"2412.10050","n_code_links":0,"syntology":null},{"paper":null,"slug":"t-gmsi-a-transformer-based-generative-model","title":"T-GMSI: A transformer-based generative model for spatial interpolation under sparse measurements","date":"2024-12-13","arxiv_id":"2412.09886","n_code_links":0,"syntology":null},{"paper":null,"slug":"vibrantvs-a-high-resolution-multi-task","title":"VibrantVS: A high-resolution multi-task transformer for forest canopy height estimation","date":"2024-12-13","arxiv_id":"2412.10351","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-novel-ensemble-based-deep-learning-model","title":"A Novel Ensemble-Based Deep Learning Model with Explainable AI for Accurate Kidney Disease Diagnosis","date":"2024-12-12","arxiv_id":"2412.09472","n_code_links":0,"syntology":null},{"paper":"/paper/advancing-attribution-based-neural-network","slug":"advancing-attribution-based-neural-network","title":"Advancing Attribution-Based Neural Network Explainability through Relative Absolute Magnitude Layer-Wise Relevance Propagation and Multi-Component Evaluation","date":"2024-12-12","arxiv_id":"2412.09311","n_code_links":1,"syntology":null},{"paper":null,"slug":"from-noise-to-nuance-advances-in-deep","title":"From Noise to Nuance: Advances in Deep Generative Image Models","date":"2024-12-12","arxiv_id":"2412.09656","n_code_links":0,"syntology":null},{"paper":"/paper/selective-visual-prompting-in-vision-mamba","slug":"selective-visual-prompting-in-vision-mamba","title":"Selective Visual Prompting in Vision Mamba","date":"2024-12-12","arxiv_id":"2412.08947","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":1,"n_instrument":0,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["zhoujiahuan1991/aaai2025-svp"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"sensing-for-space-safety-and-sustainability-a","title":"Sensing for Space Safety and Sustainability: A Deep Learning Approach with Vision Transformers","date":"2024-12-12","arxiv_id":"2412.08913","n_code_links":0,"syntology":null},{"paper":null,"slug":"vision-transformers-for-efficient-indoor","title":"Vision Transformers for Efficient Indoor Pathloss Radio Map Prediction","date":"2024-12-12","arxiv_id":"2412.09507","n_code_links":0,"syntology":null},{"paper":"/paper/sam-mamba-mamba-guided-sam-architecture-for","slug":"sam-mamba-mamba-guided-sam-architecture-for","title":"SAM-Mamba: Mamba Guided SAM Architecture for Generalized Zero-Shot Polyp Segmentation","date":"2024-12-11","arxiv_id":"2412.08482","n_code_links":1,"syntology":null},{"paper":"/paper/radio-amplified-improved-baselines-for","slug":"radio-amplified-improved-baselines-for","title":"RADIO Amplified: Improved Baselines for Agglomerative Vision Foundation Models","date":"2024-12-10","arxiv_id":"2412.07679","n_code_links":1,"syntology":null},{"paper":"/paper/bridging-the-divide-reconsidering-softmax-and","slug":"bridging-the-divide-reconsidering-softmax-and","title":"Bridging the Divide: Reconsidering Softmax and Linear Attention","date":"2024-12-09","arxiv_id":"2412.06590","n_code_links":1,"syntology":{"ran":17,"of":22,"n_ran_checked":13,"n_instrument":4,"unverified":5,"pointer_only":22,"phrase":"17 ran (of which 0 constructed an object rather than computing a result; 13 with no instrument failure: 1 honoured, 0 violated, 12 with no contract checked; 4 where Syntology's instrument failed) · 5 unverified","official":{"repos":["leaplabthu/inline"],"state":"official (archive's flag): 17 ran","n_ran":17,"n_constructed":0,"n_ran_no_instrument_failure":13,"n_unverified":5,"ran_from_kinds":["official"]}}},{"paper":"/paper/inverting-visual-representations-with-1","slug":"inverting-visual-representations-with-1","title":"Inverting Transformer-based Vision Models","date":"2024-12-09","arxiv_id":"2412.06534","n_code_links":2,"syntology":null},{"paper":"/paper/knowledge-transfer-and-domain-adaptation-for","slug":"knowledge-transfer-and-domain-adaptation-for","title":"Knowledge Transfer and Domain Adaptation for Fine-Grained Remote Sensing Image Segmentation","date":"2024-12-09","arxiv_id":"2412.06664","n_code_links":1,"syntology":null},{"paper":null,"slug":"open-vocabulary-high-resolution-3d-ovhr3d","title":"Open-Vocabulary High-Resolution 3D (OVHR3D) Data Segmentation and Annotation Framework","date":"2024-12-09","arxiv_id":"2412.06268","n_code_links":0,"syntology":null},{"paper":null,"slug":"zerokey-point-level-reasoning-and-zero-shot","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","date":"2024-12-09","arxiv_id":"2412.06292","n_code_links":0,"syntology":null},{"paper":null,"slug":"enhancing-content-representation-for-ar-image","title":"Enhancing Content Representation for AR Image Quality Assessment Using Knowledge Distillation","date":"2024-12-08","arxiv_id":"2412.06003","n_code_links":0,"syntology":null},{"paper":null,"slug":"paddy-disease-detection-and-classification","title":"Paddy Disease Detection and Classification Using Computer Vision Techniques: A Mobile Application to Detect Paddy Disease","date":"2024-12-08","arxiv_id":"2412.05996","n_code_links":0,"syntology":null},{"paper":null,"slug":"vision-transformer-based-semantic","title":"Vision Transformer-based Semantic Communications With Importance-Aware Quantization","date":"2024-12-08","arxiv_id":"2412.06038","n_code_links":0,"syntology":null},{"paper":null,"slug":"refsam3d-adapting-sam-with-cross-modal","title":"RefSAM3D: Adapting SAM with Cross-modal Reference for 3D Medical Image Segmentation","date":"2024-12-07","arxiv_id":"2412.05605","n_code_links":0,"syntology":null},{"paper":null,"slug":"pctrees-3d-point-cloud-tree-species","title":"PCTreeS: 3D Point Cloud Tree Species Classification Using Airborne LiDAR Images","date":"2024-12-06","arxiv_id":"2412.04714","n_code_links":0,"syntology":null},{"paper":"/paper/superpixel-tokenization-for-vision","slug":"superpixel-tokenization-for-vision","title":"Superpixel Tokenization for Vision Transformers: Preserving Semantic Integrity in Visual Tokens","date":"2024-12-06","arxiv_id":"2412.04680","n_code_links":1,"syntology":{"ran":2,"of":2,"n_ran_checked":2,"n_instrument":0,"unverified":0,"pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["jangsoohyuk/SuiT"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"automated-latex-code-generation-from","title":"Automated LaTeX Code Generation from Handwritten Math Expressions Using Vision Transformer","date":"2024-12-05","arxiv_id":"2412.03853","n_code_links":0,"syntology":null},{"paper":"/paper/florence-vl-enhancing-vision-language-models","slug":"florence-vl-enhancing-vision-language-models","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","date":"2024-12-05","arxiv_id":"2412.04424","n_code_links":1,"syntology":null},{"paper":null,"slug":"dive-taming-dino-for-subject-driven-video","title":"DIVE: Taming DINO for Subject-Driven Video Editing","date":"2024-12-04","arxiv_id":"2412.03347","n_code_links":0,"syntology":null},{"paper":"/paper/grapix-exploring-graph-modularity","slug":"grapix-exploring-graph-modularity","title":"GraPix: Exploring Graph Modularity Optimization for Unsupervised Pixel Clustering","date":"2024-12-04","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"multi-branch-mutual-distillation-transformer","title":"Multi-Branch Mutual-Distillation Transformer for EEG-Based Seizure Subtype Classification","date":"2024-12-04","arxiv_id":"2412.15224","n_code_links":0,"syntology":null},{"paper":null,"slug":"fcl-vit-task-aware-attention-tuning-for","title":"FCL-ViT: Task-Aware Attention Tuning for Continual Learning","date":"2024-12-03","arxiv_id":"2412.02509","n_code_links":0,"syntology":null},{"paper":null,"slug":"global-average-feature-augmentation-for","title":"Global Average Feature Augmentation for Robust Semantic Segmentation with Transformers","date":"2024-12-02","arxiv_id":"2412.01941","n_code_links":0,"syntology":null},{"paper":"/paper/mutli-view-3d-reconstruction-using-knowledge","slug":"mutli-view-3d-reconstruction-using-knowledge","title":"Mutli-View 3D Reconstruction using Knowledge Distillation","date":"2024-12-02","arxiv_id":"2412.02039","n_code_links":1,"syntology":null},{"paper":null,"slug":"categorical-keypoint-positional-embedding-for","title":"Categorical Keypoint Positional Embedding for Robust Animal Re-Identification","date":"2024-12-01","arxiv_id":"2412.00818","n_code_links":0,"syntology":null},{"paper":"/paper/visual-modality-prompt-for-adapting-vision","slug":"visual-modality-prompt-for-adapting-vision","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","date":"2024-12-01","arxiv_id":"2412.00622","n_code_links":1,"syntology":null},{"paper":null,"slug":"automatic-prompt-generation-and-grounding","title":"Automatic Prompt Generation and Grounding Object Detection for Zero-Shot Image Anomaly Detection","date":"2024-11-28","arxiv_id":"2411.19220","n_code_links":0,"syntology":null},{"paper":"/paper/clip-meets-dino-for-tuning-zero-shot","slug":"clip-meets-dino-for-tuning-zero-shot","title":"CLIP meets DINO for Tuning Zero-Shot Classifier using Unlabeled Image Collections","date":"2024-11-28","arxiv_id":"2411.19346","n_code_links":1,"syntology":null},{"paper":"/paper/efficient-track-anything","slug":"efficient-track-anything","title":"Efficient Track Anything","date":"2024-11-28","arxiv_id":"2411.18933","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":1,"n_instrument":0,"unverified":0,"pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":null}},{"paper":"/paper/enhancing-parameter-efficient-fine-tuning-of","slug":"enhancing-parameter-efficient-fine-tuning-of","title":"Enhancing Parameter-Efficient Fine-Tuning of Vision Transformers through Frequency-Based Adaptation","date":"2024-11-28","arxiv_id":"2411.19297","n_code_links":1,"syntology":null},{"paper":"/paper/maskris-semantic-distortion-aware-data","slug":"maskris-semantic-distortion-aware-data","title":"MaskRIS: Semantic Distortion-aware Data Augmentation for Referring Image Segmentation","date":"2024-11-28","arxiv_id":"2411.19067","n_code_links":1,"syntology":null},{"paper":"/paper/talking-to-dino-bridging-self-supervised","slug":"talking-to-dino-bridging-self-supervised","title":"Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation","date":"2024-11-28","arxiv_id":"2411.19331","n_code_links":1,"syntology":{"ran":9,"of":10,"n_ran_checked":9,"n_instrument":0,"unverified":1,"pointer_only":2,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 0 honoured, 0 violated, 9 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["lorebianchi98/Talk2DINO"],"state":"official (archive's flag): 9 ran","n_ran":9,"n_constructed":0,"n_ran_no_instrument_failure":9,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"tracking-progress-towards-sustainable","title":"Tracking Progress Towards Sustainable Development Goal 6 Using Satellite Imagery","date":"2024-11-28","arxiv_id":"2411.19093","n_code_links":0,"syntology":null},{"paper":null,"slug":"residual-attention-single-head-vision","title":"Residual Attention Single-Head Vision Transformer Network for Rolling Bearing Fault Diagnosis in Noisy Environments","date":"2024-11-27","arxiv_id":"2412.00085","n_code_links":0,"syntology":null},{"paper":"/paper/mwformer-multi-weather-image-restoration","slug":"mwformer-multi-weather-image-restoration","title":"MWFormer: Multi-Weather Image Restoration Using Degradation-Aware Transformers","date":"2024-11-26","arxiv_id":"2411.17226","n_code_links":1,"syntology":null},{"paper":"/paper/satvision-toa-a-geospatial-foundation-model","slug":"satvision-toa-a-geospatial-foundation-model","title":"SatVision-TOA: A Geospatial Foundation Model for Coarse-Resolution All-Sky Remote Sensing Imagery","date":"2024-11-26","arxiv_id":"2411.17000","n_code_links":1,"syntology":null},{"paper":null,"slug":"scaseg-strip-cross-attention-for-efficient","title":"SCASeg: Strip Cross-Attention for Efficient Semantic Segmentation","date":"2024-11-26","arxiv_id":"2411.17061","n_code_links":0,"syntology":null},{"paper":null,"slug":"cmavit-integrating-climate-managment-and","title":"CMAViT: Integrating Climate, Managment, and Remote Sensing Data for Crop Yield Estimation with Multimodel Vision Transformers","date":"2024-11-25","arxiv_id":"2411.16989","n_code_links":0,"syntology":null},{"paper":null,"slug":"factorized-visual-tokenization-and-generation","title":"Factorized Visual Tokenization and Generation","date":"2024-11-25","arxiv_id":"2411.16681","n_code_links":0,"syntology":null},{"paper":"/paper/interpreting-object-level-foundation-models","slug":"interpreting-object-level-foundation-models","title":"Interpreting Object-level Foundation Models via Visual Precision Search","date":"2024-11-25","arxiv_id":"2411.16198","n_code_links":2,"syntology":null},{"paper":"/paper/soft-transformers-for-continual-learning","slug":"soft-transformers-for-continual-learning","title":"Soft-TransFormers for Continual Learning","date":"2024-11-25","arxiv_id":"2411.16073","n_code_links":1,"syntology":null},{"paper":"/paper/ultrasam-a-foundation-model-for-ultrasound","slug":"ultrasam-a-foundation-model-for-ultrasound","title":"UltraSam: A Foundation Model for Ultrasound using Large Open-Access Segmentation Datasets","date":"2024-11-25","arxiv_id":"2411.16222","n_code_links":1,"syntology":null},{"paper":"/paper/vicon-vision-in-context-operator-networks-for","slug":"vicon-vision-in-context-operator-networks-for","title":"VICON: Vision In-Context Operator Networks for Multi-Physics Fluid Dynamics Prediction","date":"2024-11-25","arxiv_id":"2411.16063","n_code_links":1,"syntology":null},{"paper":"/paper/beyond-adaptive-gradient-fast-controlled","slug":"beyond-adaptive-gradient-fast-controlled","title":"Beyond adaptive gradient: Fast-Controlled Minibatch Algorithm for large-scale optimization","date":"2024-11-24","arxiv_id":"2411.15795","n_code_links":1,"syntology":null},{"paper":"/paper/evaluating-vision-transformer-models-for","slug":"evaluating-vision-transformer-models-for","title":"Evaluating Vision Transformer Models for Visual Quality Control in Industrial Manufacturing","date":"2024-11-22","arxiv_id":"2411.14953","n_code_links":1,"syntology":null},{"paper":null,"slug":"resolution-agnostic-transformer-based-climate","title":"Resolution-Agnostic Transformer-based Climate Downscaling","date":"2024-11-22","arxiv_id":"2411.14774","n_code_links":0,"syntology":null},{"paper":null,"slug":"when-spatial-meets-temporal-in-action","title":"When Spatial meets Temporal in Action Recognition","date":"2024-11-22","arxiv_id":"2411.15284","n_code_links":0,"syntology":null},{"paper":"/paper/dino-x-a-unified-vision-model-for-open-world","slug":"dino-x-a-unified-vision-model-for-open-world","title":"DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding","date":"2024-11-21","arxiv_id":"2411.14347","n_code_links":1,"syntology":null},{"paper":null,"slug":"quantum-attention-for-vision-transformers-in","title":"Quantum Attention for Vision Transformers in High Energy Physics","date":"2024-11-20","arxiv_id":"2411.13520","n_code_links":0,"syntology":null},{"paper":null,"slug":"faster-multi-gpu-training-with-ppll-a","title":"Faster Multi-GPU Training with PPLL: A Pipeline Parallelism Framework Leveraging Local Learning","date":"2024-11-19","arxiv_id":"2411.12780","n_code_links":0,"syntology":null},{"paper":null,"slug":"residual-vision-transformer-resvit-based-self","title":"Residual Vision Transformer (ResViT) Based Self-Supervised Learning Model for Brain Tumor Classification","date":"2024-11-19","arxiv_id":"2411.12874","n_code_links":0,"syntology":null},{"paper":null,"slug":"deforhmr-vision-transformer-with-deformable","title":"DeforHMR: Vision Transformer with Deformable Cross-Attention for 3D Human Mesh Recovery","date":"2024-11-18","arxiv_id":"2411.11214","n_code_links":0,"syntology":null},{"paper":null,"slug":"fcc-fully-connected-correlation-for-few-shot","title":"FCC: Fully Connected Correlation for Few-Shot Segmentation","date":"2024-11-18","arxiv_id":"2411.11917","n_code_links":0,"syntology":null},{"paper":null,"slug":"in-situ-melt-pool-characterization-via","title":"In-Situ Melt Pool Characterization via Thermal Imaging for Defect Detection in Directed Energy Deposition Using Vision Transformers","date":"2024-11-18","arxiv_id":"2411.12028","n_code_links":0,"syntology":null},{"paper":"/paper/mpoxvlm-a-vision-language-model-for","slug":"mpoxvlm-a-vision-language-model-for","title":"MpoxVLM: A Vision-Language Model for Diagnosing Skin Lesions from Mpox Virus Infection","date":"2024-11-16","arxiv_id":"2411.10888","n_code_links":1,"syntology":null},{"paper":null,"slug":"a-multi-scale-spatial-temporal-network-for","title":"A Multi-Scale Spatial-Temporal Network for Wireless Video Transmission","date":"2024-11-15","arxiv_id":"2411.09936","n_code_links":0,"syntology":null},{"paper":null,"slug":"building-6g-radio-foundation-models-with","title":"Building 6G Radio Foundation Models with Transformer Architectures","date":"2024-11-15","arxiv_id":"2411.09996","n_code_links":0,"syntology":null},{"paper":"/paper/corrclip-reconstructing-correlations-in-clip","slug":"corrclip-reconstructing-correlations-in-clip","title":"CorrCLIP: Reconstructing Correlations in CLIP with Off-the-Shelf Foundation Models for Open-Vocabulary Semantic Segmentation","date":"2024-11-15","arxiv_id":"2411.10086","n_code_links":1,"syntology":{"ran":5,"of":9,"n_ran_checked":5,"n_instrument":0,"unverified":4,"pointer_only":9,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 4 unverified","official":{"repos":["zdk258/CorrCLIP"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":4,"ran_from_kinds":["official"]}}}],"record_sha256":"d554135f8c81f21ad63322123c612fe67048d585586d2c8fe4033cfa8b51d74a","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}