{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/vision-transformer/papers/6","list_of":"/method/vision-transformer","method":"Vision Transformer","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":6,"pages_in_order":22,"rows_per_page":100,"rows":[501,600],"of":2144,"counts":{"archive_papers_tagged":2144,"with_a_code_link":1051,"where_syntology_ran_a_sample":328,"not_listed_spam_title":0,"listed":2144,"listed_where_code_ran":328,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":286,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":286,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/vision-transformer","prev":"/method/vision-transformer/papers/5","next":"/method/vision-transformer/papers/7","papers":[{"paper":null,"slug":"designing-pre-training-datasets-from","title":"Designing Pre-training Datasets from Unlabeled Data for EEG Classification with Transformers","date":"2024-09-23","arxiv_id":"2410.07190","n_code_links":0,"syntology":null},{"paper":null,"slug":"hydrovision-lidar-guided-hydrometric","title":"HydroVision: LiDAR-Guided Hydrometric Prediction with Vision Transformers and Hybrid Graph Learning","date":"2024-09-23","arxiv_id":"2409.15213","n_code_links":0,"syntology":null},{"paper":"/paper/patch-ranking-efficient-clip-by-learning-to","slug":"patch-ranking-efficient-clip-by-learning-to","title":"Patch Ranking: Efficient CLIP by Learning to Rank Local Patches","date":"2024-09-22","arxiv_id":"2409.14607","n_code_links":1,"syntology":null},{"paper":null,"slug":"multiple-exit-tuning-towards-inference","title":"Multiple-Exit Tuning: Towards Inference-Efficient Adaptation for Vision Transformer","date":"2024-09-21","arxiv_id":"2409.13999","n_code_links":0,"syntology":null},{"paper":"/paper/tackling-fluffy-clouds-field-boundaries","slug":"tackling-fluffy-clouds-field-boundaries","title":"Tackling fluffy clouds: field boundaries detection using time series of S2 and/or S1 imagery","date":"2024-09-20","arxiv_id":"2409.13568","n_code_links":1,"syntology":null},{"paper":null,"slug":"vitguard-attention-aware-detection-against","title":"ViTGuard: Attention-aware Detection against Adversarial Examples for Vision Transformer","date":"2024-09-20","arxiv_id":"2409.13828","n_code_links":0,"syntology":null},{"paper":null,"slug":"bridging-domain-gap-for-flight-ready","title":"Bridging Domain Gap for Flight-Ready Spaceborne Vision","date":"2024-09-18","arxiv_id":"2409.11661","n_code_links":0,"syntology":null},{"paper":null,"slug":"nt-vit-neural-transcoding-vision-transformers","title":"NT-ViT: Neural Transcoding Vision Transformers for EEG-to-fMRI Synthesis","date":"2024-09-18","arxiv_id":"2409.11836","n_code_links":0,"syntology":null},{"paper":"/paper/unsupervised-feature-orthogonalization-for","slug":"unsupervised-feature-orthogonalization-for","title":"Unsupervised Feature Orthogonalization for Learning Distortion-Invariant Representations","date":"2024-09-18","arxiv_id":"2409.12276","n_code_links":1,"syntology":null},{"paper":null,"slug":"are-deep-learning-models-robust-to-partial","title":"Are Deep Learning Models Robust to Partial Object Occlusion in Visual Recognition Tasks?","date":"2024-09-16","arxiv_id":"2409.10775","n_code_links":0,"syntology":null},{"paper":"/paper/metaformer-and-cnn-hybrid-model-for-polyp","slug":"metaformer-and-cnn-hybrid-model-for-polyp","title":"MetaFormer and CNN Hybrid Model for Polyp Image Segmentation","date":"2024-09-16","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"personalized-speech-emotion-recognition-in","title":"Personalized Speech Emotion Recognition in Human-Robot Interaction using Vision Transformers","date":"2024-09-16","arxiv_id":"2409.10687","n_code_links":0,"syntology":null},{"paper":null,"slug":"underwater-image-enhancement-via-dehazing-and","title":"Underwater Image Enhancement via Dehazing and Color Restoration","date":"2024-09-15","arxiv_id":"2409.09779","n_code_links":0,"syntology":null},{"paper":null,"slug":"investigation-of-hierarchical-spectral-vision","title":"Investigation of Hierarchical Spectral Vision Transformer Architecture for Classification of Hyperspectral Imagery","date":"2024-09-14","arxiv_id":"2409.09244","n_code_links":0,"syntology":null},{"paper":"/paper/sea-vit-sea-surface-currents-forecasting","slug":"sea-vit-sea-surface-currents-forecasting","title":"SEA-ViT: Sea Surface Currents Forecasting Using Vision Transformer and GRU-Based Spatio-Temporal Covariance Modeling","date":"2024-09-14","arxiv_id":"2409.16313","n_code_links":1,"syntology":null},{"paper":"/paper/htr-vt-handwritten-text-recognition-with","slug":"htr-vt-handwritten-text-recognition-with","title":"HTR-VT: Handwritten Text Recognition with Vision Transformer","date":"2024-09-13","arxiv_id":"2409.08573","n_code_links":2,"syntology":null},{"paper":"/paper/pathfinder-for-low-altitude-aircraft-with","slug":"pathfinder-for-low-altitude-aircraft-with","title":"Pathfinder for Low-altitude Aircraft with Binary Neural Network","date":"2024-09-13","arxiv_id":"2409.08824","n_code_links":1,"syntology":null},{"paper":null,"slug":"phikon-v2-a-large-and-public-feature","title":"Phikon-v2, A large and public feature extractor for biomarker prediction","date":"2024-09-13","arxiv_id":"2409.09173","n_code_links":0,"syntology":null},{"paper":null,"slug":"ad-lite-net-a-lightweight-and-concatenated","title":"AD-Lite Net: A Lightweight and Concatenated CNN Model for Alzheimer's Detection from MRI Images","date":"2024-09-12","arxiv_id":"2409.08170","n_code_links":0,"syntology":null},{"paper":"/paper/intrapartum-ultrasound-image-segmentation-of","slug":"intrapartum-ultrasound-image-segmentation-of","title":"Intrapartum Ultrasound Image Segmentation of Pubic Symphysis and Fetal Head Using Dual Student-Teacher Framework with CNN-ViT Collaborative Learning","date":"2024-09-11","arxiv_id":"2409.06928","n_code_links":1,"syntology":null},{"paper":"/paper/token-turing-machines-are-efficient-vision","slug":"token-turing-machines-are-efficient-vision","title":"Token Turing Machines are Efficient Vision Models","date":"2024-09-11","arxiv_id":"2409.07613","n_code_links":1,"syntology":{"ran":11,"of":14,"n_ran_checked":11,"n_instrument":0,"unverified":3,"pointer_only":1,"phrase":"11 ran (of which 0 constructed an object rather than computing a result; 11 with no instrument failure: 1 honoured, 0 violated, 10 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","official":{"repos":["pjjajal/efficientttms"],"state":"official (archive's flag): 11 ran","n_ran":11,"n_constructed":0,"n_ran_no_instrument_failure":11,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"connecting-concept-convexity-and-human","title":"Connecting Concept Convexity and Human-Machine Alignment in Deep Neural Networks","date":"2024-09-10","arxiv_id":"2409.06362","n_code_links":0,"syntology":null},{"paper":"/paper/unilearn-enhancing-dynamic-facial-expression","slug":"unilearn-enhancing-dynamic-facial-expression","title":"Static for Dynamic: Towards a Deeper Understanding of Dynamic Facial Expressions Using Static Expression Data","date":"2024-09-10","arxiv_id":"2409.06154","n_code_links":1,"syntology":null},{"paper":null,"slug":"exploring-rich-subjective-quality-information","title":"Exploring Rich Subjective Quality Information for Image Quality Assessment in the Wild","date":"2024-09-09","arxiv_id":"2409.05540","n_code_links":0,"syntology":null},{"paper":null,"slug":"sequential-posterior-sampling-with-diffusion","title":"Sequential Posterior Sampling with Diffusion Models","date":"2024-09-09","arxiv_id":"2409.05399","n_code_links":0,"syntology":null},{"paper":"/paper/lmlt-low-to-high-multi-level-vision","slug":"lmlt-low-to-high-multi-level-vision","title":"LMLT: Low-to-high Multi-Level Vision Transformer for Image Super-Resolution","date":"2024-09-05","arxiv_id":"2409.03516","n_code_links":1,"syntology":null},{"paper":"/paper/on-board-satellite-image-classification-for","slug":"on-board-satellite-image-classification-for","title":"Onboard Satellite Image Classification for Earth Observation: A Comparative Study of ViT Models","date":"2024-09-05","arxiv_id":"2409.03901","n_code_links":1,"syntology":null},{"paper":null,"slug":"towards-data-centric-face-anti-spoofing","title":"Towards Data-Centric Face Anti-Spoofing: Improving Cross-domain Generalization via Physics-based Data Synthesis","date":"2024-09-04","arxiv_id":"2409.03501","n_code_links":0,"syntology":null},{"paper":null,"slug":"astromae-redshift-prediction-using-a-masked","title":"AstroMAE: Redshift Prediction Using a Masked Autoencoder with a Novel Fine-Tuning Architecture","date":"2024-09-03","arxiv_id":"2409.01825","n_code_links":0,"syntology":null},{"paper":null,"slug":"improving-apple-object-detection-with","title":"Improving Apple Object Detection with Occlusion-Enhanced Distillation","date":"2024-09-03","arxiv_id":"2409.01573","n_code_links":0,"syntology":null},{"paper":null,"slug":"t1-contrast-enhanced-mri-generation-from","title":"T1-contrast Enhanced MRI Generation from Multi-parametric MRI for Glioma Patients with Latent Tumor Conditioning","date":"2024-09-03","arxiv_id":"2409.01622","n_code_links":0,"syntology":null},{"paper":null,"slug":"evidential-transformers-for-improved-image","title":"Evidential Transformers for Improved Image Retrieval","date":"2024-09-02","arxiv_id":"2409.01082","n_code_links":0,"syntology":null},{"paper":"/paper/mvx-vit-multimodal-collaborative-perception-1","slug":"mvx-vit-multimodal-collaborative-perception-1","title":"MVX-ViT: Multimodal Collaborative Perception for 6G V2X Network Management Decisions Using Vision Transformer.","date":"2024-08-30","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/comparative-analysis-of-transfer-learning","slug":"comparative-analysis-of-transfer-learning","title":"Evaluating Deep Learning Models for Breast Cancer Classification: A Comparative Study","date":"2024-08-29","arxiv_id":"2408.16859","n_code_links":2,"syntology":null},{"paper":null,"slug":"llava-sg-leveraging-scene-graphs-as-visual","title":"LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models","date":"2024-08-29","arxiv_id":"2408.16224","n_code_links":0,"syntology":null},{"paper":"/paper/partformer-awakening-latent-diverse","slug":"partformer-awakening-latent-diverse","title":"PartFormer: Awakening Latent Diverse Representation from Vision Transformer for Object Re-Identification","date":"2024-08-29","arxiv_id":"2408.16684","n_code_links":0,"syntology":null},{"paper":"/paper/weakly-supervised-object-detection-for","slug":"weakly-supervised-object-detection-for","title":"Weakly Supervised Object Detection for Automatic Tooth-marked Tongue Recognition","date":"2024-08-29","arxiv_id":"2408.16451","n_code_links":1,"syntology":null},{"paper":"/paper/applying-vit-in-generalized-few-shot-semantic","slug":"applying-vit-in-generalized-few-shot-semantic","title":"Applying ViT in Generalized Few-shot Semantic Segmentation","date":"2024-08-27","arxiv_id":"2408.14957","n_code_links":1,"syntology":null},{"paper":null,"slug":"the-benefits-of-balance-from-information","title":"The Benefits of Balance: From Information Projections to Variance Reduction","date":"2024-08-27","arxiv_id":"2408.15065","n_code_links":0,"syntology":null},{"paper":"/paper/3d-rcnet-learning-from-transformer-to-build-a","slug":"3d-rcnet-learning-from-transformer-to-build-a","title":"3D-RCNet: Learning from Transformer to Build a 3D Relational ConvNet for Hyperspectral Image Classification","date":"2024-08-25","arxiv_id":"2408.13728","n_code_links":1,"syntology":null},{"paper":"/paper/flexible-game-playing-ai-with-alphavit","slug":"flexible-game-playing-ai-with-alphavit","title":"AlphaViT: A Flexible Game-Playing AI for Multiple Games and Variable Board Sizes","date":"2024-08-25","arxiv_id":"2408.13871","n_code_links":1,"syntology":null},{"paper":null,"slug":"lowclip-adapting-the-clip-model-architecture","title":"LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task","date":"2024-08-25","arxiv_id":"2408.13909","n_code_links":0,"syntology":null},{"paper":"/paper/variational-autoencoder-for-anomaly-detection","slug":"variational-autoencoder-for-anomaly-detection","title":"Variational Autoencoder for Anomaly Detection: A Comparative Study","date":"2024-08-24","arxiv_id":"2408.13561","n_code_links":1,"syntology":null},{"paper":null,"slug":"eavit-external-attention-vision-transformer","title":"EAViT: External Attention Vision Transformer for Audio Classification","date":"2024-08-23","arxiv_id":"2408.13201","n_code_links":0,"syntology":null},{"paper":"/paper/image-segmentation-in-foundation-model-era-a","slug":"image-segmentation-in-foundation-model-era-a","title":"Image Segmentation in Foundation Model Era: A Survey","date":"2024-08-23","arxiv_id":"2408.12957","n_code_links":1,"syntology":null},{"paper":null,"slug":"enhanced-infield-agriculture-with","title":"Enhanced Infield Agriculture with Interpretable Machine Learning Approaches for Crop Classification","date":"2024-08-22","arxiv_id":"2408.12426","n_code_links":0,"syntology":null},{"paper":"/paper/sapiens-foundation-for-human-vision-models","slug":"sapiens-foundation-for-human-vision-models","title":"Sapiens: Foundation for Human Vision Models","date":"2024-08-22","arxiv_id":"2408.12569","n_code_links":2,"syntology":{"ran":9,"of":11,"n_ran_checked":9,"n_instrument":0,"unverified":2,"pointer_only":0,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 0 honoured, 0 violated, 9 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","official":null}},{"paper":null,"slug":"on-learnable-parameters-of-optimal-and","title":"On Learnable Parameters of Optimal and Suboptimal Deep Learning Models","date":"2024-08-21","arxiv_id":"2408.11720","n_code_links":0,"syntology":null},{"paper":"/paper/toward-enhancing-vehicle-color-recognition-in","slug":"toward-enhancing-vehicle-color-recognition-in","title":"Toward Enhancing Vehicle Color Recognition in Adverse Conditions: A Dataset and Benchmark","date":"2024-08-21","arxiv_id":"2408.11589","n_code_links":1,"syntology":null},{"paper":"/paper/hired-attention-guided-token-dropping-for","slug":"hired-attention-guided-token-dropping-for","title":"HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models","date":"2024-08-20","arxiv_id":"2408.10945","n_code_links":1,"syntology":{"ran":1,"of":3,"n_ran_checked":0,"n_instrument":1,"unverified":2,"pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","official":{"repos":["hasanar1f/hired"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":2,"ran_from_kinds":["official"]}}},{"paper":"/paper/mambaevt-event-stream-based-visual-object","slug":"mambaevt-event-stream-based-visual-object","title":"MambaEVT: Event Stream based Visual Object Tracking using State Space Model","date":"2024-08-20","arxiv_id":"2408.10487","n_code_links":1,"syntology":{"ran":9,"of":10,"n_ran_checked":9,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 1 honoured, 0 violated, 8 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["event-ahu/mambaevt"],"state":"official (archive's flag): 9 ran","n_ran":9,"n_constructed":0,"n_ran_no_instrument_failure":9,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"on-the-potential-of-open-vocabulary-models","title":"On the Potential of Open-Vocabulary Models for Object Detection in Unusual Street Scenes","date":"2024-08-20","arxiv_id":"2408.11221","n_code_links":0,"syntology":null},{"paper":"/paper/quantum-inverse-contextual-vision","slug":"quantum-inverse-contextual-vision","title":"Quantum Inverse Contextual Vision Transformers (Q-ICVT): A New Frontier in 3D Object Detection for AVs","date":"2024-08-20","arxiv_id":"2408.11207","n_code_links":1,"syntology":null},{"paper":"/paper/pedestrian-attribute-recognition-a-new","slug":"pedestrian-attribute-recognition-a-new","title":"Pedestrian Attribute Recognition: A New Benchmark Dataset and A Large Language Model Augmented Framework","date":"2024-08-19","arxiv_id":"2408.09720","n_code_links":2,"syntology":null},{"paper":"/paper/sam-unet-enhancing-zero-shot-segmentation-of","slug":"sam-unet-enhancing-zero-shot-segmentation-of","title":"SAM-UNet:Enhancing Zero-Shot Segmentation of SAM for Universal Medical Images","date":"2024-08-19","arxiv_id":"2408.09886","n_code_links":1,"syntology":null},{"paper":null,"slug":"ou-covit-copula-enhanced-bi-channel-multi","title":"OU-CoViT: Copula-Enhanced Bi-Channel Multi-Task Vision Transformers with Dual Adaptation for OU-UWF Images","date":"2024-08-18","arxiv_id":"2408.09395","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-novel-approach-to-classify-power-quality","title":"A Novel Approach to Classify Power Quality Signals Using Vision Transformers","date":"2024-08-16","arxiv_id":"2409.00025","n_code_links":0,"syntology":null},{"paper":null,"slug":"comparative-analysis-of-generative-models","title":"Comparative Analysis of Generative Models: Enhancing Image Synthesis with VAEs, GANs, and Stable Diffusion","date":"2024-08-16","arxiv_id":"2408.08751","n_code_links":0,"syntology":null},{"paper":null,"slug":"research-on-personalized-compression","title":"Research on Personalized Compression Algorithm for Pre-trained Models Based on Homomorphic Entropy Increase","date":"2024-08-16","arxiv_id":"2408.08684","n_code_links":0,"syntology":null},{"paper":"/paper/computer-vision-model-compression-techniques","slug":"computer-vision-model-compression-techniques","title":"Computer Vision Model Compression Techniques for Embedded Systems: A Survey","date":"2024-08-15","arxiv_id":"2408.08250","n_code_links":1,"syntology":null},{"paper":null,"slug":"efficient-data-sketches-and-fine-tuning-for","title":"Distributional Drift Detection in Medical Imaging with Sketching and Fine-Tuned Transformer","date":"2024-08-15","arxiv_id":"2408.08456","n_code_links":0,"syntology":null},{"paper":"/paper/unsupervised-part-discovery-via-dual","slug":"unsupervised-part-discovery-via-dual","title":"Unsupervised Part Discovery via Dual Representation Alignment","date":"2024-08-15","arxiv_id":"2408.08108","n_code_links":1,"syntology":null},{"paper":null,"slug":"g-2-v-2-former-graph-guided-video-vision","title":"G$^2$V$^2$former: Graph Guided Video Vision Transformer for Face Anti-Spoofing","date":"2024-08-14","arxiv_id":"2408.07675","n_code_links":0,"syntology":null},{"paper":"/paper/cross-view-geolocalization-and-disaster","slug":"cross-view-geolocalization-and-disaster","title":"Cross-View Geolocalization and Disaster Mapping with Street-View and VHR Satellite Imagery: A Case Study of Hurricane IAN","date":"2024-08-13","arxiv_id":"2408.06761","n_code_links":1,"syntology":null},{"paper":"/paper/photometric-inverse-rendering-shading-cues","slug":"photometric-inverse-rendering-shading-cues","title":"PIR: Photometric Inverse Rendering with Shading Cues Modeling and Surface Reflectance Regularization","date":"2024-08-13","arxiv_id":"2408.06828","n_code_links":1,"syntology":null},{"paper":"/paper/reclip-learn-to-rectify-the-bias-of-clip-for","slug":"reclip-learn-to-rectify-the-bias-of-clip-for","title":"ReCLIP++: Learn to Rectify the Bias of CLIP for Unsupervised Semantic Segmentation","date":"2024-08-13","arxiv_id":"2408.06747","n_code_links":1,"syntology":{"ran":4,"of":5,"n_ran_checked":4,"n_instrument":0,"unverified":1,"pointer_only":5,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["dogehhh/reclip"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/spectrum-prediction-with-deep-3d-pyramid","slug":"spectrum-prediction-with-deep-3d-pyramid","title":"Spectrum Prediction With Deep 3D Pyramid Vision Transformer Learning","date":"2024-08-13","arxiv_id":"2408.06870","n_code_links":1,"syntology":null},{"paper":null,"slug":"an-analysis-of-hoi-using-a-training-free","title":"An analysis of HOI: using a training-free method with multimodal visual foundation models when only the test set is available, without the training set","date":"2024-08-11","arxiv_id":"2408.05772","n_code_links":0,"syntology":null},{"paper":"/paper/u-decn-end-to-end-underwater-object-detection","slug":"u-decn-end-to-end-underwater-object-detection","title":"U-DECN: End-to-End Underwater Object Detection ConvNet with Improved DeNoising Training","date":"2024-08-11","arxiv_id":"2408.05780","n_code_links":1,"syntology":null},{"paper":null,"slug":"beyondct-a-deep-learning-model-for-predicting","title":"BeyondCT: A deep learning model for predicting pulmonary function from chest CT scans","date":"2024-08-10","arxiv_id":"2408.05645","n_code_links":0,"syntology":null},{"paper":"/paper/personvit-large-scale-self-supervised-vision","slug":"personvit-large-scale-self-supervised-vision","title":"PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification","date":"2024-08-10","arxiv_id":"2408.05398","n_code_links":1,"syntology":null},{"paper":"/paper/brat-bonus-orthogonal-token-for-architecture","slug":"brat-bonus-orthogonal-token-for-architecture","title":"BRAT: Bonus oRthogonAl Token for Architecture Agnostic Textual Inversion","date":"2024-08-08","arxiv_id":"2408.04785","n_code_links":1,"syntology":null},{"paper":null,"slug":"m2ef-nns-multimodal-multi-instance-evidence","title":"M2EF-NNs: Multimodal Multi-instance Evidence Fusion Neural Networks for Cancer Survival Prediction","date":"2024-08-08","arxiv_id":"2408.04170","n_code_links":0,"syntology":null},{"paper":null,"slug":"uhnet-an-ultra-lightweight-and-high-speed","title":"UHNet: An Ultra-Lightweight and High-Speed Edge Detection Network","date":"2024-08-08","arxiv_id":"2408.04258","n_code_links":0,"syntology":null},{"paper":"/paper/global-local-progressive-integration-network","slug":"global-local-progressive-integration-network","title":"No-Reference Image Quality Assessment with Global-Local Progressive Integration and Semantic-Aligned Quality Transfer","date":"2024-08-07","arxiv_id":"2408.03885","n_code_links":1,"syntology":null},{"paper":"/paper/railtrack-davit-a-vision-transformer-based","slug":"railtrack-davit-a-vision-transformer-based","title":"RailTrack-DaViT: A Vision Transformer-Based Approach for Automated Railway Track Defect Detection","date":"2024-08-07","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/advancing-eeg-based-gaze-prediction-using","slug":"advancing-eeg-based-gaze-prediction-using","title":"Advancing EEG-Based Gaze Prediction Using Depthwise Separable Convolution and Enhanced Pre-Processing","date":"2024-08-06","arxiv_id":"2408.03480","n_code_links":1,"syntology":null},{"paper":"/paper/2408-02181","slug":"2408-02181","title":"AssemAI: Interpretable Image-Based Anomaly Detection for Manufacturing Pipelines","date":"2024-08-05","arxiv_id":"2408.02181","n_code_links":1,"syntology":null},{"paper":null,"slug":"2408-01739","title":"LAM3D: Leveraging Attention for Monocular 3D Object Detection","date":"2024-08-03","arxiv_id":"2408.01739","n_code_links":0,"syntology":null},{"paper":null,"slug":"2408-01040","title":"Privacy-Preserving Split Learning with Vision Transformers using Patch-Wise Random and Noisy CutMix","date":"2024-08-02","arxiv_id":"2408.01040","n_code_links":0,"syntology":null},{"paper":"/paper/2408-01579","slug":"2408-01579","title":"THOR2: Topological Analysis for 3D Shape and Color-Based Human-Inspired Object Recognition in Unseen Environments","date":"2024-08-02","arxiv_id":"2408.01579","n_code_links":1,"syntology":null},{"paper":null,"slug":"cc-sam-sam-with-cross-feature-attention-and","title":"CC-SAM: SAM with Cross-feature Attention and Context for Ultrasound Image Segmentation","date":"2024-07-31","arxiv_id":"2408.00181","n_code_links":0,"syntology":null},{"paper":"/paper/euda-an-efficient-unsupervised-domain","slug":"euda-an-efficient-unsupervised-domain","title":"EUDA: An Efficient Unsupervised Domain Adaptation via Self-Supervised Vision Transformer","date":"2024-07-31","arxiv_id":"2407.21311","n_code_links":1,"syntology":null},{"paper":null,"slug":"mimiq-low-bit-data-free-quantization-of","title":"MimiQ: Low-Bit Data-Free Quantization of Vision Transformers with Encouraging Inter-Head Attention Similarity","date":"2024-07-29","arxiv_id":"2407.20021","n_code_links":0,"syntology":null},{"paper":"/paper/mixture-of-nested-experts-adaptive-processing","slug":"mixture-of-nested-experts-adaptive-processing","title":"Mixture of Nested Experts: Adaptive Processing of Visual Tokens","date":"2024-07-29","arxiv_id":"2407.19985","n_code_links":1,"syntology":{"ran":8,"of":14,"n_ran_checked":7,"n_instrument":1,"unverified":6,"pointer_only":0,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 1 honoured, 0 violated, 6 with no contract checked; 1 where Syntology's instrument failed) · 6 unverified","official":null}},{"paper":"/paper/depth-wise-convolutions-in-vision","slug":"depth-wise-convolutions-in-vision","title":"Depth-Wise Convolutions in Vision Transformers for Efficient Training on Small Datasets","date":"2024-07-28","arxiv_id":"2407.19394","n_code_links":1,"syntology":{"ran":13,"of":16,"n_ran_checked":11,"n_instrument":2,"unverified":3,"pointer_only":16,"phrase":"13 ran (of which 0 constructed an object rather than computing a result; 11 with no instrument failure: 1 honoured, 2 violated, 8 with no contract checked; 2 where Syntology's instrument failed) · 3 unverified","official":{"repos":["ztx-100/efficient_vit_with_dw"],"state":"official (archive's flag): 13 ran","n_ran":13,"n_constructed":0,"n_ran_no_instrument_failure":11,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"channel-boosted-cnn-transformer-based-multi","title":"Channel Boosted CNN-Transformer-based Multi-Level and Multi-Scale Nuclei Segmentation","date":"2024-07-27","arxiv_id":"2407.19186","n_code_links":0,"syntology":null},{"paper":null,"slug":"deep-companion-learning-enhancing","title":"Deep Companion Learning: Enhancing Generalization Through Historical Consistency","date":"2024-07-26","arxiv_id":"2407.18821","n_code_links":0,"syntology":null},{"paper":null,"slug":"shic-shape-image-correspondences-with-no","title":"SHIC: Shape-Image Correspondences with no Keypoint Supervision","date":"2024-07-26","arxiv_id":"2407.18907","n_code_links":0,"syntology":null},{"paper":null,"slug":"skin-cancer-detection-utilizing-deep-learning","title":"Skin Cancer Detection utilizing Deep Learning: Classification of Skin Lesion Images using a Vision Transformer","date":"2024-07-26","arxiv_id":"2407.18554","n_code_links":0,"syntology":null},{"paper":"/paper/case-enhanced-vision-transformer-improving","slug":"case-enhanced-vision-transformer-improving","title":"Case-Enhanced Vision Transformer: Improving Explanations of Image Similarity with a ViT-based Similarity Metric","date":"2024-07-24","arxiv_id":"2407.16981","n_code_links":1,"syntology":null},{"paper":"/paper/graph-neural-networks-a-suitable-alternative","slug":"graph-neural-networks-a-suitable-alternative","title":"Graph Neural Networks: A suitable Alternative to MLPs in Latent 3D Medical Image Classification?","date":"2024-07-24","arxiv_id":"2407.17219","n_code_links":1,"syntology":null},{"paper":"/paper/trans2unet-neural-fusion-for-nuclei-semantic","slug":"trans2unet-neural-fusion-for-nuclei-semantic","title":"Trans2Unet: Neural fusion for Nuclei Semantic Segmentation","date":"2024-07-24","arxiv_id":"2407.17181","n_code_links":0,"syntology":null},{"paper":"/paper/predicting-the-best-of-n-visual-trackers","slug":"predicting-the-best-of-n-visual-trackers","title":"Predicting the Best of N Visual Trackers","date":"2024-07-22","arxiv_id":"2407.15707","n_code_links":1,"syntology":null},{"paper":null,"slug":"continual-distillation-learning","title":"Continual Distillation Learning: Knowledge Distillation in Prompt-based Continual Learning","date":"2024-07-18","arxiv_id":"2407.13911","n_code_links":0,"syntology":null},{"paper":null,"slug":"lookupvit-compressing-visual-information-to-a","title":"LookupViT: Compressing visual information to a limited number of tokens","date":"2024-07-17","arxiv_id":"2407.12753","n_code_links":0,"syntology":null},{"paper":null,"slug":"dino-diffusion-scaling-medical-diffusion-via","title":"DiNO-Diffusion. Scaling Medical Diffusion via Self-Supervised Pre-Training","date":"2024-07-16","arxiv_id":"2407.11594","n_code_links":0,"syntology":null},{"paper":null,"slug":"probing-the-efficacy-of-federated-parameter","title":"Probing the Efficacy of Federated Parameter-Efficient Fine-Tuning of Vision Transformers for Medical Image Classification","date":"2024-07-16","arxiv_id":"2407.11573","n_code_links":0,"syntology":null},{"paper":null,"slug":"siamese-transformer-networks-for-few-shot","title":"Siamese Transformer Networks for Few-shot Image Classification","date":"2024-07-16","arxiv_id":"2408.01427","n_code_links":0,"syntology":null},{"paper":"/paper/aligning-neuronal-coding-of-dynamic-visual","slug":"aligning-neuronal-coding-of-dynamic-visual","title":"Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models","date":"2024-07-15","arxiv_id":"2407.10737","n_code_links":1,"syntology":null}],"record_sha256":"8e20718d25df6da034f490d1e6038e2f8ffae6f4e7b75cde0f1617a371da6fcb","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}