{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/transformer/papers/7","list_of":"/method/transformer","method":"Transformer","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":7,"pages_in_order":140,"rows_per_page":100,"rows":[601,700],"of":13999,"counts":{"archive_papers_tagged":13999,"with_a_code_link":6572,"where_syntology_ran_a_sample":2248,"not_listed_spam_title":0,"listed":13999,"listed_where_code_ran":2248,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1919,"every_run_a_failure_of_syntologys_instrument":329,"listed_with_a_run_with_no_instrument_failure":1919,"listed_every_run_a_failure_of_syntologys_instrument":329,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/transformer","prev":"/method/transformer/papers/6","next":"/method/transformer/papers/8","papers":[{"paper":"/paper/zooming-in-on-fakes-a-novel-dataset-for","slug":"zooming-in-on-fakes-a-novel-dataset-for","title":"Zooming In on Fakes: A Novel Dataset for Localized AI-Generated Image Detection with Forgery Amplification Approach","date":"2025-04-16","arxiv_id":"2504.11922","n_code_links":1,"syntology":null},{"paper":null,"slug":"a-decade-of-wheat-mapping-for-lebanon","title":"A Decade of Wheat Mapping for Lebanon","date":"2025-04-15","arxiv_id":"2504.11366","n_code_links":0,"syntology":null},{"paper":"/paper/afire-anatomy-driven-self-supervised-learning","slug":"afire-anatomy-driven-self-supervised-learning","title":"AFiRe: Anatomy-Driven Self-Supervised Learning for Fine-Grained Representation in Radiographic Images","date":"2025-04-15","arxiv_id":"2504.10972","n_code_links":1,"syntology":null},{"paper":null,"slug":"bridging-distribution-gaps-in-time-series","title":"Bridging Distribution Gaps in Time Series Foundation Model Pretraining with Prototype-Guided Normalization","date":"2025-04-15","arxiv_id":"2504.10900","n_code_links":0,"syntology":null},{"paper":"/paper/deep-learning-based-bathymetry-retrieval","slug":"deep-learning-based-bathymetry-retrieval","title":"Deep Learning-based Bathymetry Retrieval without In-situ Depths using Remote Sensing Imagery and SfM-MVS DSMs with Data Gaps","date":"2025-04-15","arxiv_id":"2504.11416","n_code_links":1,"syntology":null},{"paper":null,"slug":"embedding-radiomics-into-vision-transformers","title":"Embedding Radiomics into Vision Transformers for Multimodal Medical Image Classification","date":"2025-04-15","arxiv_id":"2504.10916","n_code_links":0,"syntology":null},{"paper":null,"slug":"exploring-the-role-of-kg-based-rag-in","title":"Exploring the Role of Knowledge Graph-Based RAG in Japanese Medical Question Answering with Small-Scale LLMs","date":"2025-04-15","arxiv_id":"2504.10982","n_code_links":0,"syntology":null},{"paper":null,"slug":"leveraging-point-transformers-for-detecting","title":"Leveraging Point Transformers for Detecting Anatomical Landmarks in Digital Dentistry","date":"2025-04-15","arxiv_id":"2504.11418","n_code_links":0,"syntology":null},{"paper":null,"slug":"moving-beyond-next-token-prediction","title":"Moving Beyond Next-Token Prediction: Transformers are Context-Sensitive Language Generators","date":"2025-04-15","arxiv_id":"2504.10845","n_code_links":0,"syntology":null},{"paper":"/paper/multi-scale-convolutional-transformer-network","slug":"multi-scale-convolutional-transformer-network","title":"Multi-scale convolutional transformer network for motor imagery brain-computer interface","date":"2025-04-15","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"progressive-rock-music-classification","title":"Progressive Rock Music Classification","date":"2025-04-15","arxiv_id":"2504.10821","n_code_links":0,"syntology":null},{"paper":null,"slug":"towards-a-universal-graph-structural-encoder","title":"Towards A Universal Graph Structural Encoder","date":"2025-04-15","arxiv_id":"2504.10917","n_code_links":0,"syntology":null},{"paper":null,"slug":"transformer-based-model-for-cold-start","title":"Transformer-Based Model for Cold Start Mitigation in FaaS Architecture","date":"2025-04-15","arxiv_id":"2504.11338","n_code_links":0,"syntology":null},{"paper":null,"slug":"vexp-a-low-cost-risc-v-isa-extension-for","title":"VEXP: A Low-Cost RISC-V ISA Extension for Accelerated Softmax Computation in Transformers","date":"2025-04-15","arxiv_id":"2504.11227","n_code_links":0,"syntology":null},{"paper":null,"slug":"beyond-chains-of-thought-benchmarking-latent","title":"Beyond Chains of Thought: Benchmarking Latent-Space Reasoning Abilities in Large Language Models","date":"2025-04-14","arxiv_id":"2504.10615","n_code_links":0,"syntology":null},{"paper":null,"slug":"can-llms-handle-webshell-detection-overcoming","title":"Can LLMs handle WebShell detection? Overcoming Detection Challenges with Behavioral Function-Aware Framework","date":"2025-04-14","arxiv_id":"2504.13811","n_code_links":0,"syntology":null},{"paper":null,"slug":"emafusion-a-self-optimizing-system-for","title":"EMAFusion: A Self-Optimizing System for Seamless LLM Selection and Integration","date":"2025-04-14","arxiv_id":"2504.10681","n_code_links":0,"syntology":null},{"paper":null,"slug":"global-and-local-mamba-network-for-multi","title":"Global and Local Mamba Network for Multi-Modality Medical Image Super-Resolution","date":"2025-04-14","arxiv_id":"2504.10105","n_code_links":0,"syntology":null},{"paper":null,"slug":"integrating-vision-and-location-with","title":"Integrating Vision and Location with Transformers: A Multimodal Deep Learning Framework for Medical Wound Analysis","date":"2025-04-14","arxiv_id":"2504.10452","n_code_links":0,"syntology":null},{"paper":null,"slug":"keyword-extraction-and-aspect-classification","title":"Keyword Extraction, and Aspect Classification in Sinhala, English, and Code-Mixed Content","date":"2025-04-14","arxiv_id":"2504.10679","n_code_links":0,"syntology":null},{"paper":null,"slug":"multi-object-grounding-via-hierarchical","title":"Multi-Object Grounding via Hierarchical Contrastive Siamese Transformers","date":"2025-04-14","arxiv_id":"2504.10048","n_code_links":0,"syntology":null},{"paper":"/paper/multimodal-long-video-modeling-based-on","slug":"multimodal-long-video-modeling-based-on","title":"Multimodal Long Video Modeling Based on Temporal Dynamic Context","date":"2025-04-14","arxiv_id":"2504.10443","n_code_links":1,"syntology":null},{"paper":null,"slug":"self-controlled-dynamic-expansion-model-for","title":"Self-Controlled Dynamic Expansion Model for Continual Learning","date":"2025-04-14","arxiv_id":"2504.10561","n_code_links":0,"syntology":null},{"paper":"/paper/toward-aligning-human-and-robot-actions-via","slug":"toward-aligning-human-and-robot-actions-via","title":"Toward Aligning Human and Robot Actions via Multi-Modal Demonstration Learning","date":"2025-04-14","arxiv_id":"2504.11493","n_code_links":1,"syntology":null},{"paper":"/paper/clinicalgpt-r1-pushing-reasoning-capability","slug":"clinicalgpt-r1-pushing-reasoning-capability","title":"ClinicalGPT-R1: Pushing reasoning capability of generalist disease diagnosis with large language model","date":"2025-04-13","arxiv_id":"2504.09421","n_code_links":1,"syntology":null},{"paper":null,"slug":"ditse-high-fidelity-generative-speech","title":"DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers","date":"2025-04-13","arxiv_id":"2504.09381","n_code_links":0,"syntology":null},{"paper":null,"slug":"enhanced-filterless-multi-color-vlc-via-qct","title":"Enhanced Filterless Multi-Color VLC via QCT","date":"2025-04-13","arxiv_id":"2504.09743","n_code_links":0,"syntology":null},{"paper":null,"slug":"ensemble-enhanced-graph-autoencoder-with-gat","title":"Ensemble-Enhanced Graph Autoencoder with GAT and Transformer-Based Encoders for Robust Fault Diagnosis","date":"2025-04-13","arxiv_id":"2504.09427","n_code_links":0,"syntology":null},{"paper":null,"slug":"integrating-large-language-models-for-1","title":"Integrating Large Language Models for Automated Structural Analysis","date":"2025-04-13","arxiv_id":"2504.09754","n_code_links":0,"syntology":null},{"paper":null,"slug":"iterative-self-training-for-code-generation","title":"Iterative Self-Training for Code Generation via Reinforced Re-Ranking","date":"2025-04-13","arxiv_id":"2504.09643","n_code_links":0,"syntology":null},{"paper":"/paper/trajectory-guided-motion-perception-for","slug":"trajectory-guided-motion-perception-for","title":"Trajectory-guided Motion Perception for Facial Expression Quality Assessment in Neurological Disorders","date":"2025-04-13","arxiv_id":"2504.09530","n_code_links":1,"syntology":null},{"paper":null,"slug":"accurate-diagnosis-of-respiratory-viruses","title":"Accurate Diagnosis of Respiratory Viruses Using an Explainable Machine Learning with Mid-Infrared Biomolecular Fingerprinting of Nasopharyngeal Secretions","date":"2025-04-12","arxiv_id":"2504.09211","n_code_links":0,"syntology":null},{"paper":"/paper/learning-occlusion-robust-vision-transformers-1","slug":"learning-occlusion-robust-vision-transformers-1","title":"Learning Occlusion-Robust Vision Transformers for Real-Time UAV Tracking","date":"2025-04-12","arxiv_id":"2504.09228","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":1,"n_instrument":0,"unverified":0,"pointer_only":0,"phrase":"1 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified; the one sample that ran constructed an object rather than computing a result","official":{"repos":["wuyou3474/ortrack"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":1,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"multi-modal-brain-tumor-segmentation-via-3d","title":"Multi-Modal Brain Tumor Segmentation via 3D Multi-Scale Self-attention and Cross-attention","date":"2025-04-12","arxiv_id":"2504.09088","n_code_links":0,"syntology":null},{"paper":"/paper/multi-scale-activation-refinement-and-1","slug":"multi-scale-activation-refinement-and-1","title":"Multi-scale Activation, Refinement, and Aggregation: Exploring Diverse Cues for Fine-Grained Bird Recognition","date":"2025-04-12","arxiv_id":"2504.09215","n_code_links":0,"syntology":null},{"paper":"/paper/nettag-a-multimodal-rtl-and-layout-aligned","slug":"nettag-a-multimodal-rtl-and-layout-aligned","title":"NetTAG: A Multimodal RTL-and-Layout-Aligned Netlist Foundation Model via Text-Attributed Graph","date":"2025-04-12","arxiv_id":"2504.09260","n_code_links":1,"syntology":null},{"paper":null,"slug":"adaptive-additive-parameter-updates-of-vision","title":"Adaptive Additive Parameter Updates of Vision Transformers for Few-Shot Continual Learning","date":"2025-04-11","arxiv_id":"2504.08982","n_code_links":0,"syntology":null},{"paper":null,"slug":"dreamfuse-adaptive-image-fusion-with","title":"DreamFuse: Adaptive Image Fusion with Diffusion Transformer","date":"2025-04-11","arxiv_id":"2504.08291","n_code_links":0,"syntology":null},{"paper":null,"slug":"drivaer-transformer-a-high-precision-and-fast","title":"DrivAer Transformer: A high-precision and fast prediction method for vehicle aerodynamic drag coefficient based on the DrivAerNet++ dataset","date":"2025-04-11","arxiv_id":"2504.08217","n_code_links":0,"syntology":null},{"paper":null,"slug":"hypergraph-vision-transformers-images-are","title":"Hypergraph Vision Transformers: Images are More than Nodes, More than Edges","date":"2025-04-11","arxiv_id":"2504.08710","n_code_links":0,"syntology":null},{"paper":null,"slug":"llmtaxo-leveraging-large-language-models-for","title":"LLMTaxo: Leveraging Large Language Models for Constructing Taxonomy of Factual Claims from Social Media","date":"2025-04-11","arxiv_id":"2504.12325","n_code_links":0,"syntology":null},{"paper":null,"slug":"millions-of-states-designing-a-scalable-moe","title":"Millions of States: Designing a Scalable MoE Architecture with RWKV-7 Meta-learner","date":"2025-04-11","arxiv_id":"2504.08247","n_code_links":0,"syntology":null},{"paper":null,"slug":"mineworld-a-real-time-and-open-source","title":"MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft","date":"2025-04-11","arxiv_id":"2504.08388","n_code_links":0,"syntology":null},{"paper":null,"slug":"mixdit-accelerating-image-diffusion","title":"MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization","date":"2025-04-11","arxiv_id":"2504.08398","n_code_links":0,"syntology":null},{"paper":null,"slug":"rtlrepocoder-repository-level-rtl-code","title":"RTLRepoCoder: Repository-Level RTL Code Completion through the Combination of Fine-Tuning and Retrieval Augmentation","date":"2025-04-11","arxiv_id":"2504.08862","n_code_links":0,"syntology":null},{"paper":null,"slug":"sarformer-an-acquisition-parameter-aware","title":"SARFormer -- An Acquisition Parameter Aware Vision Transformer for Synthetic Aperture Radar Data","date":"2025-04-11","arxiv_id":"2504.08441","n_code_links":0,"syntology":null},{"paper":null,"slug":"swan-gpt-an-efficient-and-scalable-approach","title":"SWAN-GPT: An Efficient and Scalable Approach for Long-Context Language Modeling","date":"2025-04-11","arxiv_id":"2504.08719","n_code_links":0,"syntology":null},{"paper":null,"slug":"vlmt-vision-language-multimodal-transformer","title":"VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering","date":"2025-04-11","arxiv_id":"2504.08269","n_code_links":0,"syntology":null},{"paper":null,"slug":"zipir-latent-pyramid-diffusion-transformer","title":"ZipIR: Latent Pyramid Diffusion Transformer for High-Resolution Image Restoration","date":"2025-04-11","arxiv_id":"2504.08591","n_code_links":0,"syntology":null},{"paper":null,"slug":"attentiondefense-leveraging-system-prompt","title":"AttentionDefense: Leveraging System Prompt Attention for Explainable Defense Against Novel Jailbreaks","date":"2025-04-10","arxiv_id":"2504.12321","n_code_links":0,"syntology":null},{"paper":null,"slug":"beating-transformers-using-synthetic","title":"Beating Transformers using Synthetic Cognition","date":"2025-04-10","arxiv_id":"2504.07619","n_code_links":0,"syntology":null},{"paper":null,"slug":"beyond-feature-importance-feature","title":"Beyond Feature Importance: Feature Interactions in Predicting Post-Stroke Rigidity with Graph Explainable AI","date":"2025-04-10","arxiv_id":"2504.08150","n_code_links":0,"syntology":null},{"paper":null,"slug":"breaking-the-barriers-video-vision","title":"Breaking the Barriers: Video Vision Transformers for Word-Level Sign Language Recognition","date":"2025-04-10","arxiv_id":"2504.07792","n_code_links":0,"syntology":null},{"paper":"/paper/deep-learning-meets-teleconnections-improving","slug":"deep-learning-meets-teleconnections-improving","title":"Deep Learning Meets Teleconnections: Improving S2S Predictions for European Winter Weather","date":"2025-04-10","arxiv_id":"2504.07625","n_code_links":1,"syntology":null},{"paper":null,"slug":"distilling-knowledge-from-heterogeneous","title":"Distilling Knowledge from Heterogeneous Architectures for Semantic Segmentation","date":"2025-04-10","arxiv_id":"2504.07691","n_code_links":0,"syntology":null},{"paper":null,"slug":"genetic-programming-with-reinforcement","title":"Genetic Programming with Reinforcement Learning Trained Transformer for Real-World Dynamic Scheduling Problems","date":"2025-04-10","arxiv_id":"2504.07779","n_code_links":0,"syntology":null},{"paper":null,"slug":"has-the-creativity-of-large-language-models","title":"Has the Creativity of Large-Language Models peaked? An analysis of inter- and intra-LLM variability","date":"2025-04-10","arxiv_id":"2504.12320","n_code_links":0,"syntology":null},{"paper":"/paper/heart-failure-prediction-using-modal","slug":"heart-failure-prediction-using-modal","title":"Heart Failure Prediction using Modal Decomposition and Masked Autoencoders for Scarce Echocardiography Databases","date":"2025-04-10","arxiv_id":"2504.07606","n_code_links":1,"syntology":null},{"paper":null,"slug":"jepa4rec-learning-effective-language","title":"JEPA4Rec: Learning Effective Language Representations for Sequential Recommendation via Joint Embedding Predictive Architecture","date":"2025-04-10","arxiv_id":"2504.10512","n_code_links":0,"syntology":null},{"paper":null,"slug":"novel-pooling-based-vgg-lite-for-pneumonia","title":"Novel Pooling-based VGG-Lite for Pneumonia and Covid-19 Detection from Imbalanced Chest X-Ray Datasets","date":"2025-04-10","arxiv_id":"2504.07468","n_code_links":0,"syntology":null},{"paper":null,"slug":"on-the-practice-of-deep-hierarchical-ensemble","title":"On the Practice of Deep Hierarchical Ensemble Network for Ad Conversion Rate Prediction","date":"2025-04-10","arxiv_id":"2504.08169","n_code_links":0,"syntology":null},{"paper":null,"slug":"pangu-ultra-pushing-the-limits-of-dense-large","title":"Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs","date":"2025-04-10","arxiv_id":"2504.07866","n_code_links":0,"syntology":null},{"paper":null,"slug":"patchtrad-a-patch-based-transformer-focusing","title":"PatchTrAD: A Patch-Based Transformer focusing on Patch-Wise Reconstruction Error for Time Series Anomaly Detection","date":"2025-04-10","arxiv_id":"2504.08827","n_code_links":0,"syntology":null},{"paper":"/paper/radzero-similarity-based-cross-attention-for","slug":"radzero-similarity-based-cross-attention-for","title":"RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Radiology with Zero-Shot Multi-Task Capability","date":"2025-04-10","arxiv_id":"2504.07416","n_code_links":0,"syntology":{"ran":5,"of":6,"n_ran_checked":2,"n_instrument":3,"unverified":1,"pointer_only":6,"phrase":"5 ran (of which 2 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 3 where Syntology's instrument failed) · 1 unverified","official":null}},{"paper":null,"slug":"revisiting-prompt-optimization-with-large","title":"Revisiting Prompt Optimization with Large Reasoning Models-A Case Study on Event Extraction","date":"2025-04-10","arxiv_id":"2504.07357","n_code_links":0,"syntology":null},{"paper":null,"slug":"synthetic-fluency-hallucinations","title":"Synthetic Fluency: Hallucinations, Confabulations, and the Creation of Irish Words in LLM-Generated Translations","date":"2025-04-10","arxiv_id":"2504.07680","n_code_links":0,"syntology":null},{"paper":null,"slug":"amad-automasked-attention-for-unsupervised","title":"AMAD: AutoMasked Attention for Unsupervised Multivariate Time Series Anomaly Detection","date":"2025-04-09","arxiv_id":"2504.06643","n_code_links":0,"syntology":null},{"paper":"/paper/dydit-dynamic-diffusion-transformers-for","slug":"dydit-dynamic-diffusion-transformers-for","title":"DyDiT++: Dynamic Diffusion Transformers for Efficient Visual Generation","date":"2025-04-09","arxiv_id":"2504.06803","n_code_links":1,"syntology":null},{"paper":null,"slug":"endowing-embodied-agents-with-spatial","title":"Endowing Embodied Agents with Spatial Reasoning Capabilities for Vision-and-Language Navigation","date":"2025-04-09","arxiv_id":"2504.08806","n_code_links":0,"syntology":null},{"paper":null,"slug":"gendop-auto-regressive-camera-trajectory","title":"GenDoP: Auto-regressive Camera Trajectory Generation as a Director of Photography","date":"2025-04-09","arxiv_id":"2504.07083","n_code_links":0,"syntology":null},{"paper":"/paper/kaleidoscope-in-language-exams-for-massively","slug":"kaleidoscope-in-language-exams-for-massively","title":"Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation","date":"2025-04-09","arxiv_id":"2504.07072","n_code_links":1,"syntology":null},{"paper":"/paper/linguistic-interpretability-of-transformer","slug":"linguistic-interpretability-of-transformer","title":"Linguistic Interpretability of Transformer-based Language Models: a systematic review","date":"2025-04-09","arxiv_id":"2504.08001","n_code_links":1,"syntology":null},{"paper":null,"slug":"analyzing-how-text-to-image-models-represent","title":"Text-to-Image Models and Their Representation of People from Different Nationalities Engaging in Activities","date":"2025-04-08","arxiv_id":"2504.06313","n_code_links":0,"syntology":null},{"paper":null,"slug":"assessing-how-hyperparameters-impact-large","title":"Assessing how hyperparameters impact Large Language Models' sarcasm detection performance","date":"2025-04-08","arxiv_id":"2504.06166","n_code_links":0,"syntology":null},{"paper":null,"slug":"fusing-global-and-local-transformer-cnn","title":"Fusing Global and Local: Transformer-CNN Synergy for Next-Gen Current Estimation","date":"2025-04-08","arxiv_id":"2504.07996","n_code_links":0,"syntology":null},{"paper":"/paper/gaze-guided-learning-avoiding-shortcut-bias","slug":"gaze-guided-learning-avoiding-shortcut-bias","title":"Gaze-Guided Learning: Avoiding Shortcut Bias in Visual Classification","date":"2025-04-08","arxiv_id":"2504.05583","n_code_links":1,"syntology":null},{"paper":null,"slug":"leveraging-auto-distillation-and-generative","title":"Leveraging Auto-Distillation and Generative Self-Supervised Learning in Residual Graph Transformers for Enhanced Recommender Systems","date":"2025-04-08","arxiv_id":"2504.10500","n_code_links":0,"syntology":null},{"paper":"/paper/rethinking-the-nested-u-net-approach","slug":"rethinking-the-nested-u-net-approach","title":"Rethinking the Nested U-Net Approach: Enhancing Biomarker Segmentation with Attention Mechanisms and Multiscale Feature Fusion","date":"2025-04-08","arxiv_id":"2504.06158","n_code_links":1,"syntology":null},{"paper":null,"slug":"boundary-representation-learning-via","title":"Boundary representation learning via Transformer","date":"2025-04-07","arxiv_id":"2504.07134","n_code_links":0,"syntology":null},{"paper":"/paper/content-aware-transformer-for-all-in-one","slug":"content-aware-transformer-for-all-in-one","title":"Content-Aware Transformer for All-in-one Image Restoration","date":"2025-04-07","arxiv_id":"2504.04869","n_code_links":1,"syntology":null},{"paper":null,"slug":"instructionbench-an-instructional-video","title":"InstructionBench: An Instructional Video Understanding Benchmark","date":"2025-04-07","arxiv_id":"2504.05040","n_code_links":0,"syntology":null},{"paper":null,"slug":"lumina-omnilv-a-unified-multimodal-framework","title":"Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision","date":"2025-04-07","arxiv_id":"2504.04903","n_code_links":0,"syntology":null},{"paper":"/paper/omniecon-nexus-global-microeconomic","slug":"omniecon-nexus-global-microeconomic","title":"OmniEcon Nexus: Global Microeconomic Simulation Engine","date":"2025-04-07","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"one-minute-video-generation-with-test-time","title":"One-Minute Video Generation with Test-Time Training","date":"2025-04-07","arxiv_id":"2504.05298","n_code_links":0,"syntology":null},{"paper":"/paper/one-quantizer-is-enough-toward-a-lightweight","slug":"one-quantizer-is-enough-toward-a-lightweight","title":"One Quantizer is Enough: Toward a Lightweight Audio Codec","date":"2025-04-07","arxiv_id":"2504.04949","n_code_links":1,"syntology":null},{"paper":null,"slug":"provable-failure-of-language-models-in","title":"Provable Failure of Language Models in Learning Majority Boolean Logic via Gradient Descent","date":"2025-04-07","arxiv_id":"2504.04702","n_code_links":0,"syntology":null},{"paper":null,"slug":"rewind-real-time-egocentric-whole-body-motion","title":"REWIND: Real-Time Egocentric Whole-Body Motion Diffusion with Exemplar-Based Identity Conditioning","date":"2025-04-07","arxiv_id":"2504.04956","n_code_links":0,"syntology":null},{"paper":"/paper/dancemosaic-high-fidelity-dance-generation","slug":"dancemosaic-high-fidelity-dance-generation","title":"DanceMosaic: High-Fidelity Dance Generation with Multimodal Editability","date":"2025-04-06","arxiv_id":"2504.04634","n_code_links":0,"syntology":null},{"paper":null,"slug":"cats-mitigating-correlation-shift-for","title":"CATS: Mitigating Correlation Shift for Multivariate Time Series Classification","date":"2025-04-05","arxiv_id":"2504.04283","n_code_links":0,"syntology":null},{"paper":null,"slug":"quantum-adaptive-self-attention-for-quantum","title":"Quantum Adaptive Self-Attention for Quantum Transformer Models","date":"2025-04-05","arxiv_id":"2504.05336","n_code_links":0,"syntology":null},{"paper":null,"slug":"transformer-representation-learning-is","title":"Transformer representation learning is necessary for dynamic multi-modal physiological data on small-cohort patients","date":"2025-04-05","arxiv_id":"2504.04120","n_code_links":0,"syntology":null},{"paper":null,"slug":"adavit-adaptive-vision-transformer-for","title":"AdaViT: Adaptive Vision Transformer for Flexible Pretrain and Finetune with Variable 3D Medical Image Modalities","date":"2025-04-04","arxiv_id":"2504.03589","n_code_links":0,"syntology":null},{"paper":"/paper/beyond-progress-measures-theoretical-insights","slug":"beyond-progress-measures-theoretical-insights","title":"Beyond Progress Measures: Theoretical Insights into the Mechanism of Grokking","date":"2025-04-04","arxiv_id":"2504.03162","n_code_links":1,"syntology":null},{"paper":null,"slug":"dp-let-an-efficient-spatio-temporal-network","title":"DP-LET: An Efficient Spatio-Temporal Network Traffic Prediction Framework","date":"2025-04-04","arxiv_id":"2504.03792","n_code_links":0,"syntology":null},{"paper":"/paper/dynamic-importance-in-diffusion-u-net-for","slug":"dynamic-importance-in-diffusion-u-net-for","title":"Dynamic Importance in Diffusion U-Net for Enhanced Image Synthesis","date":"2025-04-04","arxiv_id":"2504.03471","n_code_links":1,"syntology":null},{"paper":null,"slug":"nemotron-h-a-family-of-accurate-and-efficient","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","date":"2025-04-04","arxiv_id":"2504.03624","n_code_links":0,"syntology":null},{"paper":null,"slug":"vista-ocr-towards-generative-and-interactive","title":"VISTA-OCR: Towards generative and interactive end to end OCR models","date":"2025-04-04","arxiv_id":"2504.03621","n_code_links":0,"syntology":null},{"paper":null,"slug":"zfusion-an-effective-fuser-of-camera-and-4d","title":"ZFusion: An Effective Fuser of Camera and 4D Radar for 3D Object Perception in Autonomous Driving","date":"2025-04-04","arxiv_id":"2504.03438","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-sensorimotor-vision-transformer","title":"A Sensorimotor Vision Transformer","date":"2025-04-03","arxiv_id":"2504.02536","n_code_links":0,"syntology":null},{"paper":"/paper/beyond-conventional-transformers-the-medical","slug":"beyond-conventional-transformers-the-medical","title":"Beyond Conventional Transformers: The Medical X-ray Attention (MXA) Block for Improved Multi-Label Diagnosis Using Knowledge Distillation","date":"2025-04-03","arxiv_id":"2504.02277","n_code_links":1,"syntology":null}],"record_sha256":"bad912e8fd2863051bca348e2f15adb7bf22ea42bf15967753d2b6b846619319","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}