{"url":"/method/attention","slug":"attention","name":"Attention","full_name":"Attention Is All You Need","full_name_withheld":false,"description_markdown":null,"description_state":"absent","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"https://arxiv.org/abs/1706.03762v7","title":"Attention Is All You Need","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Attention Mechanisms","url":"/methods/category/attention-mechanisms","pwc_aliases":["attention-mechanisms-1"]}],"n_papers_tagged":31583,"archive_num_papers":null,"papers_newest_first":[{"paper":"/paper/tcanet-a-temporal-convolutional-attention","title":"TCANet: A Temporal Convolutional Attention Network for Motor Imagery EEG Decoding","date":"2025-06-15","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/bsa-ball-sparse-attention-for-large-scale","title":"BSA: Ball Sparse Attention for Large-scale Geometries","date":"2025-06-14","arxiv_id":"2506.12541","n_code_links":1,"syntology":{"ran":2,"of":2,"unverified":0,"pointer_only":0}},{"paper":"/paper/fame-a-lightweight-spatio-temporal-network","title":"FAME: A Lightweight Spatio-Temporal Network for Model Attribution of Face-Swap Deepfakes","date":"2025-06-13","arxiv_id":"2506.11477","n_code_links":1,"syntology":null},{"paper":null,"title":"Augmenting Large Language Models with Static Code Analysis for Automated Code Quality Improvements","date":"2025-06-12","arxiv_id":"2506.10330","n_code_links":0,"syntology":null},{"paper":null,"title":"PAL: Probing Audio Encoders via LLMs -- A Study of Information Transfer from Audio Encoders to LLMs","date":"2025-06-12","arxiv_id":"2506.10423","n_code_links":0,"syntology":null},{"paper":null,"title":"Edit360: 2D Image Edits to 3D Assets from Any Angle","date":"2025-06-12","arxiv_id":"2506.10507","n_code_links":0,"syntology":null},{"paper":null,"title":"Understanding In-Context Learning on Structured Manifolds: Bridging Attention to Kernel Methods","date":"2025-06-12","arxiv_id":"2506.10959","n_code_links":0,"syntology":null},{"paper":null,"title":"ALBERT: Advanced Localization and Bidirectional Encoder Representations from Transformers for Automotive Damage Evaluation","date":"2025-06-12","arxiv_id":"2506.10524","n_code_links":0,"syntology":null},{"paper":null,"title":"Asymmetric price adjustment over the business cycle","date":"2025-06-12","arxiv_id":"2506.10640","n_code_links":0,"syntology":null},{"paper":"/paper/beyond-attention-or-similarity-maximizing","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","date":"2025-06-12","arxiv_id":"2506.10967","n_code_links":1,"syntology":{"ran":7,"of":8,"unverified":1,"pointer_only":0}},{"paper":"/paper/ciir-liverag-2025-optimizing-multi-agent","title":"CIIR@LiveRAG 2025: Optimizing Multi-Agent Retrieval Augmented Generation through Self-Training","date":"2025-06-12","arxiv_id":"2506.10844","n_code_links":1,"syntology":null},{"paper":"/paper/constructing-and-evaluating-declarative-rag","title":"Constructing and Evaluating Declarative RAG Pipelines in PyTerrier","date":"2025-06-12","arxiv_id":"2506.10802","n_code_links":1,"syntology":null},{"paper":null,"title":"Context-Adaptive Graph Neural Networks for Next POI Recommendation","date":"2025-06-12","arxiv_id":"2506.10329","n_code_links":0,"syntology":null},{"paper":"/paper/contextrefine-clip-for-epic-kitchens-100","title":"ContextRefine-CLIP for EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge 2025","date":"2025-06-12","arxiv_id":"2506.10550","n_code_links":1,"syntology":null},{"paper":"/paper/contrastive-matrix-completion-with-denoising","title":"Contrastive Matrix Completion with Denoising and Augmented Graph Views for Robust Recommendation","date":"2025-06-12","arxiv_id":"2506.10658","n_code_links":1,"syntology":null},{"paper":null,"title":"Conversational Search: From Fundamentals to Frontiers in the LLM Era","date":"2025-06-12","arxiv_id":"2506.10635","n_code_links":0,"syntology":null},{"paper":"/paper/dart-differentiable-dynamic-adaptive-region","title":"DART: Differentiable Dynamic Adaptive Region Tokenizer for Vision Transformer and Mamba","date":"2025-06-12","arxiv_id":"2506.10390","n_code_links":1,"syntology":null},{"paper":"/paper/decomposing-mlp-activations-into","title":"Decomposing MLP Activations into Interpretable Features via Semi-Nonnegative Matrix Factorization","date":"2025-06-12","arxiv_id":"2506.10920","n_code_links":1,"syntology":null},{"paper":null,"title":"Enhancing Deepfake Detection using SE Block Attention with CNN","date":"2025-06-12","arxiv_id":"2506.10683","n_code_links":0,"syntology":null},{"paper":null,"title":"FaceLiVT: Face Recognition using Linear Vision Transformer with Structural Reparameterization For Mobile Device","date":"2025-06-12","arxiv_id":"2506.10361","n_code_links":0,"syntology":null},{"paper":null,"title":"Fine-Grained Perturbation Guidance via Attention Head Selection","date":"2025-06-12","arxiv_id":"2506.10978","n_code_links":0,"syntology":null},{"paper":null,"title":"Flick: Few Labels Text Classification using K-Aware Intermediate Learning in Multi-Task Low-Resource Languages","date":"2025-06-12","arxiv_id":"2506.10292","n_code_links":0,"syntology":null},{"paper":"/paper/fsatfusion-frequency-spatial-attention","title":"FSATFusion: Frequency-Spatial Attention Transformer for Infrared and Visible Image Fusion","date":"2025-06-12","arxiv_id":"2506.10366","n_code_links":1,"syntology":null},{"paper":null,"title":"Heterogeneous-IRS-Assisted MIMO Systems: Channel Estimation and Beamforming","date":"2025-06-12","arxiv_id":"2506.10350","n_code_links":0,"syntology":null},{"paper":null,"title":"Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration","date":"2025-06-12","arxiv_id":"2506.10573","n_code_links":0,"syntology":null},{"paper":null,"title":"J-DDL: Surface Damage Detection and Localization System for Fighter Aircraft","date":"2025-06-12","arxiv_id":"2506.10505","n_code_links":0,"syntology":null},{"paper":"/paper/lightkg-efficient-knowledge-aware","title":"LightKG: Efficient Knowledge-Aware Recommendations with Simplified GNN Architecture","date":"2025-06-12","arxiv_id":"2506.10347","n_code_links":1,"syntology":null},{"paper":null,"title":"MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment","date":"2025-06-12","arxiv_id":"2506.10430","n_code_links":0,"syntology":null},{"paper":"/paper/mstar-box-free-multi-query-scene-text","title":"MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling","date":"2025-06-12","arxiv_id":"2506.10609","n_code_links":1,"syntology":{"ran":2,"of":2,"unverified":0,"pointer_only":2}},{"paper":"/paper/neuralnexus-at-bea-2025-shared-task-retrieval","title":"NeuralNexus at BEA 2025 Shared Task: Retrieval-Augmented Prompting for Mistake Identification in AI Tutors","date":"2025-06-12","arxiv_id":"2506.10627","n_code_links":1,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/language-modelling","name":"Language Modelling","papers":3282},{"task":"/task/language-modeling","name":"Language Modeling","papers":2605},{"task":"/task/retrieval","name":"Retrieval","papers":1932},{"task":"/task/question-answering","name":"Question Answering","papers":1607},{"task":"/task/decoder","name":"Decoder","papers":1589},{"task":"/task/sentence","name":"Sentence","papers":1392},{"task":"/task/rag","name":"RAG","papers":1344},{"task":"/task/retrieval-augmented-generation","name":"Retrieval-augmented Generation","papers":1178},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":1131},{"task":"/task/translation","name":"Translation","papers":1073},{"task":"/task/large-language-model","name":"Large Language Model","papers":976},{"task":"/task/machine-translation","name":"Machine Translation","papers":956},{"task":"/task/object-detection","name":"Object Detection","papers":875},{"task":"/task/text-generation","name":"Text Generation","papers":826},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":822},{"task":"/task/image-classification","name":"Image Classification","papers":818},{"task":"/task/segmentation","name":"Segmentation","papers":814},{"task":"/task/object-detection-1","name":"object-detection","papers":802},{"task":"/task/representation-learning","name":"Representation Learning","papers":793},{"task":"/task/classification-1","name":"Classification","papers":689}],"tasks_shown":20,"n_tasks":2757,"usage_by_year":[{"year":"2017","papers":24},{"year":"2018","papers":127},{"year":"2019","papers":1087},{"year":"2020","papers":2172},{"year":"2021","papers":3172},{"year":"2022","papers":3350},{"year":"2023","papers":5296},{"year":"2024","papers":10603},{"year":"2025","papers":5752}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/attention"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}