Methods › General › Attention Mechanisms › Attention › Papers, page 306
Attention Is All You Need
Attention
Papers archive 2025-07-28
archive papers tagged: 31,583 · with a code link: 13,473 · where Syntology ran a sample: 3,998 (3,366 with a run with no instrument failure, 632 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (3,998 of 31,583 tagged: 3,366 with a run with no instrument failure, 632 where every run was a failure of Syntology's instrument)
Page 306 of 316: papers 30,501 to 30,600 of 31,583, newest first by the archive's date (ties by slug), in archive order.
Repository counts are the archive's code-links table. A Syntology line states what Syntology ran from that paper's harvested code, as “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the instrument figure counts failures of Syntology's instrument, not of the code. It is per sample and not a correctness claim. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code; “community repositories only” when every sample that ran came from a community repository, “official: no sample here; runs from other or unrecorded repositories” when some came from a repository the paper names or has in its text, or from none recorded); hover it for the repositories the samples that ran came from.
-
SEPT: Improving Scientific Named Entity Recognition with Span Representation 8 Nov 2019 · 0 repositories · arXiv:1911.03353
-
Towards Hierarchical Importance Attribution: Explaining Compositional Semantics for Neural Sequence Models 8 Nov 2019 · 3 repositories · arXiv:1911.06194
-
Transforming Wikipedia into Augmented Data for Query-Focused Summarization 8 Nov 2019 · 0 repositories · arXiv:1911.03324
-
What Would Elsa Do? Freezing Layers During Transformer Fine-Tuning 8 Nov 2019 · 0 repositories · arXiv:1911.03090
-
Lipschitz Constrained Parameter Initialization for Deep Transformers 8 Nov 2019 · 0 repositories · arXiv:1911.03179
-
BERTs of a feather do not generalize together: Large variability in generalization across models with similar test set performance 7 Nov 2019 · 1 repository · arXiv:1911.02969
-
Blockwise Self-Attention for Long Document Understanding 7 Nov 2019 · 1 repository · arXiv:1911.02972
-
Grounded Conversation Generation as Guided Traverses in Commonsense Knowledge Graphs 7 Nov 2019 · 2 repositories · arXiv:1911.02707Syntology official (archive's flag): 6 ran · 6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 1 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified (of 6 harvested samples)
-
Explicit Pairwise Word Interaction Modeling Improves Pretrained Transformers for English Semantic Similarity Tasks 7 Nov 2019 · 0 repositories · arXiv:1911.02847
-
Microsoft Research Asia's Systems for WMT19 7 Nov 2019 · 0 repositories · arXiv:1911.06191
-
Porous Lattice-based Transformer Encoder for Chinese NER 7 Nov 2019 · 0 repositories · arXiv:1911.02733
-
Probing Contextualized Sentence Representations with Visual Awareness 7 Nov 2019 · 0 repositories · arXiv:1911.02971
-
The LIG system for the English-Czech Text Translation Task of IWSLT 2019 7 Nov 2019 · 0 repositories · arXiv:1911.02898
-
How Can BERT Help Lexical Semantics Tasks? 7 Nov 2019 · 0 repositories · arXiv:1911.02929
-
An End-to-end Approach for Lexical Stress Detection based on Transformer 6 Nov 2019 · 0 repositories · arXiv:1911.04862
-
CoKE: Contextualized Knowledge Graph Embedding 6 Nov 2019 · 3 repositories · arXiv:1911.02168Syntology official (archive's flag): 1 ran · 1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified (of 1 harvested sample)
-
Enriching Conversation Context in Retrieval-based Chatbots 6 Nov 2019 · 0 repositories · arXiv:1911.02290
-
Fast Transformer Decoding: One Write-Head is All You Need 6 Nov 2019 · 4 repositories · arXiv:1911.02150Syntology 2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified (of 3 harvested samples)
-
Graph Transformer Networks 6 Nov 2019 · 1 repository · arXiv:1911.06455
-
Learning to Answer by Learning to Ask: Getting the Best of GPT-2 and BERT Worlds 6 Nov 2019 · 0 repositories · arXiv:1911.02365
-
Unsupervised Domain Adaptation of Contextual Embeddings for Low-Resource Duplicate Question Detection 6 Nov 2019 · 0 repositories · arXiv:1911.02645
-
Deepening Hidden Representations from Pre-trained Language Models 5 Nov 2019 · 0 repositories · arXiv:1911.01940
-
Efficient Multi-robot Exploration via Multi-head Attention-based Cooperation Strategy 5 Nov 2019 · 0 repositories · arXiv:1911.01774
-
Improving Bidirectional Decoding with Dynamic Target Semantics in Neural Machine Translation 5 Nov 2019 · 0 repositories · arXiv:1911.01597
-
Improving Slot Filling by Utilizing Contextual Information 5 Nov 2019 · 0 repositories · arXiv:1911.01680
-
Incremental Sense Weight Training for the Interpretation of Contextualized Word Embeddings 5 Nov 2019 · 0 repositories · arXiv:1911.01623
-
MML: Maximal Multiverse Learning for Robust Fine-Tuning of Language Models 5 Nov 2019 · 1 repository · arXiv:1911.06182
-
Unsupervised Cross-lingual Representation Learning at Scale 5 Nov 2019 · 35 repositories · arXiv:1911.02116Syntology official (archive's flag): 12 ran · 40 ran (of which 13 constructed an object rather than computing a result; 35 with no instrument failure: 4 honoured, 1 violated, 30 with no contract checked; 5 where Syntology's instrument failed) · 19 unverified (of 59 harvested samples) · 52 pointer-only (licence)
-
Assessing Social and Intersectional Biases in Contextualized Word Representations 4 Nov 2019 · 1 repository · arXiv:1911.01485
-
BAS: An Answer Selection Method Using BERT Language Model 4 Nov 2019 · 0 repositories · arXiv:1911.01528
-
An Algorithm for Routing Capsules in All Domains 2 Nov 2019 · 1 repository · arXiv:1911.00792
-
Machine Translation Evaluation using Bi-directional Entailment 2 Nov 2019 · 0 repositories · arXiv:1911.00681
-
Sentence-Level BERT and Multi-Task Learning of Age and Gender in Social Media 2 Nov 2019 · 0 repositories · arXiv:1911.00637
-
A Deep Learning-Based System for PharmaCoNER 1 Nov 2019 · 0 repositories
-
A Multi-Task Learning Framework for Extracting Bacteria Biotope Information 1 Nov 2019 · 0 repositories
-
A Recurrent BERT-based Model for Question Generation 1 Nov 2019 · 1 repository
-
Aggregating Bidirectional Encoder Representations Using MatchLSTM for Sequence Matching 1 Nov 2019 · 0 repositories
-
Applying BERT to Document Retrieval with Birch 1 Nov 2019 · 0 repositories
-
Automatically Extracting Challenge Sets for Non-Local Phenomena in Neural Machine Translation 1 Nov 2019 · 0 repositories
-
BERT Goes to Law School: Quantifying the Competitive Advantage of Access to Large Legal Corpora in Contract Understanding 1 Nov 2019 · 0 repositories · arXiv:1911.00473
-
BERT is Not an Interlingua and the Bias of Tokenization 1 Nov 2019 · 1 repository
-
Biomedical Named Entity Recognition with Multilingual BERT 1 Nov 2019 · 1 repository
-
BLCU-NLP at COIN-Shared Task1: Stagewise Fine-tuning BERT for Commonsense Inference in Everyday Narrations 1 Nov 2019 · 0 repositories
-
CAUnLP at NLP4IF 2019 Shared Task: Context-Dependent BERT for Sentence-Level Propaganda Detection 1 Nov 2019 · 0 repositories
-
CLER: Cross-task Learning with Expert Representation to Generalize Reading and Understanding 1 Nov 2019 · 0 repositories
-
Combining Global Sparse Gradients with Local Gradients in Distributed Neural Network Training 1 Nov 2019 · 0 repositories
-
Combining Unsupervised Pre-training and Annotator Rationales to Improve Low-shot Text Classification 1 Nov 2019 · 0 repositories
-
Contextualized Cross-Lingual Event Trigger Extraction with Minimal Resources 1 Nov 2019 · 0 repositories
-
Cost-Sensitive BERT for Generalisable Sentence Classification on Imbalanced Data 1 Nov 2019 · 0 repositories
-
Cross-Domain Modeling of Sentence-Level Evidence for Document Retrieval 1 Nov 2019 · 0 repositories
-
CVIT's submissions to WAT-2019 1 Nov 2019 · 0 repositories
-
Deep Bidirectional Transformers for Relation Extraction without Supervision 1 Nov 2019 · 0 repositories · arXiv:1911.00313
-
Detection of Propaganda Using Logistic Regression 1 Nov 2019 · 0 repositories
-
Dialect Text Normalization to Normative Standard Finnish 1 Nov 2019 · 1 repository
-
DialoGPT: Large-Scale Generative Pre-training for Conversational Response Generation 1 Nov 2019 · 6 repositories · arXiv:1911.00536Syntology community repositories only · 6 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 1 honoured, 0 violated, 4 with no contract checked; 1 where Syntology's instrument failed) · 6 unverified (of 12 harvested samples) · 12 pointer-only (licence)
-
Divisive Language and Propaganda Detection using Multi-head Attention Transformers with Deep Learning BERT-based Language Models for Binary Classification 1 Nov 2019 · 0 repositories
-
Domain Adaptation with BERT-based Domain Classification and Data Selection 1 Nov 2019 · 0 repositories
-
English to Hindi Multi-modal Neural Machine Translation and Hindi Image Captioning 1 Nov 2019 · 0 repositories
-
Enhanced Transformer Model for Data-to-Text Generation 1 Nov 2019 · 0 repositories
-
Enhancing BERT for Lexical Normalization 1 Nov 2019 · 0 repositories
-
Evaluating BERT for natural language inference: A case study on the CommitmentBank 1 Nov 2019 · 0 repositories
-
Event Causality Recognition Exploiting Multiple Annotators' Judgments and Background Knowledge 1 Nov 2019 · 0 repositories
-
Extract and Aggregate: A Novel Domain-Independent Approach to Factual Data Verification 1 Nov 2019 · 0 repositories
-
Extractive NarrativeQA with Heuristic Pre-Training 1 Nov 2019 · 0 repositories
-
FASPell: A Fast, Adaptable, Simple, Powerful Chinese Spell Checker Based On DAE-Decoder Paradigm 1 Nov 2019 · 1 repository
-
Fine-Grained Propaganda Detection with Fine-Tuned BERT 1 Nov 2019 · 0 repositories
-
Fine-tune BERT with Sparse Self-Attention Mechanism 1 Nov 2019 · 0 repositories
-
From Monolingual to Multilingual FAQ Assistant using Multilingual Co-training 1 Nov 2019 · 0 repositories
-
Fully Unsupervised Crosslingual Semantic Textual Similarity Metric Based on BERT for Identifying Parallel Data 1 Nov 2019 · 0 repositories
-
GEM: Generative Enhanced Model for adversarial attacks 1 Nov 2019 · 0 repositories
-
Generalizing Question Answering System with Pre-trained Language Model Fine-tuning 1 Nov 2019 · 0 repositories
-
HIT-SCIR at MRP 2019: A Unified Pipeline for Meaning Representation Parsing via Efficient Training and Effective Encoding 1 Nov 2019 · 0 repositories
-
How well do NLI models capture verb veridicality? 1 Nov 2019 · 0 repositories
-
Idiap NMT System for WAT 2019 Multimodal Translation Task 1 Nov 2019 · 0 repositories
-
IIT-KGP at COIN 2019: Using pre-trained Language Models for modeling Machine Comprehension 1 Nov 2019 · 0 repositories
-
Improving Answer Selection and Answer Triggering using Hard Negatives 1 Nov 2019 · 0 repositories
-
Improving Generalization of Transformer for Speech Recognition with Parallel Schedule Sampling and Relative Positional Embedding 1 Nov 2019 · 0 repositories · arXiv:1911.00203
-
Improving Natural Language Understanding by Reverse Mapping Bytepair Encoding 1 Nov 2019 · 0 repositories
-
Improving Pre-Trained Multilingual Model with Vocabulary Expansion 1 Nov 2019 · 0 repositories
-
Inspecting Unification of Encoding and Matching with Transformer: A Case Study of Machine Reading Comprehension 1 Nov 2019 · 0 repositories
-
JBNU at MRP 2019: Multi-level Biaffine Attention for Semantic Dependency Parsing 1 Nov 2019 · 0 repositories
-
Jeff Da at COIN - Shared Task: BIG MOOD: Relating Transformers to Explicit Commonsense Knowledge 1 Nov 2019 · 0 repositories
-
JUSTDeep at NLP4IF 2019 Task 1: Propaganda Detection using Ensemble Deep Learning Models 1 Nov 2019 · 0 repositories
-
LexicalAT: Lexical-Based Adversarial Reinforcement Training for Robust Sentiment Classification 1 Nov 2019 · 0 repositories
-
Long Warm-up and Self-Training: Training Strategies of NICT-2 NMT System at WAT-2019 1 Nov 2019 · 0 repositories
-
LTRC-MT Simple & Effective Hindi-English Neural Machine Translation Systems at WAT 2019 1 Nov 2019 · 0 repositories
-
Mixed Multi-Head Self-Attention for Neural Machine Translation 1 Nov 2019 · 0 repositories
-
MrMep: Joint Extraction of Multiple Relations and Multiple Entity Pairs Based on Triplet Attention 1 Nov 2019 · 0 repositories
-
Multi-View Domain Adapted Sentence Embeddings for Low-Resource Unsupervised Duplicate Question Detection 1 Nov 2019 · 0 repositories
-
Named Entity Recognition - Is There a Glass Ceiling? 1 Nov 2019 · 0 repositories
-
Natural Language Generation for Effective Knowledge Distillation 1 Nov 2019 · 1 repository
-
No, you're not alone: A better way to find people with similar experiences on Reddit 1 Nov 2019 · 0 repositories
-
NSIT@NLP4IF-2019: Propaganda Detection from News Articles using Transfer Learning 1 Nov 2019 · 0 repositories
-
On the Relation between Position Information and Sentence Length in Neural Machine Translation 1 Nov 2019 · 0 repositories
-
Our Neural Machine Translation Systems for WAT 2019 1 Nov 2019 · 0 repositories
-
Pingan Smart Health and SJTU at COIN - Shared Task: utilizing Pre-trained Language Models and Common-sense Knowledge in Machine Reading Tasks 1 Nov 2019 · 0 repositories
-
Policy Preference Detection in Parliamentary Debate Motions 1 Nov 2019 · 0 repositories
-
Pre-Training BERT on Domain Resources for Short Answer Grading 1 Nov 2019 · 0 repositories
-
Question Answering Using Hierarchical Attention on Top of BERT Features 1 Nov 2019 · 0 repositories
-
Recurrent Positional Embedding for Neural Machine Translation 1 Nov 2019 · 0 repositories