{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/speech-recognition-1/papers/45","list_of":"/task/speech-recognition-1","task":"speech-recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":45,"pages_in_order":58,"rows_per_page":100,"rows":[4401,4500],"of":5715,"counts":{"archive_papers_tagged":5715,"with_a_code_link":1277,"where_syntology_ran_a_sample":162,"not_listed_spam_title":0,"listed":5715,"listed_where_code_ran":162,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":134,"every_run_a_failure_of_syntologys_instrument":28,"listed_with_a_run_with_no_instrument_failure":134,"listed_every_run_a_failure_of_syntologys_instrument":28,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/speech-recognition-1","prev":"/task/speech-recognition-1/papers/44","next":"/task/speech-recognition-1/papers/46","papers":[{"url":null,"slug":"speech-corpus-of-ainu-folklore-and-end-to-end","title":"Speech Corpus of Ainu Folklore and End-to-end Speech Recognition for Ainu Language","date":"2020-02-16","arxiv_id":"2002.06675","repositories_listed":0,"syntology":null},{"url":null,"slug":"small-energy-masking-for-improved-neural","title":"Small energy masking for improved neural network training for end-to-end speech recognition","date":"2020-02-15","arxiv_id":"2002.06312","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-discrete-and-neural-features-via","title":"Integrating Discrete and Neural Features via Mixed-feature Trans-dimensional Random Field Language Models","date":"2020-02-14","arxiv_id":"2002.05967","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-enhancement-using-self-adaptation-and","title":"Speech Enhancement using Self-Adaptation and Multi-Head Self-Attention","date":"2020-02-14","arxiv_id":"2002.05873","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-speaker-adaptation-using","title":"Unsupervised Speaker Adaptation using Attention-based Speaker Memory for End-to-End ASR","date":"2020-02-14","arxiv_id":"2002.06165","repositories_listed":0,"syntology":null},{"url":null,"slug":"looking-enhances-listening-recovering-missing","title":"Looking Enhances Listening: Recovering Missing Speech Using Images","date":"2020-02-13","arxiv_id":"2002.05639","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-for-query-rewriting-in-a-spoken","title":"Pre-Training for Query Rewriting in A Spoken Language Understanding System","date":"2020-02-13","arxiv_id":"2002.05607","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-multi-speaker-speech-recognition-1","title":"End-to-End Multi-speaker Speech Recognition with Transformer","date":"2020-02-10","arxiv_id":"2002.03921","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-diverse-and-natural-text-to-speech","title":"Generating diverse and natural text-to-speech samples using a quantized fine-grained VAE and auto-regressive prosody prior","date":"2020-02-06","arxiv_id":"2002.03788","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-multi-channel-speech-recognition-using","title":"Robust Multi-channel Speech Recognition using Frequency Aligned Network","date":"2020-02-06","arxiv_id":"2002.02520","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-mind-reading","title":"Continuous Silent Speech Recognition using EEG","date":"2020-02-06","arxiv_id":"2002.03851","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-efficiency-in-large-scale","title":"Improving Efficiency in Large-Scale Decentralized Distributed Training","date":"2020-02-04","arxiv_id":"2002.01119","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-automatic-speech-recognition","title":"End-to-End Automatic Speech Recognition Integrated With CTC-Based Voice Activity Detection","date":"2020-02-03","arxiv_id":"2002.00551","repositories_listed":0,"syntology":null},{"url":null,"slug":"dialogue-based-simulation-for-cultural","title":"Dialogue-Based Simulation For Cultural Awareness Training","date":"2020-02-01","arxiv_id":"2002.00223","repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-learnable-front-end-for-multi-channel","title":"Fully Learnable Front-End for Multi-Channel Acoustic Modeling using Semi-Supervised Learning","date":"2020-02-01","arxiv_id":"2002.00125","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-emotion-primitives-from-speech-and","title":"Detecting Emotion Primitives from Speech and their use in discerning Categorical Emotions","date":"2020-01-31","arxiv_id":"2002.01323","repositories_listed":0,"syntology":null},{"url":null,"slug":"but-opensat-2019-speech-recognition-system","title":"BUT Opensat 2019 Speech Recognition System","date":"2020-01-30","arxiv_id":"2001.11360","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-visual-decision-fusion-for-wfst-based","title":"Audio-Visual Decision Fusion for WFST-based and seq2seq Models","date":"2020-01-29","arxiv_id":"2001.10832","repositories_listed":0,"syntology":null},{"url":null,"slug":"environment-aware-reconfigurable-noise","title":"Environment-aware Reconfigurable Noise Suppression","date":"2020-01-29","arxiv_id":"2001.10718","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robust-and-multilingual-speech","title":"Learning Robust and Multilingual Speech Representations","date":"2020-01-29","arxiv_id":"2001.11128","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-contextual-modeling-for-asr-correction","title":"Joint Contextual Modeling for ASR Correction and Language Understanding","date":"2020-01-28","arxiv_id":"2002.00750","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-up-online-speech-recognition-using","title":"Scaling Up Online Speech Recognition Using ConvNets","date":"2020-01-27","arxiv_id":"2001.09727","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-information-processing-on-noisy","title":"Temporal Information Processing on Noisy Quantum Computers","date":"2020-01-26","arxiv_id":"2001.09498","repositories_listed":0,"syntology":null},{"url":null,"slug":"lattice-based-improvements-for-voice","title":"Lattice-based Improvements for Voice Triggering Using Graph Neural Networks","date":"2020-01-25","arxiv_id":"2001.10822","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-detect-keyword-parts-and-whole-by","title":"Learning To Detect Keyword Parts And Whole By Smoothed Max Pooling","date":"2020-01-25","arxiv_id":"2001.09246","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-techniques-for-online-end-to-end-speech","title":"Data Techniques For Online End-to-end Speech Recognition","date":"2020-01-24","arxiv_id":"2001.09221","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-rank-gradient-approximation-for-memory","title":"Low-rank Gradient Approximation For Memory-Efficient On-device Training of Deep Neural Network","date":"2020-01-24","arxiv_id":"2001.08885","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-asr-by-end-to-end-self","title":"Semi-supervised ASR by End-to-end Self-training","date":"2020-01-24","arxiv_id":"2001.09128","repositories_listed":0,"syntology":null},{"url":null,"slug":"tlt-school-a-corpus-of-non-native-children","title":"TLT-school: a Corpus of Non Native Children Speech","date":"2020-01-22","arxiv_id":"2001.08051","repositories_listed":0,"syntology":null},{"url":"/paper/single-headed-attention-based-sequence-to","slug":"single-headed-attention-based-sequence-to","title":"Single headed attention based sequence-to-sequence model for state-of-the-art results on Switchboard","date":"2020-01-20","arxiv_id":"2001.07263","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-online-ctcattention-end-to","title":"Transformer-based Online CTC/attention End-to-End Speech Recognition Architecture","date":"2020-01-15","arxiv_id":"2001.08290","repositories_listed":0,"syntology":null},{"url":"/paper/visually-guided-self-supervised-learning-of","slug":"visually-guided-self-supervised-learning-of","title":"Visually Guided Self Supervised Learning of Speech Representations","date":"2020-01-13","arxiv_id":"2001.04316","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-spoken-language-understanding-by","title":"Improving Spoken Language Understanding By Exploiting ASR N-best Hypotheses","date":"2020-01-11","arxiv_id":"2001.05284","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-dysarthric-speech-intelligibility","title":"Improving Dysarthric Speech Intelligibility Using Cycle-consistent Adversarial Training","date":"2020-01-10","arxiv_id":"2001.04260","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-challenge-for-correcting-errors-of","title":"Open Challenge for Correcting Errors of Speech Recognition Systems","date":"2020-01-09","arxiv_id":"2001.03041","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-automatic-speech-recognition-with","title":"Streaming automatic speech recognition with the transformer model","date":"2020-01-08","arxiv_id":"2001.02674","repositories_listed":0,"syntology":null},{"url":"/paper/audio-visual-recognition-of-overlapped-speech","slug":"audio-visual-recognition-of-overlapped-speech","title":"Audio-visual Recognition of Overlapped speech for the LRS2 dataset","date":"2020-01-06","arxiv_id":"2001.01656","repositories_listed":0,"syntology":null},{"url":null,"slug":"character-aware-attention-based-end-to-end","title":"Character-Aware Attention-Based End-to-End Speech Recognition","date":"2020-01-06","arxiv_id":"2001.01795","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-via-teacher-student","title":"Domain Adaptation via Teacher-Student Learning for End-to-End Speech Recognition","date":"2020-01-06","arxiv_id":"2001.01798","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-and-analysis-of-hyper-and-hypo","title":"Investigation and Analysis of Hyper and Hypo neuron pruning to selectively update neurons during Unsupervised Adaptation","date":"2020-01-06","arxiv_id":"2001.01755","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-language-modeling-and","title":"Transformer-based language modeling and decoding for conversational speech recognition","date":"2020-01-04","arxiv_id":"2001.01140","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-based-on-device-streaming-speech","title":"Attention based on-device streaming speech recognition with large speech corpus","date":"2020-01-02","arxiv_id":"2001.00577","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-representation-learning-in-speech","title":"Deep Representation Learning in Speech Processing: Challenges, Recent Advances, and Future Trends","date":"2020-01-02","arxiv_id":"2001.00378","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-aware-speech-transformer","title":"Speaker-aware speech-transformer","date":"2020-01-02","arxiv_id":"2001.01557","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-deep-networks-with-stochastic","title":"Training Deep Networks with Stochastic Gradient Normalized by Layerwise Adaptive Second Moments","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"eeg-based-continuous-speech-recognition-using","title":"EEG based Continuous Speech Recognition using Transformers","date":"2019-12-31","arxiv_id":"2001.00501","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-training-of-a-large-vocabulary-end","title":"end-to-end training of a large vocabulary end-to-end speech recognition system","date":"2019-12-22","arxiv_id":"1912.11040","repositories_listed":0,"syntology":null},{"url":null,"slug":"power-law-nonlinearity-with-maximally-uniform","title":"power-law nonlinearity with maximally uniform distribution criterion for improved neural network training in automatic speech recognition","date":"2019-12-22","arxiv_id":"1912.11041","repositories_listed":0,"syntology":null},{"url":null,"slug":"role-of-non-linear-data-processing-on-speech","title":"Role of non-linear data processing on speech recognition task in the framework of reservoir computing","date":"2019-12-19","arxiv_id":"1906.02812","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-testing-on-asr-performance-via","title":"Statistical Testing on ASR Performance via Blockwise Bootstrap","date":"2019-12-19","arxiv_id":"1912.09508","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cycle-gan-approach-to-model-natural","title":"A Cycle-GAN Approach to Model Natural Perturbations in Speech for ASR Applications","date":"2019-12-18","arxiv_id":"1912.11151","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-adversarial-attacks-on-audio-visual","title":"Detecting Adversarial Attacks On Audiovisual Speech Recognition","date":"2019-12-18","arxiv_id":"1912.08639","repositories_listed":0,"syntology":null},{"url":null,"slug":"ene-to-end-training-of-time-domain-audio","title":"End-to-end training of time domain audio separation and recognition","date":"2019-12-18","arxiv_id":"1912.08462","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-speech-recognition-using-eeg-and","title":"Continuous Speech Recognition using EEG and Video","date":"2019-12-16","arxiv_id":"1912.07730","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalization-of-end-to-end-speech","title":"Personalization of End-to-end Speech Recognition On Mobile Devices For Named Entities","date":"2019-12-14","arxiv_id":"1912.09251","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-neural-phone-recognition-of-mixed-source","title":"On Neural Phone Recognition of Mixed-Source ECoG Signals","date":"2019-12-12","arxiv_id":"1912.05869","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-end-to-end-speech-recognition-with","title":"Leveraging End-to-End Speech Recognition with Neural Architecture Search","date":"2019-12-11","arxiv_id":"1912.05946","repositories_listed":0,"syntology":null},{"url":null,"slug":"specaugment-on-large-scale-datasets","title":"SpecAugment on Large Scale Datasets","date":"2019-12-11","arxiv_id":"1912.05533","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-topology-for-end-to-end-temporal","title":"A Novel Topology for End-to-end Temporal Classification and Segmentation with Recurrent Neural Network","date":"2019-12-10","arxiv_id":"1912.04784","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-purpose-and-large-scale-speech-corpus","title":"A Multi Purpose and Large Scale Speech Corpus in Persian and English for Speaker and Speech Recognition: the DeepMine Database","date":"2019-12-08","arxiv_id":"1912.03627","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-attention-discriminative-language-model","title":"Audio-attention discriminative language model for ASR rescoring","date":"2019-12-06","arxiv_id":"1912.03363","repositories_listed":0,"syntology":null},{"url":null,"slug":"synchronous-transformers-for-end-to-end","title":"Synchronous Transformers for End-to-End Speech Recognition","date":"2019-12-06","arxiv_id":"1912.02958","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualizing-deep-neural-networks-for-speech","title":"Visualizing Deep Neural Networks for Speech Recognition with Learned Topographic Filter Maps","date":"2019-12-06","arxiv_id":"1912.04067","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-whole-context-to-sequence-to","title":"Integrating Knowledge into End-to-End Speech Recognition from External Text-Only Data","date":"2019-12-04","arxiv_id":"1912.01777","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-bootstrapping-using-neural","title":"Language Model Bootstrapping Using Neural Machine Translation For Conversational Speech Recognition","date":"2019-12-02","arxiv_id":"1912.00958","repositories_listed":0,"syntology":null},{"url":"/paper/asr-is-all-you-need-cross-modal-distillation","slug":"asr-is-all-you-need-cross-modal-distillation","title":"ASR is all you need: cross-modal distillation for lip reading","date":"2019-11-28","arxiv_id":"1911.12747","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-the-next-generation-of-intelligent","title":"Designing the Next Generation of Intelligent Personal Robotic Assistants for the Physically Impaired","date":"2019-11-28","arxiv_id":"1911.12482","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimum-bayes-risk-training-of-rnn-transducer","title":"Minimum Bayes Risk Training of RNN-Transducer for End-to-End Speech Recognition","date":"2019-11-28","arxiv_id":"1911.12487","repositories_listed":0,"syntology":null},{"url":"/paper/multimodal-machine-translation-through","slug":"multimodal-machine-translation-through","title":"Multimodal Machine Translation through Visuals and Speech","date":"2019-11-28","arxiv_id":"1911.12798","repositories_listed":0,"syntology":null},{"url":null,"slug":"aipnet-generative-adversarial-pre-training-of","title":"AIPNet: Generative Adversarial Pre-training of Accent-invariant Networks for End-to-end Speech Recognition","date":"2019-11-27","arxiv_id":"1911.11935","repositories_listed":0,"syntology":null},{"url":null,"slug":"atcspeech-a-multilingual-pilot-controller","title":"ATCSpeech: a multilingual pilot-controller speech corpus from real Air Traffic Control environment","date":"2019-11-26","arxiv_id":"1911.11365","repositories_listed":0,"syntology":null},{"url":null,"slug":"independent-language-modeling-architecture","title":"Independent language modeling architecture for end-to-end ASR","date":"2019-11-25","arxiv_id":"1912.00863","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-summarization-of-scholarly-videos","title":"Visual Summarization of Scholarly Videos using Word Embeddings and Keyphrase Extraction","date":"2019-11-25","arxiv_id":"1912.10809","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-eeg-based-continuous-speech","title":"Improving EEG based Continuous Speech Recognition","date":"2019-11-24","arxiv_id":"1911.11610","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-neural-networks-rnns-a-gentle","title":"Recurrent Neural Networks (RNNs): A gentle Introduction and Overview","date":"2019-11-23","arxiv_id":"1912.05911","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-n-gram-language-models-with-pre","title":"Improving N-gram Language Models with Pre-trained Deep Transformer","date":"2019-11-22","arxiv_id":"1911.10235","repositories_listed":0,"syntology":null},{"url":null,"slug":"cantonese-automatic-speech-recognition-using","title":"Cantonese Automatic Speech Recognition Using Transfer Learning from Mandarin","date":"2019-11-21","arxiv_id":"1911.09271","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-using-2d-sequence-to-sequence-models-for","title":"On using 2D sequence-to-sequence models for speech recognition","date":"2019-11-20","arxiv_id":"1911.08888","repositories_listed":0,"syntology":null},{"url":null,"slug":"alternating-between-spectral-and-spatial","title":"Sequential Multi-Frame Neural Beamforming for Speech Separation and Enhancement","date":"2019-11-18","arxiv_id":"1911.07953","repositories_listed":0,"syntology":null},{"url":null,"slug":"3-d-feature-and-acoustic-modeling-for-far","title":"3-D Feature and Acoustic Modeling for Far-Field Speech Recognition","date":"2019-11-13","arxiv_id":"1911.05504","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-deep-learning-revolution-and-its","title":"The Deep Learning Revolution and Its Implications for Computer Architecture and Chip Design","date":"2019-11-13","arxiv_id":"1911.05289","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserving-adversarial-representation","title":"Privacy-Preserving Adversarial Representation Learning in ASR: Reality or Illusion?","date":"2019-11-12","arxiv_id":"1911.04913","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-direct-speech-to-text","title":"Data Efficient Direct Speech-to-Text Translation with Modality Agnostic Meta-Learning","date":"2019-11-11","arxiv_id":"1911.04283","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-span-language-modeling-for-speech","title":"Long-span language modeling for speech recognition","date":"2019-11-11","arxiv_id":"1911.04571","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-voice-conversion-based-privacy","title":"Evaluating Voice Conversion-based Privacy Protection against Informed Attackers","date":"2019-11-10","arxiv_id":"1911.03934","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-intelligence-representation","title":"Multimodal Intelligence: Representation Learning, Information Fusion, and Applications","date":"2019-11-10","arxiv_id":"1911.03977","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-transformer-automatic","title":"Listen and Fill in the Missing Letters: Non-Autoregressive Transformer for Speech Recognition","date":"2019-11-10","arxiv_id":"1911.04908","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-adaptation-for-attention-based-end-to","title":"Speaker Adaptation for Attention-Based End-to-End Speech Recognition","date":"2019-11-09","arxiv_id":"1911.03762","repositories_listed":0,"syntology":null},{"url":"/paper/europarl-st-a-multilingual-corpus-for-speech","slug":"europarl-st-a-multilingual-corpus-for-speech","title":"Europarl-ST: A Multilingual Corpus For Speech Translation Of Parliamentary Debates","date":"2019-11-08","arxiv_id":"1911.03167","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-error-simulation-techniques","title":"Investigation of Error Simulation Techniques for Learning Dialog Policies for Conversational Error Recovery","date":"2019-11-08","arxiv_id":"1911.03378","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-lstm-performance-through-dynamic","title":"Boosting LSTM Performance Through Dynamic Precision Selection","date":"2019-11-07","arxiv_id":"1911.04244","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparison-of-end-to-end-models-for-long","title":"A comparison of end-to-end models for long-form speech recognition","date":"2019-11-06","arxiv_id":"1911.02242","repositories_listed":0,"syntology":null},{"url":null,"slug":"rnn-t-for-latency-controlled-asr-with","title":"RNN-T For Latency Controlled ASR With Improved Beam Search","date":"2019-11-05","arxiv_id":"1911.01629","repositories_listed":0,"syntology":null},{"url":null,"slug":"lstm-sharp-an-adaptable-energy-efficient","title":"SHARP: An Adaptable, Energy-Efficient Accelerator for Recurrent Neural Network","date":"2019-11-04","arxiv_id":"1911.01258","repositories_listed":0,"syntology":null},{"url":null,"slug":"supervised-level-wise-pretraining-for","title":"Supervised level-wise pretraining for recurrent neural network initialization in multi-class classification","date":"2019-11-04","arxiv_id":"1911.01071","repositories_listed":0,"syntology":null},{"url":null,"slug":"chameleon-a-language-model-adaptation-toolkit","title":"Chameleon: A Language Model Adaptation Toolkit for Automatic Speech Recognition of Conversational Speech","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-augmentation-for-end-to-end-speech","title":"Data Augmentation for End-to-End Speech Translation: FBK@IWSLT ‘19","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"entity-resolution-for-noisy-asr-transcripts","title":"Entity resolution for noisy ASR transcripts","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-transformer-for","title":"Improving Generalization of Transformer for Speech Recognition with Parallel Schedule Sampling and Relative Positional Embedding","date":"2019-11-01","arxiv_id":"1911.00203","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-distance-detection-of-bioacoustic-events","title":"Long-distance Detection of Bioacoustic Events with Per-channel Energy Normalization","date":"2019-11-01","arxiv_id":"1911.00417","repositories_listed":0,"syntology":null}],"record_sha256":"8740e90dfe13341c48e7046dd48f26205200b1914883b9b9780c08b11d66c590","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}