{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/automatic-speech-recognition-2/papers/24","list_of":"/task/automatic-speech-recognition-2","task":"Automatic Speech Recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":24,"pages_in_order":32,"rows_per_page":100,"rows":[2301,2400],"of":3174,"counts":{"archive_papers_tagged":3174,"with_a_code_link":677,"where_syntology_ran_a_sample":79,"not_listed_spam_title":0,"listed":3174,"listed_where_code_ran":79,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":62,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":62,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/automatic-speech-recognition-2","prev":"/task/automatic-speech-recognition-2/papers/23","next":"/task/automatic-speech-recognition-2/papers/25","papers":[{"url":null,"slug":"dissecting-user-perceived-latency-of-on","title":"Dissecting User-Perceived Latency of On-Device E2E Speech Recognition","date":"2021-04-06","arxiv_id":"2104.02207","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-targeted-universal-adversarial","title":"Exploring Targeted Universal Adversarial Perturbations to End-to-end ASR Models","date":"2021-04-06","arxiv_id":"2104.02757","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexi-transducer-optimizing-latency-accuracy","title":"Flexi-Transducer: Optimizing Latency, Accuracy and Compute forMulti-Domain On-Device Scenarios","date":"2021-04-06","arxiv_id":"2104.02232","repositories_listed":0,"syntology":null},{"url":null,"slug":"relaxing-the-conditional-independence","title":"Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions","date":"2021-04-06","arxiv_id":"2104.02724","repositories_listed":0,"syntology":null},{"url":null,"slug":"citrinet-closing-the-gap-between-non","title":"Citrinet: Closing the Gap between Non-Autoregressive and Autoregressive End-to-End Models for Automatic Speech Recognition","date":"2021-04-05","arxiv_id":"2104.01721","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speaker-attributed-asr-with","title":"End-to-End Speaker-Attributed ASR with Transformer","date":"2021-04-05","arxiv_id":"2104.02128","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-distance-a-new-metric-for-asr","title":"Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding","date":"2021-04-05","arxiv_id":"2104.02138","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-diarization-assisted-asr-for-multi","title":"Speaker conditioned acoustic modeling for multi-speaker conversational ASR","date":"2021-04-05","arxiv_id":"2104.01882","repositories_listed":0,"syntology":null},{"url":null,"slug":"talk-don-t-write-a-study-of-direct-speech","title":"Talk, Don't Write: A Study of Direct Speech-Based Image Retrieval","date":"2021-04-05","arxiv_id":"2104.01894","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-lifelong-learning-of-end-to-end-asr","title":"Towards Lifelong Learning of End-to-end ASR","date":"2021-04-04","arxiv_id":"2104.01616","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-joint-training-with-self","title":"Adversarial Joint Training with Self-Attention Mechanism for Robust End-to-End Speech Recognition","date":"2021-04-03","arxiv_id":"2104.01471","repositories_listed":0,"syntology":null},{"url":null,"slug":"configurable-privacy-preserving-automatic","title":"Configurable Privacy-Preserving Automatic Speech Recognition","date":"2021-04-01","arxiv_id":"2104.00766","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-sensitive-evaluation-of-automatic","title":"Context-sensitive evaluation of automatic speech recognition: considering user experience & language variation","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dialect-identification-through-adversarial","title":"Dialect Identification through Adversarial Learning and Knowledge Distillation on Romanian BERT","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-end-to-end-asr-for-endangered-1","title":"Leveraging End-to-End ASR for Endangered Language Documentation: An Empirical Study on Yol\\'oxochitl Mixtec","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tutorial-proposal-end-to-end-speech","title":"Tutorial Proposal: End-to-End Speech Translation","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-and-defenses-for-speech","title":"Adversarial Attacks and Defenses for Speech Recognition Systems","date":"2021-03-31","arxiv_id":"2103.17122","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-pre-training-of-end-to-end-multi","title":"Large-Scale Pre-Training of End-to-End Multi-Talker ASR for Meeting Transcription with Single Distant Microphone","date":"2021-03-31","arxiv_id":"2103.16776","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-encoder-learning-and-stream-fusion-for","title":"Multi-Encoder Learning and Stream Fusion for Transformer-Based End-to-End Automatic Speech Recognition","date":"2021-03-31","arxiv_id":"2104.00120","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-hypothesis-ctc-based-semi-supervised","title":"Multiple-hypothesis CTC-based semi-supervised adaptation of end-to-end speech recognition","date":"2021-03-29","arxiv_id":"2103.15515","repositories_listed":0,"syntology":null},{"url":null,"slug":"bart-based-semantic-correction-for-mandarin","title":"BART based semantic correction for Mandarin automatic speech recognition system","date":"2021-03-26","arxiv_id":"2104.05507","repositories_listed":0,"syntology":null},{"url":"/paper/construction-of-a-large-scale-japanese-asr","slug":"construction-of-a-large-scale-japanese-asr","title":"Construction of a Large-scale Japanese ASR Corpus on TV Recordings","date":"2021-03-26","arxiv_id":"2103.14736","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutually-constrained-monotonic-multihead","title":"Mutually-Constrained Monotonic Multihead Attention for Online ASR","date":"2021-03-26","arxiv_id":"2103.14302","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approach-to-improve-robustness-of-nlp","title":"An Approach to Improve Robustness of NLP Systems against ASR Errors","date":"2021-03-25","arxiv_id":"2103.13610","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-energy-based-models-for-end-to-end","title":"Residual Energy-Based Models for End-to-End Speech Recognition","date":"2021-03-25","arxiv_id":"2103.14152","repositories_listed":0,"syntology":null},{"url":null,"slug":"voice-privacy-with-smart-digital-assistants","title":"Voice Privacy with Smart Digital Assistants in Educational Settings","date":"2021-03-24","arxiv_id":"2104.11038","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallucination-of-speech-recognition-errors","title":"Hallucination of speech recognition errors with sequence to sequence learning","date":"2021-03-23","arxiv_id":"2103.12258","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-biasing-of-language-models-for","title":"Contextual Biasing of Language Models for Speech Recognition in Goal-Oriented Conversational Agents","date":"2021-03-18","arxiv_id":"2103.10325","repositories_listed":0,"syntology":null},{"url":"/paper/transformer-based-asr-incorporating-time","slug":"transformer-based-asr-incorporating-time","title":"Transformer-based ASR Incorporating Time-reduction Layer and Fine-tuning with Self-Knowledge Distillation","date":"2021-03-17","arxiv_id":"2103.09903","repositories_listed":0,"syntology":null},{"url":"/paper/edgecrnn-an-edgecomputing-oriented-model-of","slug":"edgecrnn-an-edgecomputing-oriented-model-of","title":"EdgeCRNN: an edgecomputing oriented model of acoustic feature enhancement for keyword spotting","date":"2021-03-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-distributed-optimisation-framework","title":"A Distributed Optimisation Framework Combining Natural Gradient with Hessian-Free for Discriminative Sequence Training","date":"2021-03-12","arxiv_id":"2103.07554","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-acoustic-unit-augmentation-with-bpe","title":"Dynamic Acoustic Unit Augmentation With BPE-Dropout for Low-Resource End-to-End Speech Recognition","date":"2021-03-12","arxiv_id":"2103.07186","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-word-level-confidence-for-subword","title":"Learning Word-Level Confidence For Subword End-to-End ASR","date":"2021-03-11","arxiv_id":"2103.06716","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-of-both-worlds-robust-accented-speech","title":"Best of Both Worlds: Robust Accented Speech Recognition with Adversarial Transfer Learning","date":"2021-03-10","arxiv_id":"2103.05834","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-semi-supervised-learning-for-asr","title":"Contrastive Semi-supervised Learning for ASR","date":"2021-03-09","arxiv_id":"2103.05149","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-ultra-low-power-rnn-classifier-for-always","title":"An Ultra-low Power RNN Classifier for Always-On Voice Wake-Up Detection Robust to Real-World Scenarios","date":"2021-03-08","arxiv_id":"2103.04792","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-model-robustness-for-skill-routing-in","title":"Neural model robustness for skill routing in large-scale conversational AI systems: A design choice exploration","date":"2021-03-04","arxiv_id":"2103.03373","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-running-speech-recognizer-an-end-to-end","title":"Incorporating VAD into ASR System by Multi-task Learning","date":"2021-03-02","arxiv_id":"2103.01661","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignment-knowledge-distillation-for-online","title":"Alignment Knowledge Distillation for Online Streaming Attention-based Speech Recognition","date":"2021-02-28","arxiv_id":"2103.00422","repositories_listed":0,"syntology":null},{"url":null,"slug":"brain-signals-to-rescue-aphasia-apraxia-and","title":"Brain Signals to Rescue Aphasia, Apraxia and Dysarthria Speech Recognition","date":"2021-02-28","arxiv_id":"2103.00383","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-for-improving-rare-word","title":"Meta-Learning for improving rare word recognition in end-to-end ASR","date":"2021-02-25","arxiv_id":"2102.12624","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixspeech-data-augmentation-for-low-resource","title":"MixSpeech: Data Augmentation for Low-resource Automatic Speech Recognition","date":"2021-02-25","arxiv_id":"2102.12664","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-enhancement-using-multi-stage-self","title":"Speech Enhancement Using Multi-Stage Self-Attentive Temporal Convolutional Networks","date":"2021-02-24","arxiv_id":"2102.12078","repositories_listed":0,"syntology":null},{"url":null,"slug":"thoughts-on-the-potential-to-compensate-a","title":"Thoughts on the potential to compensate a hearing loss in noise","date":"2021-02-24","arxiv_id":"2102.12397","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-optimization-of-contexts-for","title":"Evolutionary optimization of contexts for phonetic correction in speech recognition systems","date":"2021-02-23","arxiv_id":"2102.11480","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-human-readable-transcript-for","title":"Generating Human Readable Transcript for Automatic Speech Recognition with Pre-trained Language Model","date":"2021-02-22","arxiv_id":"2102.11114","repositories_listed":0,"syntology":null},{"url":null,"slug":"echo-state-speech-recognition","title":"Echo State Speech Recognition","date":"2021-02-18","arxiv_id":"2102.09114","repositories_listed":0,"syntology":null},{"url":null,"slug":"fundamental-frequency-feature-normalization","title":"Fundamental Frequency Feature Normalization and Data Augmentation for Child Speech Recognition","date":"2021-02-18","arxiv_id":"2102.09106","repositories_listed":0,"syntology":null},{"url":null,"slug":"gaussian-kernelized-self-attention-for-long","title":"Gaussian Kernelized Self-Attention for Long Sequence Data and Its Application to CTC-based Speech Recognition","date":"2021-02-18","arxiv_id":"2102.09168","repositories_listed":0,"syntology":null},{"url":null,"slug":"atcspeechnet-a-multilingual-end-to-end-speech","title":"ATCSpeechNet: A multilingual end-to-end speech recognition framework for air traffic control systems","date":"2021-02-17","arxiv_id":"2102.08535","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-based-multi-source-localization","title":"Deep Learning based Multi-Source Localization with Source Splitting and its Effectiveness in Multi-Talker Speech Recognition","date":"2021-02-16","arxiv_id":"2102.07955","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-automatic-speech-recognition-with","title":"End-to-End Automatic Speech Recognition with Deep Mutual Learning","date":"2021-02-16","arxiv_id":"2102.08154","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-transformer-based-large-context","title":"Hierarchical Transformer-based Large-Context End-to-end ASR with Large-Context Knowledge Distillation","date":"2021-02-16","arxiv_id":"2102.07935","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-speech-recognition-models-with","title":"Improving speech recognition models with small samples for air traffic control systems","date":"2021-02-16","arxiv_id":"2102.08015","repositories_listed":0,"syntology":null},{"url":null,"slug":"thank-you-for-attention-a-survey-on-attention","title":"Thank you for Attention: A survey on Attention-based Artificial Neural Networks for Automatic Speech Recognition","date":"2021-02-14","arxiv_id":"2102.07259","repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-apc-bidirectional-autoregressive","title":"Bi-APC: Bidirectional Autoregressive Predictive Coding for Unsupervised Pre-training and Its Application to Children's ASR","date":"2021-02-12","arxiv_id":"2102.06816","repositories_listed":0,"syntology":null},{"url":null,"slug":"content-aware-speaker-embeddings-for-speaker","title":"Content-Aware Speaker Embeddings for Speaker Diarisation","date":"2021-02-12","arxiv_id":"2102.06467","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-as-i-mean-not-as-i-say-sequence-loss","title":"Do as I mean, not as I say: Sequence Loss Training for Spoken Language Understanding","date":"2021-02-12","arxiv_id":"2102.06750","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-punctuation-prediction-with","title":"Multimodal Punctuation Prediction with Contextual Dropout","date":"2021-02-12","arxiv_id":"2102.11012","repositories_listed":0,"syntology":null},{"url":null,"slug":"nuva-a-naming-utterance-verifier-for-aphasia","title":"NUVA: A Naming Utterance Verifier for Aphasia Treatment","date":"2021-02-10","arxiv_id":"2102.05408","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparsification-via-compressed-sensing-for","title":"Sparsification via Compressed Sensing for Automatic Speech Recognition","date":"2021-02-09","arxiv_id":"2102.04932","repositories_listed":0,"syntology":null},{"url":null,"slug":"train-your-classifier-first-cascade-neural","title":"Train your classifier first: Cascade Neural Networks Training from upper layers to lower layers","date":"2021-02-09","arxiv_id":"2102.04697","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bandit-approach-to-curriculum-generation","title":"A bandit approach to curriculum generation for automatic speech recognition","date":"2021-02-06","arxiv_id":"2102.03662","repositories_listed":0,"syntology":null},{"url":null,"slug":"intermediate-loss-regularization-for-ctc","title":"Intermediate Loss Regularization for CTC-based Speech Recognition","date":"2021-02-05","arxiv_id":"2102.03216","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-self-supervised-pre-training-for","title":"Multi-Task Self-Supervised Pre-Training for Music Classification","date":"2021-02-05","arxiv_id":"2102.03229","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stage-augmentation-and-adaptive-ctc","title":"Two-Stage Augmentation and Adaptive CTC Fusion for Improved Robustness of Multi-Stream End-to-End ASR","date":"2021-02-05","arxiv_id":"2102.03055","repositories_listed":0,"syntology":null},{"url":null,"slug":"effects-of-number-of-filters-of-convolutional","title":"Effects of Number of Filters of Convolutional Layers on Speech Recognition Model Accuracy","date":"2021-02-03","arxiv_id":"2102.02326","repositories_listed":0,"syntology":null},{"url":null,"slug":"internal-language-model-training-for-domain","title":"Internal Language Model Training for Domain-Adaptive End-to-End Speech Recognition","date":"2021-02-02","arxiv_id":"2102.01380","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-recognition-by-simply-fine-tuning-bert","title":"Speech Recognition by Simply Fine-tuning BERT","date":"2021-01-30","arxiv_id":"2102.00291","repositories_listed":0,"syntology":null},{"url":null,"slug":"bcn2brno-asr-system-fusion-for-albayzin-2020","title":"BCN2BRNO: ASR System Fusion for Albayzin 2020 Speech to Text Challenge","date":"2021-01-29","arxiv_id":"2101.12729","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-end-to-end-asr-for-endangered","title":"Leveraging End-to-End ASR for Endangered Language Documentation: An Empirical Study on Yoloxóchitl Mixtec","date":"2021-01-26","arxiv_id":"2101.10877","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-beam-search-confidence-for-energy","title":"Exploiting Beam Search Confidence for Energy-Efficient Speech Recognition","date":"2021-01-22","arxiv_id":"2101.09083","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-models-for-joint-speech-recognition","title":"Streaming Models for Joint Speech Recognition and Translation","date":"2021-01-22","arxiv_id":"2101.09149","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusing-wav2vec2-0-and-bert-into-end-to-end","title":"Efficiently Fusing Pretrained Acoustic and Linguistic Encoders for Low-resource Speech Recognition","date":"2021-01-17","arxiv_id":"2101.06699","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-evaluation-of-word-level-confidence","title":"An evaluation of word-level confidence estimation for end-to-end automatic speech recognition","date":"2021-01-14","arxiv_id":"2101.05525","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-offline-transformer-based-end-to-end","title":"Fast offline Transformer-based end-to-end automatic speech recognition for real-world applications","date":"2021-01-14","arxiv_id":"2101.05600","repositories_listed":0,"syntology":null},{"url":null,"slug":"wer-bert-automatic-wer-estimation-with-bert","title":"WER-BERT: Automatic WER Estimation with BERT in a Balanced Ordinal Classification Paradigm","date":"2021-01-14","arxiv_id":"2101.05478","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypothesis-stitcher-for-end-to-end-speaker","title":"Hypothesis Stitcher for End-to-End Speaker-attributed ASR on Long-form Multi-talker Recordings","date":"2021-01-06","arxiv_id":"2101.01853","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-without-forgetting-task-aware","title":"Learning without Forgetting: Task Aware Multitask Learning for Multi-Modality Tasks","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"nas-bench-asr-reproducible-neural","title":"NAS-Bench-ASR: Reproducible Neural Architecture Search for Speech Recognition","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"why-does-decentralized-training-outperform","title":"Why Does Decentralized Training Outperform Synchronous Training In The Large Batch Setting?","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-channel-multi-frame-adl-mvdr-for-target","title":"Multi-channel Multi-frame ADL-MVDR for Target Speech Separation","date":"2020-12-24","arxiv_id":"2012.13442","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-reasoning-graph-neural-network","title":"A Hierarchical Reasoning Graph Neural Network for The Automatic Scoring of Answer Transcriptions in Video Job Interviews","date":"2020-12-22","arxiv_id":"2012.11960","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-meta-sampling-for-multilingual","title":"Adversarial Meta Sampling for Multilingual Low-Resource Speech Recognition","date":"2020-12-22","arxiv_id":"2012.11896","repositories_listed":0,"syntology":null},{"url":null,"slug":"adjust-free-adversarial-example-generation-in","title":"Adjust-free adversarial example generation in speech recognition using evolutionary multi-objective optimization under black-box condition","date":"2020-12-21","arxiv_id":"2012.11138","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-streaming-asr-with-non-autoregressive","title":"Toward Streaming ASR with Non-Autoregressive Insertion-based Model","date":"2020-12-18","arxiv_id":"2012.10128","repositories_listed":0,"syntology":null},{"url":"/paper/exploring-transfer-learning-for-end-to-end","slug":"exploring-transfer-learning-for-end-to-end","title":"Exploring Transfer Learning For End-to-End Spoken Language Understanding","date":"2020-12-15","arxiv_id":"2012.08549","repositories_listed":0,"syntology":null},{"url":null,"slug":"user-friendly-automatic-transcription-of-low","title":"User-friendly automatic transcription of low-resource languages: Plugging ESPnet into Elpis","date":"2020-12-15","arxiv_id":"2101.03027","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-on-device-fully-neural-end-to-end","title":"A review of on-device fully neural end-to-end automatic speech recognition algorithms","date":"2020-12-14","arxiv_id":"2012.07974","repositories_listed":0,"syntology":null},{"url":null,"slug":"less-is-more-improved-rnn-t-decoding-using","title":"Less Is More: Improved RNN-T Decoding Using Limited Label Context and Path Merging","date":"2020-12-12","arxiv_id":"2012.06749","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-robustness-to-disfluencies-in-rnn","title":"Improved Robustness to Disfluencies in RNN-Transducer Based Speech Recognition","date":"2020-12-11","arxiv_id":"2012.06259","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-learning-of-lf-mmi-trained-time","title":"Bayesian Learning of LF-MMI Trained Time Delay Neural Networks for Speech Recognition","date":"2020-12-08","arxiv_id":"2012.04494","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-multiple-asr-hypotheses-to-boost-i18n","title":"Using multiple ASR hypotheses to boost i18n NLU performance","date":"2020-12-07","arxiv_id":"2012.04099","repositories_listed":0,"syntology":null},{"url":"/paper/100000-podcasts-a-spoken-english-document","slug":"100000-podcasts-a-spoken-english-document","title":"100,000 Podcasts: A Spoken English Document Corpus","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"asr-for-non-standardised-languages-with","title":"ASR for Non-standardised Languages with Dialectal Variation: the case of Swiss German","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"german-arabic-speech-to-speech-translation","title":"German-Arabic Speech-to-Speech Translation for Psychiatric Diagnosis","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-learning-of-spoken-language","title":"Multi-task Learning of Spoken Language Understanding by Integrating N-Best Hypotheses with Hierarchical Attention","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-device-detection-of-sentence-completion","title":"On-Device detection of sentence completion for voice assistants with low-memory footprint","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-transcription","title":"Sparse Transcription","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-indigenous-languages-technology-project","title":"The Indigenous Languages Technology project at NRC Canada: An empowerment-oriented approach to developing language software","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"f3b33d87e7ad674a7359358e985a31279b5012fd77768986b98e10fb3c722412","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}