{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/speech-recognition-1/papers/41","list_of":"/task/speech-recognition-1","task":"speech-recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":41,"pages_in_order":58,"rows_per_page":100,"rows":[4001,4100],"of":5715,"counts":{"archive_papers_tagged":5715,"with_a_code_link":1277,"where_syntology_ran_a_sample":162,"not_listed_spam_title":0,"listed":5715,"listed_where_code_ran":162,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":134,"every_run_a_failure_of_syntologys_instrument":28,"listed_with_a_run_with_no_instrument_failure":134,"listed_every_run_a_failure_of_syntologys_instrument":28,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/speech-recognition-1","prev":"/task/speech-recognition-1/papers/40","next":"/task/speech-recognition-1/papers/42","papers":[{"url":null,"slug":"cascade-rnn-transducer-syllable-based","title":"Cascade RNN-Transducer: Syllable Based Streaming On-device Mandarin Speech Recognition with a Syllable-to-Character Converter","date":"2020-11-17","arxiv_id":"2011.08469","repositories_listed":0,"syntology":null},{"url":null,"slug":"empowering-things-with-intelligence-a-survey","title":"Empowering Things with Intelligence: A Survey of the Progress, Challenges, and Opportunities in Artificial Intelligence of Things","date":"2020-11-17","arxiv_id":"2011.08612","repositories_listed":0,"syntology":null},{"url":null,"slug":"refining-automatic-speech-recognition-system","title":"Refining Automatic Speech Recognition System for older adults","date":"2020-11-17","arxiv_id":"2011.08346","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-visual-multi-channel-integration-and","title":"Audio-visual Multi-channel Integration and Recognition of Overlapped Speech","date":"2020-11-16","arxiv_id":"2011.07755","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-shallow-fusion-for-rnn-t-personalization","title":"Deep Shallow Fusion for RNN-T Personalization","date":"2020-11-16","arxiv_id":"2011.07754","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-enhancement-guided-by-contextual","title":"Improving Speech Enhancement Performance by Leveraging Contextual Broad Phonetic Class Information","date":"2020-11-15","arxiv_id":"2011.07442","repositories_listed":0,"syntology":null},{"url":null,"slug":"11-teraflops-per-second-photonic","title":"11 TeraFLOPs per second photonic convolutional accelerator for deep learning optical neural networks","date":"2020-11-14","arxiv_id":"2011.07393","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-reinforcement-learning-for","title":"Self-supervised reinforcement learning for speaker localisation with the iCub humanoid robot","date":"2020-11-12","arxiv_id":"2011.06544","repositories_listed":0,"syntology":null},{"url":null,"slug":"fat-training-neural-networks-for-reliable","title":"FAT: Training Neural Networks for Reliable Inference Under Hardware Faults","date":"2020-11-11","arxiv_id":"2011.05873","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-end-to-end-multi-channel-time-domain","title":"On End-to-end Multi-channel Time Domain Speech Separation in Reverberant Environments","date":"2020-11-11","arxiv_id":"2011.05958","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-semi-supervised-semantics","title":"Towards Semi-Supervised Semantics Understanding from Speech","date":"2020-11-11","arxiv_id":"2011.06195","repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneous-speech-to-speech-translation","title":"Simultaneous Speech-to-Speech Translation System with Neural Incremental ASR, MT, and TTS","date":"2020-11-10","arxiv_id":"2011.04845","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-lf-mmi-ctc-and-rnn-t-criteria","title":"Benchmarking LF-MMI, CTC and RNN-T Criteria for Streaming ASR","date":"2020-11-09","arxiv_id":"2011.04785","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-end-to-end-speech-recognition-using","title":"Efficient End-to-End Speech Recognition Using Performers in Conformers","date":"2020-11-09","arxiv_id":"2011.04196","repositories_listed":0,"syntology":null},{"url":null,"slug":"gated-recurrent-fusion-with-joint-training","title":"Gated Recurrent Fusion with Joint Training Framework for Robust End-to-End Speech Recognition","date":"2020-11-09","arxiv_id":"2011.04249","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-search-with-an-efficient","title":"Neural Architecture Search with an Efficient Multiobjective Evolutionary Framework","date":"2020-11-09","arxiv_id":"2011.04463","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-query-rewriting-in","title":"Personalized Query Rewriting in Conversational AI Agents","date":"2020-11-09","arxiv_id":"2011.04748","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-usefulness-of-self-attention-for","title":"On the Usefulness of Self-Attention for Automatic Speech Recognition with Transformers","date":"2020-11-08","arxiv_id":"2011.04906","repositories_listed":0,"syntology":null},{"url":null,"slug":"acoustics-based-intent-recognition-using","title":"Acoustics Based Intent Recognition Using Discovered Phonetic Units for Low Resource Languages","date":"2020-11-07","arxiv_id":"2011.03646","repositories_listed":0,"syntology":null},{"url":null,"slug":"espnet-se-end-to-end-speech-enhancement-and","title":"ESPnet-se: end-to-end speech enhancement and separation toolkit designed for asr integration","date":"2020-11-07","arxiv_id":"2011.03706","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-constrained-federated-learning-with","title":"Resource-Constrained Federated Learning with Heterogeneous Labels and Models","date":"2020-11-06","arxiv_id":"2011.03206","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignment-restricted-streaming-recurrent","title":"Alignment Restricted Streaming Recurrent Neural Network Transducer","date":"2020-11-05","arxiv_id":"2011.03072","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-accent-adaptation-based-on-gate","title":"Multi-Accent Adaptation based on Gate Mechanism","date":"2020-11-05","arxiv_id":"2011.02774","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-images-for-asr-and-tts-through","title":"Augmenting Images for ASR and TTS through Single-loop and Dual-loop Multimodal Chain Framework","date":"2020-11-04","arxiv_id":"2011.02099","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-lingual-machine-speech-chain-for-1","title":"Cross-Lingual Machine Speech Chain for Javanese, Sundanese, Balinese, and Bataks Speech Recognition and Synthesis","date":"2020-11-04","arxiv_id":"2011.02128","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-augmentation-for-end-to-end-code","title":"Data Augmentation for End-to-end Code-switching Speech Recognition","date":"2020-11-04","arxiv_id":"2011.02160","repositories_listed":0,"syntology":null},{"url":null,"slug":"incremental-machine-speech-chain-towards","title":"Incremental Machine Speech Chain Towards Enabling Listening while Speaking in Real-time","date":"2020-11-04","arxiv_id":"2011.02126","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequence-to-sequence-learning-via-attention","title":"Sequence-to-Sequence Learning via Attention Transfer for Incremental Speech Recognition","date":"2020-11-04","arxiv_id":"2011.02127","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-latency-speech-recognition-with","title":"Dynamic latency speech recognition with asynchronous revision","date":"2020-11-03","arxiv_id":"2011.01570","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-rnn-transducer-with-normalized","title":"Improving RNN transducer with normalized jointer network","date":"2020-11-03","arxiv_id":"2011.01576","repositories_listed":0,"syntology":null},{"url":null,"slug":"integration-of-speech-separation-diarization","title":"Integration of speech separation, diarization, and recognition for multi-speaker meetings: System description, comparison, and analysis","date":"2020-11-03","arxiv_id":"2011.02014","repositories_listed":0,"syntology":null},{"url":null,"slug":"internal-language-model-estimation-for-domain","title":"Internal Language Model Estimation for Domain-Adaptive End-to-End Speech Recognition","date":"2020-11-03","arxiv_id":"2011.01991","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-explicit-prosody-models-and-deep","title":"Learning Explicit Prosody Models and Deep Speaker Embeddings for Atypical Voice Conversion","date":"2020-11-03","arxiv_id":"2011.01678","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-attention-based-models-with","title":"Streaming Attention-Based Models with Augmented Memory for End-to-End Speech Recognition","date":"2020-11-03","arxiv_id":"2011.07120","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-pattern-discovery-from-thematic","title":"Unsupervised Pattern Discovery from Thematic Speech Archives Based on Multilingual Bottleneck Features","date":"2020-11-03","arxiv_id":"2011.01986","repositories_listed":0,"syntology":null},{"url":null,"slug":"warped-language-models-for-noise-robust","title":"Warped Language Models for Noise Robust Language Understanding","date":"2020-11-03","arxiv_id":"2011.01900","repositories_listed":0,"syntology":null},{"url":null,"slug":"dnn-based-semantic-model-for-rescoring-n-best","title":"DNN-Based Semantic Model for Rescoring N-best Speech Recognition List","date":"2020-11-02","arxiv_id":"2011.00975","repositories_listed":0,"syntology":null},{"url":null,"slug":"focus-on-the-present-a-regularization-method","title":"Focus on the present: a regularization method for the ASR source-target attention layer","date":"2020-11-02","arxiv_id":"2011.01210","repositories_listed":0,"syntology":null},{"url":null,"slug":"multitask-learning-and-joint-optimization-for","title":"Multitask Learning and Joint Optimization for Transformer-RNN-Transducer Speech Recognition","date":"2020-11-02","arxiv_id":"2011.00771","repositories_listed":0,"syntology":null},{"url":null,"slug":"sapaugment-learning-a-sample-adaptive-policy","title":"SapAugment: Learning A Sample Adaptive Policy for Data Augmentation","date":"2020-11-02","arxiv_id":"2011.01156","repositories_listed":0,"syntology":null},{"url":null,"slug":"effectively-pretraining-a-speech-translation","title":"Effectively pretraining a speech translation decoder with Machine Translation data","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"elitr-european-live-translator","title":"ELITR: European Live Translator","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"impact-of-asr-on-alzheimers-disease-detection-1","title":"Impact of ASR on Alzheimer’s Disease Detection: All Errors are Equal, but Deletions are More Equal than Others","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-end-to-end-bangla-speech","title":"Improving End-to-End Bangla Speech Recognition with Semi-supervised Training","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"may-i-ask-whos-calling-named-entity","title":"May I Ask Who’s Calling? Named Entity Recognition on Call Center Transcripts for Privacy Law Compliance","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneous-translation","title":"Simultaneous Translation","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"directional-asr-a-new-paradigm-for-e2e-multi","title":"Directional ASR: A New Paradigm for E2E Multi-Speaker Speech Recognition with Source Localization","date":"2020-10-30","arxiv_id":"2011.00091","repositories_listed":0,"syntology":null},{"url":null,"slug":"phoneme-based-neural-transducer-for-large","title":"Phoneme Based Neural Transducer for Large Vocabulary Speech Recognition","date":"2020-10-30","arxiv_id":"2010.16368","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-simultaneous-speech-translation","title":"Streaming Simultaneous Speech Translation with Augmented Memory Transformer","date":"2020-10-30","arxiv_id":"2011.00033","repositories_listed":0,"syntology":null},{"url":null,"slug":"may-i-ask-who-s-calling-named-entity","title":"May I Ask Who's Calling? Named Entity Recognition on Call Center Transcripts for Privacy Law Compliance","date":"2020-10-29","arxiv_id":"2010.15598","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-speech-recognition-via-graph","title":"Semi-Supervised Speech Recognition via Graph-based Temporal Classification","date":"2020-10-29","arxiv_id":"2010.15653","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-speech-recognition-models-with","title":"Training Speech Recognition Models with Federated Learning: A Quality/Cost Framework","date":"2020-10-29","arxiv_id":"2010.15965","repositories_listed":0,"syntology":null},{"url":null,"slug":"cass-nat-ctc-alignment-based-single-step-non","title":"CASS-NAT: CTC Alignment-based Single Step Non-autoregressive Transformer for Speech Recognition","date":"2020-10-28","arxiv_id":"2010.14725","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoupling-pronunciation-and-language-for-end","title":"Decoupling Pronunciation and Language for End-to-end Code-switching Automatic Speech Recognition","date":"2020-10-28","arxiv_id":"2010.14798","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusion-models-for-improved-visual-captioning","title":"Fusion Models for Improved Visual Captioning","date":"2020-10-28","arxiv_id":"2010.15251","repositories_listed":0,"syntology":null},{"url":null,"slug":"int8-winograd-acceleration-for-conv1d","title":"INT8 Winograd Acceleration for Conv1D Equipped ASR Models Deployed on Mobile Devices","date":"2020-10-28","arxiv_id":"2010.14841","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-transformer-asr-with-ctc","title":"Non-Autoregressive Transformer ASR with CTC-Enhanced Decoder Input","date":"2020-10-28","arxiv_id":"2010.15025","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-in-a-hundred-select-the-best-predicted","title":"One In A Hundred: Select The Best Predicted Sequence from Numerous Candidates for Streaming Speech Recognition","date":"2020-10-28","arxiv_id":"2010.14791","repositories_listed":0,"syntology":null},{"url":null,"slug":"cascaded-encoders-for-unifying-streaming-and","title":"Cascaded encoders for unifying streaming and non-streaming ASR","date":"2020-10-27","arxiv_id":"2010.14606","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-decoder-masking-for-transformer","title":"Effective Decoder Masking for Transformer Based End-to-End Speech Recognition","date":"2020-10-27","arxiv_id":"2010.14764","repositories_listed":0,"syntology":null},{"url":null,"slug":"emotion-recognition-by-fusing-time","title":"Emotion recognition by fusing time synchronous and time asynchronous representations","date":"2020-10-27","arxiv_id":"2010.14102","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-far-field-speech-recognition-with","title":"End-to-End Far-Field Speech Recognition with Unified Dereverberation and Beamforming","date":"2020-10-27","arxiv_id":"2005.10479","repositories_listed":0,"syntology":null},{"url":null,"slug":"multitask-training-with-text-data-for-end-to","title":"Multitask Training with Text Data for End-to-End Speech Recognition","date":"2020-10-27","arxiv_id":"2010.14318","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-in-action-a-comparative-study-of","title":"Transformer in action: a comparative study of transformer-based acoustic models for large scale speech recognition applications","date":"2020-10-27","arxiv_id":"2010.14665","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-mask-ctc-for-non-autoregressive-end","title":"Improved Mask-CTC for Non-Autoregressive End-to-End ASR","date":"2020-10-26","arxiv_id":"2010.13270","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-neural-language-model-fusion-for","title":"Improved Neural Language Model Fusion for Streaming Recurrent Neural Network Transducer","date":"2020-10-26","arxiv_id":"2010.13878","repositories_listed":0,"syntology":null},{"url":"/paper/lip-graph-assisted-audio-visual-speech","slug":"lip-graph-assisted-audio-visual-speech","title":"Lip Graph Assisted Audio-Visual Speech Recognition Using Bidirectional Synchronous Fusion","date":"2020-10-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"align-refine-non-autoregressive-speech","title":"Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment","date":"2020-10-24","arxiv_id":"2010.14233","repositories_listed":0,"syntology":null},{"url":null,"slug":"auxiliary-sequence-labeling-tasks-for","title":"Auxiliary Sequence Labeling Tasks for Disfluency Detection","date":"2020-10-24","arxiv_id":"2011.04512","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-noise-robustness-of-an-end-to-end","title":"Improving Noise Robustness of an End-to-End Neural Model for Automatic Speech Recognition","date":"2020-10-23","arxiv_id":"2010.12715","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-minimum-word-error-rate-training-of-the","title":"On Minimum Word Error Rate Training of the Hybrid Autoregressive Transducer","date":"2020-10-23","arxiv_id":"2010.12673","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multilingual-approach-to-joint-speech-and","title":"Multilingual Approach to Joint Speech and Accent Recognition with DNN-HMM Framework","date":"2020-10-22","arxiv_id":"2010.11483","repositories_listed":0,"syntology":null},{"url":null,"slug":"developing-real-time-streaming-transformer","title":"Developing Real-time Streaming Transformer Transducer for Speech Recognition on Large-scale Dataset","date":"2020-10-22","arxiv_id":"2010.11395","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-streaming-automatic-speech","title":"Improving Streaming Automatic Speech Recognition With Non-Streaming Model Distillation On Unsupervised Data","date":"2020-10-22","arxiv_id":"2010.12096","repositories_listed":0,"syntology":null},{"url":null,"slug":"mam-masked-acoustic-modeling-for-end-to-end","title":"MAM: Masked Acoustic Modeling for End-to-End Speech-to-Text Translation","date":"2020-10-22","arxiv_id":"2010.11445","repositories_listed":0,"syntology":null},{"url":null,"slug":"slimipl-language-model-free-iterative-pseudo","title":"SlimIPL: Language-Model-Free Iterative Pseudo-Labeling","date":"2020-10-22","arxiv_id":"2010.11524","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-multi-task-learning-framework-to","title":"A General Multi-Task Learning Framework to Leverage Text Data for Speech to Text Tasks","date":"2020-10-21","arxiv_id":"2010.11338","repositories_listed":0,"syntology":null},{"url":null,"slug":"cascaded-models-with-cyclic-feedback-for","title":"Cascaded Models With Cyclic Feedback For Direct Speech Translation","date":"2020-10-21","arxiv_id":"2010.11153","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-distillation-for-improved-accuracy","title":"Knowledge Distillation for Improved Accuracy in Spoken Question Answering","date":"2020-10-21","arxiv_id":"2010.11067","repositories_listed":0,"syntology":null},{"url":null,"slug":"lstm-lm-with-long-term-history-for-first-pass","title":"LSTM-LM with Long-Term History for First-Pass Decoding in Conversational Speech Recognition","date":"2020-10-21","arxiv_id":"2010.11349","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentence-boundary-augmentation-for-neural","title":"Sentence Boundary Augmentation For Neural Machine Translation Robustness","date":"2020-10-21","arxiv_id":"2010.11132","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-for-efficient-on-device","title":"Knowledge Transfer for Efficient On-device False Trigger Mitigation","date":"2020-10-20","arxiv_id":"2010.10591","repositories_listed":0,"syntology":null},{"url":null,"slug":"replacing-human-audio-with-synthetic-audio","title":"Replacing Human Audio with Synthetic Audio for On-device Unspoken Punctuation Prediction","date":"2020-10-20","arxiv_id":"2010.10203","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-separation-using-speaker-inventories","title":"Speaker Separation Using Speaker Inventories and Estimated Speech","date":"2020-10-20","arxiv_id":"2010.10556","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-chinese-end-to-end-spoken-language","title":"Ensemble Chinese End-to-End Spoken Language Understanding for Abnormal Event Detection from audio stream","date":"2020-10-19","arxiv_id":"2010.09235","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-data-distillation-for-end-to-end-1","title":"Towards Data Distillation for End-to-end Spoken Conversational Question Answering","date":"2020-10-18","arxiv_id":"2010.08923","repositories_listed":0,"syntology":null},{"url":null,"slug":"studying-the-similarity-of-covid-19-sounds","title":"Studying the Similarity of COVID-19 Sounds based on Correlation Analysis of MFCC","date":"2020-10-17","arxiv_id":"2010.08770","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-speech-recognition-with","title":"Multimodal Speech Recognition with Unstructured Audio Masking","date":"2020-10-16","arxiv_id":"2010.08642","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-intrusive-speech-intelligibility","title":"Non-intrusive speech intelligibility prediction using automatic speech recognition derived measures","date":"2020-10-16","arxiv_id":"2010.08574","repositories_listed":0,"syntology":null},{"url":null,"slug":"lightweight-end-to-end-speech-recognition","title":"Lightweight End-to-End Speech Recognition from Raw Audio Data Using Sinc-Convolutions","date":"2020-10-15","arxiv_id":"2010.07597","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-spectral-augmentation-for-code","title":"Exploiting Spectral Augmentation for Code-Switched Spoken Language Identification","date":"2020-10-14","arxiv_id":"2010.07130","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-lightweight-speaker-recognition-system","title":"A Lightweight Speaker Recognition System Using Timbre Properties","date":"2020-10-12","arxiv_id":"2010.05502","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-low-resource-code-switched-asr","title":"Improving Low Resource Code-switched ASR using Augmented Code-switched TTS","date":"2020-10-12","arxiv_id":"2010.05549","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-sound-of-silence-in-eeg-cognitive-voice","title":"The \"Sound of Silence\" in EEG -- Cognitive voice activity detection","date":"2020-10-12","arxiv_id":"2010.05497","repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-asr-unify-and-improve-streaming-asr-1","title":"Dual-mode ASR: Unify and Improve Streaming ASR with Full-context Modeling","date":"2020-10-12","arxiv_id":"2010.06030","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-clustering-based-method-for-automatic","title":"A Clustering-Based Method for Automatic Educational Video Recommendation Using Deep Face-Features of Lecturers","date":"2020-10-09","arxiv_id":"2010.04676","repositories_listed":0,"syntology":null},{"url":null,"slug":"population-based-training-for-data","title":"Population Based Training for Data Augmentation and Regularization in Speech Recognition","date":"2020-10-08","arxiv_id":"2010.03899","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-and-specaugment-applied-to","title":"Transfer Learning and SpecAugment applied to SSVEP Based BCI Classification","date":"2020-10-08","arxiv_id":"2010.06503","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adversarial-neural-networks-for","title":"Domain Adversarial Neural Networks for Dysarthric Speech Recognition","date":"2020-10-07","arxiv_id":"2010.03623","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-transducer-one-model-unifying","title":"Transformer Transducer: One Model Unifying Streaming and Non-streaming Speech Recognition","date":"2020-10-07","arxiv_id":"2010.03192","repositories_listed":0,"syntology":null}],"record_sha256":"533ca7861bac4bd33475ffaf55a52a4701981eb24b0befc7be180d983f4bc9a3","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}