{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/speech-recognition-1/papers/27","list_of":"/task/speech-recognition-1","task":"speech-recognition","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":27,"pages_in_order":58,"rows_per_page":100,"rows":[2601,2700],"of":5715,"counts":{"archive_papers_tagged":5715,"with_a_code_link":1277,"where_syntology_ran_a_sample":162,"not_listed_spam_title":0,"listed":5715,"listed_where_code_ran":162,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":134,"every_run_a_failure_of_syntologys_instrument":28,"listed_with_a_run_with_no_instrument_failure":134,"listed_every_run_a_failure_of_syntologys_instrument":28,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/speech-recognition-1","prev":"/task/speech-recognition-1/papers/26","next":"/task/speech-recognition-1/papers/28","papers":[{"url":null,"slug":"knowledge-distillation-from-multiple","title":"Knowledge Distillation from Multiple Foundation Models for End-to-End Speech Recognition","date":"2023-03-20","arxiv_id":"2303.10917","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-fly-text-retrieval-for-end-to-end-asr","title":"On-the-fly Text Retrieval for End-to-End ASR Adaptation","date":"2023-03-20","arxiv_id":"2303.10942","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-learning-system-for-domain-specific","title":"A Deep Learning System for Domain-specific Speech Recognition","date":"2023-03-18","arxiv_id":"2303.10510","repositories_listed":0,"syntology":null},{"url":null,"slug":"distillw2v2-a-small-and-streaming-wav2vec-2-0","title":"DistillW2V2: A Small and Streaming Wav2vec 2.0 Based ASR Model","date":"2023-03-16","arxiv_id":"2303.09278","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-perceptual-quality-intelligibility","title":"Improving Perceptual Quality, Intelligibility, and Acoustics on VoIP Platforms","date":"2023-03-16","arxiv_id":"2303.09048","repositories_listed":0,"syntology":null},{"url":null,"slug":"trustera-a-live-conversation-redaction-system","title":"Trustera: A Live Conversation Redaction System","date":"2023-03-16","arxiv_id":"2303.09438","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-information-matters-for-asr-error","title":"Visual Information Matters for ASR Error Correction","date":"2023-03-16","arxiv_id":"2303.10160","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-large-scale-multimodal-dataset-of-human","title":"A large-scale multimodal dataset of human speech recognition","date":"2023-03-15","arxiv_id":"2303.08295","repositories_listed":0,"syntology":null},{"url":null,"slug":"sharing-low-rank-conformer-weights-for-tiny","title":"Sharing Low Rank Conformer Weights for Tiny Always-On Ambient Speech Recognition Models","date":"2023-03-15","arxiv_id":"2303.08343","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-alignment-mask-ctc-improved-mask-ctc","title":"Dynamic Alignment Mask CTC: Improved Mask-CTC with Aligned Cross Entropy","date":"2023-03-14","arxiv_id":"2303.07687","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-accented-speech-recognition-with","title":"Improving Accented Speech Recognition with Multi-Domain Training","date":"2023-03-14","arxiv_id":"2303.07924","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-selective-label-smoothing-for","title":"Context-Aware Selective Label Smoothing for Calibrating Sequence Recognition Model","date":"2023-03-13","arxiv_id":"2303.06946","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-the-intent-classification-accuracy","title":"Improving the Intent Classification accuracy in Noisy Environment","date":"2023-03-12","arxiv_id":"2303.06585","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-npu-aslp-system-for-audio-visual-speech","title":"The NPU-ASLP System for Audio-Visual Speech Recognition in MISP 2022 Challenge","date":"2023-03-11","arxiv_id":"2303.06341","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-overview-on-language-models-recent","title":"An Overview on Language Models: Recent Developments and Outlook","date":"2023-03-10","arxiv_id":"2303.05759","repositories_listed":0,"syntology":null},{"url":null,"slug":"clinical-bertscore-an-improved-measure-of","title":"Clinical BERTScore: An Improved Measure of Automatic Speech Recognition Performance in Clinical Settings","date":"2023-03-10","arxiv_id":"2303.05737","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixpgd-hybrid-adversarial-training-for-speech","title":"MIXPGD: Hybrid Adversarial Training for Speech Recognition Systems","date":"2023-03-10","arxiv_id":"2303.05758","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-language-agnostic-wer","title":"Unsupervised Language agnostic WER Standardization","date":"2023-03-09","arxiv_id":"2303.05046","repositories_listed":0,"syntology":null},{"url":null,"slug":"wav2vec-and-its-current-potential-to","title":"wav2vec and its current potential to Automatic Speech Recognition in German for the usage in Digital History: A comparative assessment of available ASR-technologies for the use in cultural heritage contexts","date":"2023-03-06","arxiv_id":"2303.06026","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-speech-recognition-a-survey","title":"End-to-End Speech Recognition: A Survey","date":"2023-03-03","arxiv_id":"2303.03329","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-trained-model-representations-and-their","title":"Pre-trained Model Representations and their Robustness against Noise for Speech Emotion Analysis","date":"2023-03-03","arxiv_id":"2303.03177","repositories_listed":0,"syntology":null},{"url":null,"slug":"sottovoce-an-ultrasound-imaging-based-silent","title":"SottoVoce: An Ultrasound Imaging-Based Silent Speech Interaction Using Deep Neural Networks","date":"2023-03-03","arxiv_id":"2303.01758","repositories_listed":0,"syntology":null},{"url":null,"slug":"google-usm-scaling-automatic-speech","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","date":"2023-03-02","arxiv_id":"2303.01037","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-large-text-corpora-for-end-to-end","title":"Leveraging Large Text Corpora for End-to-End Speech Summarization","date":"2023-03-02","arxiv_id":"2303.00978","repositories_listed":0,"syntology":null},{"url":null,"slug":"liteg2p-a-fast-light-and-high-accuracy-model","title":"LiteG2P: A fast, light and high accuracy model for grapheme-to-phoneme conversion","date":"2023-03-02","arxiv_id":"2303.01086","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-redundancy-in-multiple-audio","title":"Leveraging Redundancy in Multiple Audio Signals for Far-Field Speech Recognition","date":"2023-03-01","arxiv_id":"2303.00692","repositories_listed":0,"syntology":null},{"url":null,"slug":"n-best-t5-robust-asr-error-correction-using","title":"N-best T5: Robust ASR Error Correction using Multiple Input Hypotheses and Constrained Decoding Space","date":"2023-03-01","arxiv_id":"2303.00456","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthetic-cross-accent-data-augmentation-for","title":"Synthetic Cross-accent Data Augmentation for Automatic Speech Recognition","date":"2023-03-01","arxiv_id":"2303.00802","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-token-wise-beam-search-algorithm-for-rnn-t","title":"A Token-Wise Beam Search Algorithm for RNN-T","date":"2023-02-28","arxiv_id":"2302.14357","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-self-supervised-pre-trained-asr","title":"Exploring Self-supervised Pre-trained ASR Models For Dysarthric and Elderly Speech Recognition","date":"2023-02-28","arxiv_id":"2302.14564","repositories_listed":0,"syntology":null},{"url":null,"slug":"practice-of-the-conformer-enhanced-audio","title":"Practice of the conformer enhanced AUDIO-VISUAL HUBERT on Mandarin and English","date":"2023-02-28","arxiv_id":"2303.12187","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparison-of-speech-data-augmentation","title":"A Comparison of Speech Data Augmentation Methods Using S3PRL Toolkit","date":"2023-02-27","arxiv_id":"2303.00510","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-visual-forced-alignment-learning-to","title":"Deep Visual Forced Alignment: Learning to Align Transcription with Talking Face Video","date":"2023-02-27","arxiv_id":"2303.08670","repositories_listed":0,"syntology":null},{"url":null,"slug":"diacritic-recognition-performance-in-arabic","title":"Diacritic Recognition Performance in Arabic ASR","date":"2023-02-27","arxiv_id":"2302.14022","repositories_listed":0,"syntology":null},{"url":null,"slug":"diagonal-state-space-augmented-transformers","title":"Diagonal State Space Augmented Transformers for Speech Recognition","date":"2023-02-27","arxiv_id":"2302.14120","repositories_listed":0,"syntology":null},{"url":null,"slug":"explanations-for-automatic-speech-recognition","title":"Explanations for Automatic Speech Recognition","date":"2023-02-27","arxiv_id":"2302.14062","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-medical-speech-to-text-accuracy","title":"Improving Medical Speech-to-Text Accuracy with Vision-Language Pre-training Model","date":"2023-02-27","arxiv_id":"2303.00091","repositories_listed":0,"syntology":null},{"url":null,"slug":"mole-mixture-of-language-experts-for-multi","title":"MoLE : Mixture of Language Experts for Multi-Lingual Automatic Speech Recognition","date":"2023-02-27","arxiv_id":"2302.13750","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-audio-to-symbolic-encoding","title":"From Audio to Symbolic Encoding","date":"2023-02-26","arxiv_id":"2302.13401","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-corpora-divergence-based-unsupervised","title":"Speech Corpora Divergence Based Unsupervised Data Selection for ASR","date":"2023-02-26","arxiv_id":"2302.13222","repositories_listed":0,"syntology":null},{"url":null,"slug":"chaotic-variational-auto-encoder-based","title":"Chaotic Variational Auto encoder-based Adversarial Machine Learning","date":"2023-02-25","arxiv_id":"2302.12959","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-knowledge-distillation-of-self","title":"Ensemble knowledge distillation of self-supervised speech models","date":"2023-02-24","arxiv_id":"2302.12757","repositories_listed":0,"syntology":null},{"url":null,"slug":"factual-consistency-oriented-speech","title":"Factual Consistency Oriented Speech Recognition","date":"2023-02-24","arxiv_id":"2302.12369","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-automatic-speech-recognition-in-an","title":"Evaluating Automatic Speech Recognition in an Incremental Setting","date":"2023-02-23","arxiv_id":"2302.12049","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-of-auto-regressive-hidden","title":"Generalization of Auto-Regressive Hidden Markov Models to Non-Linear Dynamics and Unit Quaternion Observation Space","date":"2023-02-23","arxiv_id":"2302.11834","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-contextual-spelling-correction-by","title":"Improving Contextual Spelling Correction by External Acoustics Attention and Semantic Aware Data Augmentation","date":"2023-02-22","arxiv_id":"2302.11192","repositories_listed":0,"syntology":null},{"url":null,"slug":"madi-inter-domain-matching-and-intra-domain","title":"MADI: Inter-domain Matching and Intra-domain Discrimination for Cross-domain Speech Recognition","date":"2023-02-22","arxiv_id":"2302.11224","repositories_listed":0,"syntology":null},{"url":null,"slug":"uml-a-universal-monolingual-output-layer-for","title":"UML: A Universal Monolingual Output Layer for Multilingual ASR","date":"2023-02-22","arxiv_id":"2302.11186","repositories_listed":0,"syntology":null},{"url":null,"slug":"connecting-humanities-and-social-sciences","title":"Connecting Humanities and Social Sciences: Applying Language and Speech Technology to Online Panel Surveys","date":"2023-02-21","arxiv_id":"2302.10593","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-asr-free-fluency-scoring-approach-with","title":"An ASR-free Fluency Scoring Approach with Self-Supervised Learning","date":"2023-02-20","arxiv_id":"2302.09928","repositories_listed":0,"syntology":null},{"url":null,"slug":"emphasizing-unseen-words-new-vocabulary","title":"Emphasizing Unseen Words: New Vocabulary Acquisition for End-to-End Speech Recognition","date":"2023-02-20","arxiv_id":"2302.09723","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-methods-in-deep-learning-a","title":"Optimization Methods in Deep Learning: A Comprehensive Overview","date":"2023-02-19","arxiv_id":"2302.09566","repositories_listed":0,"syntology":null},{"url":null,"slug":"front-end-adapter-adapting-front-end-input-of","title":"Front-End Adapter: Adapting Front-End Input of Speech based Self-Supervised Learning for Speech Recognition","date":"2023-02-18","arxiv_id":"2302.09331","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-and-language-change-detection-using","title":"Speaker and Language Change Detection using Wav2vec2 and Whisper","date":"2023-02-18","arxiv_id":"2302.09381","repositories_listed":0,"syntology":null},{"url":"/paper/audio-visual-speech-and-gesture-recognition","slug":"audio-visual-speech-and-gesture-recognition","title":"Audio-Visual Speech and Gesture Recognition by Sensors of Mobile Devices","date":"2023-02-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/conformers-are-all-you-need-for-visual-speech","slug":"conformers-are-all-you-need-for-visual-speech","title":"Conformers are All You Need for Visual Speech Recognition","date":"2023-02-17","arxiv_id":"2302.10915","repositories_listed":0,"syntology":null},{"url":null,"slug":"massively-multilingual-shallow-fusion-with","title":"Massively Multilingual Shallow Fusion with Large Language Models","date":"2023-02-17","arxiv_id":"2302.08917","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-equality-in-machine-learning","title":"Measuring Equality in Machine Learning Security Defenses: A Case Study in Speech Recognition","date":"2023-02-17","arxiv_id":"2302.08973","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptable-end-to-end-asr-models-using","title":"Adaptable End-to-End ASR Models using Replaceable Internal LMs and Residual Softmax","date":"2023-02-16","arxiv_id":"2302.08579","repositories_listed":0,"syntology":null},{"url":"/paper/adaptive-axonal-delays-in-feedforward-spiking","slug":"adaptive-axonal-delays-in-feedforward-spiking","title":"Adaptive Axonal Delays in feedforward spiking neural networks for accurate spoken word recognition","date":"2023-02-16","arxiv_id":"2302.08607","repositories_listed":0,"syntology":null},{"url":null,"slug":"jeit-joint-end-to-end-model-and-internal","title":"JEIT: Joint End-to-End Model and Internal Language Model Training for Speech Recognition","date":"2023-02-16","arxiv_id":"2302.08583","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-tuning-of-deep-neural-networks-for","title":"Prompt Tuning of Deep Neural Networks for Speaker-adaptive Visual Speech Recognition","date":"2023-02-16","arxiv_id":"2302.08102","repositories_listed":0,"syntology":null},{"url":null,"slug":"speaker-change-detection-for-transformer","title":"Speaker Change Detection for Transformer Transducer ASR","date":"2023-02-16","arxiv_id":"2302.08549","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilising-and-accelerating-light-gated","title":"Stabilising and accelerating light gated recurrent units for automatic speech recognition","date":"2023-02-16","arxiv_id":"2302.10144","repositories_listed":0,"syntology":null},{"url":null,"slug":"asr-bundestag-a-large-scale-political-debate","title":"ASR Bundestag: A Large-Scale political debate dataset in German","date":"2023-02-12","arxiv_id":"2302.06008","repositories_listed":0,"syntology":null},{"url":null,"slug":"av-data2vec-self-supervised-learning-of-audio","title":"AV-data2vec: Self-supervised Learning of Audio-Visual Speech Representations with Contextualized Target Representations","date":"2023-02-10","arxiv_id":"2302.06419","repositories_listed":0,"syntology":null},{"url":null,"slug":"patcorrect-non-autoregressive-phoneme","title":"PATCorrect: Non-autoregressive Phoneme-augmented Transformer for ASR Error Correction","date":"2023-02-10","arxiv_id":"2302.05040","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-supplementary-text-data-to-kick","title":"Leveraging supplementary text data to kick-start automatic speech recognition system development with limited transcriptions","date":"2023-02-09","arxiv_id":"2302.04975","repositories_listed":0,"syntology":null},{"url":null,"slug":"lut-nn-towards-unified-neural-network","title":"LUT-NN: Empower Efficient Neural Network Inference with Centroid Learning and Table Lookup","date":"2023-02-07","arxiv_id":"2302.03213","repositories_listed":0,"syntology":null},{"url":null,"slug":"pamp-a-unified-framework-boosting-low","title":"MAC: A unified framework boosting low resource automatic speech recognition","date":"2023-02-05","arxiv_id":"2302.03498","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-domain-adaptation-for-speech","title":"Efficient Domain Adaptation for Speech Foundation Models","date":"2023-02-03","arxiv_id":"2302.01496","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-rare-words-recognition-through","title":"Improving Rare Words Recognition through Homophone Extension and Unified Writing for Low-resource Cantonese Speech Recognition","date":"2023-02-02","arxiv_id":"2302.00836","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-attention-map-reuse-for-efficient","title":"Exploring Attention Map Reuse for Efficient Transformer Neural Networks","date":"2023-01-29","arxiv_id":"2301.12444","repositories_listed":0,"syntology":null},{"url":null,"slug":"fillers-in-spoken-language-understanding","title":"Fillers in Spoken Language Understanding: Computational and Psycholinguistic Perspectives","date":"2023-01-25","arxiv_id":"2301.10761","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparison-of-temporal-encoders-for","title":"A Comparison of Temporal Encoders for Neuromorphic Keyword Spotting with Few Neurons","date":"2023-01-24","arxiv_id":"2301.09962","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-purpose-audio-visual-corpus-for-multi","title":"A Multi-Purpose Audio-Visual Corpus for Multi-Modal Persian Speech Recognition: the Arman-AV Dataset","date":"2023-01-21","arxiv_id":"2301.10180","repositories_listed":0,"syntology":null},{"url":null,"slug":"regeneration-learning-a-learning-paradigm-for","title":"Regeneration Learning: A Learning Paradigm for Data Generation","date":"2023-01-21","arxiv_id":"2301.08846","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-agnostic-data-driven-inverse-text","title":"Language Agnostic Data-Driven Inverse Text Normalization","date":"2023-01-20","arxiv_id":"2301.08506","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-english-to-more-languages-parameter","title":"From English to More Languages: Parameter-Efficient Model Reprogramming for Cross-Lingual Speech Recognition","date":"2023-01-19","arxiv_id":"2301.07851","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-multilingual-speech-representation","title":"Adapting Multilingual Speech Representation Model for a New, Underresourced Language through Multilingual Fine-tuning and Continued Pretraining","date":"2023-01-18","arxiv_id":"2301.07295","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesspeech-a-bayesian-transformer-network","title":"BayesSpeech: A Bayesian Transformer Network for Automatic Speech Recognition","date":"2023-01-16","arxiv_id":"2301.11276","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-resolution-location-based-training-for","title":"Multi-resolution location-based training for multi-channel continuous speech separation","date":"2023-01-16","arxiv_id":"2301.06458","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-kaldi-for-automatic-speech-recognition","title":"Using Kaldi for Automatic Speech Recognition of Conversational Austrian German","date":"2023-01-16","arxiv_id":"2301.06475","repositories_listed":0,"syntology":null},{"url":null,"slug":"rationalizing-predictions-by-adversarial","title":"Rationalizing Predictions by Adversarial Information Calibration","date":"2023-01-15","arxiv_id":"2301.06009","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-punctuation-a-novel-punctuation","title":"Streaming Punctuation: A Novel Punctuation Technique Leveraging Bidirectional Context for Continuous Speech Recognition","date":"2023-01-10","arxiv_id":"2301.03819","repositories_listed":0,"syntology":null},{"url":null,"slug":"fullstop-punctuation-and-segmentation","title":"FullStop:Punctuation and Segmentation Prediction for Dutch with Transformers","date":"2023-01-09","arxiv_id":"2301.03319","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivariant-and-steerable-neural-networks-a","title":"Equivariant and Steerable Neural Networks: A review with special emphasis on the symmetric group","date":"2023-01-08","arxiv_id":"2301.03019","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-external-off-policy-speech-to-text","title":"Using External Off-Policy Speech-To-Text Mappings in Contextual End-To-End Automated Speech Recognition","date":"2023-01-06","arxiv_id":"2301.02736","repositories_listed":0,"syntology":null},{"url":null,"slug":"revise-self-supervised-speech-resynthesis-1","title":"ReVISE: Self-Supervised Speech Resynthesis With Visual Input for Universal and Generalized Speech Regeneration","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-pre-training-for-vietnamese","title":"Unsupervised Pre-Training for Vietnamese Automatic Speech Recognition in the HYKIST Project","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-augmented-lookup-dictionary-based","title":"Memory Augmented Lookup Dictionary based Language Modeling for Automatic Speech Recognition","date":"2022-12-30","arxiv_id":"2301.00066","repositories_listed":0,"syntology":null},{"url":null,"slug":"macro-block-dropout-for-improved","title":"Macro-block dropout for improved regularization in training end-to-end speech recognition models","date":"2022-12-29","arxiv_id":"2212.14149","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-be-so-sure-boosting-asr-decoding-via","title":"Don't Be So Sure! Boosting ASR Decoding via Confidence Relaxation","date":"2022-12-27","arxiv_id":"2212.13378","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignment-entropy-regularization","title":"Alignment Entropy Regularization","date":"2022-12-22","arxiv_id":"2212.12442","repositories_listed":0,"syntology":null},{"url":null,"slug":"4d-asr-joint-modeling-of-ctc-attention","title":"4D ASR: Joint modeling of CTC, Attention, Transducer, and Mask-Predict decoders","date":"2022-12-21","arxiv_id":"2212.10818","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-automatic-speech-recognition-model","title":"End-to-End Automatic Speech Recognition model for the Sudanese Dialect","date":"2022-12-21","arxiv_id":"2212.10826","repositories_listed":0,"syntology":null},{"url":"/paper/revise-self-supervised-speech-resynthesis","slug":"revise-self-supervised-speech-resynthesis","title":"ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement","date":"2022-12-21","arxiv_id":"2212.11377","repositories_listed":0,"syntology":null},{"url":null,"slug":"slue-phase-2-a-benchmark-suite-of-diverse","title":"SLUE Phase-2: A Benchmark Suite of Diverse Spoken Language Understanding Tasks","date":"2022-12-20","arxiv_id":"2212.10525","repositories_listed":0,"syntology":null},{"url":null,"slug":"mu-2-slam-multitask-multilingual-speech-and","title":"Mu$^{2}$SLAM: Multitask, Multilingual Speech and Language Models","date":"2022-12-19","arxiv_id":"2212.09553","repositories_listed":0,"syntology":null},{"url":null,"slug":"adatrans-adapting-with-boundary-based","title":"AdaTranS: Adapting with Boundary-based Shrinking for End-to-End Speech Translation","date":"2022-12-17","arxiv_id":"2212.08911","repositories_listed":0,"syntology":null}],"record_sha256":"562f98bfd9e019134cefec9bdec0b413785ee9cbf1a8b4dcca1da23039ccf1ee","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}