{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/language-modelling/papers/134","list_of":"/task/language-modelling","task":"Language Modelling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":134,"pages_in_order":177,"rows_per_page":100,"rows":[13301,13400],"of":17610,"counts":{"archive_papers_tagged":17610,"with_a_code_link":7012,"where_syntology_ran_a_sample":2428,"not_listed_spam_title":0,"listed":17610,"listed_where_code_ran":2428,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":2027,"every_run_a_failure_of_syntologys_instrument":401,"listed_with_a_run_with_no_instrument_failure":2027,"listed_every_run_a_failure_of_syntologys_instrument":401,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/language-modelling","prev":"/task/language-modelling/papers/133","next":"/task/language-modelling/papers/135","papers":[{"url":null,"slug":"leveraging-per-image-token-consistency-for","title":"Leveraging per Image-Token Consistency for Vision-Language Pre-training","date":"2022-11-20","arxiv_id":"2211.15398","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-users-social-network-embeddings","title":"Leveraging Users' Social Network Embeddings for Fake News Detection on Twitter","date":"2022-11-19","arxiv_id":"2211.10672","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-human-motion-generation-from-the-text-via","title":"3d human motion generation from the text via gesture action classification and the autoregressive model","date":"2022-11-18","arxiv_id":"2211.10003","repositories_listed":0,"syntology":null},{"url":null,"slug":"metadata-might-make-language-models-better","title":"Metadata Might Make Language Models Better","date":"2022-11-18","arxiv_id":"2211.10086","repositories_listed":0,"syntology":null},{"url":null,"slug":"longfnt-long-form-speech-recognition-with","title":"LongFNT: Long-form Speech Recognition with Factorized Neural Transducer","date":"2022-11-17","arxiv_id":"2211.09412","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-with-large-language-models-via","title":"CAPE: Corrective Actions from Precondition Errors using Large Language Models","date":"2022-11-17","arxiv_id":"2211.09935","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompting-palm-for-translation-assessing","title":"Prompting PaLM for Translation: Assessing Strategies and Performance","date":"2022-11-16","arxiv_id":"2211.09102","repositories_listed":0,"syntology":null},{"url":null,"slug":"technical-report-on-neural-language-models","title":"Technical Report on Neural Language Models and Few-Shot Learning for Systematic Requirements Processing in MDSE","date":"2022-11-16","arxiv_id":"2211.09084","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-computationally-verifiable-semantic","title":"Towards Computationally Verifiable Semantic Grounding for Language Models","date":"2022-11-16","arxiv_id":"2211.09070","repositories_listed":0,"syntology":null},{"url":null,"slug":"tsmind-alibaba-and-soochow-university-s","title":"TSMind: Alibaba and Soochow University's Submission to the WMT22 Translation Suggestion Task","date":"2022-11-16","arxiv_id":"2211.08987","repositories_listed":0,"syntology":null},{"url":null,"slug":"ed-faith-evaluating-dialogue-summarization-on","title":"ED-FAITH: Evaluating Dialogue Summarization on Faithfulness","date":"2022-11-15","arxiv_id":"2211.08464","repositories_listed":0,"syntology":null},{"url":null,"slug":"empowering-language-models-with-knowledge","title":"Empowering Language Models with Knowledge Graph Reasoning for Question Answering","date":"2022-11-15","arxiv_id":"2211.08380","repositories_listed":0,"syntology":null},{"url":null,"slug":"fedtune-a-deep-dive-into-efficient-federated","title":"FedTune: A Deep Dive into Efficient Federated Fine-Tuning with Pre-trained Transformers","date":"2022-11-15","arxiv_id":"2211.08025","repositories_listed":0,"syntology":null},{"url":null,"slug":"introducing-semantics-into-speech-encoders","title":"Introducing Semantics into Speech Encoders","date":"2022-11-15","arxiv_id":"2211.08402","repositories_listed":0,"syntology":null},{"url":null,"slug":"reasoning-circuits-few-shot-multihop-question","title":"Reasoning Circuits: Few-shot Multihop Question Generation with Structured Rationales","date":"2022-11-15","arxiv_id":"2211.08466","repositories_listed":0,"syntology":null},{"url":null,"slug":"relationship-of-the-language-distance-to","title":"Relationship of the language distance to English ability of a country","date":"2022-11-15","arxiv_id":"2211.07855","repositories_listed":0,"syntology":null},{"url":null,"slug":"robbert-2022-updating-a-dutch-language-model","title":"RobBERT-2022: Updating a Dutch Language Model to Account for Evolving Language Use","date":"2022-11-15","arxiv_id":"2211.08192","repositories_listed":0,"syntology":null},{"url":null,"slug":"albert-with-knowledge-graph-encoder-utilizing","title":"ALBERT with Knowledge Graph Encoder Utilizing Semantic Similarity for Commonsense Question Answering","date":"2022-11-14","arxiv_id":"2211.07065","repositories_listed":0,"syntology":null},{"url":null,"slug":"grafting-pre-trained-models-for-multimodal","title":"Grafting Pre-trained Models for Multimodal Headline Generation","date":"2022-11-14","arxiv_id":"2211.07210","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-mathematics-formalisation-assistant","title":"Towards a Mathematics Formalisation Assistant using Large Language Models","date":"2022-11-14","arxiv_id":"2211.07524","repositories_listed":0,"syntology":null},{"url":null,"slug":"textual-data-augmentation-for-patient","title":"Textual Data Augmentation for Patient Outcomes Prediction","date":"2022-11-13","arxiv_id":"2211.06778","repositories_listed":0,"syntology":null},{"url":null,"slug":"docut5-seq2seq-sql-generation-with-table","title":"DocuT5: Seq2seq SQL Generation with Table Documentation","date":"2022-11-11","arxiv_id":"2211.06193","repositories_listed":0,"syntology":null},{"url":null,"slug":"bert-in-plutarch-s-shadows","title":"BERT in Plutarch's Shadows","date":"2022-11-10","arxiv_id":"2211.05673","repositories_listed":0,"syntology":null},{"url":null,"slug":"formlm-recommending-creation-ideas-for-online","title":"FormLM: Recommending Creation Ideas for Online Forms by Modelling Semantic and Structural Information","date":"2022-11-10","arxiv_id":"2211.05284","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-learning-for-domain-adaptation-in-task","title":"Prompt Learning for Domain Adaptation in Task-Oriented Dialogue","date":"2022-11-10","arxiv_id":"2211.05596","repositories_listed":0,"syntology":null},{"url":null,"slug":"syntax-guided-domain-adaptation-for-aspect","title":"Syntax-Guided Domain Adaptation for Aspect-based Sentiment Analysis","date":"2022-11-10","arxiv_id":"2211.05457","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-cringe-loss-learning-what-language-not-to","title":"The CRINGE Loss: Learning what language not to model","date":"2022-11-10","arxiv_id":"2211.05826","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-multi-corpora-language-model","title":"Adaptive Multi-Corpora Language Model Training for Speech Recognition","date":"2022-11-09","arxiv_id":"2211.05121","repositories_listed":0,"syntology":null},{"url":"/paper/ernie-unix2-a-unified-cross-lingual-cross","slug":"ernie-unix2-a-unified-cross-lingual-cross","title":"ERNIE-UniX2: A Unified Cross-lingual Cross-modal Framework for Understanding and Generation","date":"2022-11-09","arxiv_id":"2211.04861","repositories_listed":0,"syntology":null},{"url":null,"slug":"ff2-a-feature-fusion-two-stream-framework-for","title":"FF2: A Feature Fusion Two-Stream Framework for Punctuation Restoration","date":"2022-11-09","arxiv_id":"2211.04699","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-noisy-student-training-on-non","title":"Improving Noisy Student Training on Non-target Domain Data for Automatic Speech Recognition","date":"2022-11-09","arxiv_id":"2211.04717","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-self-supervised-peptide-sequence","title":"Training self-supervised peptide sequence models on artificially chopped proteins","date":"2022-11-09","arxiv_id":"2211.06428","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-cross-modal-interactions-in-v-l","title":"Understanding Cross-modal Interactions in V&L Models that Generate Scene Descriptions","date":"2022-11-09","arxiv_id":"2211.04971","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-with-tabular-language-models","title":"Active Learning with Tabular Language Models","date":"2022-11-08","arxiv_id":"2211.04128","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-and-data-efficient-continual-pre","title":"Parameter and Data Efficient Continual Pre-training for Robustness to Dialectal Variance in Arabic","date":"2022-11-08","arxiv_id":"2211.03966","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-conditioned-embedding-diffusion-for-text","title":"Self-conditioned Embedding Diffusion for Text Generation","date":"2022-11-08","arxiv_id":"2211.04236","repositories_listed":0,"syntology":null},{"url":null,"slug":"word-order-matters-when-you-increase-masking","title":"Word Order Matters when you Increase Masking","date":"2022-11-08","arxiv_id":"2211.04427","repositories_listed":0,"syntology":null},{"url":null,"slug":"complex-reading-comprehension-through","title":"Complex Reading Comprehension Through Question Decomposition","date":"2022-11-07","arxiv_id":"2211.03277","repositories_listed":0,"syntology":null},{"url":"/paper/probing-neural-language-models-for","slug":"probing-neural-language-models-for","title":"Probing neural language models for understanding of words of estimative probability","date":"2022-11-07","arxiv_id":"2211.03358","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompter-utilizing-large-language-model","title":"Prompter: Utilizing Large Language Model Prompting for a Data Efficient Embodied Instruction Following","date":"2022-11-07","arxiv_id":"2211.03267","repositories_listed":0,"syntology":null},{"url":null,"slug":"noisy-channel-for-automatic-text","title":"Noisy Channel for Automatic Text Simplification","date":"2022-11-06","arxiv_id":"2211.03152","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-progress-on-scalable-oversight-for","title":"Measuring Progress on Scalable Oversight for Large Language Models","date":"2022-11-04","arxiv_id":"2211.03540","repositories_listed":0,"syntology":null},{"url":null,"slug":"osic-a-new-one-stage-image-captioner-coined","title":"OSIC: A New One-Stage Image Captioner Coined","date":"2022-11-04","arxiv_id":"2211.02321","repositories_listed":0,"syntology":null},{"url":null,"slug":"circling-back-to-recurrent-models-of-language","title":"Circling Back to Recurrent Models of Language","date":"2022-11-03","arxiv_id":"2211.01848","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-statistical-representations-for-end","title":"Probing Statistical Representations For End-To-End ASR","date":"2022-11-03","arxiv_id":"2211.01993","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-large-pre-trained-language-model-to","title":"Using Large Pre-Trained Language Model to Assist FDA in Premarket Medical Device","date":"2022-11-03","arxiv_id":"2212.01217","repositories_listed":0,"syntology":null},{"url":null,"slug":"bectra-transducer-based-end-to-end-asr-with","title":"BECTRA: Transducer-based End-to-End ASR with BERT-Enhanced Encoder","date":"2022-11-02","arxiv_id":"2211.00792","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-training-can-improve","title":"Generative Adversarial Training Can Improve Neural Language Models","date":"2022-11-02","arxiv_id":"2211.09728","repositories_listed":0,"syntology":null},{"url":null,"slug":"internal-language-model-estimation-based-1","title":"Internal Language Model Estimation based Adaptive Language Model Fusion for Domain Adaptation","date":"2022-11-02","arxiv_id":"2211.00968","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-level-distillation-of-semantic","title":"Multi-level Distillation of Semantic Knowledge for Pre-training Multilingual Language Model","date":"2022-11-02","arxiv_id":"2211.01200","repositories_listed":0,"syntology":null},{"url":null,"slug":"numerical-optimizations-for-weighted-low-rank","title":"Numerical Optimizations for Weighted Low-rank Estimation on Language Model","date":"2022-11-02","arxiv_id":"2211.09718","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-zero-shot-code-switched-speech","title":"Towards Zero-Shot Code-Switched Speech Recognition","date":"2022-11-02","arxiv_id":"2211.01458","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-quantitative-analysis-of-comparison-of","title":"A Quantitative Analysis of Comparison of Emoji Sentiment: Taiwan Mandarin Users and English Users","date":"2022-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hantrans-an-empirical-study-on-cross-era","title":"HanTrans: An Empirical Study on Cross-Era Transferability of Chinese Pre-trained Language Model","date":"2022-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-based-chinese-handwriting","title":"Language Model Based Chinese Handwriting Address Recognition","date":"2022-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-can-guide-experimental","title":"Machine learning can guide experimental approaches for protein digestibility estimations","date":"2022-11-01","arxiv_id":"2211.00625","repositories_listed":0,"syntology":null},{"url":null,"slug":"nerve-at-rocling-2022-shared-task-a","title":"NERVE at ROCLING 2022 Shared Task: A Comparison of Three Named Entity Recognition Frameworks Based on Language Model and Lexicon Approach","date":"2022-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"preserving-in-context-learning-ability-in","title":"Two-stage LLM Fine-tuning with Less Specialization and More Generalization","date":"2022-11-01","arxiv_id":"2211.00635","repositories_listed":0,"syntology":null},{"url":null,"slug":"reduce-reuse-recycle-improving-training","title":"Reduce, Reuse, Recycle: Improving Training Efficiency with Distillation","date":"2022-11-01","arxiv_id":"2211.00683","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-future-is-different-large-pre-trained","title":"The future is different: Large pre-trained language models fail in prediction tasks","date":"2022-11-01","arxiv_id":"2211.00384","repositories_listed":0,"syntology":null},{"url":"/paper/varmae-pre-training-of-variational-masked","slug":"varmae-pre-training-of-variational-masked","title":"VarMAE: Pre-training of Variational Masked Autoencoder for Domain-adaptive Language Understanding","date":"2022-11-01","arxiv_id":"2211.00430","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-yet-effective-approach-to-finding","title":"A Simple, Yet Effective Approach to Finding Biases in Code Generation","date":"2022-10-31","arxiv_id":"2211.00609","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-sequences-by-learning-to-self","title":"Generating Sequences by Learning to Self-Correct","date":"2022-10-31","arxiv_id":"2211.00053","repositories_listed":0,"syntology":null},{"url":null,"slug":"modular-hybrid-autoregressive-transducer","title":"Modular Hybrid Autoregressive Transducer","date":"2022-10-31","arxiv_id":"2210.17049","repositories_listed":0,"syntology":null},{"url":null,"slug":"pneg-prompt-based-negative-response-1","title":"Pneg: Prompt-based Negative Response Generation for Dialogue Response Selection Task","date":"2022-10-31","arxiv_id":"2210.17238","repositories_listed":0,"syntology":null},{"url":null,"slug":"tables-to-latex-structure-and-content","title":"Tables to LaTeX: structure and content extraction from scientific tables","date":"2022-10-31","arxiv_id":"2210.17246","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-decompose-hypothetical-question","title":"Learning to Decompose: Hypothetical Question Decomposition Based on Comparable Texts","date":"2022-10-30","arxiv_id":"2210.16865","repositories_listed":0,"syntology":null},{"url":null,"slug":"token2vec-a-joint-self-supervised-pre","title":"token2vec: A Joint Self-Supervised Pre-training Framework Using Unpaired Speech and Text","date":"2022-10-30","arxiv_id":"2210.16755","repositories_listed":0,"syntology":null},{"url":null,"slug":"bert-meets-ctc-new-formulation-of-end-to-end","title":"BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model","date":"2022-10-29","arxiv_id":"2210.16663","repositories_listed":0,"syntology":null},{"url":null,"slug":"ntulm-enriching-social-media-text-1","title":"NTULM: Enriching Social Media Text Representations with Non-Textual Units","date":"2022-10-29","arxiv_id":"2210.16586","repositories_listed":0,"syntology":null},{"url":null,"slug":"dimbert-learning-vision-language-grounded","title":"DiMBERT: Learning Vision-Language Grounded Representations with Disentangled Multimodal-Attention","date":"2022-10-28","arxiv_id":"2210.16431","repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-engineering-vs-bert-on-twitter-data","title":"Feature Engineering vs BERT on Twitter Data","date":"2022-10-28","arxiv_id":"2210.16168","repositories_listed":0,"syntology":null},{"url":"/paper/knowledge-in-context-towards-knowledgeable","slug":"knowledge-in-context-towards-knowledgeable","title":"Knowledge-in-Context: Towards Knowledgeable Semi-Parametric Language Models","date":"2022-10-28","arxiv_id":"2210.16433","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-structure-building-in-the-brain-with","title":"Modeling structure-building in the brain with CCG parsing and large language models","date":"2022-10-28","arxiv_id":"2210.16147","repositories_listed":0,"syntology":null},{"url":null,"slug":"upainting-unified-text-to-image-diffusion","title":"UPainting: Unified Text-to-Image Diffusion Generation with Cross-modal Guidance","date":"2022-10-28","arxiv_id":"2210.16031","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-joint-representation-of-human-motion","title":"Learning Joint Representation of Human Motion and Language","date":"2022-10-27","arxiv_id":"2210.15187","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearest-neighbor-language-models-for","title":"Nearest Neighbor Language Models for Stylistic Controllable Generation","date":"2022-10-27","arxiv_id":"2210.15762","repositories_listed":0,"syntology":null},{"url":null,"slug":"san-a-robust-end-to-end-asr-model","title":"SAN: a robust end-to-end ASR model architecture","date":"2022-10-27","arxiv_id":"2210.15285","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-language-learning-from-raw","title":"Self-supervised language learning from raw audio: Lessons from the Zero Resource Speech Challenge","date":"2022-10-27","arxiv_id":"2210.15759","repositories_listed":0,"syntology":null},{"url":null,"slug":"seq2seq-sc-end-to-end-semantic-communication","title":"Seq2Seq-SC: End-to-End Semantic Communication Systems with Pre-trained Language Model","date":"2022-10-27","arxiv_id":"2210.15237","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulating-realistic-speech-overlaps-improves","title":"Simulating realistic speech overlaps improves multi-talker ASR","date":"2022-10-27","arxiv_id":"2210.15715","repositories_listed":0,"syntology":null},{"url":null,"slug":"bloom-library-multimodal-datasets-in-300","title":"Bloom Library: Multimodal Datasets in 300+ Languages for a Variety of Downstream Tasks","date":"2022-10-26","arxiv_id":"2210.14712","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-pre-training-paradigm-for","title":"Incorporating Pre-training Paradigm for Antibody Sequence-Structure Co-design","date":"2022-10-26","arxiv_id":"2211.08406","repositories_listed":0,"syntology":null},{"url":null,"slug":"piloting-copilot-and-codex-hot-temperature","title":"Piloting Copilot, Codex, and StarCoder2: Hot Temperature, Cold Prompts, or Black Magic?","date":"2022-10-26","arxiv_id":"2210.14699","repositories_listed":0,"syntology":null},{"url":null,"slug":"cloning-ideology-and-style-using-deep","title":"Cloning Ideology and Style using Deep Learning","date":"2022-10-25","arxiv_id":"2211.07712","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-language-models-for","title":"Differentially Private Language Models for Secure Data Sharing","date":"2022-10-25","arxiv_id":"2210.13918","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-mechanism-priming-effects-in-hindi-word","title":"Dual Mechanism Priming Effects in Hindi Word Order","date":"2022-10-25","arxiv_id":"2210.13938","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-better-intent-representations-for","title":"Learning Better Intent Representations for Financial Open Intent Classification","date":"2022-10-25","arxiv_id":"2210.14304","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-open-data-and-task-augmentation-to","title":"Leveraging Open Data and Task Augmentation to Automated Behavioral Coding of Psychotherapy Conversations in Low-Resource Scenarios","date":"2022-10-25","arxiv_id":"2210.14254","repositories_listed":0,"syntology":null},{"url":null,"slug":"linguistic-enhanced-transformer-with-ctc","title":"Linguistic-Enhanced Transformer with CTC Embedding for Speech Recognition","date":"2022-10-25","arxiv_id":"2210.14725","repositories_listed":0,"syntology":null},{"url":null,"slug":"rich-knowledge-sources-bring-complex","title":"Rich Knowledge Sources Bring Complex Knowledge Conflicts: Recalibrating Models to Reflect Conflicting Evidence","date":"2022-10-25","arxiv_id":"2210.13701","repositories_listed":0,"syntology":null},{"url":null,"slug":"same-pre-training-loss-better-downstream","title":"Same Pre-training Loss, Better Downstream: Implicit Bias Matters for Language Models","date":"2022-10-25","arxiv_id":"2210.14199","repositories_listed":0,"syntology":null},{"url":null,"slug":"fcm-forgetful-causal-masking-makes-causal","title":"Towards Better Few-Shot and Finetuning Performance with Forgetful Causal Language Models","date":"2022-10-24","arxiv_id":"2210.13432","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bert-based-deep-learning-approach-for","title":"A BERT-based Deep Learning Approach for Reputation Analysis in Social Media","date":"2022-10-23","arxiv_id":"2211.01954","repositories_listed":0,"syntology":null},{"url":null,"slug":"discriminative-language-model-as-semantic","title":"Discriminative Language Model as Semantic Consistency Scorer for Prompt-based Few-Shot Text Classification","date":"2022-10-23","arxiv_id":"2210.12763","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-language-models-understand-measurements","title":"Do Language Models Understand Measurements?","date":"2022-10-23","arxiv_id":"2210.12694","repositories_listed":0,"syntology":null},{"url":null,"slug":"hard-gate-knowledge-distillation-leverage","title":"Hard Gate Knowledge Distillation -- Leverage Calibration for Robust and Reliable Language Model","date":"2022-10-22","arxiv_id":"2210.12427","repositories_listed":0,"syntology":null},{"url":null,"slug":"lmpriors-pre-trained-language-models-as-task","title":"LMPriors: Pre-Trained Language Models as Task-Specific Priors","date":"2022-10-22","arxiv_id":"2210.12530","repositories_listed":0,"syntology":null},{"url":null,"slug":"p-3-lm-probabilistically-permuted-prophet","title":"P$^3$LM: Probabilistically Permuted Prophet Language Modeling for Generative Pre-Training","date":"2022-10-22","arxiv_id":"2210.12339","repositories_listed":0,"syntology":null},{"url":null,"slug":"pentatron-personalized-context-aware","title":"PENTATRON: PErsonalized coNText-Aware Transformer for Retrieval-based cOnversational uNderstanding","date":"2022-10-22","arxiv_id":"2210.12308","repositories_listed":0,"syntology":null}],"record_sha256":"d9de349c4404f405498cfb747aa2c26ac65c9c382e2883040a20d508b9c21c88","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}