{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/language-modelling/papers/133","list_of":"/task/language-modelling","task":"Language Modelling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":133,"pages_in_order":177,"rows_per_page":100,"rows":[13201,13300],"of":17610,"counts":{"archive_papers_tagged":17610,"with_a_code_link":7012,"where_syntology_ran_a_sample":2428,"not_listed_spam_title":0,"listed":17610,"listed_where_code_ran":2428,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":2027,"every_run_a_failure_of_syntologys_instrument":401,"listed_with_a_run_with_no_instrument_failure":2027,"listed_every_run_a_failure_of_syntologys_instrument":401,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/language-modelling","prev":"/task/language-modelling/papers/132","next":"/task/language-modelling/papers/134","papers":[{"url":null,"slug":"impakt-a-dataset-for-open-schema-knowledge","title":"ImPaKT: A Dataset for Open-Schema Knowledge Base Construction","date":"2022-12-21","arxiv_id":"2212.10770","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-augmented-linear-probing-scaling","title":"Prompt-Augmented Linear Probing: Scaling beyond the Limit of Few-shot In-Context Learners","date":"2022-12-21","arxiv_id":"2212.10873","repositories_listed":0,"syntology":null},{"url":null,"slug":"serengeti-massively-multilingual-language","title":"SERENGETI: Massively Multilingual Language Models for Africa","date":"2022-12-21","arxiv_id":"2212.10785","repositories_listed":0,"syntology":null},{"url":null,"slug":"spt-semi-parametric-prompt-tuning-for","title":"SPT: Semi-Parametric Prompt Tuning for Multitask Prompted Learning","date":"2022-12-21","arxiv_id":"2212.10929","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-do-llms-know-about-financial-markets-a","title":"What do LLMs Know about Financial Markets? A Case Study on Reddit Market Sentiment Analysis","date":"2022-12-21","arxiv_id":"2212.11311","repositories_listed":0,"syntology":null},{"url":null,"slug":"zerotop-zero-shot-task-oriented-semantic","title":"ZEROTOP: Zero-Shot Task-Oriented Semantic Parsing using Large Language Models","date":"2022-12-21","arxiv_id":"2212.10815","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-measure-theoretic-characterization-of-tight","title":"A Measure-Theoretic Characterization of Tight Language Models","date":"2022-12-20","arxiv_id":"2212.10502","repositories_listed":0,"syntology":null},{"url":null,"slug":"anytod-a-programmable-task-oriented-dialog","title":"AnyTOD: A Programmable Task-Oriented Dialog System","date":"2022-12-20","arxiv_id":"2212.09939","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-current-task-oriented-dialogue-models","title":"Can Current Task-oriented Dialogue Models Automate Real-world Scenarios in the Wild?","date":"2022-12-20","arxiv_id":"2212.10504","repositories_listed":0,"syntology":null},{"url":null,"slug":"controllable-text-generation-with-language","title":"Controllable Text Generation with Language Constraints","date":"2022-12-20","arxiv_id":"2212.10466","repositories_listed":0,"syntology":null},{"url":null,"slug":"go-tuning-improving-zero-shot-learning","title":"Go-tuning: Improving Zero-shot Learning Abilities of Smaller Language Models","date":"2022-12-20","arxiv_id":"2212.10461","repositories_listed":0,"syntology":null},{"url":null,"slug":"identifying-and-manipulating-the-personality","title":"Identifying and Manipulating the Personality Traits of Language Models","date":"2022-12-20","arxiv_id":"2212.10276","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-context-learning-distillation-transferring","title":"In-context Learning Distillation: Transferring Few-shot Learning Ability of Pre-trained Language Models","date":"2022-12-20","arxiv_id":"2212.10670","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-self-attention-powerful-to-learn-code","title":"Unveiling Code Pre-Trained Models: Investigating Syntax and Semantics Capacities","date":"2022-12-20","arxiv_id":"2212.10017","repositories_listed":0,"syntology":null},{"url":null,"slug":"krona-parameter-efficient-tuning-with","title":"KronA: Parameter Efficient Tuning with Kronecker Adapter","date":"2022-12-20","arxiv_id":"2212.10650","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-modeling-with-latent-situations","title":"Language Modeling with Latent Situations","date":"2022-12-20","arxiv_id":"2212.10012","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-efficient-zero-shot-transfer-for","title":"Parameter-efficient Zero-shot Transfer for Cross-Language Dense Retrieval with Adapters","date":"2022-12-20","arxiv_id":"2212.10448","repositories_listed":0,"syntology":null},{"url":null,"slug":"perplexed-by-quality-a-perplexity-based","title":"Perplexed by Quality: A Perplexity-based Method for Adult and Harmful Content Detection in Multilingual Heterogeneous Web Data","date":"2022-12-20","arxiv_id":"2212.10440","repositories_listed":0,"syntology":null},{"url":null,"slug":"receptive-field-alignment-enables-transformer","title":"Dissecting Transformer Length Extrapolation via the Lens of Receptive Field Analysis","date":"2022-12-20","arxiv_id":"2212.10356","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-overview-of-open-source-deep-learning","title":"An overview of open source Deep Learning-based libraries for Neuroscience","date":"2022-12-19","arxiv_id":"2301.05057","repositories_listed":0,"syntology":null},{"url":null,"slug":"apollo-a-simple-approach-for-adaptive","title":"APOLLO: A Simple Approach for Adaptive Pretraining of Language Models for Logical Reasoning","date":"2022-12-19","arxiv_id":"2212.09282","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-long-form-spoken-language","title":"Improved Long-Form Spoken Language Translation with Large Language Models","date":"2022-12-19","arxiv_id":"2212.09895","repositories_listed":0,"syntology":null},{"url":null,"slug":"knife-knowledge-distillation-with-free-text","title":"KNIFE: Distilling Reasoning Knowledge From Free-Text Rationales","date":"2022-12-19","arxiv_id":"2212.09721","repositories_listed":0,"syntology":null},{"url":null,"slug":"mantis-at-tsar-2022-shared-task-improved","title":"MANTIS at TSAR-2022 Shared Task: Improved Unsupervised Lexical Simplification with Pretrained Encoders","date":"2022-12-19","arxiv_id":"2212.09855","repositories_listed":0,"syntology":null},{"url":null,"slug":"mu-2-slam-multitask-multilingual-speech-and","title":"Mu$^{2}$SLAM: Multitask, Multilingual Speech and Language Models","date":"2022-12-19","arxiv_id":"2212.09553","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-language-to-code-generation-in","title":"Natural Language to Code Generation in Interactive Data Science Notebooks","date":"2022-12-19","arxiv_id":"2212.09248","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-acceptability-judgements-are","title":"Language model acceptability judgements are not always robust to context","date":"2022-12-18","arxiv_id":"2212.08979","repositories_listed":0,"syntology":null},{"url":null,"slug":"alert-adapting-language-models-to-reasoning","title":"ALERT: Adapting Language Models to Reasoning Tasks","date":"2022-12-16","arxiv_id":"2212.08286","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-japanese-png-bert-language","title":"Investigation of Japanese PnG BERT language model in text-to-speech synthesis for pitch accent language","date":"2022-12-16","arxiv_id":"2212.08321","repositories_listed":0,"syntology":null},{"url":null,"slug":"legalrelectra-mixed-domain-language-modeling","title":"LegalRelectra: Mixed-domain Language Modeling for Long-range Legal Text Comprehension","date":"2022-12-16","arxiv_id":"2212.08204","repositories_listed":0,"syntology":null},{"url":null,"slug":"poibert-a-transformer-based-model-for-the","title":"POIBERT: A Transformer-based Model for the Tour Recommendation Problem","date":"2022-12-16","arxiv_id":"2212.13900","repositories_listed":0,"syntology":null},{"url":null,"slug":"clam-selective-clarification-for-ambiguous","title":"CLAM: Selective Clarification for Ambiguous Questions with Generative Language Models","date":"2022-12-15","arxiv_id":"2212.07769","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepjoin-joinable-table-discovery-with-pre","title":"DeepJoin: Joinable Table Discovery with Pre-trained Language Models","date":"2022-12-15","arxiv_id":"2212.07588","repositories_listed":0,"syntology":null},{"url":"/paper/fido-fusion-in-decoder-optimized-for-stronger","slug":"fido-fusion-in-decoder-optimized-for-stronger","title":"FiDO: Fusion-in-Decoder optimized for stronger performance and faster inference","date":"2022-12-15","arxiv_id":"2212.08153","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-chess-commentaries-by-combining","title":"Improving Chess Commentaries by Combining Language Models with Symbolic Reasoning Engines","date":"2022-12-15","arxiv_id":"2212.08195","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-similarity-based-curriculum","title":"Cross-Modal Similarity-Based Curriculum Learning for Image Captioning","date":"2022-12-14","arxiv_id":"2212.07075","repositories_listed":0,"syntology":null},{"url":null,"slug":"manta-efficient-gradient-based-tokenization","title":"MANTa: Efficient Gradient-Based Tokenization for Robust End-to-End Language Modeling","date":"2022-12-14","arxiv_id":"2212.07284","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-image-style-transfer-from-freeform-text","title":"Deep Image Style Transfer from Freeform Text","date":"2022-12-13","arxiv_id":"2212.06868","repositories_listed":0,"syntology":null},{"url":null,"slug":"technical-report-competition-solution-for","title":"Technical Report -- Competition Solution for Prompt Tuning using Pretrained Language Model","date":"2022-12-13","arxiv_id":"2212.06369","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-challenges-of-htr-model-training-feedback","title":"The Challenges of HTR Model Training: Feedback from the Project Donner le gout de l'archive a l'ere numerique","date":"2022-12-13","arxiv_id":"2212.11146","repositories_listed":0,"syntology":null},{"url":null,"slug":"cno-lstm-a-chaotic-neural-oscillatory-long","title":"CNO-LSTM: A Chaotic Neural Oscillatory Long Short-Term Memory Model for Text Classification","date":"2022-12-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"i-think-this-is-the-most-disruptive","title":"\"I think this is the most disruptive technology\": Exploring Sentiments of ChatGPT Early Adopters using Twitter Data","date":"2022-12-12","arxiv_id":"2212.05856","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-knowledge-graph-service-for","title":"A Unified Knowledge Graph Augmentation Service for Boosting Domain-specific NLP Tasks","date":"2022-12-10","arxiv_id":"2212.05251","repositories_listed":0,"syntology":null},{"url":null,"slug":"artificial-text-detection-with-multiple","title":"Artificial Text Detection with Multiple Training Strategies","date":"2022-12-10","arxiv_id":"2212.05194","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-information-extraction-from","title":"Structured information extraction from complex scientific text with fine-tuned large language models","date":"2022-12-10","arxiv_id":"2212.05238","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniform-masking-prevails-in-vision-language","title":"Uniform Masking Prevails in Vision-Language Pretraining","date":"2022-12-10","arxiv_id":"2212.05195","repositories_listed":0,"syntology":null},{"url":null,"slug":"implicit-causality-in-gpt-2-a-case-study","title":"Implicit causality in GPT-2: a case study","date":"2022-12-08","arxiv_id":"2212.04348","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-role-of-ai-in-drug-discovery-challenges","title":"The Role of AI in Drug Discovery: Challenges, Opportunities, and Strategies","date":"2022-12-08","arxiv_id":"2212.08104","repositories_listed":0,"syntology":null},{"url":null,"slug":"pivotal-role-of-language-modeling-in","title":"Pivotal Role of Language Modeling in Recommender Systems: Enriching Task-specific and Task-agnostic Representation Learning","date":"2022-12-07","arxiv_id":"2212.03760","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-with-scientific-text-improves","title":"Pre-Training With Scientific Text Improves Educational Question Generation","date":"2022-12-07","arxiv_id":"2212.03869","repositories_listed":0,"syntology":null},{"url":null,"slug":"adir-adaptive-diffusion-for-image","title":"ADIR: Adaptive Diffusion for Image Reconstruction","date":"2022-12-06","arxiv_id":"2212.03221","repositories_listed":0,"syntology":null},{"url":null,"slug":"cysecbert-a-domain-adapted-language-model-for","title":"CySecBERT: A Domain-Adapted Language Model for the Cybersecurity Domain","date":"2022-12-06","arxiv_id":"2212.02974","repositories_listed":0,"syntology":null},{"url":null,"slug":"m-vader-a-model-for-diffusion-with-multimodal","title":"M-VADER: A Model for Diffusion with Multimodal Context","date":"2022-12-06","arxiv_id":"2212.02936","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-audio-visual-speech","title":"Self-Supervised Audio-Visual Speech Representations Learning By Multimodal Self-Distillation","date":"2022-12-06","arxiv_id":"2212.02782","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-metadata-inference-using-a","title":"Building Metadata Inference Using a Transducer Based Language Model","date":"2022-12-05","arxiv_id":"2212.01964","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-and-accurate-factorized-neural","title":"Fast and accurate factorized neural transducer for text adaption of end-to-end speech recognition models","date":"2022-12-05","arxiv_id":"2212.01992","repositories_listed":0,"syntology":null},{"url":null,"slug":"i2mvformer-large-language-model-generated","title":"I2MVFormer: Large Language Model Generated Multi-View Document Supervision for Zero-Shot Image Classification","date":"2022-12-05","arxiv_id":"2212.02291","repositories_listed":0,"syntology":null},{"url":null,"slug":"legal-prompt-engineering-for-multilingual","title":"Legal Prompt Engineering for Multilingual Legal Judgement Prediction","date":"2022-12-05","arxiv_id":"2212.02199","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-fast-weight-language-models","title":"Meta-Learning Fast Weight Language Models","date":"2022-12-05","arxiv_id":"2212.02475","repositories_listed":0,"syntology":null},{"url":null,"slug":"kpt-keyword-guided-pre-training-for-grounded","title":"KPT: Keyword-guided Pre-training for Grounded Dialog Generation","date":"2022-12-04","arxiv_id":"2212.01739","repositories_listed":0,"syntology":null},{"url":null,"slug":"milmo-minority-multilingual-pre-trained","title":"MiLMo:Minority Multilingual Pre-trained Language Model","date":"2022-12-04","arxiv_id":"2212.01779","repositories_listed":0,"syntology":null},{"url":"/paper/toward-efficient-language-model-pretraining","slug":"toward-efficient-language-model-pretraining","title":"Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE","date":"2022-12-04","arxiv_id":"2212.01853","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-memory-transformer-for-processing-long","title":"Global memory transformer for processing long documents","date":"2022-12-03","arxiv_id":"2212.01650","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-information-theoretic-analysis-of-compute","title":"An Information-Theoretic Analysis of Compute-Optimal Neural Scaling Laws","date":"2022-12-02","arxiv_id":"2212.01365","repositories_listed":0,"syntology":null},{"url":null,"slug":"compound-tokens-channel-fusion-for-vision","title":"Compound Tokens: Channel Fusion for Vision-Language Representation Learning","date":"2022-12-02","arxiv_id":"2212.01447","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-adaptive-federated-learning","title":"Faster Adaptive Federated Learning","date":"2022-12-02","arxiv_id":"2212.00974","repositories_listed":0,"syntology":null},{"url":null,"slug":"general-framework-for-self-supervised-model","title":"Systematic Analysis for Pretrained Language Model Priming for Parameter-Efficient Fine-tuning","date":"2022-12-02","arxiv_id":"2212.01032","repositories_listed":0,"syntology":null},{"url":null,"slug":"legal-prompting-teaching-a-language-model-to","title":"Legal Prompting: Teaching a Language Model to Think Like a Lawyer","date":"2022-12-02","arxiv_id":"2212.01326","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapted-multimodal-bert-with-layer-wise","title":"Adapted Multimodal BERT with Layer-wise Fusion for Sentiment Analysis","date":"2022-12-01","arxiv_id":"2212.00678","repositories_listed":0,"syntology":null},{"url":null,"slug":"climedbert-a-pre-trained-language-model-for","title":"CliMedBERT: A Pre-trained Language Model for Climate and Health-related Text","date":"2022-12-01","arxiv_id":"2212.00689","repositories_listed":0,"syntology":null},{"url":null,"slug":"extensible-prompts-for-language-models","title":"Extensible Prompts for Language Models on Zero-shot Language Style Customization","date":"2022-12-01","arxiv_id":"2212.00616","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-pre-training-on-true-negatives-1","title":"Language Model Pre-training on True Negatives","date":"2022-12-01","arxiv_id":"2212.00460","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-models-and-brain-alignment-beyond","title":"Language models and brains align due to more than next-word prediction and word-level information","date":"2022-12-01","arxiv_id":"2212.00596","repositories_listed":0,"syntology":null},{"url":null,"slug":"budgetlongformer-can-we-cheaply-pretrain-a","title":"BudgetLongformer: Can we Cheaply Pretrain a SotA Legal Language Model From Scratch?","date":"2022-11-30","arxiv_id":"2211.17135","repositories_listed":0,"syntology":null},{"url":null,"slug":"sehr-ce-language-modelling-of-structured-ehr","title":"sEHR-CE: Language modelling of structured EHR data for efficient and generalizable patient cohort expansion","date":"2022-11-30","arxiv_id":"2211.17121","repositories_listed":0,"syntology":null},{"url":null,"slug":"xtrimoabfold-improving-antibody-structure","title":"xTrimoABFold: De novo Antibody Structure Prediction without MSA","date":"2022-11-30","arxiv_id":"2212.00735","repositories_listed":0,"syntology":null},{"url":null,"slug":"better-transcription-of-uk-supreme-court","title":"Better Transcription of UK Supreme Court Hearings","date":"2022-11-29","arxiv_id":"2211.17094","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-astrobert-using-semantic-textual","title":"Improving astroBERT using Semantic Textual Similarity","date":"2022-11-29","arxiv_id":"2212.00744","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-diffusion-for-categorical-data","title":"Continuous diffusion for categorical data","date":"2022-11-28","arxiv_id":"2211.15089","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-language-models-to-find-agreement","title":"Fine-tuning language models to find agreement among humans with diverse preferences","date":"2022-11-28","arxiv_id":"2211.15006","repositories_listed":0,"syntology":null},{"url":null,"slug":"inter-kd-intermediate-knowledge-distillation","title":"Inter-KD: Intermediate Knowledge Distillation for CTC-Based Automatic Speech Recognition","date":"2022-11-28","arxiv_id":"2211.15075","repositories_listed":0,"syntology":null},{"url":"/paper/large-pre-trained-models-with-extra-large","slug":"large-pre-trained-models-with-extra-large","title":"Large Pre-Trained Models with Extra-Large Vocabularies: A Contrastive Analysis of Hebrew BERT Models and a New One to Outperform Them All","date":"2022-11-28","arxiv_id":"2211.15199","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-distance-metric-learning-for-few","title":"Revisiting Distance Metric Learning for Few-Shot Natural Language Classification","date":"2022-11-28","arxiv_id":"2211.15202","repositories_listed":0,"syntology":null},{"url":null,"slug":"detect-localize-repair-a-unified-framework","title":"Detect-Localize-Repair: A Unified Framework for Learning to Debug with CodeT5","date":"2022-11-27","arxiv_id":"2211.14875","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-automatic-soap-classification-system-using","title":"An Automatic SOAP Classification System Using Weakly Supervision And Transfer Learning","date":"2022-11-26","arxiv_id":"2211.14539","repositories_listed":0,"syntology":null},{"url":null,"slug":"skdbert-compressing-bert-via-stochastic","title":"SKDBERT: Compressing BERT via Stochastic Knowledge Distillation","date":"2022-11-26","arxiv_id":"2211.14466","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparison-study-between-token-classification","title":"Comparison Study Between Token Classification and Sequence Classification In Text Classification","date":"2022-11-25","arxiv_id":"2211.13899","repositories_listed":0,"syntology":null},{"url":null,"slug":"gpt-3-driven-pedagogical-agents-for-training","title":"GPT-3-driven pedagogical agents for training children's curious question-asking skills","date":"2022-11-25","arxiv_id":"2211.14228","repositories_listed":0,"syntology":null},{"url":null,"slug":"bidirectional-representations-for-low","title":"Bidirectional Representations for Low Resource Spoken Language Understanding","date":"2022-11-24","arxiv_id":"2211.14320","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-answering-and-question-generation","title":"Question Answering and Question Generation for Finnish","date":"2022-11-24","arxiv_id":"2211.13794","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-selective-masking-as-a-bridge-between","title":"Using Selective Masking as a Bridge between Pre-training and Fine-tuning","date":"2022-11-24","arxiv_id":"2211.13815","repositories_listed":0,"syntology":null},{"url":null,"slug":"word-level-representation-from-bytes-for","title":"Word-Level Representation From Bytes For Language Modeling","date":"2022-11-23","arxiv_id":"2211.12677","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypertuning-toward-adapting-large-language","title":"HyperTuning: Toward Adapting Large Language Models without Back-propagation","date":"2022-11-22","arxiv_id":"2211.12485","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-prompting-for-few-shot-action","title":"Knowledge Prompting for Few-shot Action Recognition","date":"2022-11-22","arxiv_id":"2211.12030","repositories_listed":0,"syntology":null},{"url":"/paper/retrieval-augmented-multimodal-language","slug":"retrieval-augmented-multimodal-language","title":"Retrieval-Augmented Multimodal Language Modeling","date":"2022-11-22","arxiv_id":"2211.12561","repositories_listed":0,"syntology":null},{"url":null,"slug":"clipcrop-conditioned-cropping-driven-by","title":"ClipCrop: Conditioned Cropping Driven by Vision-Language Model","date":"2022-11-21","arxiv_id":"2211.11492","repositories_listed":0,"syntology":null},{"url":null,"slug":"deanthropomorphising-nlp-can-a-language-model","title":"Deanthropomorphising NLP: Can a Language Model Be Conscious?","date":"2022-11-21","arxiv_id":"2211.11483","repositories_listed":0,"syntology":null},{"url":null,"slug":"vatlm-visual-audio-text-pre-training-with","title":"VATLM: Visual-Audio-Text Pre-Training with Unified Masked Prediction for Speech Representation Learning","date":"2022-11-21","arxiv_id":"2211.11275","repositories_listed":0,"syntology":null},{"url":null,"slug":"conceptor-aided-debiasing-of-contextualized","title":"Conceptor-Aided Debiasing of Large Language Models","date":"2022-11-20","arxiv_id":"2211.11087","repositories_listed":0,"syntology":null},{"url":null,"slug":"embracing-ambiguity-improving-similarity","title":"Embracing Ambiguity: Improving Similarity-oriented Tasks with Contextual Synonym Knowledge","date":"2022-11-20","arxiv_id":"2211.10997","repositories_listed":0,"syntology":null}],"record_sha256":"5fd5f5032375db7b9db2d8e06885b57e1697c7012f803ef2734b4d325ace3225","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}