{"url":"/task/document-classification","name":"Document Classification","slug":"document-classification","description_markdown":"**Document Classification** is a procedure of assigning one or more labels to a document from a predetermined set of labels.\n\n\n<span class=\"description-source\">Source: [Long-length Legal Document Classification ](https://arxiv.org/abs/1912.06905)</span>","categories":[{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":641,"papers_with_code":235,"benchmarks":21,"benchmark_tables_in_archive":22,"benchmark_tables_shown":22,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":18,"subtasks":1,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/document-classification-on-reuters-21578","slug":"document-classification-on-reuters-21578","dataset":"Reuters-21578","dataset_url":"/dataset/reuters-21578","rows_in_archive":8,"metrics":["Accuracy","F1"],"first_row_in_archive_order":{"model":"ApproxRepSet","paper_title":"Rep the Set: Neural Networks for Learning Set Representations","paper_url":"/paper/rep-the-set-neural-networks-for-learning-set","paper_date":"2019-04-03","arxiv_id":"1904.01962","code_links":[{"title":"giannisnik/repset","url":"https://github.com/giannisnik/repset"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-cora","slug":"document-classification-on-cora","dataset":"Cora","dataset_url":"/dataset/cora","rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ACNet","paper_title":"Adaptively Connected Neural Networks","paper_url":"/paper/adaptively-connected-neural-networks","paper_date":"2019-04-07","arxiv_id":"1904.03579","code_links":[{"title":"wanggrun/Adaptively-Connected-Neural-Networks","url":"https://github.com/wanggrun/Adaptively-Connected-Neural-Networks"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-hoc","slug":"document-classification-on-hoc","dataset":"HOC","dataset_url":"/dataset/hoc-1","rows_in_archive":5,"metrics":["F1","Micro F1"],"first_row_in_archive_order":{"model":"BioLinkBERT (large)","paper_title":"LinkBERT: Pretraining Language Models with Document Links","paper_url":"/paper/linkbert-pretraining-language-models-with","paper_date":"2022-03-29","arxiv_id":"2203.15827","code_links":[{"title":"michiyasunaga/LinkBERT","url":"https://github.com/michiyasunaga/LinkBERT"}],"syntology":{"n":14,"n_ran":0,"n_unverified":14,"n_pointer_only":0}}},{"leaderboard":"/sota/document-classification-on-bbcsport","slug":"document-classification-on-bbcsport","dataset":"BBCSport","dataset_url":null,"rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MPAD-path","paper_title":"Message Passing Attention Networks for Document Understanding","paper_url":"/paper/message-passing-attention-networks-for","paper_date":"2019-08-17","arxiv_id":"1908.06267","code_links":[{"title":"giannisnik/mpad","url":"https://github.com/giannisnik/mpad"},{"title":"Tixierae/gow_tools","url":"https://github.com/Tixierae/gow_tools"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-amazon","slug":"document-classification-on-amazon","dataset":"Amazon","dataset_url":null,"rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ApproxRepSet","paper_title":"Rep the Set: Neural Networks for Learning Set Representations","paper_url":"/paper/rep-the-set-neural-networks-for-learning-set","paper_date":"2019-04-03","arxiv_id":"1904.01962","code_links":[{"title":"giannisnik/repset","url":"https://github.com/giannisnik/repset"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-twitter","slug":"document-classification-on-twitter","dataset":"Twitter","dataset_url":null,"rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ApproxRepSet","paper_title":"Rep the Set: Neural Networks for Learning Set Representations","paper_url":"/paper/rep-the-set-neural-networks-for-learning-set","paper_date":"2019-04-03","arxiv_id":"1904.01962","code_links":[{"title":"giannisnik/repset","url":"https://github.com/giannisnik/repset"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-aapd","slug":"document-classification-on-aapd","dataset":"AAPD","dataset_url":null,"rows_in_archive":2,"metrics":["F1"],"first_row_in_archive_order":{"model":"KD-LSTMreg","paper_title":"DocBERT: BERT for Document Classification","paper_url":"/paper/docbert-bert-for-document-classification","paper_date":"2019-04-17","arxiv_id":"1904.08398","code_links":[{"title":"castorini/hedwig","url":"https://github.com/castorini/hedwig"},{"title":"dki-lab/covid19-classification","url":"https://github.com/dki-lab/covid19-classification"},{"title":"helenabalabin/covid-19-document-classification","url":"https://github.com/helenabalabin/covid-19-document-classification"}],"syntology":{"n":14,"n_ran":0,"n_unverified":14,"n_pointer_only":0}}},{"leaderboard":"/sota/document-classification-on-classic","slug":"document-classification-on-classic","dataset":"Classic","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"REL-RWMD k-NN","paper_title":"Speeding up Word Mover's Distance and its variants via properties of distances between embeddings","paper_url":"/paper/speeding-up-word-movers-distance-and-its","paper_date":"2019-12-01","arxiv_id":"1912.00509","code_links":[{"title":"matwerner/fast-wmd","url":"https://github.com/matwerner/fast-wmd"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/document-classification-on-imdb-m","slug":"document-classification-on-imdb-m","dataset":"IMDb-M","dataset_url":"/dataset/imdb-multi","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Document Classification Using Importance of Sentences","paper_title":"Improving Document-Level Sentiment Classification Using Importance of Sentences","paper_url":"/paper/improving-document-level-sentiment","paper_date":"2021-03-09","arxiv_id":"2103.05167","code_links":[],"syntology":null}},{"leaderboard":"/sota/document-classification-on-recipe","slug":"document-classification-on-recipe","dataset":"Recipe","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ApproxRepSet","paper_title":"Rep the Set: Neural Networks for Learning Set Representations","paper_url":"/paper/rep-the-set-neural-networks-for-learning-set","paper_date":"2019-04-03","arxiv_id":"1904.01962","code_links":[{"title":"giannisnik/repset","url":"https://github.com/giannisnik/repset"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-scidocs-mag","slug":"document-classification-on-scidocs-mag","dataset":"SciDocs (MAG)","dataset_url":null,"rows_in_archive":2,"metrics":["F1 (micro)"],"first_row_in_archive_order":{"model":"SPECTER","paper_title":"SPECTER: Document-level Representation Learning using Citation-informed Transformers","paper_url":"/paper/document-level-representation-learning-using","paper_date":"2020-04-15","arxiv_id":"2004.07180","code_links":[{"title":"allenai/specter","url":"https://github.com/allenai/specter"},{"title":"allenai/scidocs","url":"https://github.com/allenai/scidocs"},{"title":"allenai/aspire","url":"https://github.com/allenai/aspire"},{"title":"sntcristian/and-kge","url":"https://github.com/sntcristian/and-kge"},{"title":"hle027/IR-Competition","url":"https://github.com/hle027/IR-Competition"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/document-classification-on-scidocs-mesh","slug":"document-classification-on-scidocs-mesh","dataset":"SciDocs (MeSH)","dataset_url":null,"rows_in_archive":2,"metrics":["F1 (micro)"],"first_row_in_archive_order":{"model":"SciNCL","paper_title":"Neighborhood Contrastive Learning for Scientific Document Representations with Citation Embeddings","paper_url":"/paper/neighborhood-contrastive-learning-for-1","paper_date":"2022-02-14","arxiv_id":"2202.06671","code_links":[{"title":"malteos/scincl","url":"https://github.com/malteos/scincl"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/document-classification-on-wos-5736","slug":"document-classification-on-wos-5736","dataset":"WOS-5736","dataset_url":"/dataset/web-of-science-dataset","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ConvTextTM","paper_title":"ConvTextTM: An Explainable Convolutional Tsetlin Machine Framework for Text Classification","paper_url":"/paper/convtexttm-an-explainable-convolutional","paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/document-classification-on-hyperpartisan-news","slug":"document-classification-on-hyperpartisan-news","dataset":"Hyperpartisan News Detection","dataset_url":"/dataset/hyperpartisan","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ChuLo","paper_title":"ChuLo: Chunk-Level Key Information Representation for Long Document Processing","paper_url":"/paper/chulo-chunk-level-key-information","paper_date":"2024-10-14","arxiv_id":"2410.11119","code_links":[{"title":"adlnlp/Chulo","url":"https://github.com/adlnlp/Chulo"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-lun","slug":"document-classification-on-lun","dataset":"LUN","dataset_url":"/dataset/lun","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ChuLo","paper_title":"ChuLo: Chunk-Level Key Information Representation for Long Document Processing","paper_url":"/paper/chulo-chunk-level-key-information","paper_date":"2024-10-14","arxiv_id":"2410.11119","code_links":[{"title":"adlnlp/Chulo","url":"https://github.com/adlnlp/Chulo"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-mpqa","slug":"document-classification-on-mpqa","dataset":"MPQA","dataset_url":"/dataset/mpqa-opinion-corpus","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MPAD-path","paper_title":"Message Passing Attention Networks for Document Understanding","paper_url":"/paper/message-passing-attention-networks-for","paper_date":"2019-08-17","arxiv_id":"1908.06267","code_links":[{"title":"giannisnik/mpad","url":"https://github.com/giannisnik/mpad"},{"title":"Tixierae/gow_tools","url":"https://github.com/Tixierae/gow_tools"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-reuters-de-en","slug":"document-classification-on-reuters-de-en","dataset":"Reuters De-En","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BilBOWA","paper_title":"BilBOWA: Fast Bilingual Distributed Representations without Word Alignments","paper_url":"/paper/bilbowa-fast-bilingual-distributed","paper_date":"2014-10-09","arxiv_id":"1410.2455","code_links":[{"title":"eske/multivec","url":"https://github.com/eske/multivec"},{"title":"gouwsmeister/bilbowa","url":"https://github.com/gouwsmeister/bilbowa"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-reuters-en-de","slug":"document-classification-on-reuters-en-de","dataset":"Reuters En-De","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BilBOWA","paper_title":"BilBOWA: Fast Bilingual Distributed Representations without Word Alignments","paper_url":"/paper/bilbowa-fast-bilingual-distributed","paper_date":"2014-10-09","arxiv_id":"1410.2455","code_links":[{"title":"eske/multivec","url":"https://github.com/eske/multivec"},{"title":"gouwsmeister/bilbowa","url":"https://github.com/gouwsmeister/bilbowa"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-wos-11967","slug":"document-classification-on-wos-11967","dataset":"WOS-11967","dataset_url":"/dataset/web-of-science-dataset","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"HDLTex","paper_title":"HDLTex: Hierarchical Deep Learning for Text Classification","paper_url":"/paper/hdltex-hierarchical-deep-learning-for-text","paper_date":"2017-09-24","arxiv_id":"1709.08267","code_links":[{"title":"kk7nc/HDLTex","url":"https://github.com/kk7nc/HDLTex"},{"title":"lackel/hierarchical_weighted_scl","url":"https://github.com/lackel/hierarchical_weighted_scl"},{"title":"Lackel/DNA","url":"https://github.com/Lackel/DNA"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-wos-46985","slug":"document-classification-on-wos-46985","dataset":"WOS-46985","dataset_url":"/dataset/web-of-science-dataset","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"HDLTex","paper_title":"HDLTex: Hierarchical Deep Learning for Text Classification","paper_url":"/paper/hdltex-hierarchical-deep-learning-for-text","paper_date":"2017-09-24","arxiv_id":"1709.08267","code_links":[{"title":"kk7nc/HDLTex","url":"https://github.com/kk7nc/HDLTex"},{"title":"lackel/hierarchical_weighted_scl","url":"https://github.com/lackel/hierarchical_weighted_scl"},{"title":"Lackel/DNA","url":"https://github.com/Lackel/DNA"}],"syntology":null}},{"leaderboard":"/sota/document-classification-on-yelp-14","slug":"document-classification-on-yelp-14","dataset":"Yelp-14","dataset_url":"/dataset/yelp","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"KD-LSTMreg","paper_title":"DocBERT: BERT for Document Classification","paper_url":"/paper/docbert-bert-for-document-classification","paper_date":"2019-04-17","arxiv_id":"1904.08398","code_links":[{"title":"castorini/hedwig","url":"https://github.com/castorini/hedwig"},{"title":"dki-lab/covid19-classification","url":"https://github.com/dki-lab/covid19-classification"},{"title":"helenabalabin/covid-19-document-classification","url":"https://github.com/helenabalabin/covid-19-document-classification"}],"syntology":{"n":14,"n_ran":0,"n_unverified":14,"n_pointer_only":0}}},{"leaderboard":null,"slug":"document-classification-on-doclaynet","dataset":"DocLayNet","dataset_url":null,"rows_in_archive":0,"metrics":["Test Accuracy","Test Loss"],"first_row_in_archive_order":null}],"datasets":[{"url":"/dataset/cora","name":"Cora","full_name":"","num_papers_in_archive":602},{"url":"/dataset/mpqa-opinion-corpus","name":"MPQA Opinion Corpus","full_name":"Multi-Perspective Question Answering","num_papers_in_archive":313},{"url":"/dataset/imdb-multi","name":"IMDB-MULTI","full_name":"","num_papers_in_archive":243},{"url":"/dataset/yelp","name":"Yelp","full_name":"","num_papers_in_archive":86},{"url":"/dataset/reuters-21578","name":"Reuters-21578","full_name":"","num_papers_in_archive":66},{"url":"/dataset/web-of-science-dataset","name":"WOS","full_name":"Web of Science Dataset","num_papers_in_archive":59},{"url":"/dataset/scidocs","name":"SciDocs","full_name":"SciDocs","num_papers_in_archive":57},{"url":"/dataset/hoc-1","name":"HOC","full_name":"Hallmarks of Cancer","num_papers_in_archive":37},{"url":"/dataset/multieurlex","name":"MultiEURLEX","full_name":"","num_papers_in_archive":11},{"url":"/dataset/lun","name":"LUN","full_name":"","num_papers_in_archive":8},{"url":"/dataset/bengali-hate-speech","name":"Bengali Hate Speech","full_name":"","num_papers_in_archive":6},{"url":"/dataset/hyperpartisan","name":"Hyperpartisan News Detection","full_name":"","num_papers_in_archive":3},{"url":"/dataset/wikipedia-title","name":"Wikipedia Title","full_name":null,"num_papers_in_archive":3},{"url":"/dataset/rtc","name":"RTC","full_name":"Reddit Time Corpus","num_papers_in_archive":2},{"url":"/dataset/meshup","name":"MeSHup","full_name":"A Corpus for Full Text Biomedical Document Indexing","num_papers_in_archive":1},{"url":"/dataset/rvl-cdip-mp","name":"RVL-CDIP_MP","full_name":"RVL-CDIP multi-page","num_papers_in_archive":1},{"url":"/dataset/rvl-cdip-n-mp","name":"RVL-CDIP_N_MP","full_name":"RVL-CDIP-N multi-page","num_papers_in_archive":1},{"url":"/dataset/tacm12k","name":"TACM12K","full_name":"Table-ACM12K","num_papers_in_archive":1}],"subtasks":[{"url":"/task/page-stream-segmentation","name":"Page Stream Segmentation"}],"parent_tasks":[{"url":"/task/text-classification","name":"Text Classification"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":235,"tagged_in_all":641,"items":[{"url":"/paper/graph-attention-networks","title":"Graph Attention Networks","date":"2017-10-30","arxiv_id":"1710.10903","repositories_listed":93,"syntology":{"n":106,"n_ran":50,"n_unverified":56,"n_pointer_only":43}},{"url":"/paper/semi-supervised-classification-with-graph","title":"Semi-Supervised Classification with Graph Convolutional Networks","date":"2016-09-09","arxiv_id":"1609.02907","repositories_listed":55,"syntology":{"n":58,"n_ran":31,"n_unverified":27,"n_pointer_only":22}},{"url":"/paper/revisiting-semi-supervised-learning-with","title":"Revisiting Semi-Supervised Learning with Graph Embeddings","date":"2016-03-29","arxiv_id":"1603.08861","repositories_listed":26,"syntology":{"n":28,"n_ran":15,"n_unverified":13,"n_pointer_only":4}},{"url":"/paper/on-calibration-of-modern-neural-networks","title":"On Calibration of Modern Neural Networks","date":"2017-06-14","arxiv_id":"1706.04599","repositories_listed":15,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/flashattention-fast-and-memory-efficient","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","date":"2022-05-27","arxiv_id":"2205.14135","repositories_listed":13,"syntology":{"n":30,"n_ran":9,"n_unverified":21,"n_pointer_only":1}},{"url":"/paper/massively-multilingual-sentence-embeddings","title":"Massively Multilingual Sentence Embeddings for Zero-Shot Cross-Lingual Transfer and Beyond","date":"2018-12-26","arxiv_id":"1812.10464","repositories_listed":13,"syntology":{"n":10,"n_ran":4,"n_unverified":6,"n_pointer_only":4}},{"url":"/paper/improving-language-understanding-by","title":"Improving Language Understanding by Generative Pre-Training","date":"2018-06-11","arxiv_id":null,"repositories_listed":13,"syntology":null},{"url":"/paper/zen-pre-training-chinese-text-encoder","title":"ZEN: Pre-training Chinese Text Encoder Enhanced by N-gram Representations","date":"2019-11-02","arxiv_id":"1911.00720","repositories_listed":7,"syntology":{"n":35,"n_ran":7,"n_unverified":28,"n_pointer_only":0}},{"url":"/paper/document-level-representation-learning-using","title":"SPECTER: Document-level Representation Learning using Citation-informed Transformers","date":"2020-04-15","arxiv_id":"2004.07180","repositories_listed":5,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/biogpt-generative-pre-trained-transformer-for","title":"BioGPT: Generative Pre-trained Transformer for Biomedical Text Generation and Mining","date":"2022-10-19","arxiv_id":"2210.10341","repositories_listed":4,"syntology":null},{"url":"/paper/pairwise-multi-class-document-classification","title":"Pairwise Multi-Class Document Classification for Semantic Relations between Wikipedia Articles","date":"2020-03-22","arxiv_id":"2003.09881","repositories_listed":4,"syntology":null},{"url":"/paper/multifit-efficient-multi-lingual-language","title":"MultiFiT: Efficient Multi-lingual Language Model Fine-tuning","date":"2019-09-10","arxiv_id":"1909.04761","repositories_listed":4,"syntology":null},{"url":"/paper/transfer-learning-in-biomedical-natural","title":"Transfer Learning in Biomedical Natural Language Processing: An Evaluation of BERT and ELMo on Ten Benchmarking Datasets","date":"2019-06-13","arxiv_id":"1906.05474","repositories_listed":4,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/learning-to-skim-text","title":"Learning to Skim Text","date":"2017-04-23","arxiv_id":"1704.06877","repositories_listed":4,"syntology":null},{"url":"/paper/geometric-deep-learning-on-graphs-and","title":"Geometric deep learning on graphs and manifolds using mixture model CNNs","date":"2016-11-25","arxiv_id":"1611.08402","repositories_listed":4,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/glove-global-vectors-for-word-representation","title":"GloVe: Global Vectors for Word Representation","date":"2014-10-01","arxiv_id":null,"repositories_listed":4,"syntology":null},{"url":"/paper/docgenome-an-open-large-scale-scientific","title":"DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language Models","date":"2024-06-17","arxiv_id":"2406.11633","repositories_listed":3,"syntology":{"n":5,"n_ran":1,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/modular-multimodal-architecture-for-document","title":"Modular Multimodal Architecture for Document Classification","date":"2019-12-09","arxiv_id":"1912.04376","repositories_listed":3,"syntology":null},{"url":"/paper/hierarchical-transformers-for-long-document","title":"Hierarchical Transformers for Long Document Classification","date":"2019-10-23","arxiv_id":"1910.10781","repositories_listed":3,"syntology":null},{"url":"/paper/multimodal-deep-networks-for-text-and-image","title":"Multimodal deep networks for text and image-based document classification","date":"2019-07-15","arxiv_id":"1907.06370","repositories_listed":3,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/docbert-bert-for-document-classification","title":"DocBERT: BERT for Document Classification","date":"2019-04-17","arxiv_id":"1904.08398","repositories_listed":3,"syntology":{"n":14,"n_ran":0,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/combining-similarity-features-and-deep","title":"Combining Similarity Features and Deep Representation Learning for Stance Detection in the Context of Checking Fake News","date":"2018-11-02","arxiv_id":"1811.00706","repositories_listed":3,"syntology":null},{"url":"/paper/hdltex-hierarchical-deep-learning-for-text","title":"HDLTex: Hierarchical Deep Learning for Text Classification","date":"2017-09-24","arxiv_id":"1709.08267","repositories_listed":3,"syntology":null},{"url":"/paper/anls-a-universal-document-processing-metric","title":"ANLS* -- A Universal Document Processing Metric for Generative Large Language Models","date":"2024-02-06","arxiv_id":"2402.03848","repositories_listed":2,"syntology":null},{"url":"/paper/balancing-methods-for-multi-label-text","title":"Balancing Methods for Multi-label Text Classification with Long-Tailed Class Distribution","date":"2021-09-10","arxiv_id":"2109.04712","repositories_listed":2,"syntology":null},{"url":"/paper/pyeurovoc-a-tool-for-multilingual-legal","title":"PyEuroVoc: A Tool for Multilingual Legal Document Classification with EuroVoc Descriptors","date":"2021-08-02","arxiv_id":"2108.01139","repositories_listed":2,"syntology":null},{"url":"/paper/temporal-adaptation-of-bert-and-performance","title":"Temporal Adaptation of BERT and Performance on Downstream Document Classification: Insights from Social Media","date":"2021-04-16","arxiv_id":"2104.08116","repositories_listed":2,"syntology":null},{"url":"/paper/can-a-fruit-fly-learn-word-embeddings-1","title":"Can a Fruit Fly Learn Word Embeddings?","date":"2021-01-18","arxiv_id":"2101.06887","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/an-explainable-cnn-approach-for-medical-codes","title":"An Explainable CNN Approach for Medical Codes Prediction from Clinical Text","date":"2021-01-14","arxiv_id":"2101.11430","repositories_listed":2,"syntology":null},{"url":"/paper/text-classification-using-label-names-only-a","title":"Text Classification Using Label Names Only: A Language Model Self-Training Approach","date":"2020-10-14","arxiv_id":"2010.07245","repositories_listed":2,"syntology":null}],"syntology_records":14,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}