{"url":"/task/news-classification","name":"News Classification","slug":"news-classification","description_markdown":null,"categories":[{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":72,"papers_with_code":33,"benchmarks":4,"benchmark_tables_in_archive":4,"benchmark_tables_shown":4,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":12,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/news-classification-on-n15news","slug":"news-classification-on-n15news","dataset":"N15News","dataset_url":"/dataset/n15news","rows_in_archive":9,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Multimodal(ViT+BERT, Input: Image + Body)","paper_title":"N24News: A New Dataset for Multimodal News Classification","paper_url":"/paper/n15news-a-new-dataset-for-multimodal-news","paper_date":"2021-08-30","arxiv_id":"2108.13327","code_links":[{"title":"billywzh717/n24news","url":"https://github.com/billywzh717/n24news"}],"syntology":null}},{"leaderboard":"/sota/news-classification-on-reddit-ideological-and","slug":"news-classification-on-reddit-ideological-and","dataset":"Reddit Ideological and Extreme Bias Dataset","dataset_url":"/dataset/reddit-ideological-and-extreme-bias-dataset","rows_in_archive":7,"metrics":["weighted-F1 score"],"first_row_in_archive_order":{"model":"SVM","paper_title":"RICo: Reddit ideological communities","paper_url":"/paper/rico-reddit-ideological-communities","paper_date":"2024-06-05","arxiv_id":null,"code_links":[{"title":"ADCLab/RedditIdeologyDB","url":"https://github.com/ADCLab/RedditIdeologyDB"}],"syntology":null}},{"leaderboard":"/sota/news-classification-on-soham-news-article","slug":"news-classification-on-soham-news-article","dataset":"Soham News Article Classification","dataset_url":null,"rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"xlmindic-base-uniscript","paper_title":"Does Transliteration Help Multilingual Language Modeling?","paper_url":"/paper/does-transliteration-help-multilingual","paper_date":"2022-01-29","arxiv_id":"2201.12501","code_links":[{"title":"ibraheem-moosa/xlm-indic","url":"https://github.com/ibraheem-moosa/xlm-indic"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/news-classification-on-bbc-hindi-news-article","slug":"news-classification-on-bbc-hindi-news-article","dataset":"BBC Hindi News Article Classification","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"xlmindic-base-uniscript","paper_title":"Does Transliteration Help Multilingual Language Modeling?","paper_url":"/paper/does-transliteration-help-multilingual","paper_date":"2022-01-29","arxiv_id":"2201.12501","code_links":[{"title":"ibraheem-moosa/xlm-indic","url":"https://github.com/ibraheem-moosa/xlm-indic"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/indicglue","name":"IndicGLUE","full_name":"Indic General Language Understanding Evaluation Benchmark","num_papers_in_archive":16},{"url":"/dataset/masakhanews","name":"MasakhaNEWS","full_name":"","num_papers_in_archive":12},{"url":"/dataset/gvfc","name":"GVFC","full_name":"Gun Violence Frame Corpus","num_papers_in_archive":8},{"url":"/dataset/mn-ds","name":"MN-DS","full_name":"Multilabeled News Dataset","num_papers_in_archive":4},{"url":"/dataset/hlgd","name":"HLGD","full_name":"Headline Grouping Dataset","num_papers_in_archive":2},{"url":"/dataset/reddit-ideological-and-extreme-bias-dataset","name":"Reddit Ideological and Extreme Bias Dataset","full_name":"","num_papers_in_archive":2},{"url":"/dataset/kinnews-and-kirnews","name":"KINNEWS and KIRNEWS","full_name":"","num_papers_in_archive":1},{"url":"/dataset/n15news","name":"N15News","full_name":"","num_papers_in_archive":1},{"url":"/dataset/verifee","name":"Verifee","full_name":"","num_papers_in_archive":1},{"url":"/dataset/balitanlp","name":"BalitaNLP","full_name":"","num_papers_in_archive":0},{"url":"/dataset/cidii-dataset","name":"CIDII Dataset","full_name":"Correct Information  and  Disinformation  about  Islamic  Issues","num_papers_in_archive":0},{"url":"/dataset/eduge","name":"Eduge","full_name":"Eduge news classification dataset","num_papers_in_archive":0}],"subtasks":[],"parent_tasks":[{"url":"/task/cross-lingual-document-classification","name":"Cross-Lingual Document Classification"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":33,"tagged_in_all":72,"items":[{"url":"/paper/explainable-tsetlin-machine-framework-for","title":"Explainable Tsetlin Machine framework for fake news detection with credibility score assessment","date":"2021-05-19","arxiv_id":"2105.09114","repositories_listed":6,"syntology":null},{"url":"/paper/lux-linguistic-aspects-under-examination","title":"LUX (Linguistic aspects Under eXamination): Discourse Analysis for Automatic Fake News Classification","date":"2021-08-01","arxiv_id":null,"repositories_listed":4,"syntology":null},{"url":"/paper/accuracy-of-textfooler-black-box-adversarial","title":"Accuracy of TextFooler black box adversarial attacks on 01 loss sign activation neural network ensemble","date":"2024-02-12","arxiv_id":"2402.07347","repositories_listed":2,"syntology":null},{"url":"/paper/a-novel-perspective-to-look-at-attention-bi","title":"A Novel Perspective to Look At Attention: Bi-level Attention-based Explainable Topic Modeling for News Classification","date":"2022-03-14","arxiv_id":"2203.07216","repositories_listed":2,"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":7}},{"url":"/paper/knowledge-graph-informed-fake-news","title":"Knowledge Graph informed Fake News Classification via Heterogeneous Representation Ensembles","date":"2021-10-20","arxiv_id":"2110.10457","repositories_listed":2,"syntology":null},{"url":"/paper/tri-learn-graph-fusion-network-for-attributed","title":"Tri-Learn Graph Fusion Network for Attributed Graph Clustering","date":"2025-07-18","arxiv_id":"2507.13620","repositories_listed":1,"syntology":null},{"url":"/paper/llm-teacher-student-framework-for-text","title":"LLM Teacher-Student Framework for Text Classification With No Manually Annotated Data: A Case Study in IPTC News Topic Classification","date":"2024-11-29","arxiv_id":"2411.19638","repositories_listed":1,"syntology":null},{"url":"/paper/bert-or-fasttext-a-comparative-analysis-of","title":"BERT or FastText? A Comparative Analysis of Contextual as well as Non-Contextual Embeddings","date":"2024-11-26","arxiv_id":"2411.17661","repositories_listed":1,"syntology":null},{"url":"/paper/comprehensive-dataset-of-user-submitted","title":"Comprehensive dataset of user-submitted articles with ideological and extreme bias from Reddit","date":"2024-08-12","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/rico-reddit-ideological-communities","title":"RICo: Reddit ideological communities","date":"2024-06-05","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/exploring-tokenization-strategies-and","title":"Exploring Tokenization Strategies and Vocabulary Sizes for Enhanced Arabic Language Models","date":"2024-03-17","arxiv_id":"2403.11130","repositories_listed":1,"syntology":null},{"url":"/paper/improving-black-box-robustness-with-in","title":"Improving Black-box Robustness with In-Context Rewriting","date":"2024-02-13","arxiv_id":"2402.08225","repositories_listed":1,"syntology":null},{"url":"/paper/interpretcc-conditional-computation-for","title":"Intrinsic User-Centric Interpretability through Global Mixture of Experts","date":"2024-02-05","arxiv_id":"2402.02933","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/benchmarking-multilabel-topic-classification","title":"Benchmarking Multilabel Topic Classification in the Kyrgyz Language","date":"2023-08-30","arxiv_id":"2308.15952","repositories_listed":1,"syntology":null},{"url":"/paper/a-dataset-and-strong-baselines-for","title":"A Dataset and Strong Baselines for Classification of Czech News Texts","date":"2023-07-20","arxiv_id":"2307.10666","repositories_listed":1,"syntology":null},{"url":"/paper/masakhanews-news-topic-classification-for","title":"MasakhaNEWS: News Topic Classification for African languages","date":"2023-04-19","arxiv_id":"2304.09972","repositories_listed":1,"syntology":null},{"url":"/paper/classifying-the-ideological-orientation-of","title":"Classifying the Ideological Orientation of User-Submitted Texts in Social Media","date":"2022-12-12","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/wild-time-a-benchmark-of-in-the-wild","title":"Wild-Time: A Benchmark of in-the-Wild Distribution Shift over Time","date":"2022-11-25","arxiv_id":"2211.14238","repositories_listed":1,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/multiverse-multilingual-evidence-for-fake","title":"Multiverse: Multilingual Evidence for Fake News Detection","date":"2022-11-25","arxiv_id":"2211.14279","repositories_listed":1,"syntology":null},{"url":"/paper/astock-a-new-dataset-and-automated-stock","title":"Astock: A New Dataset and Automated Stock Trading based on Stock-specific News Analyzing Model","date":"2022-06-14","arxiv_id":"2206.06606","repositories_listed":1,"syntology":null},{"url":"/paper/does-transliteration-help-multilingual","title":"Does Transliteration Help Multilingual Language Modeling?","date":"2022-01-29","arxiv_id":"2201.12501","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/transforming-fake-news-robust-generalisable","title":"Transforming Fake News: Robust Generalisable News Classification Using Transformers","date":"2021-09-20","arxiv_id":"2109.09796","repositories_listed":1,"syntology":null},{"url":"/paper/n15news-a-new-dataset-for-multimodal-news","title":"N24News: A New Dataset for Multimodal News Classification","date":"2021-08-30","arxiv_id":"2108.13327","repositories_listed":1,"syntology":null},{"url":"/paper/cross-lingual-evidence-improves-monolingual","title":"Cross-lingual Evidence Improves Monolingual Fake News Detection","date":"2021-08-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/evaluating-various-tokenizers-for-arabic-text","title":"Evaluating Various Tokenizers for Arabic Text Classification","date":"2021-06-14","arxiv_id":"2106.07540","repositories_listed":1,"syntology":null},{"url":"/paper/aracovid19-mfh-arabic-covid-19-multi-label","title":"AraCOVID19-MFH: Arabic COVID-19 Multi-label Fake News and Hate Speech Detection Dataset","date":"2021-05-07","arxiv_id":"2105.03143","repositories_listed":1,"syntology":null},{"url":"/paper/graph-convolutional-network-for-swahili-news","title":"Graph Convolutional Network for Swahili News Classification","date":"2021-03-16","arxiv_id":"2103.09325","repositories_listed":1,"syntology":null},{"url":"/paper/indicnlpsuite-monolingual-corpora-evaluation","title":"IndicNLPSuite: Monolingual Corpora, Evaluation Benchmarks and Pre-trained Multilingual Language Models for Indian Languages","date":"2020-11-08","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/kinnews-and-kirnews-benchmarking-cross","title":"KINNEWS and KIRNEWS: Benchmarking Cross-Lingual Text Classification for Kinyarwanda and Kirundi","date":"2020-10-23","arxiv_id":"2010.12174","repositories_listed":1,"syntology":null},{"url":"/paper/assessing-robustness-of-text-classification","title":"Assessing Robustness of Text Classification through Maximal Safe Radius Computation","date":"2020-10-01","arxiv_id":"2010.02004","repositories_listed":1,"syntology":null}],"syntology_records":4,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}