{"url":"/dataset/benchmark-for-neural-paraphrase-detection","name":"Autoencoder Paraphrase Dataset (AEPD)","full_name":null,"description_markdown":"This is a benchmark for neural paraphrase detection, to differentiate between original and machine-generated content.\r\n\r\n####Training:\r\n1,474,230 aligned paragraphs (98,282 original, 1,375,948 paraphrased with 3 models and 5 hyperparameter configurations each 98,282) extracted from 4,012 (English) Wikipedia articles.\r\n\r\n####Testing:\r\n```\r\nBERT-large (cased): \r\n    arXiv             - Original - 20,966;     Paraphrased - 20,966; \r\n    Theses          - Original - 5,226;      Paraphrased - 5,226;\r\n    Wikipedia      - Original - 39,241;     Paraphrased - 39,241;\r\n    \r\nRoBERTa-large (cased): \r\n    arXiv             - Original - 20,966;     Paraphrased - 20,966; \r\n    Theses          - Original - 5,226;      Paraphrased - 5,226;\r\n    Wikipedia      - Original - 39,241;     Paraphrased - 39,241;\r\n\r\nLongformer-large (uncased): \r\n    arXiv             - Original - 20,966;     Paraphrased - 20,966; \r\n    Theses          - Original - 5,226;      Paraphrased - 5,226;\r\n    Wikipedia      - Original - 39,241;     Paraphrased - 39,241;\r\n```","description_withheld":null,"homepage":"https://zenodo.org/record/4621403#.YFs1Xkj7SL8","introduced_date":"2021-03-23","introduced_date_note":null,"introduced_by":{"paper":"/paper/are-neural-language-models-good-plagiarists-a","title":"Are Neural Language Models Good Plagiarists? A Benchmark for Neural Paraphrase Detection","first_author":"Jan Philip Wahle","url":null},"license":{"name":"Creative Commons Attribution 4.0 International","url":"https://creativecommons.org/licenses/by/4.0/legalcode"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Paraphrase Identification","url":"/task/paraphrase-identification","datasets_with_task":"/datasets/task/paraphrase-identification"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["Autoencoder Paraphrase Dataset (AEPD)"],"data_loaders":[],"num_papers_in_archive":1,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-25T09:33:49+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}