{"url":"/dataset/uspto-backgrounds-1","name":"USPTO Backgrounds","full_name":null,"description_markdown":"The **USPTO Backgrounds dataset** provides valuable information related to patents and trademarks. Here are some key datasets available from the United States Patent and Trademark Office (USPTO):\r\n\r\n1. **Trademark Daily XML File (TDXF) Applications**:\r\n   - Contains pending and registered trademark text data (no images) for word marks, serial numbers, registration numbers, filing dates, registration dates, goods and services, classification numbers, status codes, design search codes, and pseudo marks in **CY2024**.\r\n   - Format: eXtensible Markup Language (XML) based on the U.S. Trademark Assignments Version 2.0 Document Type Definition (DTD).\r\n   - [Download here](https://developer.uspto.gov/data?search_api_fulltext=csv) ¹.\r\n\r\n2. **Trademark Daily XML File (TDXF) Assignments**:\r\n   - Includes assignment text data (no images) for trademark assignments in **CY2024**.\r\n   - Format: XML based on the U.S. Trademark Assignments Version 0.4 DTD.\r\n   - [Download here](https://developer.uspto.gov/data?op=&search_api_fulltext=EXCEL) ³.\r\n\r\n3. **Trademark Daily XML File (TDXF) Trademark Trial and Appeal Board (TTAB)**:\r\n   - Provides TTAB text data (no images) for trademark trial and appeal board cases in **CY2024**.\r\n   - Format: XML based on the U.S. Trademark Trial and Appeal Board Version 1.0 DTD.\r\n   - [Download here](https://developer.uspto.gov/data?page=1) ⁴.\r\n\r\n4. **Patent Application Multi-Page PDF Images**:\r\n   - Contains images of each patent application (non-provisional utility and plant) published weekly from **March 15, 2001** to present.\r\n   - Format: Portable Document Format (PDF) created from the Patent Application Single-Page TIFF Images.\r\n   - Approximately **11 GB** (compressed) per week.\r\n   - [Download here](https://developer.uspto.gov/data) ¹.\r\n\r\n5. **Patent Application Data/XML**:\r\n   - Includes full text, images/drawings, and complex work units (tables, mathematical expressions, chemical structures, genetic sequence data) of each patent application (non-provisional utility and plant) published weekly.\r\n   - Format: XML based on the Patent Application International Common Element (ICE) DTD.\r\n   - [Download here](https://developer.uspto.gov/data) ¹.\r\n\r\n6. **Patent Application Full Text Data/XML**:\r\n   - Contains the full text of each patent application (non-provisional utility and plant) published weekly (excluding images/drawings).\r\n   - Format: XML based on the Patent Application International Common Element (ICE) DTD.\r\n   - [Download here](https://developer.uspto.gov/data) ¹.\r\n\r\n(1) USPTO Datasets - United States Patent and Trademark Office. https://developer.uspto.gov/data.\r\n(2) USPTO Datasets | United States Patent and Trademark Office - Open Data .... https://developer.uspto.gov/data?op=&search_api_fulltext=EXCEL.\r\n(3) USPTO Datasets | United States Patent and Trademark Office - Open Data .... https://developer.uspto.gov/data?page=1.\r\n(4) USPTO Datasets - United States Patent and Trademark Office. https://developer.uspto.gov/data?search_api_fulltext=csv.\r\n(5) Research datasets | USPTO. https://www.uspto.gov/ip-policy/economic-research/research-datasets.","description_withheld":null,"homepage":"https://developer.uspto.gov/data","introduced_date":null,"introduced_date_note":null,"introduced_by":null,"license":null,"modalities":[],"tasks":[{"name":"Language Modelling","url":"/task/language-modelling","datasets_with_task":"/datasets/task/language-modelling"}],"languages":[],"variants":[" USPTO Backgrounds","USPTO Backgrounds"],"data_loaders":[],"num_papers_in_archive":1,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/language-modelling-on-uspto-backgrounds","task":"Language Modelling","dataset_variant":"USPTO Backgrounds","rows":1,"metrics":["BPB"],"first_row_in_archive_order":{"model":"Gopher","paper":"/paper/scaling-language-models-methods-analysis-1","metrics":{"BPB":"0.546"},"code_links":[{"title":"allenai/dolma","url":"https://github.com/allenai/dolma"},{"title":"rvlopes/gloria","url":"https://github.com/rvlopes/gloria"},{"title":"bramiozo/PubScience","url":"https://github.com/bramiozo/PubScience"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/scaling-language-models-methods-analysis-1","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","date":"2021-12-08","rows_on_this_dataset":1,"code_links":3,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}