{"url":"/dataset/approved-drug-target","name":"approved_drug_target","full_name":"Approved Drug SMILES and Protein Sequence Dataset","description_markdown":"This dataset provides a curated collection of approved drug Simplified Molecular Input Line Entry System (SMILES) strings and their associated protein sequences. Each small molecule has been approved by at least one regulatory body, ensuring the safety and relevance of the data for computational applications. The dataset includes 1,660 approved small molecules and their 2,093 related protein targets.","description_withheld":null,"homepage":"https://huggingface.co/datasets/alimotahharynia/approved_drug_target","introduced_date":"2025-04-18","introduced_date_note":null,"introduced_by":{"paper":"/paper/druggen-enhances-drug-discovery-with-large","title":"DrugGen enhances drug discovery with large language models and reinforcement learning","first_author":"Mahsa Sheikholeslami","url":null},"license":{"name":"cc-by-nc-4.0","url":"https://spdx.org/licenses/CC-BY-NC-4.0"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Drug Discovery","url":"/task/drug-discovery","datasets_with_task":"/datasets/task/drug-discovery"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["approved_drug_target"],"data_loaders":[],"num_papers_in_archive":1,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}