{"url":"/dataset/databricks-dolly-15k","name":"Databricks Dolly 15k","full_name":"databricks-dolly-15k","description_markdown":"**Databricks Dolly 15k** is a dataset containing 15,000 high-quality human-generated prompt / response pairs specifically designed for instruction tuning large language models. It is authored by more than 5,000 Databricks employees during March and April of 2023. The training records are natural, expressive and designed to represent a wide range of the behaviors, from brainstorming and content generation to information extraction and summarization.\r\n\r\nSource: [Free Dolly: Introducing the World's First Truly Open Instruction-Tuned LLM](https://www.databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm)","description_withheld":null,"homepage":"https://github.com/databrickslabs/dolly","introduced_date":"2012-06-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/100-things-you-always-wanted-to-know-about","title":"100 Things You Always Wanted to Know about Linguistics But Were Afraid to Ask*","first_author":"Emily M. Bender","url":null},"license":{"name":"Creative Commons Attribution-ShareAlike 3.0 Unported License","url":"https://creativecommons.org/licenses/by-sa/3.0/"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Language Modelling","url":"/task/language-modelling","datasets_with_task":"/datasets/task/language-modelling"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["Databricks Dolly 15k"],"data_loaders":[],"num_papers_in_archive":4,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}