{"url":"/dataset/sas-bench","name":"SAS-Bench","full_name":null,"description_markdown":"SAS-Bench represents the first specialized benchmark for evaluating Large Language Models (LLMs) on Short Answer Scoring (SAS) tasks. Utilizing authentic questions from China's National College Entrance Examination (Gaokao), our benchmark offers:\r\n\r\n- 1,030 questions spanning 9 academic disciplines\r\n- 4,109 expert-annotated student responses\r\n- Step-wise scoring with Step-wise error analysis\r\n- Multi-dimensional evaluation (holistic scoring, step-wise scoring, and error diagnosis consistency)","description_withheld":null,"homepage":"https://huggingface.co/datasets/aleversn/SAS-Bench","introduced_date":"2025-05-12","introduced_date_note":null,"introduced_by":{"paper":"/paper/sas-bench-a-fine-grained-benchmark-for","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","first_author":"Peichao Lai","url":null},"license":{"name":"Apache License 2.0","url":"https://huggingface.co/datasets/aleversn/SAS-Bench"},"modalities":[],"tasks":[{"name":"automatic short answer grading","url":"/task/automatic-short-answer-grading","datasets_with_task":"/datasets/task/automatic-short-answer-grading"}],"languages":[{"name":"Chinese","url":"/datasets/language/chinese"}],"variants":["SAS-Bench"],"data_loaders":[],"num_papers_in_archive":1,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}