{"url":"/sota/on-web-bench","task":{"name":null,"url":null,"note":"task not recorded in the archive for this table"},"dataset":{"name":"Web-Bench","url":"/dataset/web-bench"},"category":null,"categories":["Adversarial","Audio","Computer Code","Computer Vision","Medical","Methodology","Miscellaneous","Music","Natural Language Processing","Reasoning","Speech"],"category_note":"the archive's category list for this table covers most areas; treated as no area assigned","description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Pass@1","Pass@2"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Pass@1":null,"Pass@2":null}},"counts":{"rows":40,"rows_with_code":40,"rows_with_paper_page":40,"rows_dated":40,"rows_using_additional_data":0},"rows":[{"rank_in_archive_order":1,"model":"claude-3-7-sonnet-20250219-thinking","metrics":{"Pass@1":"25.11%","Pass@2":"35.33%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"claude-3-5-sonnet-20241022","metrics":{"Pass@1":"23.04%","Pass@2":"32.39%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":3,"model":"claude-3-7-sonnet-20250219","metrics":{"Pass@1":"22.50%","Pass@2":"30.98%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":4,"model":"claude-3-5-sonnet-20240620","metrics":{"Pass@1":"21.96%","Pass@2":"30.33%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":5,"model":"gpt-4.1","metrics":{"Pass@1":"21.09%","Pass@2":"25.11%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":6,"model":"gpt-4.1-mini","metrics":{"Pass@1":"20.76%","Pass@2":"23.70%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":7,"model":"doubao-pro-1.5-thinking","metrics":{"Pass@1":"20.11%","Pass@2":"30.22%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":8,"model":"gpt-4o","metrics":{"Pass@1":"17.17%","Pass@2":"23.80%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"deepseek-v3-0324","metrics":{"Pass@1":"17.07%","Pass@2":"23.59%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":10,"model":"deepseek-coder-v2","metrics":{"Pass@1":"16.74%","Pass@2":"23.15%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":11,"model":"doubao-pro-1.5-32k","metrics":{"Pass@1":"16.63%","Pass@2":"22.93%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"llama-4 Maverick","metrics":{"Pass@1":"15.98%","Pass@2":"20.87%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"qwen-max-2025-01-25","metrics":{"Pass@1":"15.87%","Pass@2":"19.02%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"gemini-2.5-pro","metrics":{"Pass@1":"15.67%","Pass@2":"24.02%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"claude-3-5-haiku-20241022","metrics":{"Pass@1":"15.43%","Pass@2":"21.74%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"gemini-2.0-flash","metrics":{"Pass@1":"15.33%","Pass@2":"20.87%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"gemini-2.0-flash-thinking","metrics":{"Pass@1":"14.89%","Pass@2":"19.24%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"gemini-pro-1.5","metrics":{"Pass@1":"14.78%","Pass@2":"20.87%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"deepseek-r1","metrics":{"Pass@1":"14.46%","Pass@2":"26.20%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"step-fun-2-16k","metrics":{"Pass@1":"13.70%","Pass@2":"15.87%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"o4-mini","metrics":{"Pass@1":"13.26%","Pass@2":"22.93%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":22,"model":"mistral-large-2411","metrics":{"Pass@1":"13.04%","Pass@2":"18.70%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"gemini-flash-1.5","metrics":{"Pass@1":"12.83%","Pass@2":"17.07%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"qwen-plus-2025-01-25","metrics":{"Pass@1":"11.85%","Pass@2":"15.11%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"grok-2-1212","metrics":{"Pass@1":"11.30%","Pass@2":"17.17%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":26,"model":"qwen-2.5-72b-instruct","metrics":{"Pass@1":"10.54%","Pass@2":"13.70%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"o1","metrics":{"Pass@1":"10.43%","Pass@2":"12.39%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"gemma-3-27b","metrics":{"Pass@1":"9.89%","Pass@2":"11.85%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":29,"model":"o3-mini","metrics":{"Pass@1":"9.13%","Pass@2":"14.24%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":30,"model":"gpt-4o-mini","metrics":{"Pass@1":"8.48%","Pass@2":"13.04%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":31,"model":"sense-chat-5","metrics":{"Pass@1":"8.48%","Pass@2":"12.72%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"minimax-text","metrics":{"Pass@1":"8.48%","Pass@2":"10.76%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":33,"model":"360-gpt2-o1","metrics":{"Pass@1":"8.26%","Pass@2":"14.46%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"GLM-4-0414","metrics":{"Pass@1":"7.50%","Pass@2":"9.02%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":35,"model":"gpt-4.1-nano","metrics":{"Pass@1":"7.07%","Pass@2":"12.28%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"llama-3.3","metrics":{"Pass@1":"6.63%","Pass@2":"9.57%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"moonshot-kimi-latest","metrics":{"Pass@1":"5.22%","Pass@2":"11.85%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":38,"model":"llama-4 Scout","metrics":{"Pass@1":"5.00%","Pass@2":"7.72%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":39,"model":"doubao-pro-1.5-32k-lite","metrics":{"Pass@1":"3.48%","Pass@2":"5.98%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null},{"rank_in_archive_order":40,"model":"qwen-turbo-2024-11-01","metrics":{"Pass@1":"2.61%","Pass@2":"5.11%"},"uses_additional_data":false,"paper_date":"2025-05-12","paper":"/paper/web-bench-a-llm-code-benchmark-based-on-web","paper_url":"https://arxiv.org/abs/2505.07473v1","paper_title":"Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks","code":"https://github.com/bytedance/Web-Bench","n_code_links":1,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":0,"rows_with_any_sample_ran":0,"distinct_papers_with_graph_line":0,"distinct_papers_with_any_sample_ran":0,"samples_over_distinct_papers":{"n_ran":0,"n_unverified":0,"n_samples":0,"n_pointer_only_licence":0,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":0,"n_unverified":0,"n_samples":0,"n_pointer_only_licence":0,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}