{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/census/repeat-kv","entry":"repeat_kv","source":"Syntology differential census (groundwork/55, run v2_2026-09-22), per sample; not an archive number","census_date":"2026-09-22","battery_sha256":["b986f7e04d794a0d88ad4c5f32cf63ec3590b5deff0192150737bc5f1c0b4677"],"runner_sha256":["5a452d0e7c0da5b80771d1be2afe3572e253568cf5c5d59a0d08ebd663d00808"],"bucket_key":"positional (rank, kind, dtype) of each array argument; the argument name is not part of the key because the harness draws the shared array from (rank, kind) and casts it to the dtype, whatever the name","bucket_fields":["rank","kind","dtype"],"claim":"Implementations sharing this entry name were each run on one shared input fixed by the positional (rank, kind, dtype) of their array arguments (the bucket). A cluster is the set whose recorded output digest (sha256 of the output rounded to 6 decimals) is identical. Identical values to six decimals on the shared input are agreement on those inputs, not a statement about the whole domain and not a substitution claim.","n_implementations_compared":15,"n_papers":60,"n_buckets":1,"n_distinct_outputs":2,"n_class_bearing":0,"not_compared":{"not_run_on_shared_input":{"n":0,"by_error":{}},"no_array_argument_ran_on_own_fixture_arguments_only":{"n":0,"n_papers":0,"recorded_shared_digest_equals_own_fixture_digest":0},"output_not_digested_non_numeric":{"n":0,"by_type":{}}},"withdrawn_excluded":0,"code_page":"/code/repeat-kv","buckets":[{"bucket":[[4,"float","float32"]],"n_implementations_compared":15,"n_papers":60,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"78125b9a9282a1ab","size":12,"n_papers":56,"shape":[2,6,4,4],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":0.0,"members_with_recorded_values":12,"torch_reference_conventions_with_this_digest":[],"values":[0.7231047749519348,0.6530793309211731,1.4460861682891846,1.0985400676727295,1.1372957229614258,-0.19992724061012268,-0.2714869976043701,0.8319791555404663,0.3433533310890198,-0.13238386809825897,-1.1905570030212402,-0.012713957577943802,-0.709074079990387,-0.4362029433250427,-2.665717124938965,0.812962532043457,0.7231047749519348,0.6530793309211731,1.4460861682891846,1.0985400676727295,1.1372957229614258,-0.19992724061012268,-0.2714869976043701,0.8319791555404663,0.3433533310890198,-0.13238386809825897,-1.1905570030212402,-0.012713957577943802,-0.709074079990387,-0.4362029433250427,-2.665717124938965,0.812962532043457,-0.45303258299827576,0.12553228437900543,0.5928415060043335,-1.463806390762329,-0.7250184416770935,1.1514394283294678,-0.3975509703159332,1.4335219860076904,0.22366678714752197,1.184694528579712,-2.0680742263793945,-0.16907231509685516,0.3742450773715973,0.00391392083838582,0.895301342010498,-0.4980470836162567,-0.45303258299827576,0.12553228437900543,0.5928415060043335,-1.463806390762329,-0.7250184416770935,1.1514394283294678,-0.3975509703159332,1.4335219860076904,0.22366678714752197,1.184694528579712,-2.0680742263793945,-0.16907231509685516,0.3742450773715973,0.00391392083838582,0.895301342010498,-0.4980470836162567,-0.4213716387748718,1.020633339881897,-0.4836711883544922,-0.4854681193828583,-0.6618722677230835,1.982889175415039,0.2125764787197113,-1.2040232419967651,-0.21204684674739838,-1.479430913925171,-0.7425822019577026,1.2173826694488525,0.022702597081661224,-0.16384494304656982,0.3325777053833008,-1.246457576751709,-0.4213716387748718,1.020633339881897,-0.4836711883544922,-0.4854681193828583,-0.6618722677230835,1.982889175415039,0.2125764787197113,-1.2040232419967651,-0.21204684674739838,-1.479430913925171,-0.7425822019577026,1.2173826694488525,0.022702597081661224,-0.16384494304656982,0.3325777053833008,-1.246457576751709,1.0319796800613403,0.47569993138313293,2.1016592979431152,-0.01877530850470066,1.654322624206543,-0.6244865655899048,-2.408447742462158,-0.21435445547103882,-1.3870023488998413,-2.00654673576355,-1.3687102794647217,-0.026417039334774017,-2.796109437942505,-0.7385192513465881,-0.6348524689674377,0.21286723017692566,1.0319796800613403,0.47569993138313293,2.1016592979431152,-0.01877530850470066,1.654322624206543,-0.6244865655899048,-2.408447742462158,-0.21435445547103882,-1.3870023488998413,-2.00654673576355,-1.3687102794647217,-0.026417039334774017,-2.796109437942505,-0.7385192513465881,-0.6348524689674377,0.21286723017692566,0.8440517783164978,-1.0907533168792725,0.7723703980445862,2.0942370891571045,0.4846275746822357,0.022118685767054558,3.1044223308563232,0.0736190527677536,0.6060231924057007,0.28421318531036377,0.5158193111419678,-0.6696537733078003,1.0927388668060303,0.267061322927475,0.6621701121330261,0.2371496558189392,0.8440517783164978,-1.0907533168792725,0.7723703980445862,2.0942370891571045,0.4846275746822357,0.022118685767054558,3.1044223308563232,0.0736190527677536,0.6060231924057007,0.28421318531036377,0.5158193111419678,-0.6696537733078003,1.0927388668060303,0.267061322927475,0.6621701121330261,0.2371496558189392,-2.2168080806732178,-0.08749820291996002,0.16540314257144928,-0.8387367129325867,0.7167379260063171,1.2303640842437744,-1.5213911533355713,1.0778614282608032,0.22837327420711517,0.4391850531101227,1.9725817441940308,-1.1686570644378662,0.49750959873199463,0.14785639941692352,-1.3677366971969604,-0.28564757108688354,-2.2168080806732178,-0.08749820291996002,0.16540314257144928,-0.8387367129325867,0.7167379260063171,1.2303640842437744,-1.5213911533355713,1.0778614282608032,0.22837327420711517,0.4391850531101227,1.9725817441940308,-1.1686570644378662,0.49750959873199463,0.14785639941692352,-1.3677366971969604,-0.28564757108688354],"values_recorded":192,"members":[{"code_sha256_prefix":"30d7eec482ebf6b1","path":"modeling_xalma.py","papers":["2309.11499","2309.11674","2404.10308","2405.13845","2407.12665","2410.11842","2410.11988","2502.06352","2503.11187","2505.20674","2305.17888","2308.10882","2401.01325","2310.11453","2311.17911","2403.09629","2312.15166","2405.12532","2408.02032","2410.17247","2410.07348","2403.05527","2404.10710","2410.18517","2502.00592","2312.12141","2412.04652","2504.20595","2402.02872","2410.00255","2405.14488","2505.06708","2606.18781","2609.03756"],"paper_pages":[{"arxiv_id":"2309.11499","page":"/paper/dreamllm-synergistic-multimodal-comprehension"},{"arxiv_id":"2309.11674","page":"/paper/a-paradigm-shift-in-machine-translation"},{"arxiv_id":"2404.10308","page":"/paper/hierarchical-context-merging-better-long"},{"arxiv_id":"2405.13845","page":"/paper/semantic-density-uncertainty-quantification"},{"arxiv_id":"2407.12665","page":"/paper/patch-level-training-for-large-language"},{"arxiv_id":"2410.11842","page":"/paper/moh-multi-head-attention-as-mixture-of-head"},{"arxiv_id":"2410.11988","page":"/paper/disp-llm-dimension-independent-structural"},{"arxiv_id":"2502.06352","page":"/paper/lantern-enhanced-relaxed-speculative-decoding"},{"arxiv_id":"2503.11187","page":"/paper/fastvid-dynamic-density-pruning-for-fast"},{"arxiv_id":"2505.20674","page":"/paper/pretraining-language-models-to-ponder-in"},{"arxiv_id":"2305.17888","page":"/paper/llm-qat-data-free-quantization-aware-training"},{"arxiv_id":"2308.10882","page":"/paper/giraffe-adventures-in-expanding-context"},{"arxiv_id":"2401.01325","page":"/paper/llm-maybe-longlm-self-extend-llm-context"},{"arxiv_id":"2310.11453","page":"/paper/bitnet-scaling-1-bit-transformers-for-large"},{"arxiv_id":"2311.17911","page":"/paper/opera-alleviating-hallucination-in-multi"},{"arxiv_id":"2403.09629","page":"/paper/quiet-star-language-models-can-teach"},{"arxiv_id":"2312.15166","page":"/paper/solar-10-7b-scaling-large-language-models"},{"arxiv_id":"2405.12532","page":"/paper/pyramidinfer-pyramid-kv-cache-compression-for"},{"arxiv_id":"2408.02032","page":"/paper/2408-02032"},{"arxiv_id":"2410.17247","page":"/paper/pyramiddrop-accelerating-your-large-vision"},{"arxiv_id":"2410.07348","page":"/paper/moe-accelerating-mixture-of-experts-methods"},{"arxiv_id":"2403.05527","page":"/paper/gear-an-efficient-kv-cache-compression"},{"arxiv_id":"2404.10710","page":"/paper/dual-modalities-of-text-visual-and-textual"},{"arxiv_id":"2410.18517","page":"/paper/kvsharer-efficient-inference-via-layer-wise"},{"arxiv_id":"2502.00592","page":"/paper/m-extending-memoryllm-with-scalable-long-term"},{"arxiv_id":"2312.12141","page":"/paper/exploring-the-residual-stream-of-transformers"},{"arxiv_id":"2412.04652","page":"/paper/cross-self-kv-cache-pruning-for-efficient"},{"arxiv_id":"2504.20595","page":"/paper/reasonir-training-retrievers-for-reasoning"},{"arxiv_id":"2402.02872","page":"/paper/how-do-large-language-models-learn-in-context"},{"arxiv_id":"2410.00255","page":"/paper/robin3d-improving-3d-large-language-model-via"},{"arxiv_id":"2405.14488","page":"/paper/mogu-a-framework-for-enhancing-safety-of-open"},{"arxiv_id":"2505.06708","page":"/paper/gated-attention-for-large-language-models-non"},{"arxiv_id":"2606.18781","page":"/paper/arxiv-2606-18781"},{"arxiv_id":"2609.03756","page":"/paper/arxiv-2609-03756"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"3c76e52815c5401d","path":"time_moe/models/modeling_time_moe.py","papers":["2409.16040","2505.23416","2506.08373","2404.07143","2402.01912","2412.13335","2505.10475","2503.20533","2606.16158","2609.00097"],"paper_pages":[{"arxiv_id":"2409.16040","page":"/paper/time-moe-billion-scale-time-series-foundation"},{"arxiv_id":"2505.23416","page":"/paper/kvzip-query-agnostic-kv-cache-compression"},{"arxiv_id":"2506.08373","page":"/paper/draft-based-approximate-inference-for-llms"},{"arxiv_id":"2404.07143","page":"/paper/leave-no-context-behind-efficient-infinite"},{"arxiv_id":"2402.01912","page":"/paper/natural-language-guidance-of-high-fidelity"},{"arxiv_id":"2412.13335","page":"/paper/experience-of-training-a-1-7b-parameter-llama"},{"arxiv_id":"2505.10475","page":"/paper/parallel-scaling-law-for-language-models"},{"arxiv_id":"2503.20533","page":"/paper/accelerate-parallelizable-reasoning-via"},{"arxiv_id":"2606.16158","page":"/paper/arxiv-2606-16158"},{"arxiv_id":"2609.00097","page":"/paper/arxiv-2609-00097"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"4e762613ee907cdb","path":"src/gemma.py","papers":["1901.02860","2605.18753"],"paper_pages":[{"arxiv_id":"1901.02860","page":"/paper/transformer-xl-attentive-language-models"},{"arxiv_id":"2605.18753","page":"/paper/arxiv-2605-18753"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"ab40781baaa35b67","path":"modeling_mole.py","papers":["2503.15798","2412.00129"],"paper_pages":[{"arxiv_id":"2503.15798","page":"/paper/mixture-of-lookup-experts"},{"arxiv_id":"2412.00129","page":"/paper/scaling-particle-collision-data-analysis"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"0f07b44f9c18969e","path":"src/flas/model.py","papers":["2605.05892"],"paper_pages":[{"arxiv_id":"2605.05892","page":"/paper/arxiv-2605-05892"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"25ef0712acc702e7","path":"SVDLLM.py","papers":["2503.12340"],"paper_pages":[{"arxiv_id":"2503.12340","page":"/paper/svd-llm-v2-optimizing-singular-value"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"31333a36df31a820","path":"model.py","papers":["2302.13971"],"paper_pages":[{"arxiv_id":"2302.13971","page":"/paper/llama-open-and-efficient-foundation-language-1"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"3281dccd4fa39596","path":"model_lib/attention_tools.py","papers":["2309.15098"],"paper_pages":[{"arxiv_id":"2309.15098","page":"/paper/attention-satisfies-a-constraint-satisfaction"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"404c0af567476d50","path":"eval/attention_helpers.py","papers":["2603.00188"],"paper_pages":[{"arxiv_id":"2603.00188","page":"/paper/arxiv-2603-00188"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"6045450d1a869974","path":"trol/arch_internlm2/modeling_trol.py","papers":["2406.12246"],"paper_pages":[{"arxiv_id":"2406.12246","page":"/paper/trol-traversal-of-layers-for-large-language"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"8b9e23cfcb2e7648","path":"Diff-Transformer/multihead_attention.py","papers":["2002.12804"],"paper_pages":[{"arxiv_id":"2002.12804","page":"/paper/unilmv2-pseudo-masked-language-models-for"}],"arg_sig_recorded":[["x",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"ab05d5e4c4236572","path":"src/model/linear_attention/linear_window_attention_sw_linear.py","papers":["2410.10254"],"paper_pages":[{"arxiv_id":"2410.10254","page":"/paper/lolcats-on-low-rank-linearizing-of-large"}],"arg_sig_recorded":[["hidden_states",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false}]},{"output_sha":"2f77db535cd385e5","size":3,"n_papers":4,"shape":[2,3,8,4],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":0.0,"members_with_recorded_values":3,"torch_reference_conventions_with_this_digest":[],"values":[0.7231047749519348,0.6530793309211731,1.4460861682891846,1.0985400676727295,0.7231047749519348,0.6530793309211731,1.4460861682891846,1.0985400676727295,1.1372957229614258,-0.19992724061012268,-0.2714869976043701,0.8319791555404663,1.1372957229614258,-0.19992724061012268,-0.2714869976043701,0.8319791555404663,0.3433533310890198,-0.13238386809825897,-1.1905570030212402,-0.012713957577943802,0.3433533310890198,-0.13238386809825897,-1.1905570030212402,-0.012713957577943802,-0.709074079990387,-0.4362029433250427,-2.665717124938965,0.812962532043457,-0.709074079990387,-0.4362029433250427,-2.665717124938965,0.812962532043457,-0.45303258299827576,0.12553228437900543,0.5928415060043335,-1.463806390762329,-0.45303258299827576,0.12553228437900543,0.5928415060043335,-1.463806390762329,-0.7250184416770935,1.1514394283294678,-0.3975509703159332,1.4335219860076904,-0.7250184416770935,1.1514394283294678,-0.3975509703159332,1.4335219860076904,0.22366678714752197,1.184694528579712,-2.0680742263793945,-0.16907231509685516,0.22366678714752197,1.184694528579712,-2.0680742263793945,-0.16907231509685516,0.3742450773715973,0.00391392083838582,0.895301342010498,-0.4980470836162567,0.3742450773715973,0.00391392083838582,0.895301342010498,-0.4980470836162567,-0.4213716387748718,1.020633339881897,-0.4836711883544922,-0.4854681193828583,-0.4213716387748718,1.020633339881897,-0.4836711883544922,-0.4854681193828583,-0.6618722677230835,1.982889175415039,0.2125764787197113,-1.2040232419967651,-0.6618722677230835,1.982889175415039,0.2125764787197113,-1.2040232419967651,-0.21204684674739838,-1.479430913925171,-0.7425822019577026,1.2173826694488525,-0.21204684674739838,-1.479430913925171,-0.7425822019577026,1.2173826694488525,0.022702597081661224,-0.16384494304656982,0.3325777053833008,-1.246457576751709,0.022702597081661224,-0.16384494304656982,0.3325777053833008,-1.246457576751709,1.0319796800613403,0.47569993138313293,2.1016592979431152,-0.01877530850470066,1.0319796800613403,0.47569993138313293,2.1016592979431152,-0.01877530850470066,1.654322624206543,-0.6244865655899048,-2.408447742462158,-0.21435445547103882,1.654322624206543,-0.6244865655899048,-2.408447742462158,-0.21435445547103882,-1.3870023488998413,-2.00654673576355,-1.3687102794647217,-0.026417039334774017,-1.3870023488998413,-2.00654673576355,-1.3687102794647217,-0.026417039334774017,-2.796109437942505,-0.7385192513465881,-0.6348524689674377,0.21286723017692566,-2.796109437942505,-0.7385192513465881,-0.6348524689674377,0.21286723017692566,0.8440517783164978,-1.0907533168792725,0.7723703980445862,2.0942370891571045,0.8440517783164978,-1.0907533168792725,0.7723703980445862,2.0942370891571045,0.4846275746822357,0.022118685767054558,3.1044223308563232,0.0736190527677536,0.4846275746822357,0.022118685767054558,3.1044223308563232,0.0736190527677536,0.6060231924057007,0.28421318531036377,0.5158193111419678,-0.6696537733078003,0.6060231924057007,0.28421318531036377,0.5158193111419678,-0.6696537733078003,1.0927388668060303,0.267061322927475,0.6621701121330261,0.2371496558189392,1.0927388668060303,0.267061322927475,0.6621701121330261,0.2371496558189392,-2.2168080806732178,-0.08749820291996002,0.16540314257144928,-0.8387367129325867,-2.2168080806732178,-0.08749820291996002,0.16540314257144928,-0.8387367129325867,0.7167379260063171,1.2303640842437744,-1.5213911533355713,1.0778614282608032,0.7167379260063171,1.2303640842437744,-1.5213911533355713,1.0778614282608032,0.22837327420711517,0.4391850531101227,1.9725817441940308,-1.1686570644378662,0.22837327420711517,0.4391850531101227,1.9725817441940308,-1.1686570644378662,0.49750959873199463,0.14785639941692352,-1.3677366971969604,-0.28564757108688354,0.49750959873199463,0.14785639941692352,-1.3677366971969604,-0.28564757108688354],"values_recorded":192,"members":[{"code_sha256_prefix":"6d2a08dcf3466514","path":"models/bam.py","papers":["2505.22842","2203.15556"],"paper_pages":[{"arxiv_id":"2505.22842","page":"/paper/bayesian-attention-mechanism-a-probabilistic"},{"arxiv_id":"2203.15556","page":"/paper/training-compute-optimal-large-language"}],"arg_sig_recorded":[["x",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"07d6ef500d143328","path":"model/model_miniwin.py","papers":["2605.27980"],"paper_pages":[{"arxiv_id":"2605.27980","page":"/paper/arxiv-2605-27980"}],"arg_sig_recorded":[["x",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false},{"code_sha256_prefix":"226c2c7378c2826e","path":"model/model_minimind.py","papers":["2402.14905"],"paper_pages":[{"arxiv_id":"2402.14905","page":"/paper/mobilellm-optimizing-sub-billion-parameter"}],"arg_sig_recorded":[["x",4,"float","float32"]],"scalar_args":{"n_rep":"2"},"class_bearing":false}]}]}]}