{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/census/rotate-half","entry":"rotate_half","source":"Syntology differential census (groundwork/55, run v2_2026-09-22), per sample; not an archive number","census_date":"2026-09-22","battery_sha256":["b986f7e04d794a0d88ad4c5f32cf63ec3590b5deff0192150737bc5f1c0b4677"],"runner_sha256":["5a452d0e7c0da5b80771d1be2afe3572e253568cf5c5d59a0d08ebd663d00808"],"bucket_key":"positional (rank, kind, dtype) of each array argument; the argument name is not part of the key because the harness draws the shared array from (rank, kind) and casts it to the dtype, whatever the name","bucket_fields":["rank","kind","dtype"],"claim":"Implementations sharing this entry name were each run on one shared input fixed by the positional (rank, kind, dtype) of their array arguments (the bucket). A cluster is the set whose recorded output digest (sha256 of the output rounded to 6 decimals) is identical. Identical values to six decimals on the shared input are agreement on those inputs, not a statement about the whole domain and not a substitution claim.","n_implementations_compared":24,"n_papers":96,"n_buckets":2,"n_distinct_outputs":4,"n_class_bearing":0,"not_compared":{"not_run_on_shared_input":{"n":0,"by_error":{}},"no_array_argument_ran_on_own_fixture_arguments_only":{"n":0,"n_papers":0,"recorded_shared_digest_equals_own_fixture_digest":0},"output_not_digested_non_numeric":{"n":0,"by_type":{}}},"withdrawn_excluded":0,"code_page":"/code/rotate-half","buckets":[{"bucket":[[2,"float","float32"]],"n_implementations_compared":21,"n_papers":93,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"e9dcbf18fea68658","size":15,"n_papers":83,"shape":[4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":0.0,"members_with_recorded_values":15,"torch_reference_conventions_with_this_digest":["halves"],"values":[0.9028494954109192,1.0304712057113647,0.6627609133720398,-0.5728892087936401,1.8026286363601685,-1.5337762832641602,0.47605323791503906,-0.6908870339393616,0.28853508830070496,-2.322108745574951,0.5147839784622192,-0.5505285859107971,0.5188759565353394,0.9591456651687622,-0.3971995711326599,-1.5683481693267822,0.02259422466158867,1.180782437324524,0.5368682742118835,-0.983674168586731,0.06639543920755386,-1.6228755712509155,0.4321114122867584,-0.4061858654022217,1.225785732269287,-1.274217963218689,1.3222218751907349,0.5941091179847717,-0.7956128120422363,0.43327441811561584,0.9449777603149414,1.0175182819366455],"values_recorded":32,"members":[{"code_sha256_prefix":"b99eea6376d1e212","path":"modeling_xalma.py","papers":["2307.03170","2309.11499","2309.11674","2404.10308","2405.13845","2407.12665","2410.11842","2410.11988","2502.06352","2502.15618","2503.01773","2503.11187","2505.20674","2306.15595","2310.19785","2305.17888","2308.10882","2401.01325","2310.11511","2310.11453","2311.17911","2403.09629","2403.07652","2312.15166","2404.07413","2405.12532","2402.10685","2408.02032","2410.17247","2402.05406","2407.04620","2410.07348","2412.17743","2402.04647","2403.05527","2404.10710","2410.18517","2502.00592","2503.09427","2501.15368","2312.12141","2504.20595","2402.02872","2410.00255","2405.14488","2410.10814","2505.06708","2608.20382","2609.03756"],"paper_pages":[{"arxiv_id":"2307.03170","page":"/paper/focused-transformer-contrastive-training-for"},{"arxiv_id":"2309.11499","page":"/paper/dreamllm-synergistic-multimodal-comprehension"},{"arxiv_id":"2309.11674","page":"/paper/a-paradigm-shift-in-machine-translation"},{"arxiv_id":"2404.10308","page":"/paper/hierarchical-context-merging-better-long"},{"arxiv_id":"2405.13845","page":"/paper/semantic-density-uncertainty-quantification"},{"arxiv_id":"2407.12665","page":"/paper/patch-level-training-for-large-language"},{"arxiv_id":"2410.11842","page":"/paper/moh-multi-head-attention-as-mixture-of-head"},{"arxiv_id":"2410.11988","page":"/paper/disp-llm-dimension-independent-structural"},{"arxiv_id":"2502.06352","page":"/paper/lantern-enhanced-relaxed-speculative-decoding"},{"arxiv_id":"2502.15618","page":"/paper/probe-pruning-accelerating-llms-through"},{"arxiv_id":"2503.01773","page":"/paper/why-is-spatial-reasoning-hard-for-vlms-an"},{"arxiv_id":"2503.11187","page":"/paper/fastvid-dynamic-density-pruning-for-fast"},{"arxiv_id":"2505.20674","page":"/paper/pretraining-language-models-to-ponder-in"},{"arxiv_id":"2306.15595","page":"/paper/extending-context-window-of-large-language"},{"arxiv_id":"2310.19785","page":"/paper/what-s-up-with-vision-language-models"},{"arxiv_id":"2305.17888","page":"/paper/llm-qat-data-free-quantization-aware-training"},{"arxiv_id":"2308.10882","page":"/paper/giraffe-adventures-in-expanding-context"},{"arxiv_id":"2401.01325","page":"/paper/llm-maybe-longlm-self-extend-llm-context"},{"arxiv_id":"2310.11511","page":"/paper/self-rag-learning-to-retrieve-generate-and"},{"arxiv_id":"2310.11453","page":"/paper/bitnet-scaling-1-bit-transformers-for-large"},{"arxiv_id":"2311.17911","page":"/paper/opera-alleviating-hallucination-in-multi"},{"arxiv_id":"2403.09629","page":"/paper/quiet-star-language-models-can-teach"},{"arxiv_id":"2403.07652","page":"/paper/harder-tasks-need-more-experts-dynamic"},{"arxiv_id":"2312.15166","page":"/paper/solar-10-7b-scaling-large-language-models"},{"arxiv_id":"2404.07413","page":"/paper/jetmoe-reaching-llama2-performance-with-0-1m"},{"arxiv_id":"2405.12532","page":"/paper/pyramidinfer-pyramid-kv-cache-compression-for"},{"arxiv_id":"2402.10685","page":"/paper/longheads-multi-head-attention-is-secretly-a"},{"arxiv_id":"2408.02032","page":"/paper/2408-02032"},{"arxiv_id":"2410.17247","page":"/paper/pyramiddrop-accelerating-your-large-vision"},{"arxiv_id":"2402.05406","page":"/paper/everybody-prune-now-structured-pruning-of"},{"arxiv_id":"2407.04620","page":"/paper/learning-to-learn-at-test-time-rnns-with"},{"arxiv_id":"2410.07348","page":"/paper/moe-accelerating-mixture-of-experts-methods"},{"arxiv_id":"2412.17743","page":"/paper/yulan-mini-an-open-data-efficient-language"},{"arxiv_id":"2402.04647","page":"/paper/latent-plan-transformer-planning-as-latent"},{"arxiv_id":"2403.05527","page":"/paper/gear-an-efficient-kv-cache-compression"},{"arxiv_id":"2404.10710","page":"/paper/dual-modalities-of-text-visual-and-textual"},{"arxiv_id":"2410.18517","page":"/paper/kvsharer-efficient-inference-via-layer-wise"},{"arxiv_id":"2502.00592","page":"/paper/m-extending-memoryllm-with-scalable-long-term"},{"arxiv_id":"2503.09427","page":"/paper/multimodal-language-modeling-for-high"},{"arxiv_id":"2501.15368","page":"/paper/baichuan-omni-1-5-technical-report"},{"arxiv_id":"2312.12141","page":"/paper/exploring-the-residual-stream-of-transformers"},{"arxiv_id":"2504.20595","page":"/paper/reasonir-training-retrievers-for-reasoning"},{"arxiv_id":"2402.02872","page":"/paper/how-do-large-language-models-learn-in-context"},{"arxiv_id":"2410.00255","page":"/paper/robin3d-improving-3d-large-language-model-via"},{"arxiv_id":"2405.14488","page":"/paper/mogu-a-framework-for-enhancing-safety-of-open"},{"arxiv_id":"2410.10814","page":"/paper/your-mixture-of-experts-llm-is-secretly-an"},{"arxiv_id":"2505.06708","page":"/paper/gated-attention-for-large-language-models-non"},{"arxiv_id":"2608.20382","page":"/paper/arxiv-2608-20382"},{"arxiv_id":"2609.03756","page":"/paper/arxiv-2609-03756"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"e03d53ba9d4f9ae5","path":"time_moe/models/modeling_time_moe.py","papers":["2409.16040","2503.11187","2310.08278","2404.07143","2312.06968","2412.13335","2406.19598","2505.10475","2503.20533","2607.21595","2609.00097"],"paper_pages":[{"arxiv_id":"2409.16040","page":"/paper/time-moe-billion-scale-time-series-foundation"},{"arxiv_id":"2503.11187","page":"/paper/fastvid-dynamic-density-pruning-for-fast"},{"arxiv_id":"2310.08278","page":"/paper/lag-llama-towards-foundation-models-for-time"},{"arxiv_id":"2404.07143","page":"/paper/leave-no-context-behind-efficient-infinite"},{"arxiv_id":"2312.06968","page":"/paper/hallucination-augmented-contrastive-learning"},{"arxiv_id":"2412.13335","page":"/paper/experience-of-training-a-1-7b-parameter-llama"},{"arxiv_id":"2406.19598","page":"/paper/mixture-of-in-context-experts-enhance-llms"},{"arxiv_id":"2505.10475","page":"/paper/parallel-scaling-law-for-language-models"},{"arxiv_id":"2503.20533","page":"/paper/accelerate-parallelizable-reasoning-via"},{"arxiv_id":"2607.21595","page":"/paper/arxiv-2607-21595"},{"arxiv_id":"2609.00097","page":"/paper/arxiv-2609-00097"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"437c7011506995a3","path":"src/language/transformer.py","papers":["2410.08417","2510.12764","2502.08769","2606.18703","2609.15740"],"paper_pages":[{"arxiv_id":"2410.08417","page":"/paper/bilinear-mlps-enable-weight-based-mechanistic"},{"arxiv_id":"2510.12764","page":"/paper/arxiv-2510-12764"},{"arxiv_id":"2502.08769","page":"/paper/cluster-and-predict-latents-patches-for"},{"arxiv_id":"2606.18703","page":"/paper/arxiv-2606-18703"},{"arxiv_id":"2609.15740","page":"/paper/arxiv-2609-15740"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"cec833a99feb528c","path":"src/gemma.py","papers":["1901.02860","2607.09754","2601.11522"],"paper_pages":[{"arxiv_id":"1901.02860","page":"/paper/transformer-xl-attentive-language-models"},{"arxiv_id":"2607.09754","page":"/paper/arxiv-2607-09754"},{"arxiv_id":"2601.11522","page":"/paper/arxiv-2601-11522"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"fdd93453f92f9167","path":"retro_pytorch/retro_pytorch.py","papers":["2112.04426","2411.09502","2603.28610"],"paper_pages":[{"arxiv_id":"2112.04426","page":"/paper/improving-language-models-by-retrieving-from"},{"arxiv_id":"2411.09502","page":"/paper/golden-noise-for-diffusion-models-a-learning"},{"arxiv_id":"2603.28610","page":"/paper/arxiv-2603-28610"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"08213c6683993d3b","path":"palm_pytorch/palm_pytorch.py","papers":["2204.02311","2407.14207"],"paper_pages":[{"arxiv_id":"2204.02311","page":"/paper/palm-scaling-language-modeling-with-pathways-1"},{"arxiv_id":"2407.14207","page":"/paper/longhorn-state-space-models-are-amortized"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"0ad8d888b1eb9c46","path":"modeling_mole.py","papers":["2503.15798","2412.00129"],"paper_pages":[{"arxiv_id":"2503.15798","page":"/paper/mixture-of-lookup-experts"},{"arxiv_id":"2412.00129","page":"/paper/scaling-particle-collision-data-analysis"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"8526ce179df04bd4","path":"models/dit_gumbel.py","papers":["2510.24088","2603.22216"],"paper_pages":[{"arxiv_id":"2510.24088","page":"/paper/arxiv-2510-24088"},{"arxiv_id":"2603.22216","page":"/paper/arxiv-2603-22216"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"1964789ef2be9b81","path":"perceiver_ar_pytorch/perceiver_ar_pytorch.py","papers":["2202.07765"],"paper_pages":[{"arxiv_id":"2202.07765","page":"/paper/general-purpose-long-context-autoregressive"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"2a2393c46243da08","path":"SVDLLM.py","papers":["2503.12340"],"paper_pages":[{"arxiv_id":"2503.12340","page":"/paper/svd-llm-v2-optimizing-singular-value"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"4da1a1beab34982c","path":"model/cart.py","papers":["2606.01495"],"paper_pages":[{"arxiv_id":"2606.01495","page":"/paper/arxiv-2606-01495"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"5d0ae16200be190c","path":"models/air/air_1net_L2x_H2x_input_token_prepend.py","papers":["2605.17811"],"paper_pages":[{"arxiv_id":"2605.17811","page":"/paper/arxiv-2605-17811"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"91bc58efb8a6482c","path":"src/genrec/models/model_seqrec/sasrec_sprint.py","papers":["2606.21911"],"paper_pages":[{"arxiv_id":"2606.21911","page":"/paper/arxiv-2606-21911"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"be9b02c5fb845efa","path":"server/block_generate_server.py","papers":["2409.15355"],"paper_pages":[{"arxiv_id":"2409.15355","page":"/paper/block-attention-for-efficient-rag"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"e0782939cfb8d55c","path":"src/flas/model.py","papers":["2605.05892"],"paper_pages":[{"arxiv_id":"2605.05892","page":"/paper/arxiv-2605-05892"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]},{"output_sha":"ccd07400c61f225c","size":6,"n_papers":10,"shape":[4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":0.0,"members_with_recorded_values":6,"torch_reference_conventions_with_this_digest":["interleaved"],"values":[1.5337762832641602,1.8026286363601685,0.6908870339393616,0.47605323791503906,1.0304712057113647,-0.9028494954109192,-0.5728892087936401,-0.6627609133720398,-0.9591456651687622,0.5188759565353394,1.5683481693267822,-0.3971995711326599,-2.322108745574951,-0.28853508830070496,-0.5505285859107971,-0.5147839784622192,1.6228755712509155,0.06639543920755386,0.4061858654022217,0.4321114122867584,1.180782437324524,-0.02259422466158867,-0.983674168586731,-0.5368682742118835,-0.43327441811561584,-0.7956128120422363,-1.0175182819366455,0.9449777603149414,-1.274217963218689,-1.225785732269287,0.5941091179847717,-1.3222218751907349],"values_recorded":32,"members":[{"code_sha256_prefix":"58823d9435a8751b","path":"fairseq/modules/rotary_embedding.py","papers":["2104.09864","2507.03738","2605.27102"],"paper_pages":[{"arxiv_id":"2104.09864","page":"/paper/roformer-enhanced-transformer-with-rotary"},{"arxiv_id":"2507.03738","page":"/paper/flow-anchored-consistency-models"},{"arxiv_id":"2605.27102","page":"/paper/arxiv-2605-27102"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"a3ec43c12656acbb","path":"lightglue/lightglue.py","papers":["2306.13643","2507.02581","2605.14654"],"paper_pages":[{"arxiv_id":"2306.13643","page":"/paper/lightglue-local-feature-matching-at-light"},{"arxiv_id":"2507.02581","page":null},{"arxiv_id":"2605.14654","page":"/paper/arxiv-2605-14654"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"0c3c32d281da5332","path":"LatentMDM/model/latent_mdm.py","papers":["2607.26504"],"paper_pages":[{"arxiv_id":"2607.26504","page":"/paper/arxiv-2607-26504"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"7082304fd2ae76b8","path":"src/models/encoder.py","papers":["2502.10425"],"paper_pages":[{"arxiv_id":"2502.10425","page":"/paper/neuron-platonic-intrinsic-representation-from"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"a61b41823e31cfae","path":"lam/lam/modules/lam.py","papers":["2503.18938"],"paper_pages":[{"arxiv_id":"2503.18938","page":"/paper/adaworld-learning-adaptable-world-models-with"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"c1f873b79cb6cd24","path":"models/FM/EEGPT/Model_EEGPT.py","papers":["2601.17883"],"paper_pages":[{"arxiv_id":"2601.17883","page":"/paper/arxiv-2601-17883"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]}]},{"bucket":[[3,"float","float32"]],"n_implementations_compared":3,"n_papers":3,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"6dd639b65787a9cf","size":2,"n_papers":2,"shape":[2,4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":0.0,"members_with_recorded_values":2,"torch_reference_conventions_with_this_digest":["interleaved"],"values":[-1.682853102684021,-0.8931272625923157,0.2582058608531952,-1.2588046789169312,1.434759497642517,0.15099599957466125,0.3811257779598236,-0.34014570713043213,-0.011872420087456703,-2.139214038848877,0.7722031474113464,-0.848949134349823,0.16943085193634033,0.8366092443466187,-0.40691596269607544,0.15168990194797516,0.7452988624572754,1.8797812461853027,-0.7744670510292053,-0.08752579241991043,-1.1243221759796143,-0.5704304575920105,-0.9569169282913208,-0.40352779626846313,-0.9237498044967651,0.95430988073349,0.30625444650650024,-0.7546214461326599,-1.2410037517547607,-1.0338436365127563,-1.836632490158081,-0.9114314913749695,-1.8682522773742676,-0.9571838974952698,0.8039284944534302,-1.1814329624176025,-0.6304919123649597,0.9990944862365723,-1.7415422201156616,0.044029541313648224,0.8975064754486084,-1.1923047304153442,0.6859840750694275,-1.0145355463027954,0.14383146166801453,0.9828868508338928,-0.9042900204658508,0.38964250683784485,0.0975174680352211,-0.33936411142349243,0.9978419542312622,0.7487973570823669,-0.18848304450511932,0.5280088782310486,0.9634317755699158,-0.7085897922515869,-1.155332088470459,-1.271640658378601,0.581495463848114,1.6535718441009521,-1.2408666610717773,1.8763816356658936,0.8599306344985962,-1.2724858522415161],"values_recorded":64,"members":[{"code_sha256_prefix":"d727d58b7f752099","path":"fastvideo/layers/rotary_embedding_3d.py","papers":["2502.15894"],"paper_pages":[{"arxiv_id":"2502.15894","page":"/paper/riflex-a-free-lunch-for-length-extrapolation"}],"arg_sig_recorded":[["x",3,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"dda8bc930ad44165","path":"hyvideo/modules/models.py","papers":["2412.03603"],"paper_pages":[{"arxiv_id":"2412.03603","page":"/paper/hunyuanvideo-a-systematic-framework-for-large"}],"arg_sig_recorded":[["x",3,"float","float32"]],"scalar_args":{},"class_bearing":false}]},{"output_sha":"68fbd6edefdcd195","size":1,"n_papers":1,"shape":[2,4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":null,"members_with_recorded_values":1,"torch_reference_conventions_with_this_digest":["halves"],"values":[-0.15099599957466125,1.434759497642517,0.34014570713043213,0.3811257779598236,-0.8931272625923157,1.682853102684021,-1.2588046789169312,-0.2582058608531952,-0.8366092443466187,0.16943085193634033,-0.15168990194797516,-0.40691596269607544,-2.139214038848877,0.011872420087456703,-0.848949134349823,-0.7722031474113464,0.5704304575920105,-1.1243221759796143,0.40352779626846313,-0.9569169282913208,1.8797812461853027,-0.7452988624572754,-0.08752579241991043,0.7744670510292053,1.0338436365127563,-1.2410037517547607,0.9114314913749695,-1.836632490158081,0.95430988073349,0.9237498044967651,-0.7546214461326599,-0.30625444650650024,-0.9990944862365723,-0.6304919123649597,-0.044029541313648224,-1.7415422201156616,-0.9571838974952698,1.8682522773742676,-1.1814329624176025,-0.8039284944534302,-0.9828868508338928,0.14383146166801453,-0.38964250683784485,-0.9042900204658508,-1.1923047304153442,-0.8975064754486084,-1.0145355463027954,-0.6859840750694275,-0.5280088782310486,-0.18848304450511932,0.7085897922515869,0.9634317755699158,-0.33936411142349243,-0.0975174680352211,0.7487973570823669,-0.9978419542312622,-1.8763816356658936,-1.2408666610717773,1.2724858522415161,0.8599306344985962,-1.271640658378601,1.155332088470459,1.6535718441009521,-0.581495463848114],"values_recorded":64,"members":[{"code_sha256_prefix":"6b01a575e36ad18c","path":"block_recurrent_transformer/transformer.py","papers":["2203.07852"],"paper_pages":[{"arxiv_id":"2203.07852","page":"/paper/block-recurrent-transformers"}],"arg_sig_recorded":[["x",3,"float","float32"]],"scalar_args":{},"class_bearing":false}]}]}]}