{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/census/apply-rotary-pos-emb","entry":"apply_rotary_pos_emb","source":"Syntology differential census (groundwork/55, run v2_2026-09-22), per sample; not an archive number","census_date":"2026-09-22","battery_sha256":["b986f7e04d794a0d88ad4c5f32cf63ec3590b5deff0192150737bc5f1c0b4677"],"runner_sha256":["5a452d0e7c0da5b80771d1be2afe3572e253568cf5c5d59a0d08ebd663d00808"],"bucket_key":"positional (rank, kind, dtype) of each array argument; the argument name is not part of the key because the harness draws the shared array from (rank, kind) and casts it to the dtype, whatever the name","bucket_fields":["rank","kind","dtype"],"claim":"Implementations sharing this entry name were each run on one shared input fixed by the positional (rank, kind, dtype) of their array arguments (the bucket). A cluster is the set whose recorded output digest (sha256 of the output rounded to 6 decimals) is identical. Identical values to six decimals on the shared input are agreement on those inputs, not a statement about the whole domain and not a substitution claim.","n_implementations_compared":14,"n_papers":15,"n_buckets":7,"n_distinct_outputs":8,"n_class_bearing":0,"not_compared":{"not_run_on_shared_input":{"n":2,"by_error":{"EinopsError":1,"RuntimeError":1}},"no_array_argument_ran_on_own_fixture_arguments_only":{"n":0,"n_papers":0,"recorded_shared_digest_equals_own_fixture_digest":0},"output_not_digested_non_numeric":{"n":0,"by_type":{}}},"withdrawn_excluded":0,"code_page":"/code/apply-rotary-pos-emb","buckets":[{"bucket":[[3,"float","float32"],[2,"float","float32"]],"n_implementations_compared":3,"n_papers":3,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"316ba939c9ef614d","size":3,"n_papers":3,"shape":[2,4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":0.0,"members_with_recorded_values":3,"torch_reference_conventions_with_this_digest":[],"values":[0.0582495778799057,-1.3714914321899414,-0.962958574295044,-0.4418557286262512,0.7947129607200623,-2.181178092956543,0.5064013004302979,-0.4602382779121399,-2.2725226879119873,0.14553062617778778,-0.724177360534668,0.4050242602825165,1.4107346534729004,0.12432952970266342,0.5500081777572632,-0.057175278663635254,1.9134856462478638,1.1615948677062988,0.08951229602098465,1.0895380973815918,-0.6127534508705139,1.1167984008789062,-0.3019924759864807,1.1748743057250977,-0.07059580087661743,0.31736236810684204,0.29667285084724426,-1.723549246788025,-1.2477270364761353,1.2461037635803223,0.5071948766708374,1.6933531761169434,-0.7524420022964478,0.6992068886756897,-1.0702476501464844,0.4901748299598694,1.3702948093414307,-1.2777694463729858,0.7616388201713562,1.027705430984497,-1.5227880477905273,-0.3976108431816101,-0.7848235368728638,0.9026079177856445,1.2815241813659668,-0.5577128529548645,0.8386478424072266,0.41181525588035583,-0.3736479878425598,0.19330382347106934,0.9767202138900757,-1.2973120212554932,0.5355411171913147,0.1618557572364807,-0.9918720126152039,-1.36445152759552,0.450331449508667,0.5276031494140625,1.999927043914795,0.4260709583759308,1.8313100337982178,1.4675354957580566,-1.915808081626892,-0.3870752155780792],"values_recorded":64,"members":[{"code_sha256_prefix":"a1f5fb7641bf7ce3","path":"block_recurrent_transformer_pytorch/block_recurrent_transformer_pytorch.py","papers":["2203.07852"],"paper_pages":[{"arxiv_id":"2203.07852","page":"/paper/block-recurrent-transformers"}],"arg_sig_recorded":[["t",3,"float","float32"],["pos",2,"float","float32"]],"scalar_args":{"scale":"1.0"},"class_bearing":false},{"code_sha256_prefix":"a6120b0228dbf889","path":"retro_pytorch/retro_pytorch.py","papers":["2112.04426"],"paper_pages":[{"arxiv_id":"2112.04426","page":"/paper/improving-language-models-by-retrieving-from"}],"arg_sig_recorded":[["t",3,"float","float32"],["freqs",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"f1c3b8a106802591","path":"models/framework.py","papers":["2509.24332"],"paper_pages":[{"arxiv_id":"2509.24332","page":"/paper/arxiv-2509-24332"}],"arg_sig_recorded":[["t",3,"float","float32"],["freqs",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]}]},{"bucket":[[3,"float","float32"],[3,"float","float32"]],"n_implementations_compared":3,"n_papers":3,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"5ee0be11597fcec1","size":3,"n_papers":3,"shape":[2,4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":0.0,"members_with_recorded_values":3,"torch_reference_conventions_with_this_digest":[],"values":[-0.44234055280685425,1.2375802993774414,-0.7101209163665771,-0.34696531295776367,0.014931157231330872,-1.861884355545044,0.09931060671806335,-0.25773492455482483,1.8565928936004639,0.013883090578019619,-0.44710564613342285,-0.2692757248878479,-1.0275856256484985,-0.16900669038295746,0.021664336323738098,0.0680677592754364,-0.028209567070007324,0.2147965431213379,-0.12246476113796234,-0.11562144756317139,-1.4951847791671753,-0.1867721974849701,-0.33674871921539307,1.1842896938323975,1.3952836990356445,-0.43329036235809326,-1.1741074323654175,0.261721134185791,-1.3488428592681885,1.275863528251648,0.0380823016166687,-0.7780097126960754,0.2656628489494324,-1.1503678560256958,-0.4077374041080475,0.696230411529541,-0.26439976692199707,1.6106855869293213,-0.00801428034901619,-1.0881564617156982,0.47274160385131836,-0.6720939874649048,-0.20479118824005127,0.04199695587158203,-0.44698768854141235,-0.013701245188713074,-0.024942398071289062,0.0198974609375,-0.14424142241477966,-0.0787028819322586,1.0308785438537598,-1.3505216836929321,0.2851238250732422,0.16687318682670593,-1.02530837059021,0.26954716444015503,1.418273687362671,-0.6689958572387695,1.131410002708435,-0.9582598209381104,-1.7772389650344849,1.4950309991836548,-1.9545316696166992,-0.12044045329093933],"values_recorded":64,"members":[{"code_sha256_prefix":"746466b4822c61fb","path":"perceiver_ar_pytorch/perceiver_ar_pytorch.py","papers":["2202.07765"],"paper_pages":[{"arxiv_id":"2202.07765","page":"/paper/general-purpose-long-context-autoregressive"}],"arg_sig_recorded":[["pos",3,"float","float32"],["t",3,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"a0a60756432aafb6","path":"block_recurrent_transformer/transformer.py","papers":["2203.07852"],"paper_pages":[{"arxiv_id":"2203.07852","page":"/paper/block-recurrent-transformers"}],"arg_sig_recorded":[["t",3,"float","float32"],["freqs",3,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"c3acddf93e491a49","path":"libs/factorization_module.py","papers":["2601.21681"],"paper_pages":[{"arxiv_id":"2601.21681","page":"/paper/arxiv-2601-21681"}],"arg_sig_recorded":[["t",3,"float","float32"],["freqs",3,"float","float32"]],"scalar_args":{},"class_bearing":false}]}]},{"bucket":[[2,"float","float32"],[2,"float","float32"]],"n_implementations_compared":2,"n_papers":1,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"775c5948d5b3fcdf","size":2,"n_papers":1,"shape":[4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":0.0,"members_with_recorded_values":2,"torch_reference_conventions_with_this_digest":[],"values":[0.46452149748802185,-1.0865325927734375,0.726847767829895,-0.16739654541015625,-1.9744374752044678,0.7851871848106384,-0.8153655529022217,0.10691702365875244,0.5936658382415771,-1.3503531217575073,-0.5654144883155823,0.5466873645782471,-0.4242527484893799,-0.8841302990913391,-0.2525075674057007,-0.3512752652168274,0.06774819642305374,-1.0947015285491943,0.6172277927398682,0.015521585941314697,-0.024088483303785324,1.0520687103271484,-0.6823409795761108,0.20675811171531677,-1.4323769807815552,-0.14173585176467896,1.6251704692840576,1.040156364440918,0.3341599404811859,0.7867483496665955,-1.2412294149398804,-1.0618840456008911],"values_recorded":32,"members":[{"code_sha256_prefix":"6d7a8eee9f74827c","path":"palm_pytorch/palm_pytorch.py","papers":["2204.02311"],"paper_pages":[{"arxiv_id":"2204.02311","page":"/paper/palm-scaling-language-modeling-with-pathways-1"}],"arg_sig_recorded":[["pos",2,"float","float32"],["t",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"fd592af960c2230e","path":"coca_pytorch/coca_pytorch.py","papers":["2204.02311"],"paper_pages":[{"arxiv_id":"2204.02311","page":"/paper/palm-scaling-language-modeling-with-pathways-1"}],"arg_sig_recorded":[["pos",2,"float","float32"],["t",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]}]},{"bucket":[[3,"float","float32"],[3,"float","float32"],[3,"float","float32"]],"n_implementations_compared":2,"n_papers":2,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"30f0088025a6b14f","size":2,"n_papers":2,"shape":[2,4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":0.0,"members_with_recorded_values":2,"torch_reference_conventions_with_this_digest":[],"values":[0.93253493309021,5.24648380279541,1.1564122438430786,-0.03173863887786865,-0.1120588481426239,-0.355954647064209,0.5438761115074158,0.24366576969623566,6.365922927856445,0.0021525085903704166,0.8494916558265686,0.9105194807052612,-1.0897711515426636,0.026695258915424347,-0.10576719045639038,-0.1486411988735199,4.605861663818359,1.3934264183044434,-0.02765832468867302,-0.14130139350891113,-0.7468935251235962,0.4261443018913269,0.1981537789106369,1.6567906141281128,1.8973145484924316,-0.29306328296661377,-0.11833220720291138,0.6562686562538147,0.08222544193267822,2.686467170715332,1.5184931755065918,2.810742139816284,1.8725180625915527,2.312448501586914,1.4478018283843994,2.0463764667510986,0.04187268018722534,1.5754380226135254,-0.0500793531537056,1.6328938007354736,2.5934910774230957,0.6764281988143921,1.4245884418487549,1.0909026861190796,-0.20583409070968628,0.14977715909481049,-0.24348488450050354,0.1974118947982788,0.29435527324676514,0.027890045195817947,1.091287612915039,0.0343359112739563,0.09960609674453735,0.017145469784736633,-0.028490662574768066,1.889553427696228,4.003152847290039,-0.09882080554962158,4.838446617126465,-0.1619088053703308,1.1347248554229736,2.973363161087036,-0.4849264621734619,1.2395265102386475],"values_recorded":64,"members":[{"code_sha256_prefix":"0f92704bc4a6e1f6","path":"src/omnisleep/models.py","papers":["2607.07720"],"paper_pages":[{"arxiv_id":"2607.07720","page":"/paper/arxiv-2607-07720"}],"arg_sig_recorded":[["x",3,"float","float32"],["cos",3,"float","float32"],["sin",3,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"576e999c3a27c6a4","path":"hacl/llava/model/language_model/llava.py","papers":["2312.06968"],"paper_pages":[{"arxiv_id":"2312.06968","page":"/paper/hallucination-augmented-contrastive-learning"}],"arg_sig_recorded":[["x",3,"float","float32"],["cos",3,"float","float32"],["sin",3,"float","float32"]],"scalar_args":{"offset":"0"},"class_bearing":false}]}]},{"bucket":[[4,"float","float32"]],"n_implementations_compared":2,"n_papers":4,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"b83d2fdbcca5c8b3","size":1,"n_papers":3,"shape":[2,3,4,4],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":null,"members_with_recorded_values":1,"torch_reference_conventions_with_this_digest":[],"values":[-2.4235730171203613,-0.6916622519493103,-1.6313731670379639,-1.4442816972732544,-2.4124741554260254,1.761087417602539,0.39958980679512024,-0.970986545085907,-0.6461999416351318,0.6988990306854248,1.423251748085022,0.12222081422805786,2.1436827182769775,0.20413988828659058,3.262361764907837,-0.7330365180969238,-0.1808730959892273,-0.3058878481388092,-3.3991613388061523,0.6294047832489014,-0.9831646084785461,-0.30224937200546265,3.1133549213409424,-0.9541233777999878,-0.8205164074897766,0.39664924144744873,2.1228182315826416,4.015311241149902,0.0708804503083229,0.2738936245441437,-1.9731228351593018,-1.0657497644424438,1.8805654048919678,0.10786426067352295,-0.4907815754413605,-0.027088478207588196,3.5658345222473145,-0.04307568073272705,-0.46386271715164185,-0.7442318201065063,-2.2654385566711426,1.1696480512619019,0.1875247061252594,1.005468726158142,-0.27674156427383423,0.05510726943612099,-0.4201904535293579,-0.8244036436080933,-2.938413619995117,0.07238543033599854,-2.516134023666382,-0.166438490152359,-3.1287097930908203,3.3363795280456543,2.862224817276001,0.4729320704936981,5.5083723068237305,3.0769336223602295,1.635164499282837,0.15462809801101685,7.333902359008789,-1.473924160003662,0.7786769270896912,-0.1976146697998047,0.962329089641571,0.4010762572288513,2.9551990032196045,-3.890882730484009,0.07934315502643585,0.35803714394569397,-3.5190858840942383,-5.815323829650879,-0.08801393955945969,0.4982711374759674,-1.8430155515670776,-0.16344618797302246,0.02040010690689087,0.8500947952270508,-0.34197747707366943,-1.5011191368103027,1.0995888710021973,3.6213581562042236,-0.31389254331588745,-0.5267446041107178,1.581626534461975,-1.8435735702514648,-0.29484105110168457,1.3044363260269165,0.5799431800842285,-0.6138052344322205,0.49200671911239624,-1.5691955089569092,-0.04015040397644043,-0.8844828009605408,-0.8666021227836609,0.503373384475708],"values_recorded":96,"members":[{"code_sha256_prefix":"2f6618868885e7ca","path":"codegen1/jaxformer/hf/codegen/modeling_codegen.py","papers":["2512.02315","2203.13474","2206.13517"],"paper_pages":[{"arxiv_id":"2512.02315","page":"/paper/arxiv-2512-02315"},{"arxiv_id":"2203.13474","page":"/paper/a-conversational-paradigm-for-program"},{"arxiv_id":"2206.13517","page":"/paper/progen2-exploring-the-boundaries-of-protein"}],"arg_sig_recorded":[["x",4,"float","float32"]],"scalar_args":{"sincos":"(tensor([[ 1.1404, -0.0899],\n        [ 0.7298, -1.8453],\n   ","offset":"0"},"class_bearing":false}]},{"output_sha":"e7c45f49ac2b5aee","size":1,"n_papers":1,"shape":[2,3,4,4],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":null,"members_with_recorded_values":1,"torch_reference_conventions_with_this_digest":[],"values":[0.13313236832618713,0.6065443158149719,-3.4980461597442627,0.6643701791763306,0.6638951301574707,0.3175573945045471,-0.8554470539093018,-1.487412452697754,0.22710978984832764,0.05851671099662781,1.5811500549316406,-1.7173619270324707,-0.20618514716625214,-0.4888673424720764,2.314730167388916,-4.949655055999756,-0.20495650172233582,-0.4016629159450531,1.4560060501098633,-0.3351496160030365,-1.2213342189788818,-0.4603087902069092,-1.3265421390533447,0.4700327217578888,-1.0704448223114014,0.43765977025032043,-0.9914858937263489,-1.6942124366760254,0.06817486882209778,0.3524706959724426,0.8718551397323608,0.4233975112438202,0.7391023635864258,-2.3454084396362305,0.4882687032222748,-0.7369898557662964,1.0880928039550781,-4.526586532592773,1.5766923427581787,-0.04317036271095276,0.7543426752090454,3.2418453693389893,-1.7308392524719238,-0.6231881976127625,-0.018935218453407288,0.36789169907569885,1.6613991260528564,0.09749671816825867,0.35902640223503113,0.6289540529251099,-2.7311275005340576,3.0857150554656982,1.0892983675003052,0.2888687252998352,3.4733481407165527,-3.226565361022949,0.023861587047576904,-1.5544055700302124,1.8349387645721436,-1.9588570594787598,-1.1766223907470703,-1.4186841249465942,0.5232161283493042,-1.204057216644287,1.1871546506881714,0.5838289856910706,-1.2034966945648193,1.7351622581481934,0.07225874811410904,0.4597044885158539,1.6279478073120117,2.445416212081909,-0.15075291693210602,0.6241140961647034,0.7988523244857788,0.03621309995651245,-0.041186392307281494,1.078241229057312,0.17565181851387024,0.6417997479438782,4.93539571762085,-0.2311984747648239,1.102828025817871,-0.00818420946598053,-1.8263524770736694,-2.592386245727539,-1.7562123537063599,-1.643576741218567,-0.5909760594367981,-0.9306368827819824,1.9878108501434326,2.190274477005005,-1.1322330236434937,-0.23260384798049927,0.006777256727218628,-1.8025168180465698],"values_recorded":96,"members":[{"code_sha256_prefix":"e206028c02336479","path":"apicoder/CodeGenAPI/nl2code/modeling_codegen.py","papers":["2206.06888"],"paper_pages":[{"arxiv_id":"2206.06888","page":"/paper/cert-continual-pre-training-on-sketches-for"}],"arg_sig_recorded":[["x",4,"float","float32"]],"scalar_args":{"sincos":"(tensor([[ 0.3704,  1.4565],\n        [ 0.9398,  0.7748],\n   ","offset":"0"},"class_bearing":false}]}]},{"bucket":[[2,"float","float32"],[2,"float","float32"],[2,"float","float32"]],"n_implementations_compared":1,"n_papers":1,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"9606137f1b2acf0e","size":1,"n_papers":1,"shape":[4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":null,"members_with_recorded_values":1,"torch_reference_conventions_with_this_digest":[],"values":[4.876972198486328,0.7719573974609375,0.5421361327171326,0.8731266260147095,-0.8123651146888733,2.642383098602295,0.12374255061149597,-0.06759968400001526,0.41894620656967163,-1.30728018283844,-0.04670447111129761,3.323136568069458,-0.06646142154932022,7.619429588317871,0.46947452425956726,-0.5603387355804443,0.005908507853746414,0.7174621820449829,0.4187071919441223,0.5645415186882019,-0.0009896544506773353,3.3105101585388184,0.05624064803123474,0.5680603384971619,-0.34225112199783325,-0.3643593192100525,2.142453193664551,1.6398602724075317,2.4778013229370117,2.17571759223938,0.4988003969192505,-0.25155121088027954],"values_recorded":32,"members":[{"code_sha256_prefix":"22f75dc2bea7b46e","path":"src/ctx_to_lora/modeling/text_to_lora.py","papers":["2602.15902"],"paper_pages":[{"arxiv_id":"2602.15902","page":"/paper/arxiv-2602-15902"}],"arg_sig_recorded":[["x",2,"float","float32"],["cos",2,"float","float32"],["sin",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]}]},{"bucket":[[4,"float","float32"],[4,"float","float32"],[4,"float","float32"]],"n_implementations_compared":1,"n_papers":2,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"094e8198ce32c3a6","size":1,"n_papers":2,"shape":[2,3,4,4],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":null,"members_with_recorded_values":1,"torch_reference_conventions_with_this_digest":[],"values":[-0.52279132604599,-0.2909212112426758,3.1368370056152344,1.9242241382598877,1.6022025346755981,0.20630620419979095,-0.2350558042526245,0.5258540511131287,0.5266731977462769,0.015842365100979805,1.0086443424224854,0.0018447674810886383,-1.3874049186706543,0.5448896288871765,8.996238708496094,0.30629146099090576,0.47381505370140076,0.19951331615447998,0.0828845202922821,1.9589741230010986,0.2374199628829956,-0.324800968170166,0.44627857208251953,3.705599069595337,0.5125863552093506,1.6038001775741577,3.814371347427368,-0.17171359062194824,-0.1950027346611023,0.00196463568136096,1.1366266012191772,0.24610158801078796,-0.02625127136707306,1.537177324295044,0.4377431273460388,-0.2598056495189667,0.5787733793258667,6.319293975830078,-0.09550972282886505,-0.9377727508544922,-0.11249834299087524,3.9897494316101074,0.7088905572891235,-0.3190128803253174,-0.007034969981759787,-0.17738059163093567,0.11815831065177917,1.7578822374343872,-1.103887677192688,0.23522183299064636,6.585841178894043,-0.008578901179134846,6.721132755279541,0.25612199306488037,1.8162710666656494,0.1798093169927597,0.025371193885803223,3.9732227325439453,3.7717721462249756,0.053704883903265,6.0431108474731445,0.7026172280311584,2.178154706954956,-0.11189409345388412,0.06050276756286621,3.47403883934021,1.2484766244888306,2.1015329360961914,-1.2696248292922974,-0.0011391204316169024,11.141926765441895,0.007048121653497219,0.05466565489768982,0.27110156416893005,0.5786679983139038,0.25811174511909485,0.4704992175102234,0.00798824429512024,1.1620482206344604,0.11957345902919769,5.280904769897461,-0.06573202461004257,-0.33930882811546326,0.7768672704696655,1.604151964187622,0.18763375282287598,1.2241922616958618,2.4879472255706787,-0.39833059906959534,0.7061402201652527,4.341563701629639,0.8525026440620422,0.9279779195785522,0.06409633904695511,1.1902415752410889,0.03935971111059189],"values_recorded":96,"members":[{"code_sha256_prefix":"206c90f5d5d477d1","path":"src/models/controlnet.py","papers":["2406.10391","2602.04680"],"paper_pages":[{"arxiv_id":"2406.10391","page":"/paper/beacon-benchmark-for-comprehensive-rna-tasks"},{"arxiv_id":"2602.04680","page":"/paper/arxiv-2602-04680"}],"arg_sig_recorded":[["x",4,"float","float32"],["cos",4,"float","float32"],["sin",4,"float","float32"]],"scalar_args":{},"class_bearing":false}]}]}]}