{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/census/gelu","entry":"gelu","source":"Syntology differential census (groundwork/55, run v2_2026-09-22), per sample; not an archive number","census_date":"2026-09-22","battery_sha256":["b986f7e04d794a0d88ad4c5f32cf63ec3590b5deff0192150737bc5f1c0b4677"],"runner_sha256":["5a452d0e7c0da5b80771d1be2afe3572e253568cf5c5d59a0d08ebd663d00808"],"bucket_key":"positional (rank, kind, dtype) of each array argument; the argument name is not part of the key because the harness draws the shared array from (rank, kind) and casts it to the dtype, whatever the name","bucket_fields":["rank","kind","dtype"],"claim":"Implementations sharing this entry name were each run on one shared input fixed by the positional (rank, kind, dtype) of their array arguments (the bucket). A cluster is the set whose recorded output digest (sha256 of the output rounded to 6 decimals) is identical. Identical values to six decimals on the shared input are agreement on those inputs, not a statement about the whole domain and not a substitution claim.","n_implementations_compared":43,"n_papers":74,"n_buckets":1,"n_distinct_outputs":6,"n_class_bearing":0,"not_compared":{"not_run_on_shared_input":{"n":0,"by_error":{}},"no_array_argument_ran_on_own_fixture_arguments_only":{"n":1,"n_papers":1,"recorded_shared_digest_equals_own_fixture_digest":1},"output_not_digested_non_numeric":{"n":0,"by_type":{}}},"withdrawn_excluded":0,"code_page":"/code/gelu","buckets":[{"bucket":[[2,"float","float32"]],"n_implementations_compared":43,"n_papers":74,"n_not_digested":0,"not_digested_by_type":{},"clusters":[{"output_sha":"ae7f1a8a01e3276b","size":31,"n_papers":54,"shape":[4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":5.960464477539063e-08,"members_with_recorded_values":31,"torch_reference_conventions_with_this_digest":[],"values":[1.738232970237732,-0.09592601656913757,0.3251356780529022,-0.1691417247056961,-0.1654948890209198,-0.15600766241550446,-0.16817015409469604,0.4105554223060608,0.3622150421142578,0.7972968816757202,-0.13727621734142303,-0.0915914922952652,-0.11150975525379181,2.298624038696289,-0.15616074204444885,0.39033663272857666,0.03495510295033455,-0.08488936722278595,0.28829169273376465,-0.13903865218162537,-0.01109346840530634,-0.14032964408397675,-0.1587408185005188,0.8236914277076721,-0.1695677936077118,0.28925061225891113,0.7821248769760132,0.8603590726852417,-0.13500770926475525,1.1451483964920044,-0.12302908301353455,-0.16410452127456665],"values_recorded":32,"members":[{"code_sha256_prefix":"fdc64f4c72036ae4","path":"modeling_bert.py","papers":["2412.11959","1810.04805","1910.09796","2004.05234","2012.15701","1909.00252","1902.01069","2302.11812","2305.16986","2401.00793","2110.07592","2604.27550"],"paper_pages":[{"arxiv_id":"2412.11959","page":"/paper/gramian-multimodal-representation-learning"},{"arxiv_id":"1810.04805","page":"/paper/bert-pre-training-of-deep-bidirectional"},{"arxiv_id":"1910.09796","page":"/paper/kernel-graph-attention-network-for-fact"},{"arxiv_id":"2004.05234","page":"/paper/attend-and-decode-4d-fmri-task-state-decoding"},{"arxiv_id":"2012.15701","page":"/paper/binarybert-pushing-the-limit-of-bert"},{"arxiv_id":"1909.00252","page":"/paper/humor-detection-a-transformer-gets-the-last"},{"arxiv_id":"1902.01069","page":"/paper/a-comprehensive-exploration-on-wikisql-with"},{"arxiv_id":"2302.11812","page":"/paper/teacher-intervention-improving-convergence-of"},{"arxiv_id":"2305.16986","page":"/paper/navgpt-explicit-reasoning-in-vision-and"},{"arxiv_id":"2401.00793","page":"/paper/secformer-towards-fast-and-accurate-privacy"},{"arxiv_id":"2110.07592","page":"/paper/speech-toxicity-analysis-a-new-spoken"},{"arxiv_id":"2604.27550","page":"/paper/arxiv-2604-27550"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"40e9fee2e0b7e278","path":"modeling.py","papers":["1810.04805","1909.04849","1906.02900","2609.02204"],"paper_pages":[{"arxiv_id":"1810.04805","page":"/paper/bert-pre-training-of-deep-bidirectional"},{"arxiv_id":"1909.04849","page":"/paper/a-discrete-hard-em-approach-for-weakly"},{"arxiv_id":"1906.02900","page":"/paper/compositional-questions-do-not-necessitate"},{"arxiv_id":"2609.02204","page":"/paper/arxiv-2609-02204"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"56a9ab06b860b180","path":"models/MELT_FMLP.py","papers":["2310.20138","2304.08382","2202.04298"],"paper_pages":[{"arxiv_id":"2310.20138","page":"/paper/depn-detecting-and-editing-privacy-neurons-in"},{"arxiv_id":"2304.08382","page":"/paper/melt-mutual-enhancement-of-long-tailed-user"},{"arxiv_id":"2202.04298","page":"/paper/image-difference-captioning-with-pre-training"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"62e7409a816626ac","path":"continuous_transformer/ContSpaceTime.py","papers":["1810.04805","2301.13338","2310.12864"],"paper_pages":[{"arxiv_id":"1810.04805","page":"/paper/bert-pre-training-of-deep-bidirectional"},{"arxiv_id":"2301.13338","page":"/paper/continuous-spatiotemporal-transformers"},{"arxiv_id":"2310.12864","page":"/paper/the-locality-and-symmetry-of-positional"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"211753ba29188d4e","path":"models/transformers/modeling_bert.py","papers":["2002.10345","2404.19563"],"paper_pages":[{"arxiv_id":"2002.10345","page":"/paper/improving-bert-fine-tuning-via-self-ensemble"},{"arxiv_id":"2404.19563","page":"/paper/repeval-effective-text-evaluation-with-llm"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"50e1ffed03f484ec","path":"src/models/TSR_model.py","papers":["2203.00867","2509.01337"],"paper_pages":[{"arxiv_id":"2203.00867","page":"/paper/incremental-transformer-structure-enhanced"},{"arxiv_id":"2509.01337","page":"/paper/arxiv-2509-01337"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"66c21a3911091d29","path":"src/model/transformer.py","papers":["1911.02116","1905.12790"],"paper_pages":[{"arxiv_id":"1911.02116","page":"/paper/unsupervised-cross-lingual-representation-1"},{"arxiv_id":"1905.12790","page":"/paper/a-generalized-framework-of-sequence"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"9d64df741b029314","path":"models/model.py","papers":["2010.08210","2112.06714"],"paper_pages":[{"arxiv_id":"2010.08210","page":"/paper/coarse-to-fine-pre-training-for-named-entity"},{"arxiv_id":"2112.06714","page":"/paper/learning-semantic-aligned-feature"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"a3abf3fe697fabd0","path":"vlcgan/model.py","papers":["2210.08465","2609.01136"],"paper_pages":[{"arxiv_id":"2210.08465","page":"/paper/character-centric-story-visualization-via"},{"arxiv_id":"2609.01136","page":"/paper/arxiv-2609-01136"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"a43d18e9c8836542","path":"src/model.py","papers":["2009.14786","2211.07950"],"paper_pages":[{"arxiv_id":"2009.14786","page":"/paper/measuring-systematic-generalization-in-neural"},{"arxiv_id":"2211.07950","page":"/paper/breakpoint-transformers-for-modeling-and"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"be4a5b4fd2623b72","path":"model.py","papers":["2403.16030","2404.17169"],"paper_pages":[{"arxiv_id":"2403.16030","page":"/paper/vcr-graphormer-a-mini-batch-graph-transformer"},{"arxiv_id":"2404.17169","page":"/paper/fairgt-a-fairness-aware-graph-transformer"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"c2f0705ed8e6f7e6","path":"model/ce.py","papers":["2106.14019","2312.02010"],"paper_pages":[{"arxiv_id":"2106.14019","page":"/paper/umic-an-unreferenced-metric-for-image"},{"arxiv_id":"2312.02010","page":"/paper/towards-learning-a-generalist-model-for"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"eb13ab048d49bf28","path":"src/model/sequential/fmlprec.py","papers":["2401.06633","2604.14114"],"paper_pages":[{"arxiv_id":"2401.06633","page":"/paper/ada-retrieval-an-adaptive-multi-round"},{"arxiv_id":"2604.14114","page":"/paper/arxiv-2604-14114"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"067fa79dc5c16d05","path":"spikeLM-BERT/spike_bert.py","papers":["2407.04752"],"paper_pages":[{"arxiv_id":"2407.04752","page":"/paper/spikellm-scaling-up-spiking-neural-network-to"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"2214122297c45b69","path":"textgen/language_modeling/songnet_model.py","papers":["2004.08022"],"paper_pages":[{"arxiv_id":"2004.08022","page":"/paper/rigid-formats-controlled-text-generation"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"29af270e862dd867","path":"model/squidnet.py","papers":["2210.08714"],"paper_pages":[{"arxiv_id":"2210.08714","page":"/paper/selective-query-guided-debiasing-network-for"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"2d588601e8e99f5d","path":"transformer/modeling_bert_quant.py","papers":["2205.13016"],"paper_pages":[{"arxiv_id":"2205.13016","page":"/paper/bit-robustly-binarized-multi-distilled"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"344a09e8f735a6b3","path":"model.py","papers":["2206.04910"],"paper_pages":[{"arxiv_id":"2206.04910","page":"/paper/nagphormer-neighborhood-aggregation-graph"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"3c06d11eadebd504","path":"src/modeling.py","papers":["2105.03761"],"paper_pages":[{"arxiv_id":"2105.03761","page":"/paper/e-vil-a-dataset-and-benchmark-for-natural"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"409ea40d28f93c7e","path":"chinese_gpt/gpt_modeling.py","papers":["1810.04805"],"paper_pages":[{"arxiv_id":"1810.04805","page":"/paper/bert-pre-training-of-deep-bidirectional"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"4ac7efa4e6383d65","path":"DynaBERT/transformers/modeling_bert.py","papers":["2004.04037"],"paper_pages":[{"arxiv_id":"2004.04037","page":"/paper/dynabert-dynamic-bert-with-adaptive-width-and"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"69e3a274f98c15af","path":"src/rtransformer/model.py","papers":["2603.05969"],"paper_pages":[{"arxiv_id":"2603.05969","page":"/paper/arxiv-2603-05969"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"6a9faa89f4d1a831","path":"models/TransGAN_8_8_1.py","papers":["2102.07074"],"paper_pages":[{"arxiv_id":"2102.07074","page":"/paper/transgan-two-transformers-can-make-one-strong"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"6f324d970195cc1d","path":"moco/GCN_Transformer_mask.py","papers":["2405.20666"],"paper_pages":[{"arxiv_id":"2405.20666","page":"/paper/masa-motion-aware-masked-autoencoder-with"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"82a647d4d28fc62b","path":"model/rnalm/modeling_rnalm.py","papers":["2406.10391"],"paper_pages":[{"arxiv_id":"2406.10391","page":"/paper/beacon-benchmark-for-comprehensive-rna-tasks"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"835ff702d75feb5b","path":"run_hbm.py","papers":["1905.05583"],"paper_pages":[{"arxiv_id":"1905.05583","page":"/paper/how-to-fine-tune-bert-for-text-classification"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"8d619e54294fb0b7","path":"rosita/modeling/pretrain_tasks/rosita.py","papers":["2004.06165"],"paper_pages":[{"arxiv_id":"2004.06165","page":"/paper/oscar-object-semantics-aligned-pre-training"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"90e5e96897d48ebb","path":"relogic/logickit/inference/modeling.py","papers":["1810.04805"],"paper_pages":[{"arxiv_id":"1810.04805","page":"/paper/bert-pre-training-of-deep-bidirectional"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"a8eafe3c0d1e9892","path":"model/modeling_genmc.py","papers":["2205.00274"],"paper_pages":[{"arxiv_id":"2205.00274","page":"/paper/clues-before-answers-generation-enhanced"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"e650dcdf9e8a559f","path":"modeling.py","papers":["2203.09101"],"paper_pages":[{"arxiv_id":"2203.09101","page":"/paper/relationprompt-leveraging-prompts-to-generate"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"f6ed858344bb92c7","path":"src/train/model/transformer.py","papers":["2306.11641"],"paper_pages":[{"arxiv_id":"2306.11641","page":"/paper/salsa-verde-a-machine-learning-attack-on"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]},{"output_sha":"fbdb323a3bf06188","size":7,"n_papers":13,"shape":[4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":1.1920928955078125e-07,"members_with_recorded_values":7,"torch_reference_conventions_with_this_digest":["tanh"],"values":[1.7381689548492432,-0.09613436460494995,0.32512131333351135,-0.16919474303722382,-0.1656133085489273,-0.15617094933986664,-0.16821636259555817,0.41052737832069397,0.36219537258148193,0.7971585392951965,-0.1372835338115692,-0.09178822487592697,-0.11151190102100372,2.2989766597747803,-0.15617986023426056,0.3903122842311859,0.03495509922504425,-0.08506333827972412,0.2882816195487976,-0.13904662430286407,-0.011093470267951488,-0.14053864777088165,-0.1587630957365036,0.8235445022583008,-0.16965042054653168,0.2892405092716217,0.7819916605949402,0.8602001667022705,-0.13522674143314362,1.1449211835861206,-0.12326118350028992,-0.1641363799571991],"values_recorded":32,"members":[{"code_sha256_prefix":"8d23fbe2b99b840b","path":"gpt/examples/NLG/src/model_nola.py","papers":["2310.02556","2406.02900","2402.02347","2506.13366"],"paper_pages":[{"arxiv_id":"2310.02556","page":"/paper/nola-networks-as-linear-combination-of-low"},{"arxiv_id":"2406.02900","page":"/paper/scaling-laws-for-reward-model-1"},{"arxiv_id":"2402.02347","page":"/paper/riemannian-preconditioned-lora-for-fine"},{"arxiv_id":"2506.13366","page":"/paper/enhancing-goal-oriented-proactive-dialogue"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"d9dcfb510a5e2690","path":"recbole/model/sequential_recommender/sasrec.py","papers":["2102.10407","2303.11921","2310.14079"],"paper_pages":[{"arxiv_id":"2102.10407","page":"/paper/visualgpt-data-efficient-image-captioning-by"},{"arxiv_id":"2303.11921","page":"/paper/context-de-confounded-emotion-recognition"},{"arxiv_id":"2310.14079","page":"/paper/to-copy-or-not-to-copy-that-is-a-critical"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"f51cf2cbd3e598d8","path":"JGA-LBD/DDBM/ddbm/unet3d.py","papers":["2404.00491","2601.00328"],"paper_pages":[{"arxiv_id":"2404.00491","page":"/paper/denoising-monte-carlo-renders-with-diffusion"},{"arxiv_id":"2601.00328","page":"/paper/arxiv-2601-00328"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"0e399e430fc4851d","path":"lopuhin_transformer_lm/lm/model.py","papers":["1706.03762"],"paper_pages":[{"arxiv_id":"1706.03762","page":"/paper/attention-is-all-you-need"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{"c":"0.7978845608028654"},"class_bearing":false},{"code_sha256_prefix":"52548f442af51038","path":"model.py","papers":["2603.25752"],"paper_pages":[{"arxiv_id":"2603.25752","page":"/paper/arxiv-2603-25752"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{"dataset":"'IEMOCAP'"},"class_bearing":false},{"code_sha256_prefix":"b75e9c793d2a286a","path":"modeling_gnn.py","papers":["2109.06480"],"paper_pages":[{"arxiv_id":"2109.06480","page":"/paper/logic-level-evidence-retrieval-and-graph"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"d60ff4b7f07480e1","path":"models/transformer.py","papers":["2203.13131"],"paper_pages":[{"arxiv_id":"2203.13131","page":"/paper/make-a-scene-scene-based-text-to-image"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]},{"output_sha":"1348f288d0c74473","size":2,"n_papers":5,"shape":[4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":0.0,"members_with_recorded_values":2,"torch_reference_conventions_with_this_digest":["exact"],"values":[1.7382328510284424,-0.09592597186565399,0.3251356780529022,-0.1691417694091797,-0.16549493372440338,-0.15600760281085968,-0.16817018389701843,0.4105553925037384,0.3622150421142578,0.7972968816757202,-0.13727620244026184,-0.09159144759178162,-0.11150974780321121,2.298624038696289,-0.15616074204444885,0.39033663272857666,0.03495510667562485,-0.08488936722278595,0.28829169273376465,-0.13903865218162537,-0.011093470267951488,-0.14032961428165436,-0.15874083340168,0.8236914873123169,-0.16956782341003418,0.2892506718635559,0.7821248769760132,0.8603590130805969,-0.13500763475894928,1.145148515701294,-0.123028963804245,-0.16410456597805023],"values_recorded":32,"members":[{"code_sha256_prefix":"f30ebf4e48b7e2d7","path":"zerosyl/zerosyl.py","papers":["2410.15500","2602.16687","2602.15537"],"paper_pages":[{"arxiv_id":"2410.15500","page":"/paper/anonymising-elderly-and-pathological-speech"},{"arxiv_id":"2602.16687","page":"/paper/arxiv-2602-16687"},{"arxiv_id":"2602.15537","page":"/paper/arxiv-2602-15537"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false},{"code_sha256_prefix":"08a5be1ffa0676e3","path":"model/supernet_transformer.py","papers":["2310.16898","2312.09059"],"paper_pages":[{"arxiv_id":"2310.16898","page":"/paper/mcuformer-deploying-vision-tranformers-on-1"},{"arxiv_id":"2312.09059","page":"/paper/auto-prox-training-free-vision-transformer"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]},{"output_sha":"15d2e6cc373b43ee","size":1,"n_papers":1,"shape":[4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":null,"members_with_recorded_values":1,"torch_reference_conventions_with_this_digest":[],"values":[1.7382335662841797,-0.09592528641223907,0.3251359164714813,-0.16914132237434387,-0.16549435257911682,-0.15600700676441193,-0.168169766664505,0.4105556905269623,0.3622152805328369,0.797297477722168,-0.13727609813213348,-0.0915907472372055,-0.11150969564914703,2.2986245155334473,-0.15616048872470856,0.39033690094947815,0.03495512157678604,-0.08488863706588745,0.2882918417453766,-0.13903853297233582,-0.01109346840530634,-0.14032894372940063,-0.1587405651807785,0.8236921429634094,-0.1695673018693924,0.28925085067749023,0.7821254730224609,0.8603596687316895,-0.13500697910785675,1.1451491117477417,-0.12302833795547485,-0.16410423815250397],"values_recorded":32,"members":[{"code_sha256_prefix":"1ada98e81f3ec64a","path":"hetseq/bert_modeling.py","papers":["1810.04805"],"paper_pages":[{"arxiv_id":"1810.04805","page":"/paper/bert-pre-training-of-deep-bidirectional"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]},{"output_sha":"7a843be0cfb053a3","size":1,"n_papers":1,"shape":[4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":null,"members_with_recorded_values":1,"torch_reference_conventions_with_this_digest":[],"values":[1.7225133180618286,-0.10501232743263245,0.32950559258461,-0.16290567815303802,-0.15982495248317719,-0.15205709636211395,-0.1620628386735916,0.4159899950027466,0.36708909273147583,0.8023322820663452,-0.13391469419002533,-0.10164095461368561,-0.10953877866268158,2.2783377170562744,-0.15133292973041534,0.39555105566978455,0.0350714810192585,-0.09640691429376602,0.2921077013015747,-0.13555951416492462,-0.011079922318458557,-0.13955561816692352,-0.15366949141025543,0.8283882141113281,-0.16325615346431732,0.29308170080184937,0.7873389720916748,0.8645288944244385,-0.1353718340396881,1.1434897184371948,-0.12602505087852478,-0.1584787368774414],"values_recorded":32,"members":[{"code_sha256_prefix":"08eccabe0923b8c0","path":"maskclip/modeling/maskclip.py","papers":["2208.08984"],"paper_pages":[{"arxiv_id":"2208.08984","page":"/paper/open-vocabulary-panoptic-segmentation-with"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]},{"output_sha":"d37efaa41103178a","size":1,"n_papers":1,"shape":[4,8],"dtype":"float32","type":"Tensor","finite":true,"max_difference_among_recorded_values":null,"members_with_recorded_values":1,"torch_reference_conventions_with_this_digest":[],"values":[1.7924906015396118,-0.02159120887517929,0.36631372570991516,-0.10065992176532745,-0.07892391830682755,-0.06454931199550629,-0.10290049761533737,0.4646635055541992,0.409166544675827,0.8865962624549866,-0.10661618411540985,-0.019716884940862656,-0.09408717602491379,2.320417642593384,-0.10975892841815948,0.4415091276168823,0.03595442697405815,-0.017020143568515778,0.32356205582618713,-0.10720251500606537,-0.010977283120155334,-0.04878545552492142,-0.10938222706317902,0.9138956069946289,-0.09068097919225693,0.3246762752532959,0.870823323726654,0.9515315294265747,-0.044493287801742554,1.2340846061706543,-0.036088816821575165,-0.10725856572389603],"values_recorded":32,"members":[{"code_sha256_prefix":"8c106eab341fc5d3","path":"modules/transformer.py","papers":["2207.08625"],"paper_pages":[{"arxiv_id":"2207.08625","page":"/paper/unifying-event-detection-and-captioning-as"}],"arg_sig_recorded":[["x",2,"float","float32"]],"scalar_args":{},"class_bearing":false}]}]}]}