{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/layer-norm","entry":"layer_norm","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":32,"n_papers_ran":4,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":31,"n_samples_ran":4,"n_samples_fingerprinted":0,"n_places":38,"n_places_pointer_only":7,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":2,"ran_fixture":1,"ran":1,"unverified":27},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2602.09396","paper":"/paper/arxiv-2602-09396","title":"Squeezing More from the Stream : Learning Representation Online for Streaming Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"chandar-lab/stream-rep-rl","path":"algorithms/dqn-spr.py","file_url":"https://github.com/chandar-lab/stream-rep-rl/blob/HEAD/algorithms/dqn-spr.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b20d0377d799a4b6","mcp_get_code":{"code_sha256":"b20d0377d799a4b6"}},{"arxiv_id":"2411.05282","paper":"/paper/microscopiq-accelerating-foundational-models","title":"MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization","date":"2024-11-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"georgia-tech-synergy-lab/microscopiq-llm-quantization","path":"number_system/mx/layernorm.py","file_url":"https://github.com/georgia-tech-synergy-lab/microscopiq-llm-quantization/blob/HEAD/number_system/mx/layernorm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"494a1f0c452b05c6","mcp_get_code":{"code_sha256":"494a1f0c452b05c6"}},{"arxiv_id":"2406.16282","paper":"/paper/reducing-fine-tuning-memory-overhead-by","title":"Reducing Fine-Tuning Memory Overhead by Approximate and Memory-Sharing Backpropagation","date":"2024-06-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yyyyychen/LowMemoryBP","path":"lomem/normalization.py","file_url":"https://github.com/yyyyychen/LowMemoryBP/blob/HEAD/lomem/normalization.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"24f25e03d2510fc4","mcp_get_code":{"code_sha256":"24f25e03d2510fc4"}},{"arxiv_id":"2405.05695","paper":"/paper/aux-nas-exploiting-auxiliary-labels-with","title":"Aux-NAS: Exploiting Auxiliary Labels with Negligibly Extra Inference Cost","date":"2024-05-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ethanygao/aux-nas","path":"networks/stagewise_search_aux.py","file_url":"https://github.com/ethanygao/aux-nas/blob/HEAD/networks/stagewise_search_aux.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ddb859dc4e680704","mcp_get_code":{"code_sha256":"ddb859dc4e680704"}},{"arxiv_id":"2402.13040","paper":"/paper/text-guided-molecule-generation-with","title":"Text-Guided Molecule Generation with Diffusion Language Model","date":"2024-02-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Deno-V/tgm-dlm","path":"improved-diffusion/improved_diffusion/transformer_model.py","file_url":"https://github.com/Deno-V/tgm-dlm/blob/HEAD/improved-diffusion/improved_diffusion/transformer_model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8347681d84656d7d","mcp_get_code":{"code_sha256":"8347681d84656d7d"}},{"arxiv_id":"2402.08393","paper":"/paper/nfgtransformer-equivariant-representation","title":"NfgTransformer: Equivariant Representation Learning for Normal-form Games","date":null,"month_inferred_from_arxiv_id":"2024-02","title_source":"archive","repo":"google-deepmind/nfg_transformer","path":"nfg_transformer/network.py","file_url":"https://github.com/google-deepmind/nfg_transformer/blob/HEAD/nfg_transformer/network.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"662a6c7691ca6ce4","mcp_get_code":{"code_sha256":"662a6c7691ca6ce4"}},{"arxiv_id":"2402.08393","paper":"/paper/nfgtransformer-equivariant-representation","title":"NfgTransformer: Equivariant Representation Learning for Normal-form Games","date":null,"month_inferred_from_arxiv_id":"2024-02","title_source":"archive","repo":"google-deepmind/nfg_transformer","path":"nfg_transformer/network.py","file_url":"https://github.com/google-deepmind/nfg_transformer/blob/HEAD/nfg_transformer/network.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8cb271e59820a9a9","mcp_get_code":{"code_sha256":"8cb271e59820a9a9"}},{"arxiv_id":"2402.04494","paper":"/paper/grandmaster-level-chess-without-search","title":"Amortized Planning with Large-Scale Transformers: A Case Study on Chess","date":"2024-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"google-deepmind/searchless_chess","path":"src/transformer.py","file_url":"https://github.com/google-deepmind/searchless_chess/blob/HEAD/src/transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a145acc7af542d06","mcp_get_code":{"code_sha256":"a145acc7af542d06"}},{"arxiv_id":"2401.14953","paper":"/paper/learning-universal-predictors","title":"Learning Universal Predictors","date":"2024-01-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"google-deepmind/neural_networks_solomonoff_induction","path":"models/transformer.py","file_url":"https://github.com/google-deepmind/neural_networks_solomonoff_induction/blob/HEAD/models/transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a145acc7af542d06","mcp_get_code":{"code_sha256":"a145acc7af542d06"}},{"arxiv_id":"2310.10537","paper":"/paper/microscaling-data-formats-for-deep-learning","title":"Microscaling Data Formats for Deep Learning","date":"2023-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/microxcaling","path":"mx/layernorm.py","file_url":"https://github.com/microsoft/microxcaling/blob/HEAD/mx/layernorm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"494a1f0c452b05c6","mcp_get_code":{"code_sha256":"494a1f0c452b05c6"}},{"arxiv_id":"2309.10668","paper":"/paper/language-modeling-is-compression","title":"Language Modeling Is Compression","date":"2023-09-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"google-deepmind/language_modeling_is_compression","path":"transformer.py","file_url":"https://github.com/google-deepmind/language_modeling_is_compression/blob/HEAD/transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a145acc7af542d06","mcp_get_code":{"code_sha256":"a145acc7af542d06"}},{"arxiv_id":"2302.03067","paper":"/paper/memory-based-meta-learning-on-non-stationary","title":"Memory-Based Meta-Learning on Non-Stationary Distributions","date":"2023-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deepmind/nonstationary_mbml","path":"models/transformer.py","file_url":"https://github.com/deepmind/nonstationary_mbml/blob/HEAD/models/transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5d83309868b4e1a6","mcp_get_code":{"code_sha256":"5d83309868b4e1a6"}},{"arxiv_id":"2301.11798","paper":"/paper/medsegdiff-v2-diffusion-based-medical-image","title":"MedSegDiff-V2: Diffusion based Medical Image Segmentation with Transformer","date":"2023-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wujunde/medsegdiff","path":"guided_diffusion/nn.py","file_url":"https://github.com/wujunde/medsegdiff/blob/HEAD/guided_diffusion/nn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"359793d02b65c82c","mcp_get_code":{"code_sha256":"359793d02b65c82c"}},{"arxiv_id":"2207.02098","paper":"/paper/neural-networks-and-the-chomsky-hierarchy","title":"Neural Networks and the Chomsky Hierarchy","date":"2022-07-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deepmind/neural_networks_chomsky_hierarchy","path":"models/transformer.py","file_url":"https://github.com/deepmind/neural_networks_chomsky_hierarchy/blob/HEAD/models/transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5d83309868b4e1a6","mcp_get_code":{"code_sha256":"5d83309868b4e1a6"}},{"arxiv_id":"2205.03766","paper":"/paper/scheduled-multi-task-learning-for-neural-chat","title":"Scheduled Multi-task Learning for Neural Chat Translation","date":"2022-05-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xl2248/sml","path":"thumt-sml/thumt/layers/nn.py","file_url":"https://github.com/xl2248/sml/blob/HEAD/thumt-sml/thumt/layers/nn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b299f075318205c0","mcp_get_code":{"code_sha256":"b299f075318205c0"}},{"arxiv_id":"2205.05055","paper":"/paper/data-distributional-properties-drive-emergent","title":"Data Distributional Properties Drive Emergent In-Context Learning in Transformers","date":"2022-04-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deepmind/emergent_in_context_learning","path":"modules/transformer_core.py","file_url":"https://github.com/deepmind/emergent_in_context_learning/blob/HEAD/modules/transformer_core.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5d83309868b4e1a6","mcp_get_code":{"code_sha256":"5d83309868b4e1a6"}},{"arxiv_id":"2107.03377","paper":"/paper/long-short-term-transformer-for-online-action","title":"Long Short-Term Transformer for Online Action Detection","date":"2021-07-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amazon-science/long-short-term-transformer","path":"src/rekognition_online_action_detection/models/transformer/utils.py","file_url":"https://github.com/amazon-science/long-short-term-transformer/blob/HEAD/src/rekognition_online_action_detection/models/transformer/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"38e465d98db284f6","mcp_get_code":{"code_sha256":"38e465d98db284f6"}},{"arxiv_id":"2106.02636","paper":"/paper/merlot-multimodal-neural-script-knowledge","title":"MERLOT: Multimodal Neural Script Knowledge Models","date":"2021-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rowanz/merlot","path":"utils/model_utils.py","file_url":"https://github.com/rowanz/merlot/blob/HEAD/utils/model_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1fda499c82a8193a","mcp_get_code":{"code_sha256":"1fda499c82a8193a"}},{"arxiv_id":"2105.11210","paper":"/paper/structurallm-structural-pre-training-for-form","title":"StructuralLM: Structural Pre-training for Form Understanding","date":"2021-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alibaba/AliceMind","path":"StructuralLM/modeling.py","file_url":"https://github.com/alibaba/AliceMind/blob/HEAD/StructuralLM/modeling.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"180084952859e5e0","mcp_get_code":{"code_sha256":"180084952859e5e0"}},{"arxiv_id":"2104.00969","paper":"/paper/tuber-tube-transformer-for-action-detection","title":"TubeR: Tubelet Transformer for Video Action Detection","date":"2021-04-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amazon-science/tubelet-transformer","path":"models/transformer/transformer_layers.py","file_url":"https://github.com/amazon-science/tubelet-transformer/blob/HEAD/models/transformer/transformer_layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"99c111ef29c683f2","mcp_get_code":{"code_sha256":"99c111ef29c683f2"}},{"arxiv_id":"2103.07719","paper":"/paper/spectral-temporal-graph-neural-network-for-1","title":"Spectral Temporal Graph Neural Network for Multivariate Time-series Forecasting","date":"2021-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"VeritasYin/STGCN_IJCAI-18","path":"models/layers.py","file_url":"https://github.com/VeritasYin/STGCN_IJCAI-18/blob/HEAD/models/layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-2-Clause","inline_ok":true,"code_sha256_prefix":"90cae9bd0b8c88e0","mcp_get_code":{"code_sha256":"90cae9bd0b8c88e0"}},{"arxiv_id":"2005.04732","paper":"/paper/towards-robustifying-nli-models-against","title":"Towards Robustifying NLI Models Against Lexical Dataset Biases","date":"2020-05-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"owenzx/LexicalDebias-ACL2020","path":"models/hex.py","file_url":"https://github.com/owenzx/LexicalDebias-ACL2020/blob/HEAD/models/hex.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"11f9661c4bf99c8a","mcp_get_code":{"code_sha256":"11f9661c4bf99c8a"}},{"arxiv_id":"2004.11867","paper":"/paper/improving-massively-multilingual-neural","title":"Improving Massively Multilingual Neural Machine Translation and Zero-Shot Translation","date":"2020-04-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bzhangGo/zero","path":"models/transformer_l0drop.py","file_url":"https://github.com/bzhangGo/zero/blob/HEAD/models/transformer_l0drop.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"9dcd5100e4896669","mcp_get_code":{"code_sha256":"9dcd5100e4896669"}},{"arxiv_id":"2004.11579","paper":"/paper/probabilistically-masked-language-model","title":"Probabilistically Masked Language Model Capable of Autoregressive Generation in Arbitrary Word Order","date":"2020-04-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"huawei-noah/Pretrained-Language-Model","path":"PMLM/interactive_conditional_samples_sincos_acrostic.py","file_url":"https://github.com/huawei-noah/Pretrained-Language-Model/blob/HEAD/PMLM/interactive_conditional_samples_sincos_acrostic.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fedeb6766bad1fad","mcp_get_code":{"code_sha256":"fedeb6766bad1fad"}},{"arxiv_id":"1906.00091","paper":"/paper/190600091","title":"Deep Learning Recommendation Model for Personalization and Recommendation Systems","date":"2019-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alibaba/easyrec","path":"easy_rec/python/compat/layers.py","file_url":"https://github.com/alibaba/easyrec/blob/HEAD/easy_rec/python/compat/layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2afd8b1d98ef1308","mcp_get_code":{"code_sha256":"2afd8b1d98ef1308"}},{"arxiv_id":"1905.12616","paper":"/paper/defending-against-neural-fake-news","title":"Defending Against Neural Fake News","date":"2019-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rowanz/grover","path":"lm/utils.py","file_url":"https://github.com/rowanz/grover/blob/HEAD/lm/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":false,"code_sha256_prefix":"cc925f3f6a2fb18c","mcp_get_code":{"code_sha256":"cc925f3f6a2fb18c"}},{"arxiv_id":"1810.03581","paper":"/paper/improving-the-transformer-translation-model","title":"Improving the Transformer Translation Model with Document-Level Context","date":"2018-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Glaceon31/Document-Transformer","path":"thumt/layers/nn.py","file_url":"https://github.com/Glaceon31/Document-Transformer/blob/HEAD/thumt/layers/nn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b299f075318205c0","mcp_get_code":{"code_sha256":"b299f075318205c0"}},{"arxiv_id":"1805.00631","paper":"/paper/accelerating-neural-transformer-via-an","title":"Accelerating Neural Transformer via an Average Attention Network","date":"2018-05-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bzhangXMU/transformer-aan","path":"code/thumt/layers/nn.py","file_url":"https://github.com/bzhangXMU/transformer-aan/blob/HEAD/code/thumt/layers/nn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"788092fa1ba69066","mcp_get_code":{"code_sha256":"788092fa1ba69066"}},{"arxiv_id":"1706.03762","paper":"/paper/attention-is-all-you-need","title":"Attention Is All You Need","date":"2017-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"appcoreopc/berty","path":"modeling.py","file_url":"https://github.com/appcoreopc/berty/blob/HEAD/modeling.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5576e2a080c321cd","mcp_get_code":{"code_sha256":"5576e2a080c321cd"}},{"arxiv_id":"1706.03762","paper":"/paper/attention-is-all-you-need","title":"Attention Is All You Need","date":"2017-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SCismycat/bert_code_view","path":"modeling.py","file_url":"https://github.com/SCismycat/bert_code_view/blob/HEAD/modeling.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"92e3786c47fc756c","mcp_get_code":{"code_sha256":"92e3786c47fc756c"}},{"arxiv_id":"1706.03762","paper":"/paper/attention-is-all-you-need","title":"Attention Is All You Need","date":"2017-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ricardordb/bert","path":"modeling.py","file_url":"https://github.com/ricardordb/bert/blob/HEAD/modeling.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"dd5f4494a6bda7e9","mcp_get_code":{"code_sha256":"dd5f4494a6bda7e9"}},{"arxiv_id":"1706.03762","paper":"/paper/attention-is-all-you-need","title":"Attention Is All You Need","date":"2017-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Maple728/transformer","path":"models/transformer.py","file_url":"https://github.com/Maple728/transformer/blob/HEAD/models/transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"37fdd4b948df58c8","mcp_get_code":{"code_sha256":"37fdd4b948df58c8"}},{"arxiv_id":"1607.06450","paper":"/paper/layer-normalization","title":"Layer Normalization","date":"2016-07-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kienduynguyen/Layer-Normalization","path":"LayerNorm.py","file_url":"https://github.com/kienduynguyen/Layer-Normalization/blob/HEAD/LayerNorm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"def0b163983628e2","mcp_get_code":{"code_sha256":"def0b163983628e2"}},{"arxiv_id":"1607.06450","paper":"/paper/layer-normalization","title":"Layer Normalization","date":"2016-07-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JRC1995/Machine-Translation-Transformers","path":"Machine Translation.py","file_url":"https://github.com/JRC1995/Machine-Translation-Transformers/blob/HEAD/Machine%20Translation.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0050dfbf8ad7677a","mcp_get_code":{"code_sha256":"0050dfbf8ad7677a"}},{"arxiv_id":"1607.06450","paper":"/paper/layer-normalization","title":"Layer Normalization","date":"2016-07-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhangyaoyuan/GAN-Simplification","path":"tensor2tensor/common_layers.py","file_url":"https://github.com/zhangyaoyuan/GAN-Simplification/blob/HEAD/tensor2tensor/common_layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"caa1927febb58775","mcp_get_code":{"code_sha256":"caa1927febb58775"}},{"arxiv_id":"aaai_28418","paper":null,"title":"arXiv:aaai_28418","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"KidsWithTokens/MedSegDiff","path":"guided_diffusion/nn.py","file_url":"https://github.com/KidsWithTokens/MedSegDiff/blob/HEAD/guided_diffusion/nn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"359793d02b65c82c","mcp_get_code":{"code_sha256":"359793d02b65c82c"}},{"arxiv_id":"aaai_16580","paper":null,"title":"arXiv:aaai_16580","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"modriczhang/HRL-Rec","path":"layer_util.py","file_url":"https://github.com/modriczhang/HRL-Rec/blob/HEAD/layer_util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d567287de8bb0575","mcp_get_code":{"code_sha256":"d567287de8bb0575"}},{"arxiv_id":"2023.emnlp-main.534","paper":null,"title":"arXiv:2023.emnlp-main.534","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"PreferredAI/superposed-topics","path":"gpt2/model.py","file_url":"https://github.com/PreferredAI/superposed-topics/blob/HEAD/gpt2/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c9d3430dfeeed766","mcp_get_code":{"code_sha256":"c9d3430dfeeed766"}}]}