{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/bertselfattention","entry":"BertSelfAttention","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":29,"n_papers_ran":16,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":37,"n_samples_ran":23,"n_samples_fingerprinted":10,"n_places":37,"n_places_pointer_only":16,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":23,"unverified":14},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2603.05969","paper":"/paper/arxiv-2603-05969","title":"Imagine How To Change: Explicit Procedure Modeling for Change Captioning","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"BlueberryOreo/ProCap","path":"src/rtransformer/model.py","file_url":"https://github.com/BlueberryOreo/ProCap/blob/HEAD/src/rtransformer/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"202febc467fcdff1","mcp_get_code":{"code_sha256":"202febc467fcdff1"}},{"arxiv_id":"2511.21416","paper":"/paper/arxiv-2511-21416","title":"Odin: Oriented Dual-module Integration for Text-rich Network Representation Learning","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"hongkaifeng/Odin","path":"src/OpenLP/models/Graphformer ME.py","file_url":"https://github.com/hongkaifeng/Odin/blob/HEAD/src/OpenLP/models/Graphformer%20ME.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f2984e2313d67383","mcp_get_code":{"code_sha256":"f2984e2313d67383"}},{"arxiv_id":"2501.17403","paper":"/paper/general-scene-adaptation-for-vision-and","title":"General Scene Adaptation for Vision-and-Language Navigation","date":"2025-01-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"honghd16/gsa-vln","path":"GR-DUET/map_nav_src/models/vilmodel.py","file_url":"https://github.com/honghd16/gsa-vln/blob/HEAD/GR-DUET/map_nav_src/models/vilmodel.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"50a3d34aac2573cd","mcp_get_code":{"code_sha256":"50a3d34aac2573cd"}},{"arxiv_id":"2405.00390","paper":"/paper/cofipara-a-coarse-to-fine-paradigm-for","title":"CofiPara: A Coarse-to-fine Paradigm for Multimodal Sarcasm Target Identification with Large Multimodal Models","date":"2024-05-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wjq-learning/MSTI","path":"model.py","file_url":"https://github.com/wjq-learning/MSTI/blob/HEAD/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fc89405716521d69","mcp_get_code":{"code_sha256":"fc89405716521d69"}},{"arxiv_id":"2402.13040","paper":"/paper/text-guided-molecule-generation-with","title":"Text-Guided Molecule Generation with Diffusion Language Model","date":"2024-02-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Deno-V/tgm-dlm","path":"improved-diffusion/improved_diffusion/transformer_model.py","file_url":"https://github.com/Deno-V/tgm-dlm/blob/HEAD/improved-diffusion/improved_diffusion/transformer_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c52c56e6b503ff9a","mcp_get_code":{"code_sha256":"c52c56e6b503ff9a"}},{"arxiv_id":"2308.12587","paper":"/paper/grounded-entity-landmark-adaptive-pre","title":"Grounded Entity-Landmark Adaptive Pre-training for Vision-and-Language Navigation","date":"2023-08-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"csir1996/vln-gela","path":"ada_pretrain_src/model/pretrain_cmt.py","file_url":"https://github.com/csir1996/vln-gela/blob/HEAD/ada_pretrain_src/model/pretrain_cmt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"181a8da7e0d87dd3","mcp_get_code":{"code_sha256":"181a8da7e0d87dd3"}},{"arxiv_id":"2305.12268","paper":"/paper/patton-language-model-pretraining-on-text","title":"Patton: Language Model Pretraining on Text-Rich Networks","date":"2023-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"PeterGriffinJin/Patton","path":"src/OpenLP/models/Graphformer.py","file_url":"https://github.com/PeterGriffinJin/Patton/blob/HEAD/src/OpenLP/models/Graphformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"94182c53af96db35","mcp_get_code":{"code_sha256":"94182c53af96db35"}},{"arxiv_id":"2305.12074","paper":"/paper/disco-distilled-student-models-co-training","title":"DisCo: Distilled Student Models Co-training for Semi-supervised Text Mining","date":"2023-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"litesslhub/disco","path":"src/model.py","file_url":"https://github.com/litesslhub/disco/blob/HEAD/src/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"578d4f3276e30323","mcp_get_code":{"code_sha256":"578d4f3276e30323"}},{"arxiv_id":"2305.03602","paper":"/paper/a-dual-semantic-aware-recurrent-global","title":"A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation","date":"2023-05-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CrystalSixone/DSRG","path":"finetune_src/models/vilmodel.py","file_url":"https://github.com/CrystalSixone/DSRG/blob/HEAD/finetune_src/models/vilmodel.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ffff1ac5549ddff4","mcp_get_code":{"code_sha256":"ffff1ac5549ddff4"}},{"arxiv_id":"2303.15796","paper":"/paper/kerm-knowledge-enhanced-reasoning-for-vision","title":"KERM: Knowledge Enhanced Reasoning for Vision-and-Language Navigation","date":"2023-03-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XiangyangLi20/KERM","path":"knowledge_nav_src/models/vilmodel.py","file_url":"https://github.com/XiangyangLi20/KERM/blob/HEAD/knowledge_nav_src/models/vilmodel.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8e5c1f482d9ee1e0","mcp_get_code":{"code_sha256":"8e5c1f482d9ee1e0"}},{"arxiv_id":"2303.08409","paper":"/paper/lana-a-language-capable-navigator-for","title":"Lana: A Language-Capable Navigator for Instruction Following and Generation","date":"2023-03-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wxh1996/lana-vln","path":"finetune_src/models/vilmodel_cmt_lana.py","file_url":"https://github.com/wxh1996/lana-vln/blob/HEAD/finetune_src/models/vilmodel_cmt_lana.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a0efcc75e5e7e5de","mcp_get_code":{"code_sha256":"a0efcc75e5e7e5de"}},{"arxiv_id":"2210.08714","paper":"/paper/selective-query-guided-debiasing-network-for","title":"Selective Query-guided Debiasing for Video Corpus Moment Retrieval","date":"2022-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dbstjswo505/SQuiDNet","path":"model/squidnet.py","file_url":"https://github.com/dbstjswo505/SQuiDNet/blob/HEAD/model/squidnet.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"57400b456ed52f49","mcp_get_code":{"code_sha256":"57400b456ed52f49"}},{"arxiv_id":"2210.08465","paper":"/paper/character-centric-story-visualization-via","title":"Character-Centric Story Visualization via Visual Planning and Token Alignment","date":"2022-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"adymaharana/VLCStoryGan","path":"vlcgan/model.py","file_url":"https://github.com/adymaharana/VLCStoryGan/blob/HEAD/vlcgan/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e5006dcf91e21556","mcp_get_code":{"code_sha256":"e5006dcf91e21556"}},{"arxiv_id":"2205.00274","paper":"/paper/clues-before-answers-generation-enhanced","title":"Clues Before Answers: Generation-Enhanced Multiple-Choice QA","date":"2022-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nju-websoft/GenMC","path":"model/modeling_genmc.py","file_url":"https://github.com/nju-websoft/GenMC/blob/HEAD/model/modeling_genmc.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"6a50fa25bd29286f","mcp_get_code":{"code_sha256":"6a50fa25bd29286f"}},{"arxiv_id":"2203.15125","paper":"/paper/text2pos-text-to-point-cloud-cross-modal","title":"Text2Pos: Text-to-Point-Cloud Cross-Modal Localization","date":"2022-03-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kevin301342/cmmloc","path":"models/coarse/cell_retrieval.py","file_url":"https://github.com/kevin301342/cmmloc/blob/HEAD/models/coarse/cell_retrieval.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9a383ff97b1c44e8","mcp_get_code":{"code_sha256":"9a383ff97b1c44e8"}},{"arxiv_id":"2203.14040","paper":"/paper/visual-abductive-reasoning","title":"Visual Abductive Reasoning","date":"2022-03-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leonnnop/var","path":"src/model/mainmodel.py","file_url":"https://github.com/leonnnop/var/blob/HEAD/src/model/mainmodel.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1ad7e9bae41c84c2","mcp_get_code":{"code_sha256":"1ad7e9bae41c84c2"}},{"arxiv_id":"2110.13309","paper":"/paper/history-aware-multimodal-transformer-for","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","date":"2021-10-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cshizhe/vln-hamt","path":"finetune_src/models/vilmodel_cmt.py","file_url":"https://github.com/cshizhe/vln-hamt/blob/HEAD/finetune_src/models/vilmodel_cmt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c08a770513cf174b","mcp_get_code":{"code_sha256":"c08a770513cf174b"}},{"arxiv_id":"2110.12567","paper":"/paper/alignment-attention-by-matching-key-and-query","title":"Alignment Attention by Matching Key and Query Distributions","date":"2021-10-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"szhang42/alignment_attention","path":"src/transformers/modeling_albert.py","file_url":"https://github.com/szhang42/alignment_attention/blob/HEAD/src/transformers/modeling_albert.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ebb254c6336aec90","mcp_get_code":{"code_sha256":"ebb254c6336aec90"}},{"arxiv_id":"2108.00061","paper":"/paper/mtvr-multilingual-moment-retrieval-in-videos","title":"MTVR: Multilingual Moment Retrieval in Videos","date":"2021-07-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jayleicn/mTVRetrieval","path":"baselines/mxml/model_xml_shared.py","file_url":"https://github.com/jayleicn/mTVRetrieval/blob/HEAD/baselines/mxml/model_xml_shared.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f68c67bac0562ca9","mcp_get_code":{"code_sha256":"f68c67bac0562ca9"}},{"arxiv_id":"2106.14019","paper":"/paper/umic-an-unreferenced-metric-for-image","title":"UMIC: An Unreferenced Metric for Image Captioning via Contrastive Learning","date":"2021-06-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hwanheelee1993/UMIC","path":"model/ce.py","file_url":"https://github.com/hwanheelee1993/UMIC/blob/HEAD/model/ce.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"50a06ca454859f0c","mcp_get_code":{"code_sha256":"50a06ca454859f0c"}},{"arxiv_id":"2011.05268","paper":"/paper/towards-interpretable-natural-language","title":"Towards Interpretable Natural Language Understanding with Explanations as Latent Variables","date":"2020-10-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JamesHujy/ELV","path":"ELV_re/s2s_ft/modeling_decoding.py","file_url":"https://github.com/JamesHujy/ELV/blob/HEAD/ELV_re/s2s_ft/modeling_decoding.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0cddc969b8e047cc","mcp_get_code":{"code_sha256":"0cddc969b8e047cc"}},{"arxiv_id":"2010.08210","paper":"/paper/coarse-to-fine-pre-training-for-named-entity","title":"Coarse-to-Fine Pre-training for Named Entity Recognition","date":"2020-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"strawberryx/CoFEE","path":"model/bert_mrc_ner_cluster.py","file_url":"https://github.com/strawberryx/CoFEE/blob/HEAD/model/bert_mrc_ner_cluster.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"47113e22d2e57c7f","mcp_get_code":{"code_sha256":"47113e22d2e57c7f"}},{"arxiv_id":"2010.02399","paper":"/paper/guiding-attention-for-self-supervised","title":"Guiding Attention for Self-Supervised Learning with Transformers","date":"2020-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ameet-1997/AttentionGuidance","path":"attention_guidance/src/transformers/modeling_bert.py","file_url":"https://github.com/ameet-1997/AttentionGuidance/blob/HEAD/attention_guidance/src/transformers/modeling_bert.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b2e5008f527ce193","mcp_get_code":{"code_sha256":"b2e5008f527ce193"}},{"arxiv_id":"2004.13278","paper":"/paper/vd-bert-a-unified-vision-and-dialog","title":"VD-BERT: A Unified Vision and Dialog Transformer with BERT","date":"2020-04-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"salesforce/VD-BERT","path":"pytorch_pretrained_bert/modeling.py","file_url":"https://github.com/salesforce/VD-BERT/blob/HEAD/pytorch_pretrained_bert/modeling.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"39133fc31b6e7ba0","mcp_get_code":{"code_sha256":"39133fc31b6e7ba0"}},{"arxiv_id":"1908.02265","paper":"/paper/vilbert-pretraining-task-agnostic","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","date":"2019-08-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jiasenlu/vilbert_beta","path":"vilbert/vilbert.py","file_url":"https://github.com/jiasenlu/vilbert_beta/blob/HEAD/vilbert/vilbert.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d5fe4e5fe4ebd34d","mcp_get_code":{"code_sha256":"d5fe4e5fe4ebd34d"}},{"arxiv_id":"1907.11692","paper":"/paper/roberta-a-robustly-optimized-bert-pretraining","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","date":"2019-07-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"GeorgeLuImmortal/Hierarchical-BERT-Model-with-Limited-Labelled-Data","path":"run_hbm.py","file_url":"https://github.com/GeorgeLuImmortal/Hierarchical-BERT-Model-with-Limited-Labelled-Data/blob/HEAD/run_hbm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"df8363b5430892a0","mcp_get_code":{"code_sha256":"df8363b5430892a0"}},{"arxiv_id":"1810.04805","paper":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cedrickchee/pytorch-pretrained-BERT","path":"pytorch_pretrained_bert/modeling.py","file_url":"https://github.com/cedrickchee/pytorch-pretrained-BERT/blob/HEAD/pytorch_pretrained_bert/modeling.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d7fe09a1ec2f4f0d","mcp_get_code":{"code_sha256":"d7fe09a1ec2f4f0d"}},{"arxiv_id":"1810.04805","paper":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"derronxu/sparsebert","path":"SparseBERT/main_functions/transformer/modeling.py","file_url":"https://github.com/derronxu/sparsebert/blob/HEAD/SparseBERT/main_functions/transformer/modeling.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"72415b9f7aa76ac9","mcp_get_code":{"code_sha256":"72415b9f7aa76ac9"}},{"arxiv_id":"1810.04805","paper":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Impavidity/relogic","path":"relogic/logickit/inference/modeling.py","file_url":"https://github.com/Impavidity/relogic/blob/HEAD/relogic/logickit/inference/modeling.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b62d4fe9e831d295","mcp_get_code":{"code_sha256":"b62d4fe9e831d295"}},{"arxiv_id":"1810.04805","paper":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ganeshjawahar/interpret_bert","path":"tpdn/unsuptree_modeler.py","file_url":"https://github.com/ganeshjawahar/interpret_bert/blob/HEAD/tpdn/unsuptree_modeler.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"47914b62d30c89d7","mcp_get_code":{"code_sha256":"47914b62d30c89d7"}},{"arxiv_id":"1810.04805","paper":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yifding/hetseq","path":"hetseq/bert_modeling.py","file_url":"https://github.com/yifding/hetseq/blob/HEAD/hetseq/bert_modeling.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"deecd100e8c17400","mcp_get_code":{"code_sha256":"deecd100e8c17400"}},{"arxiv_id":"1810.04805","paper":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"airsplay/vimpac","path":"vimpac/modeling.py","file_url":"https://github.com/airsplay/vimpac/blob/HEAD/vimpac/modeling.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8396c5967c3a2df6","mcp_get_code":{"code_sha256":"8396c5967c3a2df6"}},{"arxiv_id":"1810.04805","paper":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cybertronai/megatron-lm","path":"model/modeling.py","file_url":"https://github.com/cybertronai/megatron-lm/blob/HEAD/model/modeling.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"e4d01ce175b1609c","mcp_get_code":{"code_sha256":"e4d01ce175b1609c"}},{"arxiv_id":"1810.04805","paper":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"charles9n/bert-sklearn","path":"bert_sklearn/model/pytorch_pretrained/modeling.py","file_url":"https://github.com/charles9n/bert-sklearn/blob/HEAD/bert_sklearn/model/pytorch_pretrained/modeling.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"79f120e0db5db99e","mcp_get_code":{"code_sha256":"79f120e0db5db99e"}},{"arxiv_id":"1803.02155","paper":"/paper/self-attention-with-relative-position","title":"Self-Attention with Relative Position Representations","date":"2018-03-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mehdibenamorr/bert-positional-bias-ner","path":"models/attention.py","file_url":"https://github.com/mehdibenamorr/bert-positional-bias-ner/blob/HEAD/models/attention.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a9285738d93fbcb8","mcp_get_code":{"code_sha256":"a9285738d93fbcb8"}},{"arxiv_id":"1706.03762","paper":"/paper/attention-is-all-you-need","title":"Attention Is All You Need","date":"2017-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"han-shi/SparseBERT","path":"modeling.py","file_url":"https://github.com/han-shi/SparseBERT/blob/HEAD/modeling.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5a86d6c972a844fa","mcp_get_code":{"code_sha256":"5a86d6c972a844fa"}},{"arxiv_id":"1706.03762","paper":"/paper/attention-is-all-you-need","title":"Attention Is All You Need","date":"2017-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hiun/learning-transformers","path":"modeling_bert.py","file_url":"https://github.com/hiun/learning-transformers/blob/HEAD/modeling_bert.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e3f87e22fdcfec57","mcp_get_code":{"code_sha256":"e3f87e22fdcfec57"}}]}