{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/starcraft/papers/2","list_of":"/task/starcraft","task":"Starcraft","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":4,"rows_per_page":100,"rows":[101,200],"of":311,"counts":{"archive_papers_tagged":311,"with_a_code_link":148,"where_syntology_ran_a_sample":36,"not_listed_spam_title":0,"listed":311,"listed_where_code_ran":36,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":29,"every_run_a_failure_of_syntologys_instrument":7,"listed_with_a_run_with_no_instrument_failure":29,"listed_every_run_a_failure_of_syntologys_instrument":7,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/starcraft","prev":"/task/starcraft","next":"/task/starcraft/papers/3","papers":[{"url":"/paper/off-policy-correction-for-multi-agent","slug":"off-policy-correction-for-multi-agent","title":"Off-Policy Correction For Multi-Agent Reinforcement Learning","date":"2021-11-22","arxiv_id":"2111.11229","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/off-policy-correction-for-multi-agent#ran","syntology_url":"https://syntology.ai/paper/2111.11229","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2111.11229"}},"official":{"repos":["awarelab/seed_rl"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/coordinated-proximal-policy-optimization","slug":"coordinated-proximal-policy-optimization","title":"Coordinated Proximal Policy Optimization","date":"2021-11-07","arxiv_id":"2111.04051","repositories_listed":1,"syntology":null},{"url":"/paper/tikick-toward-playing-multi-agent-football","slug":"tikick-toward-playing-multi-agent-football","title":"TiKick: Towards Playing Multi-agent Football Full Games from Single-agent Demonstrations","date":"2021-10-09","arxiv_id":"2110.04507","repositories_listed":1,"syntology":null},{"url":"/paper/no-press-diplomacy-from-scratch","slug":"no-press-diplomacy-from-scratch","title":"No-Press Diplomacy from Scratch","date":"2021-10-06","arxiv_id":"2110.02924","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":1,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/no-press-diplomacy-from-scratch#ran","syntology_url":"https://syntology.ai/paper/2110.02924","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2110.02924"}},"official":{"repos":["facebookresearch/diplomacy_searchbot"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/applying-supervised-and-reinforcement","slug":"applying-supervised-and-reinforcement","title":"Applying supervised and reinforcement learning methods to create neural-network-based agents for playing StarCraft II","date":"2021-09-26","arxiv_id":"2109.12691","repositories_listed":1,"syntology":null},{"url":"/paper/settling-the-variance-of-multi-agent-policy","slug":"settling-the-variance-of-multi-agent-policy","title":"Settling the Variance of Multi-Agent Policy Gradients","date":"2021-08-19","arxiv_id":"2108.08612","repositories_listed":1,"syntology":null},{"url":"/paper/believe-what-you-see-implicit-constraint","slug":"believe-what-you-see-implicit-constraint","title":"Believe What You See: Implicit Constraint Approach for Offline Multi-Agent Reinforcement Learning","date":"2021-06-07","arxiv_id":"2106.03400","repositories_listed":1,"syntology":null},{"url":"/paper/context-aware-sparse-deep-coordination-graphs","slug":"context-aware-sparse-deep-coordination-graphs","title":"Context-Aware Sparse Deep Coordination Graphs","date":"2021-06-05","arxiv_id":"2106.02886","repositories_listed":1,"syntology":null},{"url":"/paper/shaq-incorporating-shapley-value-theory-into","slug":"shaq-incorporating-shapley-value-theory-into","title":"SHAQ: Incorporating Shapley Value Theory into Multi-Agent Q-Learning","date":"2021-05-31","arxiv_id":"2105.15013","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/shaq-incorporating-shapley-value-theory-into#ran","syntology_url":"https://syntology.ai/paper/2105.15013","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2105.15013"}},"official":{"repos":["hsvgbkhgbv/shapley-q-learning"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/cooperative-multi-agent-reinforcement-5","slug":"cooperative-multi-agent-reinforcement-5","title":"Cooperative Multi-Agent Reinforcement Learning with Sequential Credit Assignment","date":"2021-05-21","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/coach-player-multi-agent-reinforcement","slug":"coach-player-multi-agent-reinforcement","title":"Coach-Player Multi-Agent Reinforcement Learning for Dynamic Team Composition","date":"2021-05-18","arxiv_id":"2105.08692","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/coach-player-multi-agent-reinforcement#ran","syntology_url":"https://syntology.ai/paper/2105.08692","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2105.08692"}},"official":{"repos":["cranial-xix/marl-copa"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/an-introduction-of-mini-alphastar","slug":"an-introduction-of-mini-alphastar","title":"An Introduction of mini-AlphaStar","date":"2021-04-14","arxiv_id":"2104.06890","repositories_listed":1,"syntology":null},{"url":"/paper/decomposed-soft-actor-critic-method-for","slug":"decomposed-soft-actor-critic-method-for","title":"Decomposed Soft Actor-Critic Method for Cooperative Multi-Agent Reinforcement Learning","date":"2021-04-14","arxiv_id":"2104.06655","repositories_listed":1,"syntology":null},{"url":"/paper/c-coma-a-continual-reinforcement-learning","slug":"c-coma-a-continual-reinforcement-learning","title":"C-COMA: A CONTINUAL REINFORCEMENT LEARNING MODEL FOR DYNAMIC MULTIAGENT ENVIRONMENTS","date":"2021-04-05","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/dfac-framework-factorizing-the-value-function","slug":"dfac-framework-factorizing-the-value-function","title":"DFAC Framework: Factorizing the Value Function via Quantile Mixture for Multi-Agent Distributional Q-Learning","date":"2021-02-16","arxiv_id":"2102.07936","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":1,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified; the one sample that ran constructed an object rather than computing a result","sample_list":"/paper/dfac-framework-factorizing-the-value-function#ran","syntology_url":"https://syntology.ai/paper/2102.07936","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2102.07936"}},"official":{"repos":["j3soon/dfac"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":1,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/qvmix-and-qvmix-max-extending-the-deep","slug":"qvmix-and-qvmix-max-extending-the-deep","title":"QVMix and QVMix-Max: Extending the Deep Quality-Value Family of Algorithms to Cooperative Multi-Agent Reinforcement Learning","date":"2020-12-22","arxiv_id":"2012.12062","repositories_listed":1,"syntology":null},{"url":"/paper/tstarbot-x-an-open-sourced-and-comprehensive","slug":"tstarbot-x-an-open-sourced-and-comprehensive","title":"TStarBot-X: An Open-Sourced and Comprehensive Study for Efficient League Training in StarCraft II Full Game","date":"2020-11-27","arxiv_id":"2011.13729","repositories_listed":1,"syntology":null},{"url":"/paper/tleague-a-framework-for-competitive-self-play","slug":"tleague-a-framework-for-competitive-self-play","title":"TLeague: A Framework for Competitive Self-Play based Distributed Multi-Agent Reinforcement Learning","date":"2020-11-25","arxiv_id":"2011.12895","repositories_listed":1,"syntology":null},{"url":"/paper/graph-convolutional-value-decomposition-in-1","slug":"graph-convolutional-value-decomposition-in-1","title":"Graph Convolutional Value Decomposition in Multi-Agent Reinforcement Learning","date":"2020-10-09","arxiv_id":"2010.04740","repositories_listed":1,"syntology":null},{"url":"/paper/energy-based-surprise-minimization-for-multi","slug":"energy-based-surprise-minimization-for-multi","title":"Energy-based Surprise Minimization for Multi-Agent Value Factorization","date":"2020-09-16","arxiv_id":"2009.09842","repositories_listed":1,"syntology":null},{"url":"/paper/off-policy-multi-agent-decomposed-policy","slug":"off-policy-multi-agent-decomposed-policy","title":"Off-Policy Multi-Agent Decomposed Policy Gradients","date":"2020-07-24","arxiv_id":"2007.12322","repositories_listed":1,"syntology":null},{"url":"/paper/value-decomposition-multi-agent-actor-critics","slug":"value-decomposition-multi-agent-actor-critics","title":"Value-Decomposition Multi-Agent Actor-Critics","date":"2020-07-24","arxiv_id":"2007.12306","repositories_listed":1,"syntology":null},{"url":"/paper/deep-implicit-coordination-graphs-for-multi","slug":"deep-implicit-coordination-graphs-for-multi","title":"Deep Implicit Coordination Graphs for Multi-agent Reinforcement Learning","date":"2020-06-19","arxiv_id":"2006.11438","repositories_listed":1,"syntology":null},{"url":"/paper/real-world-games-look-like-spinning-tops","slug":"real-world-games-look-like-spinning-tops","title":"Real World Games Look Like Spinning Tops","date":"2020-04-20","arxiv_id":"2004.09468","repositories_listed":1,"syntology":null},{"url":"/paper/monotonic-value-function-factorisation-for","slug":"monotonic-value-function-factorisation-for","title":"Monotonic Value Function Factorisation for Deep Multi-Agent Reinforcement Learning","date":"2020-03-19","arxiv_id":"2003.08839","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/monotonic-value-function-factorisation-for#ran","syntology_url":"https://syntology.ai/paper/2003.08839","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2003.08839"}},"official":{"repos":["oxwhirl/pymarl"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/defoggan-predicting-hidden-information-in-the","slug":"defoggan-predicting-hidden-information-in-the","title":"DefogGAN: Predicting Hidden Information in the StarCraft Fog of War with Generative Adversarial Nets","date":"2020-03-04","arxiv_id":"2003.01927","repositories_listed":1,"syntology":null},{"url":"/paper/meta-reinforcement-learning-with-autonomous-1","slug":"meta-reinforcement-learning-with-autonomous-1","title":"Meta Reinforcement Learning with Autonomous Inference of Subtask Dependencies","date":"2020-01-01","arxiv_id":"2001.00248","repositories_listed":1,"syntology":{"n":5,"n_ran":5,"n_constructed":2,"n_ran_checked":3,"n_instrument":2,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"5 ran (of which 2 constructed an object rather than computing a result; 3 with no instrument failure: 1 honoured, 0 violated, 2 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/meta-reinforcement-learning-with-autonomous-1#ran","syntology_url":"https://syntology.ai/paper/2001.00248","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2001.00248"}},"official":{"repos":["srsohn/msgi"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":2,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/liir-learning-individual-intrinsic-reward-in","slug":"liir-learning-individual-intrinsic-reward-in","title":"LIIR: Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning","date":"2019-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/smix-enhancing-centralized-value-functions","slug":"smix-enhancing-centralized-value-functions","title":"SMIX($λ$): Enhancing Centralized Value Functions for Cooperative Multi-Agent Reinforcement Learning","date":"2019-11-11","arxiv_id":"1911.04094","repositories_listed":1,"syntology":null},{"url":"/paper/a-structured-prediction-approach-for","slug":"a-structured-prediction-approach-for","title":"A Structured Prediction Approach for Generalization in Cooperative Multi-Agent Reinforcement Learning","date":"2019-10-19","arxiv_id":"1910.08809","repositories_listed":1,"syntology":null},{"url":"/paper/learning-nearly-decomposable-value-functions-1","slug":"learning-nearly-decomposable-value-functions-1","title":"Learning Nearly Decomposable Value Functions Via Communication Minimization","date":"2019-10-11","arxiv_id":"1910.05366","repositories_listed":1,"syntology":null},{"url":"/paper/action-semantics-network-considering-the","slug":"action-semantics-network-considering-the","title":"Action Semantics Network: Considering the Effects of Actions in Multiagent Systems","date":"2019-07-26","arxiv_id":"1907.11461","repositories_listed":1,"syntology":null},{"url":"/paper/growing-action-spaces","slug":"growing-action-spaces","title":"Growing Action Spaces","date":"2019-06-28","arxiv_id":"1906.12266","repositories_listed":1,"syntology":null},{"url":"/paper/efficient-reinforcement-learning-with-a-mind","slug":"efficient-reinforcement-learning-with-a-mind","title":"Efficient Reinforcement Learning for StarCraft by Abstract Forward Models and Transfer Learning","date":"2019-03-02","arxiv_id":"1903.00715","repositories_listed":1,"syntology":null},{"url":"/paper/prolonets-neural-encoding-human-experts","slug":"prolonets-neural-encoding-human-experts","title":"Neural-encoding Human Experts' Domain Knowledge to Warm Start Reinforcement Learning","date":"2019-02-15","arxiv_id":"1902.06007","repositories_listed":1,"syntology":null},{"url":"/paper/the-natural-language-of-actions","slug":"the-natural-language-of-actions","title":"The Natural Language of Actions","date":"2019-02-04","arxiv_id":"1902.01119","repositories_listed":1,"syntology":null},{"url":"/paper/staralgo-a-squad-movement-planning-library","slug":"staralgo-a-squad-movement-planning-library","title":"StarAlgo: A Squad Movement Planning Library for StarCraft using Monte Carlo Tree Search and Negamax","date":"2018-12-29","arxiv_id":"1812.11371","repositories_listed":1,"syntology":null},{"url":"/paper/variational-saccading-efficient-inference-for","slug":"variational-saccading-efficient-inference-for","title":"Variational Saccading: Efficient Inference for Large Resolution Images","date":"2018-12-08","arxiv_id":"1812.03170","repositories_listed":1,"syntology":null},{"url":"/paper/macro-action-selection-with-deep","slug":"macro-action-selection-with-deep","title":"Macro action selection with deep reinforcement learning in StarCraft","date":"2018-12-02","arxiv_id":"1812.00336","repositories_listed":1,"syntology":null},{"url":"/paper/clear-the-fog-combat-value-assessment-in","slug":"clear-the-fog-combat-value-assessment-in","title":"Clear the Fog: Combat Value Assessment in Incomplete Information Games with Convolutional Encoder-Decoders","date":"2018-11-30","arxiv_id":"1811.12627","repositories_listed":1,"syntology":null},{"url":"/paper/forward-modeling-for-partial-observation","slug":"forward-modeling-for-partial-observation","title":"Forward Modeling for Partial Observation Strategy Games - A StarCraft Defogger","date":"2018-11-30","arxiv_id":"1812.00054","repositories_listed":1,"syntology":null},{"url":"/paper/multi-agent-common-knowledge-reinforcement","slug":"multi-agent-common-knowledge-reinforcement","title":"Multi-Agent Common Knowledge Reinforcement Learning","date":"2018-10-27","arxiv_id":"1810.11702","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/multi-agent-common-knowledge-reinforcement#ran","syntology_url":"https://syntology.ai/paper/1810.11702","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1810.11702"}},"official":{"repos":["schroederdewitt/mackrl"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/deep-rts-a-game-environment-for-deep","slug":"deep-rts-a-game-environment-for-deep","title":"Deep RTS: A Game Environment for Deep Reinforcement Learning in Real-Time Strategy Games","date":"2018-08-15","arxiv_id":"1808.05032","repositories_listed":1,"syntology":null},{"url":"/paper/starcraft-micromanagement-with-reinforcement","slug":"starcraft-micromanagement-with-reinforcement","title":"StarCraft Micromanagement with Reinforcement Learning and Curriculum Transfer Learning","date":"2018-04-03","arxiv_id":"1804.00810","repositories_listed":1,"syntology":null},{"url":"/paper/multi-platform-version-of-starcraft-brood-war","slug":"multi-platform-version-of-starcraft-brood-war","title":"Multi-platform Version of StarCraft: Brood War in a Docker Container: Technical Report","date":"2018-01-07","arxiv_id":"1801.02193","repositories_listed":1,"syntology":null},{"url":"/paper/reddwarfdata-a-simplified-dataset-of","slug":"reddwarfdata-a-simplified-dataset-of","title":"RedDwarfData: a simplified dataset of StarCraft matches","date":"2017-12-29","arxiv_id":"1712.10179","repositories_listed":1,"syntology":null},{"url":"/paper/stardata-a-starcraft-ai-research-dataset","slug":"stardata-a-starcraft-ai-research-dataset","title":"STARDATA: A StarCraft AI Research Dataset","date":"2017-08-07","arxiv_id":"1708.02139","repositories_listed":1,"syntology":null},{"url":"/paper/a-dataset-for-starcraft-ai-an-example-of","slug":"a-dataset-for-starcraft-ai-an-example-of","title":"A Dataset for StarCraft AI \\& an Example of Armies Clustering","date":"2012-11-19","arxiv_id":"1211.4552","repositories_listed":1,"syntology":null},{"url":null,"slug":"neuropal-punctuated-anytime-learning-with","title":"NeuroPAL: Punctuated Anytime Learning with Neuroevolution for Macromanagement in Starcraft: Brood War","date":"2025-06-12","arxiv_id":"2506.10384","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-guided-multi-agent-learning-in","title":"Language-Guided Multi-Agent Learning in Simulations: A Unified Framework and Evaluation","date":"2025-06-01","arxiv_id":"2506.04251","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-sight-range-selection-in-multi-agent","title":"Dynamic Sight Range Selection in Multi-Agent Reinforcement Learning","date":"2025-05-19","arxiv_id":"2505.12811","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-01458","title":"SrSv: Integrating Sequential Rollouts with Sequential Value Estimation for Multi-agent Reinforcement Learning","date":"2025-03-03","arxiv_id":"2503.01458","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-00372","title":"Nucleolus Credit Assignment for Effective Coalitions in Multi-agent Reinforcement Learning","date":"2025-03-01","arxiv_id":"2503.00372","repositories_listed":0,"syntology":null},{"url":null,"slug":"reflection-of-episodes-learning-to-play-game","title":"Reflection of Episodes: Learning to Play Game from Expert and Self Experiences","date":"2025-02-19","arxiv_id":"2502.13388","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-planning-with","title":"Cooperative Multi-Agent Planning with Adaptive Skill Synthesis","date":"2025-02-14","arxiv_id":"2502.10148","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-rank-agent-specific-adaptation-lorasa-for","title":"Low-Rank Agent-Specific Adaptation (LoRASA) for Multi-Agent Policy Learning","date":"2025-02-08","arxiv_id":"2502.05573","repositories_listed":0,"syntology":null},{"url":null,"slug":"innovative-activities-of-activision-blizzard","title":"Innovative activities of Activision Blizzard: A patent network analysis","date":"2025-02-04","arxiv_id":"2502.02259","repositories_listed":0,"syntology":null},{"url":null,"slug":"superhuman-ai-disclosure-impacts-on-toxicity","title":"Superhuman Game AI Disclosure: Expertise and Context Moderate Effects on Trust and Fairness","date":"2025-01-31","arxiv_id":"2503.15514","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-like-bots-for-tactical-shooters-using","title":"Human-like Bots for Tactical Shooters Using Compute-Efficient Sensors","date":"2024-12-30","arxiv_id":"2501.00078","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-distributed-common-operational","title":"Data-Driven Distributed Common Operational Picture from Heterogeneous Platforms using Multi-Agent Reinforcement Learning","date":"2024-11-08","arxiv_id":"2411.05683","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-to-online-multi-agent-reinforcement","title":"Offline-to-Online Multi-Agent Reinforcement Learning with Offline Value Function Memory and Sequential Exploration","date":"2024-10-25","arxiv_id":"2410.19450","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiently-scanning-and-resampling-spatio","title":"Efficiently Scanning and Resampling Spatio-Temporal Tasks with Irregular Observations","date":"2024-10-11","arxiv_id":"2410.08681","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounded-answers-for-multi-agent-decision","title":"Grounded Answers for Multi-agent Decision-making Problem through Generative World Model","date":"2024-10-03","arxiv_id":"2410.02664","repositories_listed":0,"syntology":null},{"url":null,"slug":"comadice-offline-cooperative-multi-agent","title":"ComaDICE: Offline Cooperative Multi-Agent Reinforcement Learning with Stationary Distribution Shift Regularization","date":"2024-10-02","arxiv_id":"2410.01954","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-stateful-value-factorization-in-multi","title":"On Stateful Value Factorization in Multi-Agent Reinforcement Learning","date":"2024-08-27","arxiv_id":"2408.15381","repositories_listed":0,"syntology":null},{"url":"/paper/hybrid-training-for-enhanced-multi-task","slug":"hybrid-training-for-enhanced-multi-task","title":"Hybrid Training for Enhanced Multi-task Generalization in Multi-agent Reinforcement Learning","date":"2024-08-24","arxiv_id":"2408.13567","repositories_listed":0,"syntology":{"n":3,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/hybrid-training-for-enhanced-multi-task#ran","syntology_url":"https://syntology.ai/paper/2408.13567","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2408.13567"}},"official":null}},{"url":null,"slug":"tree-search-for-simultaneous-move-games-via","title":"Tree Search for Simultaneous Move Games via Equilibrium Approximation","date":"2024-06-14","arxiv_id":"2406.10411","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-offline-multi-agent-skill","title":"Variational Offline Multi-agent Skill Discovery","date":"2024-05-26","arxiv_id":"2405.16386","repositories_listed":0,"syntology":null},{"url":null,"slug":"powqmix-weighted-value-factorization-with","title":"POWQMIX: Weighted Value Factorization with Potentially Optimal Joint Actions Recognition for Cooperative Multi-Agent Reinforcement Learning","date":"2024-05-13","arxiv_id":"2405.08036","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-multi-agent-reinforcement-2","title":"Heterogeneous Multi-Agent Reinforcement Learning for Zero-Shot Scalable Collaboration","date":"2024-04-05","arxiv_id":"2404.03869","repositories_listed":0,"syntology":null},{"url":null,"slug":"marl-lns-cooperative-multi-agent","title":"MARL-LNS: Cooperative Multi-agent Reinforcement Learning via Large Neighborhoods Search","date":"2024-04-03","arxiv_id":"2404.03101","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-ai-teaming-in-unknown","title":"Collaborative AI Teaming in Unknown Environments via Active Goal Deduction","date":"2024-03-22","arxiv_id":"2403.15341","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-joint-demonstrations-personalized","title":"Beyond Joint Demonstrations: Personalized Expert Guidance for Efficient Multi-Agent Reinforcement Learning","date":"2024-03-13","arxiv_id":"2403.08936","repositories_listed":0,"syntology":null},{"url":null,"slug":"smaug-a-sliding-multidimensional-task-window","title":"SMAUG: A Sliding Multidimensional Task Window-Based MARL Framework for Adaptive Real-Time Subtask Recognition","date":"2024-03-04","arxiv_id":"2403.01816","repositories_listed":0,"syntology":null},{"url":null,"slug":"imagine-initialize-and-explore-an-effective","title":"Imagine, Initialize, and Explore: An Effective Exploration Method in Multi-Agent Reinforcement Learning","date":"2024-02-28","arxiv_id":"2402.17978","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-individual-and-collective-objectives","title":"Aligning Individual and Collective Objectives in Multi-Agent Cooperation","date":"2024-02-19","arxiv_id":"2402.12416","repositories_listed":0,"syntology":null},{"url":null,"slug":"enabling-multi-agent-transfer-reinforcement","title":"Enabling Multi-Agent Transfer Reinforcement Learning via Scenario Independent Representation","date":"2024-02-13","arxiv_id":"2402.08184","repositories_listed":0,"syntology":null},{"url":null,"slug":"maidcrl-semi-centralized-multi-agent","title":"MAIDCRL: Semi-centralized Multi-Agent Influence Dense-CNN Reinforcement Learning","date":"2024-02-12","arxiv_id":"2402.07890","repositories_listed":0,"syntology":null},{"url":null,"slug":"coa-gpt-generative-pre-trained-transformers","title":"COA-GPT: Generative Pre-trained Transformers for Accelerated Course of Action Development in Military Operations","date":"2024-02-01","arxiv_id":"2402.01786","repositories_listed":0,"syntology":null},{"url":null,"slug":"bet-explaining-deep-reinforcement-learning","title":"BET: Explaining Deep Reinforcement Learning through The Error-Prone Decisions","date":"2024-01-14","arxiv_id":"2401.07263","repositories_listed":0,"syntology":null},{"url":null,"slug":"innate-values-driven-reinforcement-learning","title":"Innate-Values-driven Reinforcement Learning based Cooperative Multi-Agent Cognitive Modeling","date":"2024-01-10","arxiv_id":"2401.05572","repositories_listed":0,"syntology":null},{"url":null,"slug":"starcraftimage-a-dataset-for-prototyping-1","title":"StarCraftImage: A Dataset For Prototyping Spatial Reasoning Methods For Multi-Agent Environments","date":"2024-01-09","arxiv_id":"2401.04290","repositories_listed":0,"syntology":null},{"url":null,"slug":"dcir-dynamic-consistency-intrinsic-reward-for","title":"DCIR: Dynamic Consistency Intrinsic Reward for Multi-Agent Reinforcement Learning","date":"2023-12-10","arxiv_id":"2312.05783","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-exploiter-a-data-efficient-approach","title":"Minimax Exploiter: A Data Efficient Approach for Competitive Self-Play","date":"2023-11-28","arxiv_id":"2311.17190","repositories_listed":0,"syntology":null},{"url":null,"slug":"qfree-a-universal-value-function","title":"QFree: A Universal Value Function Factorization for Multi-Agent Reinforcement Learning","date":"2023-11-01","arxiv_id":"2311.00356","repositories_listed":0,"syntology":null},{"url":null,"slug":"mir2-towards-provably-robust-multi-agent","title":"Robust Multi-Agent Reinforcement Learning by Mutual Information Regularization","date":"2023-10-15","arxiv_id":"2310.09833","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-engineered-value-decomposition","title":"Privacy-Engineered Value Decomposition Networks for Cooperative Multi-Agent Reinforcement Learning","date":"2023-09-13","arxiv_id":"2311.06255","repositories_listed":0,"syntology":null},{"url":null,"slug":"fidelity-induced-interpretable-policy","title":"Fidelity-Induced Interpretable Policy Extraction for Reinforcement Learning","date":"2023-09-12","arxiv_id":"2309.06097","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-world-model-disentanglement-in","title":"Leveraging World Model Disentanglement in Value-Based Multi-Agent Reinforcement Learning","date":"2023-09-08","arxiv_id":"2309.04615","repositories_listed":0,"syntology":null},{"url":null,"slug":"never-explore-repeatedly-in-multi-agent","title":"Never Explore Repeatedly in Multi-Agent Reinforcement Learning","date":"2023-08-19","arxiv_id":"2308.09909","repositories_listed":0,"syntology":null},{"url":null,"slug":"anticipatory-thinking-challenges-in-open","title":"Anticipatory Thinking Challenges in Open Worlds: Risk Management","date":"2023-06-22","arxiv_id":"2306.13157","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferable-curricula-through-difficulty","title":"Transferable Curricula through Difficulty Conditioned Generators","date":"2023-06-22","arxiv_id":"2306.13028","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-multi-agent-reinforcement-learning","title":"Offline Multi-Agent Reinforcement Learning with Coupled Value Factorization","date":"2023-06-15","arxiv_id":"2306.08900","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-value-decomposition-via-unit-wise","title":"Boosting Value Decomposition via Unit-Wise Attentive State Representation for Cooperative Multi-Agent Reinforcement Learning","date":"2023-05-12","arxiv_id":"2305.07182","repositories_listed":0,"syntology":null},{"url":null,"slug":"svde-scalable-value-decomposition-exploration","title":"SVDE: Scalable Value-Decomposition Exploration for Cooperative Multi-Agent Reinforcement Learning","date":"2023-03-16","arxiv_id":"2303.09058","repositories_listed":0,"syntology":null},{"url":null,"slug":"aiir-mix-multi-agent-reinforcement-learning","title":"AIIR-MIX: Multi-Agent Reinforcement Learning Meets Attention Individual Intrinsic Reward Mixing Network","date":"2023-02-19","arxiv_id":"2302.09531","repositories_listed":0,"syntology":null},{"url":null,"slug":"remix-regret-minimization-for-monotonic-value","title":"ReMIX: Regret Minimization for Monotonic Value Function Factorization in Multiagent Reinforcement Learning","date":"2023-02-11","arxiv_id":"2302.05593","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivariant-muzero","title":"Equivariant MuZero","date":"2023-02-09","arxiv_id":"2302.04798","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-strategies-for-cooperative-multi","title":"Hierarchical Strategies for Cooperative Multi-Agent Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.07397","repositories_listed":0,"syntology":null},{"url":null,"slug":"system-design-for-an-integrated-lifelong","title":"System Design for an Integrated Lifelong Reinforcement Learning Agent for Real-Time Strategy Games","date":"2022-12-08","arxiv_id":"2212.04603","repositories_listed":0,"syntology":null}],"record_sha256":"fffbb3c78d5f6e5baaff85f46623fd93e0f61dc62951cba6bd264fc2d489a5ad","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}