{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-agent-reinforcement-learning/papers/17","list_of":"/task/multi-agent-reinforcement-learning","task":"Multi-agent Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":17,"pages_in_order":18,"rows_per_page":100,"rows":[1601,1700],"of":1718,"counts":{"archive_papers_tagged":1718,"with_a_code_link":522,"where_syntology_ran_a_sample":135,"not_listed_spam_title":0,"listed":1718,"listed_where_code_ran":135,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":119,"every_run_a_failure_of_syntologys_instrument":16,"listed_with_a_run_with_no_instrument_failure":119,"listed_every_run_a_failure_of_syntologys_instrument":16,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-agent-reinforcement-learning","prev":"/task/multi-agent-reinforcement-learning/papers/16","next":"/task/multi-agent-reinforcement-learning/papers/18","papers":[{"url":null,"slug":"neighborhood-cognition-consistent-multi-agent","title":"Neighborhood Cognition Consistent Multi-Agent Reinforcement Learning","date":"2019-12-03","arxiv_id":"1912.01160","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-and-bandit-algorithms-for","title":"Online and Bandit Algorithms for Nonstationary Stochastic Saddle-Point Optimization","date":"2019-12-03","arxiv_id":"1912.01698","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-for-reinforcement-learning-from","title":"Optimization for Reinforcement Learning: From Single Agent to Cooperative Agents","date":"2019-12-01","arxiv_id":"1912.00498","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-with-2","title":"Multi-Agent Deep Reinforcement Learning with Adaptive Policies","date":"2019-11-28","arxiv_id":"1912.00949","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-adaptive","title":"Adversarial Deep Reinforcement Learning based Adaptive Moving Target Defense","date":"2019-11-27","arxiv_id":"1911.11972","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-game-abstraction-via-graph","title":"Multi-Agent Game Abstraction via Graph Attention Neural Network","date":"2019-11-25","arxiv_id":"1911.10715","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-a","title":"Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms","date":"2019-11-24","arxiv_id":"1911.10635","repositories_listed":0,"syntology":null},{"url":null,"slug":"iteratively-refined-interactive-3d-medical","title":"Iteratively-Refined Interactive 3D Medical Image Segmentation with Multi-Agent Reinforcement Learning","date":"2019-11-23","arxiv_id":"1911.10334","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-multi-agent-communication","title":"Learning Efficient Multi-agent Communication: An Information Bottleneck Approach","date":"2019-11-16","arxiv_id":"1911.06992","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-communicate-in-multi-agent","title":"Learning to Communicate in Multi-Agent Reinforcement Learning : A Review","date":"2019-11-13","arxiv_id":"1911.05438","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analysis-of-decentralized","title":"Finite-Sample Analysis of Decentralized Temporal-Difference Learning with Linear Function Approximation","date":"2019-11-03","arxiv_id":"1911.00934","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013196","title":"Deep Decentralized Reinforcement Learning for Cooperative Control","date":"2019-10-29","arxiv_id":"1910.13196","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamps-safe-multi-agent-reinforcement-learning","title":"MAMPS: Safe Multi-Agent Reinforcement Learning via Model Predictive Shielding","date":"2019-10-25","arxiv_id":"1910.12639","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-framework-for-multi-agent-reinforcement","title":"A New Framework for Multi-Agent Reinforcement Learning -- Centralized Training and Exploration with Decentralized Execution via Policy Distillation","date":"2019-10-21","arxiv_id":"1910.09152","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-order","title":"Multi-Agent Reinforcement Learning for Order-dispatching via Order-Vehicle Distribution Matching","date":"2019-10-07","arxiv_id":"1910.02591","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-based-fault-tolerant-approach-for","title":"Attention-based Fault-tolerant Approach for Multi-agent Reinforcement Learning Systems","date":"2019-10-05","arxiv_id":"1910.02240","repositories_listed":0,"syntology":null},{"url":null,"slug":"interaction-aware-multi-agent-reinforcement","title":"Interaction-Aware Multi-Agent Reinforcement Learning for Mobile Agents with Individual Goals","date":"2019-09-27","arxiv_id":"1909.12925","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-actor-critic-with-hierarchical","title":"Multi-Agent Actor-Critic with Hierarchical Graph Attention Network","date":"2019-09-27","arxiv_id":"1909.12557","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-fake-news-in-social-networks-with","title":"Modeling Fake News in Social Networks with Deep Multi-Agent Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-hierarchical-reinforcement-1","title":"Multi-Agent Hierarchical Reinforcement Learning for Humanoid Navigation","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-view-of-multi-agent","title":"Probabilistic View of Multi-agent Reinforcement Learning: A Unified Approach","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-independent-and-centralized-multi","title":"Integrating independent and centralized multi-agent reinforcement learning for traffic signal network optimization","date":"2019-09-23","arxiv_id":"1909.10651","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-robot-deep-reinforcement-learning-with","title":"Learning Multi-Robot Decentralized Macro-Action-Based Policies via a Centralized Q-Net","date":"2019-09-19","arxiv_id":"1909.08776","repositories_listed":0,"syntology":null},{"url":null,"slug":"stock-market-microstructure-inference-via","title":"Stock market microstructure inference via multi-agent reinforcement learning","date":"2019-09-17","arxiv_id":"1909.07748","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-sensorimotor-coordination-as-multi","title":"Modeling Sensorimotor Coordination as Multi-Agent Reinforcement Learning with Differentiable Communication","date":"2019-09-12","arxiv_id":"1909.05815","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-memory-mechanism-in-multi-agent","title":"On Memory Mechanism in Multi-Agent Reinforcement Learning","date":"2019-09-11","arxiv_id":"1909.05232","repositories_listed":0,"syntology":null},{"url":null,"slug":"signal-instructed-coordination-in-team","title":"Signal Instructed Coordination in Cooperative Multi-agent Reinforcement Learning","date":"2019-09-10","arxiv_id":"1909.04224","repositories_listed":0,"syntology":null},{"url":null,"slug":"stmarl-a-spatio-temporal-multi-agent","title":"STMARL: A Spatio-Temporal Multi-Agent Reinforcement Learning Approach for Cooperative Traffic Light Control","date":"2019-08-28","arxiv_id":"1908.10577","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-update-and-unified-representation","title":"Iterative Update and Unified Representation for Multi-Agent Reinforcement Learning","date":"2019-08-16","arxiv_id":"1908.06758","repositories_listed":0,"syntology":null},{"url":null,"slug":"competitive-multi-agent-deep-reinforcement","title":"Competitive Multi-Agent Deep Reinforcement Learning with Counterfactual Thinking","date":"2019-08-13","arxiv_id":"1908.04573","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-cooperative-multi-agent-deep","title":"A Review of Cooperative Multi-Agent Deep Reinforcement Learning","date":"2019-08-11","arxiv_id":"1908.03963","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-traffic-signal-control-using-a","title":"Large-Scale Traffic Signal Control Using a Novel Multi-Agent Reinforcement Learning","date":"2019-08-10","arxiv_id":"1908.03761","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-multi-agent-temporal-difference-learning","title":"Fast Multi-Agent Temporal-Difference Learning via Homotopy Stochastic Primal-Dual Optimization","date":"2019-08-07","arxiv_id":"1908.02805","repositories_listed":0,"syntology":null},{"url":null,"slug":"promoting-coordination-through-policy","title":"Promoting Coordination through Policy Regularization in Multi-Agent Deep Reinforcement Learning","date":"2019-08-06","arxiv_id":"1908.02269","repositories_listed":0,"syntology":null},{"url":"/paper/multi-agent-reinforcement-learning-based","slug":"multi-agent-reinforcement-learning-based","title":"Multi-Agent Reinforcement Learning Based Frame Sampling for Effective Untrimmed Video Recognition","date":"2019-07-31","arxiv_id":"1907.13369","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-performance-of-distributed","title":"Finite-Time Performance of Distributed Temporal Difference Learning with Linear Function Approximation","date":"2019-07-25","arxiv_id":"1907.12530","repositories_listed":0,"syntology":null},{"url":null,"slug":"prioritized-guidance-for-efficient-multi","title":"Prioritized Guidance for Efficient Multi-Agent Reinforcement Learning Exploration","date":"2019-07-18","arxiv_id":"1907.07847","repositories_listed":0,"syntology":null},{"url":null,"slug":"voting-based-multi-agent-reinforcement","title":"Voting-Based Multi-Agent Reinforcement Learning for Intelligent IoT","date":"2019-07-02","arxiv_id":"1907.01385","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealing-with-non-stationarity-in-multi-agent","title":"Dealing with Non-Stationarity in Multi-Agent Deep Reinforcement Learning","date":"2019-06-11","arxiv_id":"1906.04737","repositories_listed":0,"syntology":null},{"url":null,"slug":"escaping-the-state-of-nature-a-hobbesian","title":"Escaping the State of Nature: A Hobbesian Approach to Cooperation in Multi-agent Reinforcement Learning","date":"2019-06-05","arxiv_id":"1906.09874","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-with-unreliable-intrinsic-reward","title":"Exploration with Unreliable Intrinsic Reward in Multi-Agent Reinforcement Learning","date":"2019-06-05","arxiv_id":"1906.02138","repositories_listed":0,"syntology":null},{"url":null,"slug":"options-as-responses-grounding-behavioural","title":"Options as responses: Grounding behavioural hierarchies in multi-agent RL","date":"2019-06-04","arxiv_id":"1906.01470","repositories_listed":0,"syntology":null},{"url":null,"slug":"attentional-policies-for-cross-context-multi","title":"Attentional Policies for Cross-Context Multi-Agent Reinforcement Learning","date":"2019-05-31","arxiv_id":"1905.13428","repositories_listed":0,"syntology":null},{"url":null,"slug":"agentgraph-towards-universal-dialogue","title":"AgentGraph: Towards Universal Dialogue Management with Structured Deep Reinforcement Learning","date":"2019-05-27","arxiv_id":"1905.11259","repositories_listed":0,"syntology":null},{"url":null,"slug":"pac-guarantees-for-concurrent-reinforcement","title":"PAC Guarantees for Cooperative Multi-Agent Reinforcement Learning with Restricted Communication","date":"2019-05-23","arxiv_id":"1905.09951","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-multi-agent-reinforcement-learning-based","title":"Deep Multi-Agent Reinforcement Learning Based Cooperative Edge Caching in Wireless Networks","date":"2019-05-13","arxiv_id":"1905.05256","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-escape-based-flocking-behavior-using","title":"Emergent Escape-based Flocking Behavior using Multi-Agent Reinforcement Learning","date":"2019-05-10","arxiv_id":"1905.04077","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-air-traffic-controller-a-deep","title":"Autonomous Air Traffic Controller: A Deep Multi-Agent Reinforcement Learning Approach","date":"2019-05-02","arxiv_id":"1905.01303","repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-cooperation-via-learning-to-reshape","title":"Inducing Cooperation via Learning to reshape rewards in semi-cooperative multi-agent reinforcement learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsic-social-motivation-via-causal","title":"Intrinsic Social Motivation via Causal Influence in Multi-Agent RL","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"m3rl-mind-aware-multi-agent-management","title":"M^3RL: Mind-aware Multi-agent Management Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-policy-learning-in-multi","title":"Sample-efficient policy learning in multi-agent Reinforcement Learning via meta-learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ssoc-learning-spontaneous-and-self-organizing","title":"SSoC: Learning Spontaneous and Self-Organizing Communication for Multi-Agent Collaboration","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"argus-smartphone-enabled-human-cooperation","title":"Argus: Smartphone-enabled Human Cooperation via Multi-Agent Reinforcement Learning for Disaster Situational Awareness","date":"2019-04-29","arxiv_id":"1906.03037","repositories_listed":0,"syntology":null},{"url":null,"slug":"190501357","title":"Teaching on a Budget in Multi-Agent Deep Reinforcement Learning","date":"2019-04-19","arxiv_id":"1905.01357","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-3d-navigation-protocols-on-touch","title":"Learning 3D Navigation Protocols on Touch Interfaces with Cooperative Multi-Agent Reinforcement Learning","date":"2019-04-16","arxiv_id":"1904.07802","repositories_listed":0,"syntology":null},{"url":null,"slug":"interaction-aware-decision-making-with","title":"Interaction-aware Decision Making with Adaptive Strategies under Merging Scenarios","date":"2019-04-12","arxiv_id":"1904.06025","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-power-control-for-large-energy","title":"Distributed Power Control for Large Energy Harvesting Networks: A Multi-Agent Deep Reinforcement Learning Approach","date":"2019-04-01","arxiv_id":"1904.00601","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-reinforcement-1","title":"Cooperative Multi-Agent Reinforcement Learning Framework for Scalping Trading","date":"2019-03-31","arxiv_id":"1904.00441","repositories_listed":0,"syntology":null},{"url":null,"slug":"failure-scenario-maker-for-rule-based-agent","title":"Failure-Scenario Maker for Rule-Based Agent using Multi-agent Adversarial Reinforcement Learning and its Application to Autonomous Driving","date":"2019-03-26","arxiv_id":"1903.10654","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-off-policy-actor-critic","title":"Distributed off-Policy Actor-Critic Reinforcement Learning with Policy Consensus","date":"2019-03-21","arxiv_id":"1903.09255","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-multi-agent-reinforcement-learning-with-1","title":"Deep Multi-Agent Reinforcement Learning with Discrete-Continuous Hybrid Action Spaces","date":"2019-03-12","arxiv_id":"1903.04959","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-sophisticated-dispatching-strategy","title":"Can Sophisticated Dispatching Strategy Acquired by Reinforcement Learning? - A Case Study in Dynamic Courier Dispatching System","date":"2019-03-07","arxiv_id":"1903.02716","repositories_listed":0,"syntology":null},{"url":null,"slug":"message-dropout-an-efficient-training-method","title":"Message-Dropout: An Efficient Training Method for Multi-Agent Deep Reinforcement Learning","date":"2019-02-18","arxiv_id":"1902.06527","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-whole","title":"Whole-Chain Recommendations","date":"2019-02-11","arxiv_id":"1902.03987","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-impact-of-partner-choice-on","title":"Partner Selection for the Emergence of Cooperation in Multi-Agent Systems Using Reinforcement Learning","date":"2019-02-08","arxiv_id":"1902.03185","repositories_listed":0,"syntology":null},{"url":null,"slug":"cesma-centralized-expert-supervises-multi","title":"Decentralized Multi-Agents by Imitation of a Centralized Controller","date":"2019-02-06","arxiv_id":"1902.02311","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-regulation-enforcement-solution-for-multi","title":"A Regulation Enforcement Solution for Multi-agent Reinforcement Learning","date":"2019-01-29","arxiv_id":"1901.10059","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-multi","title":"Multi-Agent Reinforcement Learning with Multi-Step Generative Models","date":"2019-01-29","arxiv_id":"1901.10251","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-propagation-for-decentralized-networked","title":"Value Propagation for Decentralized Networked Deep Multi-agent Reinforcement Learning","date":"2019-01-27","arxiv_id":"1901.09326","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-recursive-reasoning-for-multi","title":"Probabilistic Recursive Reasoning for Multi-Agent Reinforcement Learning","date":"2019-01-26","arxiv_id":"1901.09207","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-policy-iteration-for-scalable","title":"Distributed Policy Iteration for Scalable Approximation of Cooperative Multi-Agent Policies","date":"2019-01-25","arxiv_id":"1901.08761","repositories_listed":0,"syntology":null},{"url":null,"slug":"theory-of-minds-understanding-behavior-in","title":"Theory of Minds: Understanding Behavior in Groups Through Inverse Planning","date":"2019-01-18","arxiv_id":"1901.06085","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-embedded","title":"Multi-agent Reinforcement Learning Embedded Game for the Optimization of Building Energy Control and Power System Planning","date":"2019-01-17","arxiv_id":"1901.07333","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-market-making-using-multi-agent","title":"Optimizing Market Making using Multi-Agent Reinforcement Learning","date":"2018-12-26","arxiv_id":"1812.10252","repositories_listed":0,"syntology":null},{"url":null,"slug":"malthusian-reinforcement-learning","title":"Malthusian Reinforcement Learning","date":"2018-12-17","arxiv_id":"1812.07019","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-likelihood-quantile-networks","title":"Likelihood Quantile Networks for Coordinating Multi-Agent Reinforcement Learning","date":"2018-12-15","arxiv_id":"1812.06319","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-distributed-4","title":"Communication-Efficient Policy Gradient Methods for Distributed Reinforcement Learning","date":"2018-12-07","arxiv_id":"1812.03239","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analyses-for-fully","title":"Finite-Sample Analysis For Decentralized Batch Multi-Agent Reinforcement Learning With Networked Agents","date":"2018-12-06","arxiv_id":"1812.02783","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-with","title":"Multi-agent Deep Reinforcement Learning with Extremely Noisy Observations","date":"2018-12-03","arxiv_id":"1812.00922","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergence-of-linguistic-conventions-in-multi","title":"Emergence of linguistic conventions in multi-agent reinforcement learning","date":"2018-11-17","arxiv_id":"1811.07208","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinating-disaster-emergency-response-with","title":"Coordinating Disaster Emergency Response with Heuristic Reinforcement Learning","date":"2018-11-12","arxiv_id":"1811.05010","repositories_listed":0,"syntology":null},{"url":null,"slug":"tarmac-targeted-multi-agent-communication","title":"TarMAC: Targeted Multi-Agent Communication","date":"2018-10-26","arxiv_id":"1810.11187","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-based-1","title":"Multi-Agent Reinforcement Learning Based Resource Allocation for UAV Networks","date":"2018-10-24","arxiv_id":"1810.10408","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-actor-critic-with-generative","title":"Multi-Agent Actor-Critic with Generative Cooperative Policy Network","date":"2018-10-22","arxiv_id":"1810.09206","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-better-baseline-for-second-order-gradient","title":"A Better Baseline for Second Order Gradient Estimation in Stochastic Computation Graphs","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-through-probing-a-decentralized","title":"Learning through Probing: a decentralized reinforcement learning architecture for social dilemmas","date":"2018-09-26","arxiv_id":"1809.10007","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligentcrowd-mobile-crowdsensing-via","title":"IntelligentCrowd: Mobile Crowdsensing via Multi-Agent Reinforcement Learning","date":"2018-09-20","arxiv_id":"1809.07830","repositories_listed":0,"syntology":null},{"url":null,"slug":"prosocial-or-selfish-agents-with-different","title":"Prosocial or Selfish? Agents with different behaviors for Contract Negotiation using Reinforcement Learning","date":"2018-09-19","arxiv_id":"1809.07066","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-collaborate-multi-scenario","title":"Learning to Collaborate: Multi-Scenario Ranking via Multi-Agent Reinforcement Learning","date":"2018-09-17","arxiv_id":"1809.06260","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordination-driven-learning-in-multi-agent","title":"Coordination-driven learning in multi-agent problem spaces","date":"2018-09-13","arxiv_id":"1809.04918","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-agent-reinforcement-learning-method","title":"A Multi-Agent Reinforcement Learning Method for Impression Allocation in Online Display Advertising","date":"2018-09-10","arxiv_id":"1809.03152","repositories_listed":0,"syntology":null},{"url":null,"slug":"marl-fwc-optimal-coordination-of-freeway","title":"MARL-FWC: Optimal Coordination of Freeway Traffic Control Measures","date":"2018-08-27","arxiv_id":"1808.09806","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-act-in-decentralized-partially","title":"Learning to Act in Decentralized Partially Observable MDPs","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-existing-social-conventions-in","title":"Learning Existing Social Conventions via Observationally Augmented Self-Play","date":"2018-06-26","arxiv_id":"1806.10071","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-via-double","title":"Multi-Agent Reinforcement Learning via Double Averaging Primal-Dual Optimization","date":"2018-06-03","arxiv_id":"1806.00877","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-centralized-deep-multi-agent","title":"Scalable Centralized Deep Multi-Agent Reinforcement Learning via Policy Gradients","date":"2018-05-22","arxiv_id":"1805.08776","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-gradient-based-learning","title":"On Gradient-Based Learning in Continuous Games","date":"2018-04-16","arxiv_id":"1804.05464","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-based-independent-learning-in","title":"Entropy based Independent Learning in Anonymous Multi-Agent Settings","date":"2018-03-27","arxiv_id":"1803.09928","repositories_listed":0,"syntology":null},{"url":null,"slug":"valuing-knowledge-information-and-agency-in","title":"Valuing knowledge, information and agency in Multi-agent Reinforcement Learning: a case study in smart buildings","date":"2018-03-09","arxiv_id":"1803.03491","repositories_listed":0,"syntology":null}],"record_sha256":"76171ef1d3d118b4d0c80a18f235f566ab7d3e5246b3a139bec8df17f80b49f2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}