{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-agent-reinforcement-learning/papers/15","list_of":"/task/multi-agent-reinforcement-learning","task":"Multi-agent Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":15,"pages_in_order":18,"rows_per_page":100,"rows":[1401,1500],"of":1718,"counts":{"archive_papers_tagged":1718,"with_a_code_link":522,"where_syntology_ran_a_sample":135,"not_listed_spam_title":0,"listed":1718,"listed_where_code_ran":135,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":119,"every_run_a_failure_of_syntologys_instrument":16,"listed_with_a_run_with_no_instrument_failure":119,"listed_every_run_a_failure_of_syntologys_instrument":16,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-agent-reinforcement-learning","prev":"/task/multi-agent-reinforcement-learning/papers/14","next":"/task/multi-agent-reinforcement-learning/papers/16","papers":[{"url":null,"slug":"robust-restless-bandits-tackling-interval","title":"Restless and Uncertain: Robust Policies for Restless Bandits via Deep Multi-Agent Reinforcement Learning","date":"2021-07-04","arxiv_id":"2107.01689","repositories_listed":0,"syntology":null},{"url":null,"slug":"traffic-signal-control-with-communicative","title":"Traffic Signal Control with Communicative Deep Reinforcement Learning Agents: a Case Study","date":"2021-07-03","arxiv_id":"2107.01347","repositories_listed":0,"syntology":null},{"url":null,"slug":"sa-matd3-self-attention-based-multi-agent","title":"SA-MATD3:Self-attention-based multi-agent continuous control method in cooperative environments","date":"2021-07-01","arxiv_id":"2107.00284","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-dynamic-spectrum-access","title":"Federated Dynamic Spectrum Access","date":"2021-06-28","arxiv_id":"2106.14976","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmd-mix-value-function-factorisation-with","title":"MMD-MIX: Value Function Factorisation with Maximum Mean Discrepancy for Cooperative Multi-Agent Reinforcement Learning","date":"2021-06-22","arxiv_id":"2106.11652","repositories_listed":0,"syntology":null},{"url":null,"slug":"scientific-multi-agent-reinforcement-learning","title":"Scientific multi-agent reinforcement learning for wall-models of turbulent flows","date":"2021-06-21","arxiv_id":"2106.11144","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-reinforcement-3","title":"Cooperative Multi-Agent Reinforcement Learning Based Distributed Dynamic Spectrum Access in Cognitive Radio Networks","date":"2021-06-17","arxiv_id":"2106.09274","repositories_listed":0,"syntology":null},{"url":null,"slug":"many-agent-reinforcement-learning-under","title":"Many Agent Reinforcement Learning Under Partial Observability","date":"2021-06-17","arxiv_id":"2106.09825","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimizing-communication-while-maximizing","title":"Minimizing Communication while Maximizing Performance in Multi-Agent Reinforcement Learning","date":"2021-06-15","arxiv_id":"2106.08482","repositories_listed":0,"syntology":null},{"url":null,"slug":"informative-policy-representations-in-multi","title":"Metric Policy Representations for Opponent Modeling","date":"2021-06-10","arxiv_id":"2106.05802","repositories_listed":0,"syntology":null},{"url":null,"slug":"deception-in-social-learning-a-multi-agent","title":"Deception in Social Learning: A Multi-Agent Reinforcement Learning Perspective","date":"2021-06-09","arxiv_id":"2106.05402","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-cooperative-bidding-games-for","title":"Multi-Agent Cooperative Bidding Games for Multi-Objective Optimization in e-Commercial Sponsored Search","date":"2021-06-08","arxiv_id":"2106.04075","repositories_listed":0,"syntology":null},{"url":null,"slug":"unbiased-self-play","title":"Truthful Self-Play","date":"2021-06-06","arxiv_id":"2106.03007","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-q-learning-in-zero-sum-markov","title":"Decentralized Q-Learning in Zero-sum Markov Games","date":"2021-06-04","arxiv_id":"2106.02748","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferable-and-distributed-user-association","title":"Transferable and Distributed User Association Policies for 5G and Beyond Networks","date":"2021-06-04","arxiv_id":"2106.02540","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-transfer-learning","title":"Cooperative Multi-Agent Transfer Learning with Level-Adaptive Credit Assignment","date":"2021-06-01","arxiv_id":"2106.00517","repositories_listed":0,"syntology":null},{"url":null,"slug":"shapley-counterfactual-credits-for-multi","title":"Shapley Counterfactual Credits for Multi-Agent Reinforcement Learning","date":"2021-06-01","arxiv_id":"2106.00285","repositories_listed":0,"syntology":null},{"url":null,"slug":"tesseract-tensorised-actors-for-multi-agent","title":"Tesseract: Tensorised Actors for Multi-Agent Reinforcement Learning","date":"2021-05-31","arxiv_id":"2106.00136","repositories_listed":0,"syntology":null},{"url":null,"slug":"marl-with-general-utilities-via-decentralized","title":"MARL with General Utilities via Decentralized Shadow Reward Actor-Critic","date":"2021-05-29","arxiv_id":"2106.00543","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowsr-knowledge-sharing-among-homogeneous","title":"KnowSR: Knowledge Sharing among Homogeneous Agents in Multi-agent Reinforcement Learning","date":"2021-05-25","arxiv_id":"2105.11611","repositories_listed":0,"syntology":null},{"url":null,"slug":"searching-collaborative-agents-for-multi-1","title":"Searching Collaborative Agents for Multi-plane Localization in 3D Ultrasound","date":"2021-05-22","arxiv_id":"2105.10626","repositories_listed":0,"syntology":null},{"url":null,"slug":"dependent-multi-task-learning-with-causal","title":"Dependent Multi-Task Learning with Causal Intervention for Image Captioning","date":"2021-05-18","arxiv_id":"2105.08573","repositories_listed":0,"syntology":null},{"url":null,"slug":"permutation-invariant-policy-optimization-for","title":"Permutation Invariant Policy Optimization for Mean-Field Multi-Agent Reinforcement Learning: A Principled Approach","date":"2021-05-18","arxiv_id":"2105.08268","repositories_listed":0,"syntology":null},{"url":null,"slug":"side-i-infer-the-state-i-want-to-learn","title":"SIDE: State Inference for Partially Observable Cooperative Multi-Agent Reinforcement Learning","date":"2021-05-13","arxiv_id":"2105.06228","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-rnns-based-transformers-maddpg","title":"Hierarchical RNNs-Based Transformers MADDPG for Mixed Cooperative-Competitive Environments","date":"2021-05-11","arxiv_id":"2105.04888","repositories_listed":0,"syntology":null},{"url":null,"slug":"aoi-aware-resource-allocation-for-platoon","title":"AoI-Aware Resource Allocation for Platoon-Based C-V2X Networks via Multi-Agent Multi-Task Reinforcement Learning","date":"2021-05-10","arxiv_id":"2105.04196","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-multichannel-access-via-multi-agent","title":"Dynamic Multichannel Access via Multi-agent Reinforcement Learning: Throughput and Fairness Guarantees","date":"2021-05-10","arxiv_id":"2105.04077","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-decentralized-multi-agent","title":"Scalable, Decentralized Multi-Agent Reinforcement Learning Methods Inspired by Stigmergy and Ant Colonies","date":"2021-05-08","arxiv_id":"2105.03546","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-bus-bunching-with-asynchronous-multi","title":"Reducing Bus Bunching with Asynchronous Multi-Agent Reinforcement Learning","date":"2021-05-02","arxiv_id":"2105.00376","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-time-mean-field-control-with","title":"Discrete-Time Mean Field Control with Environment States","date":"2021-04-30","arxiv_id":"2104.14900","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-marl-based-bandwidth-negotiation","title":"Mean Field MARL Based Bandwidth Negotiation Method for Massive Devices Spectrum Sharing","date":"2021-04-30","arxiv_id":"2104.15085","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-on-policy-training-for-sample-efficient","title":"Semi-On-Policy Training for Sample Efficient Multi-Agent Policy Gradients","date":"2021-04-27","arxiv_id":"2104.13446","repositories_listed":0,"syntology":null},{"url":null,"slug":"birds-of-a-feather-flock-together-a-close","title":"Birds of a Feather Flock Together: A Close Look at Cooperation Emergence via Multi-Agent RL","date":"2021-04-23","arxiv_id":"2104.11455","repositories_listed":0,"syntology":null},{"url":null,"slug":"network-wide-traffic-signal-control","title":"Network-wide traffic signal control optimization using a multi-agent deep reinforcement learning","date":"2021-04-20","arxiv_id":"2104.09936","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-centric-representations-for-multi-agent","title":"Agent-Centric Representations for Multi-Agent Reinforcement Learning","date":"2021-04-19","arxiv_id":"2104.09402","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-based-3","title":"Multi-Agent Reinforcement Learning Based Coded Computation for Mobile Ad Hoc Computing","date":"2021-04-15","arxiv_id":"2104.07539","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stage-training-algorithm-for-ai-robot","title":"Two-stage training algorithm for AI robot soccer","date":"2021-04-13","arxiv_id":"2104.05931","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-resilience-for-multi-agent-qd","title":"Towards Resilience for Multi-Agent $QD$-Learning","date":"2021-04-07","arxiv_id":"2104.03153","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-learning-in-wireless-networks","title":"Distributed Learning in Wireless Networks: Recent Progress and Future Challenges","date":"2021-04-05","arxiv_id":"2104.02151","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-monotonic-value-function-factorization","title":"NQMIX: Non-monotonic Value Function Factorization for Deep Multi-Agent Reinforcement Learning","date":"2021-04-05","arxiv_id":"2104.01939","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-efficient-edge-computing-when-lyapunov","title":"Energy Efficient Edge Computing: When Lyapunov Meets Distributed Reinforcement Learning","date":"2021-03-31","arxiv_id":"2103.16985","repositories_listed":0,"syntology":null},{"url":null,"slug":"flatland-competition-2020-mapf-and-marl-for","title":"Flatland Competition 2020: MAPF and MARL for Efficient Train Coordination on a Grid World","date":"2021-03-30","arxiv_id":"2103.16511","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-of-event","title":"Deep reinforcement learning of event-triggered communication and control for multi-agent cooperative transport","date":"2021-03-29","arxiv_id":"2103.15260","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowru-knowledge-reusing-via-knowledge","title":"KnowRU: Knowledge Reusing via Knowledge Distillation in Multi-agent Reinforcement Learning","date":"2021-03-27","arxiv_id":"2103.14891","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-gradient-convergence-bound-of-federated","title":"The Gradient Convergence Bound of Federated Multi-Agent Reinforcement Learning with Efficient Communication","date":"2021-03-24","arxiv_id":"2103.13026","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-robustly-negotiate-bi-directional","title":"Learning to Robustly Negotiate Bi-Directional Lane Usage in High-Conflict Driving Scenarios","date":"2021-03-22","arxiv_id":"2103.12070","repositories_listed":0,"syntology":null},{"url":null,"slug":"softmax-with-regularization-better-value","title":"Regularized Softmax Deep Multi-Agent $Q$-Learning","date":"2021-03-22","arxiv_id":"2103.11883","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-in-consensus-based-multi","title":"Adversarial attacks in consensus-based multi-agent reinforcement learning","date":"2021-03-11","arxiv_id":"2103.06967","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-models-the","title":"A multi-agent reinforcement learning model of reputation and cooperation in human groups","date":"2021-03-08","arxiv_id":"2103.04982","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-cooperative-multi-agent","title":"Provably Efficient Cooperative Multi-Agent Reinforcement Learning with Function Approximation","date":"2021-03-08","arxiv_id":"2103.04972","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-uav-trajectory-planning-using","title":"Efficient UAV Trajectory-Planning using Economic Reinforcement Learning","date":"2021-03-03","arxiv_id":"2103.02676","repositories_listed":0,"syntology":null},{"url":null,"slug":"credit-assignment-with-meta-policy-gradient","title":"Credit Assignment with Meta-Policy Gradient for Multi-Agent Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12957","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-emergent-discrete-message","title":"Learning Emergent Discrete Message Communication for Cooperative Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12550","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealing-with-non-stationarity-in-multi-agent-1","title":"Dealing with Non-Stationarity in MARL via Trust-Region Decomposition","date":"2021-02-21","arxiv_id":"2102.10616","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-deterministic-multi-agent-1","title":"Decentralized Deterministic Multi-Agent Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09745","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategic-bidding-in-freight-transport-using","title":"Strategic bidding in freight transport using deep reinforcement learning","date":"2021-02-18","arxiv_id":"2102.09253","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantifying-environment-and-population","title":"Quantifying the effects of environment and population diversity in multi-agent reinforcement learning","date":"2021-02-16","arxiv_id":"2102.08370","repositories_listed":0,"syntology":null},{"url":null,"slug":"rmix-learning-risk-sensitive-policies-for","title":"RMIX: Learning Risk-Sensitive Policies for Cooperative Reinforcement Learning Agents","date":"2021-02-16","arxiv_id":"2102.08159","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-the-interaction-between-agents-in","title":"Modeling the Interaction between Agents in Cooperative Multi-Agent Reinforcement Learning","date":"2021-02-10","arxiv_id":"2102.06042","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-diversification-emergence-via","title":"Structured Diversification Emergence via Reinforced Organization Control and Hierarchical Consensus Learning","date":"2021-02-09","arxiv_id":"2102.04775","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrasting-centralized-and-decentralized","title":"Contrasting Centralized and Decentralized Critics in Multi-Agent Reinforcement Learning","date":"2021-02-08","arxiv_id":"2102.04402","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-modularized-and-scalable-multi-agent","title":"MSPM: A Modularized and Scalable Multi-Agent Reinforcement Learning-based System for Financial Portfolio Management","date":"2021-02-06","arxiv_id":"2102.03502","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-recursive-belief-states-in-multi-agent","title":"Neural Recursive Belief States in Multi-Agent Reinforcement Learning","date":"2021-02-03","arxiv_id":"2102.02274","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-abstraction-based-method-to-verify-multi","title":"An Abstraction-based Method to Check Multi-Agent Deep Reinforcement-Learning Behaviors","date":"2021-02-02","arxiv_id":"2102.01434","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-multi-agent-reinforcement-learning","title":"Towards Multi-agent Reinforcement Learning for Wireless Network Protocol Synthesis","date":"2021-02-02","arxiv_id":"2102.01611","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-information-driven-multi-agent","title":"Hybrid Information-driven Multi-agent Reinforcement Learning","date":"2021-02-01","arxiv_id":"2102.01004","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-multi-agent-reinforcement-learning-via","title":"Safe Multi-Agent Reinforcement Learning via Shielding","date":"2021-01-27","arxiv_id":"2101.11196","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-sequence-generation-with-multi-agent","title":"Fast Sequence Generation with Multi-Agent Reinforcement Learning","date":"2021-01-24","arxiv_id":"2101.09698","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-and-competitive-biases-for-multi","title":"Cooperative and Competitive Biases for Multi-Agent Reinforcement Learning","date":"2021-01-18","arxiv_id":"2101.06890","repositories_listed":0,"syntology":null},{"url":null,"slug":"coding-for-distributed-multi-agent","title":"Coding for Distributed Multi-Agent Reinforcement Learning","date":"2021-01-07","arxiv_id":"2101.02308","repositories_listed":0,"syntology":null},{"url":null,"slug":"derivative-free-policy-optimization-for-risk","title":"Derivative-Free Policy Optimization for Linear Risk-Sensitive and Robust Control Design: Implicit Regularization and Sample Complexity","date":"2021-01-04","arxiv_id":"2101.01041","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-joint-learning-and-communication-framework","title":"Effective Communications: A Joint Learning and Communication Framework for Multi-Agent Reinforcement Learning over Noisy Channels","date":"2021-01-02","arxiv_id":"2101.10369","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-learning-rates-for-multi-agent","title":"Adaptive Learning Rates for Multi-Agent Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-in-multi-agent-reinforcement","title":"Communication in Multi-Agent Reinforcement Learning: Intention Sharing","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dop-off-policy-multi-agent-decomposed-policy","title":"DOP: Off-Policy Multi-Agent Decomposed Policy Gradients","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fsv-learning-to-factorize-soft-value-function","title":"FSV: Learning to Factorize Soft Value Function for Cooperative Multi-Agent Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-communicate-through-imagination","title":"Learning to communicate through imagination with model-based deep multi-agent reinforcement learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-based-6","title":"Multi-Agent Reinforcement Learning Based Resource Management in MEC- and UAV-Assisted Vehicular Networks","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rmix-risk-sensitive-multi-agent-reinforcement","title":"RMIX: Risk-Sensitive Multi-Agent Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-multi-agent-reinforcement-learning","title":"Robust Multi-Agent Reinforcement Learning Driven by Correlated Equilibrium","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"updet-universal-multi-agent-rl-via-policy","title":"UPDeT: Universal Multi-agent RL via Policy Decoupling with Transformers","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-user-scheduling-for-6g-a-fairness","title":"Fairness-Oriented User Scheduling for Bursty Downlink Transmission Using Multi-Agent Reinforcement Learning","date":"2020-12-30","arxiv_id":"2012.15081","repositories_listed":0,"syntology":null},{"url":null,"slug":"difference-rewards-policy-gradients","title":"Difference Rewards Policy Gradients","date":"2020-12-21","arxiv_id":"2012.11258","repositories_listed":0,"syntology":null},{"url":null,"slug":"magnet-multi-agent-graph-network-for-deep","title":"MAGNet: Multi-agent Graph Network for Deep Multi-agent Reinforcement Learning","date":"2020-12-17","arxiv_id":"2012.09762","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-q-learning-via-soft-mellowmax","title":"Stabilizing Q Learning Via Soft Mellowmax Operator","date":"2020-12-17","arxiv_id":"2012.09456","repositories_listed":0,"syntology":null},{"url":null,"slug":"sat-marl-specification-aware-training-in","title":"SAT-MARL: Specification Aware Training in Multi-Agent Reinforcement Learning","date":"2020-12-14","arxiv_id":"2012.07949","repositories_listed":0,"syntology":null},{"url":null,"slug":"specializing-inter-agent-communication-in","title":"Specializing Inter-Agent Communication in Heterogeneous Multi-Agent Reinforcement Learning using Agent Class Information","date":"2020-12-14","arxiv_id":"2012.07617","repositories_listed":0,"syntology":null},{"url":null,"slug":"flatland-rl-multi-agent-reinforcement","title":"Flatland-RL : Multi-Agent Reinforcement Learning on Trains","date":"2020-12-10","arxiv_id":"2012.05893","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-policy-optimization-with-1","title":"Multi-agent Policy Optimization with Approximatively Synchronous Advantage Estimation","date":"2020-12-07","arxiv_id":"2012.03488","repositories_listed":0,"syntology":null},{"url":null,"slug":"fever-basketball-a-complex-flexible-and","title":"Fever Basketball: A Complex, Flexible, and Asynchronized Sports Game Environment for Multi-agent Reinforcement Learning","date":"2020-12-06","arxiv_id":"2012.03204","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-optimization-of-the-textile","title":"Multi-Objective Optimization of the Textile Manufacturing Process Using Deep-Q-Network Based Multi-Agent Reinforcement Learning","date":"2020-12-02","arxiv_id":"2012.01101","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-multi-agent-reinforcement-learning-1","title":"Robust Multi-Agent Reinforcement Learning with Model Uncertainty","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"low-bandwidth-communication-emerges-naturally","title":"Low-Bandwidth Communication Emerges Naturally in Multi-Agent Learning Systems","date":"2020-11-30","arxiv_id":"2011.14890","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-sample-complexity-for-turn-based","title":"Minimax Sample Complexity for Turn-based Stochastic Game","date":"2020-11-29","arxiv_id":"2011.14267","repositories_listed":0,"syntology":null},{"url":null,"slug":"powernet-multi-agent-deep-reinforcement","title":"PowerNet: Multi-agent Deep Reinforcement Learning for Scalable Powergrid Control","date":"2020-11-24","arxiv_id":"2011.12354","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-5","title":"Multi-Agent Reinforcement Learning for Markov Routing Games: A New Modeling Paradigm For Dynamic Traffic Assignment","date":"2020-11-22","arxiv_id":"2011.10915","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-latency-federated-learning-and-blockchain","title":"Low-latency Federated Learning and Blockchain for Edge Association in Digital Twin empowered 6G Networks","date":"2020-11-17","arxiv_id":"2011.09902","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning","title":"Multi-agent Reinforcement Learning Accelerated MCMC on Multiscale Inversion Problem","date":"2020-11-17","arxiv_id":"2011.08954","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-joint","title":"Multi-Agent Reinforcement Learning for Channel Assignment and Power Allocation in Platoon-Based C-V2X Systems","date":"2020-11-09","arxiv_id":"2011.04555","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-and-multi-agent-deep-reinforcement","title":"Single and Multi-Agent Deep Reinforcement Learning for AI-Enabled Wireless Networks: A Tutorial","date":"2020-11-06","arxiv_id":"2011.03615","repositories_listed":0,"syntology":null}],"record_sha256":"7cdc2186eae915689b2e0828614c432b6fd0bdb45e81de86029b379f09ce2f5f","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}