{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/90","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":90,"pages_in_order":152,"rows_per_page":100,"rows":[8901,9000],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/89","next":"/task/reinforcement-learning-1/papers/91","papers":[{"url":null,"slug":"domain-knowledge-based-automated-analog","title":"Domain Knowledge-Based Automated Analog Circuit Design with Deep Reinforcement Learning","date":"2022-02-26","arxiv_id":"2202.13185","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-for-content","title":"Whittle Index based Q-Learning for Wireless Edge Caching with Linear Function Approximation","date":"2022-02-26","arxiv_id":"2202.13187","repositories_listed":0,"syntology":null},{"url":null,"slug":"consolidated-adaptive-t-soft-update-for-deep","title":"Consolidated Adaptive T-soft Update for Deep Reinforcement Learning","date":"2022-02-25","arxiv_id":"2202.12504","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-hierarchy-inverse-reinforcement","title":"Context-Hierarchy Inverse Reinforcement Learning","date":"2022-02-25","arxiv_id":"2202.12597","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-making-in-non-stationary","title":"Decision Making in Non-Stationary Environments with Policy-Augmented Monte Carlo Tree Search","date":"2022-02-25","arxiv_id":"2202.13003","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamic-mechanisms-in-unknown","title":"Learning Dynamic Mechanisms in Unknown Environments: A Reinforcement Learning Approach","date":"2022-02-25","arxiv_id":"2202.12797","repositories_listed":0,"syntology":null},{"url":null,"slug":"reachability-analysis-in-stochastic-directed","title":"Reachability analysis in stochastic directed graphs by reinforcement learning","date":"2022-02-25","arxiv_id":"2202.12546","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-multi-objective-reinforcement","title":"Evolutionary Multi-Objective Reinforcement Learning Based Trajectory Control and Task Offloading in UAV-Assisted Mobile Edge Computing","date":"2022-02-24","arxiv_id":"2202.12028","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-to-learn-reinforcement-learning","title":"Evolving-to-Learn Reinforcement Learning Tasks with Spiking Neural Networks","date":"2022-02-24","arxiv_id":"2202.12322","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparative-analysis-of-machine-learning-3","title":"Comparative analysis of machine learning methods for active flow control","date":"2022-02-23","arxiv_id":"2202.11664","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistent-dropout-for-policy-gradient","title":"Consistent Dropout for Policy Gradient Reinforcement Learning","date":"2022-02-23","arxiv_id":"2202.11818","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-opportunities-and","title":"Reinforcement Learning in Practice: Opportunities and Challenges","date":"2022-02-23","arxiv_id":"2202.11296","repositories_listed":0,"syntology":null},{"url":null,"slug":"drawing-inductor-layout-with-a-reinforcement","title":"Drawing Inductor Layout with a Reinforcement Learning Agent: Method and Application for VCO Inductors","date":"2022-02-23","arxiv_id":"2202.11798","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-relative-return-policies-with-upside","title":"Learning Relative Return Policies With Upside-Down Reinforcement Learning","date":"2022-02-23","arxiv_id":"2202.12742","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-demonstrations-by","title":"Reinforcement Learning from Demonstrations by Novel Interactive Expert and Application to Automatic Berthing Control Systems for Unmanned Surface Vessel","date":"2022-02-23","arxiv_id":"2202.11325","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-characteristic-functions-with","title":"Training Characteristic Functions with Reinforcement Learning: XAI-methods play Connect Four","date":"2022-02-23","arxiv_id":"2202.11797","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-decentralized-communication-framework-based","title":"A Decentralized Communication Framework based on Dual-Level Recurrence for Multi-Agent Reinforcement Learning","date":"2022-02-22","arxiv_id":"2202.10612","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-gradient-ascent-methods-for","title":"A policy gradient approach for optimization of smooth risk measures","date":"2022-02-22","arxiv_id":"2202.11046","repositories_listed":0,"syntology":null},{"url":null,"slug":"behaviour-diverse-automatic-penetration","title":"Behaviour-Diverse Automatic Penetration Testing: A Curiosity-Driven Multi-Objective Deep Reinforcement Learning Approach","date":"2022-02-22","arxiv_id":"2202.10630","repositories_listed":0,"syntology":null},{"url":null,"slug":"behaviour-neutral-smart-charging-of-plugin","title":"Behaviour-neutral Smart Charging of Plugin Electric Vehicles: Reinforcement learning approach","date":"2022-02-22","arxiv_id":"2202.10823","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-auxiliary-task-learning-1","title":"Continual Auxiliary Task Learning","date":"2022-02-22","arxiv_id":"2202.11133","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-fidelity-reinforcement-learning","title":"Multi-fidelity reinforcement learning framework for shape optimization","date":"2022-02-22","arxiv_id":"2202.11170","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-free-policy-space-compression-for-1","title":"Reward-Free Policy Space Compression for Reinforcement Learning","date":"2022-02-22","arxiv_id":"2202.11079","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-information-design-markov","title":"Sequential Information Design: Markov Persuasion Process and Its Efficient Reinforcement Learning","date":"2022-02-22","arxiv_id":"2202.10678","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-primal-dual-methods-for","title":"Accelerating Primal-dual Methods for Regularized Markov Decision Processes","date":"2022-02-21","arxiv_id":"2202.10506","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-warehouse-robot-using-deep-q","title":"Autonomous Warehouse Robot using Deep Q-Learning","date":"2022-02-21","arxiv_id":"2202.10019","repositories_listed":0,"syntology":null},{"url":null,"slug":"ccpt-automatic-gameplay-testing-and","title":"CCPT: Automatic Gameplay Testing and Validation with Curiosity-Conditioned Proximal Trajectories","date":"2022-02-21","arxiv_id":"2202.10057","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-learning-for-orchestrating-deep","title":"Hybrid Learning for Orchestrating Deep Learning Inference in Multi-user Edge-cloud Networks","date":"2022-02-21","arxiv_id":"2202.11098","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-causal-overhypotheses-through","title":"Learning Causal Overhypotheses through Exploration in Children and Computational Models","date":"2022-02-21","arxiv_id":"2202.10430","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-framework-for-server","title":"Reinforcement Learning Framework for Server Placement and Workload Allocation in Multi-Access Edge Computing","date":"2022-02-21","arxiv_id":"2203.07998","repositories_listed":0,"syntology":null},{"url":null,"slug":"rule-mining-over-knowledge-graphs-via","title":"Rule Mining over Knowledge Graphs via Reinforcement Learning","date":"2022-02-21","arxiv_id":"2202.10381","repositories_listed":0,"syntology":null},{"url":null,"slug":"pool-pheromone-inspired-communication","title":"PooL: Pheromone-inspired Communication Framework forLarge Scale Multi-Agent Reinforcement Learning","date":"2022-02-20","arxiv_id":"2202.09722","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-credit-assignment","title":"Selective Credit Assignment","date":"2022-02-20","arxiv_id":"2202.09699","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-regularized-implicit-policy-for-offline","title":"A Behavior Regularized Implicit Policy for Offline Reinforcement Learning","date":"2022-02-19","arxiv_id":"2202.09673","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-safe-reinforcement-learning-for","title":"Multi-task Safe Reinforcement Learning for Navigating Intersections in Dense Traffic","date":"2022-02-19","arxiv_id":"2202.09644","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-as-a","title":"Robust Reinforcement Learning as a Stackelberg Game via Adaptively-Regularized Adversarial Training","date":"2022-02-19","arxiv_id":"2202.09514","repositories_listed":0,"syntology":null},{"url":"/paper/transdreamer-reinforcement-learning-with-1","slug":"transdreamer-reinforcement-learning-with-1","title":"TransDreamer: Reinforcement Learning with Transformer World Models","date":"2022-02-19","arxiv_id":"2202.09481","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/transdreamer-reinforcement-learning-with-1#ran","syntology_url":"https://syntology.ai/paper/2202.09481","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2202.09481"}},"official":null}},{"url":null,"slug":"transformation-coding-simple-objectives-for","title":"Transformation Coding: Simple Objectives for Equivariant Representations","date":"2022-02-19","arxiv_id":"2202.10930","repositories_listed":0,"syntology":null},{"url":null,"slug":"who-are-the-best-adopters-user-selection","title":"Who Are the Best Adopters? User Selection Model for Free Trial Item Promotion","date":"2022-02-19","arxiv_id":"2202.09508","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-interpretable-reinforcement-learning","title":"Can Interpretable Reinforcement Learning Manage Prosperity Your Way?","date":"2022-02-18","arxiv_id":"2202.09064","repositories_listed":0,"syntology":null},{"url":null,"slug":"tinyman-lightweight-energy-manager-using","title":"tinyMAN: Lightweight Energy Manager using Reinforcement Learning for Energy Harvesting Wearable IoT Devices","date":"2022-02-18","arxiv_id":"2202.09297","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-explainable-reinforcement","title":"A Survey of Explainable Reinforcement Learning","date":"2022-02-17","arxiv_id":"2202.08434","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-deep-reinforcement-learning-based","title":"A Survey on Deep Reinforcement Learning-based Approaches for Adaptation and Generalization","date":"2022-02-17","arxiv_id":"2202.08444","repositories_listed":0,"syntology":null},{"url":null,"slug":"baddr-bayes-adaptive-deep-dropout-rl-for","title":"BADDr: Bayes-Adaptive Deep Dropout RL for POMDPs","date":"2022-02-17","arxiv_id":"2202.08884","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-learning-of-safe-driving-policy-via-1","title":"Efficient Learning of Safe Driving Policy via Human-AI Copilot Optimization","date":"2022-02-17","arxiv_id":"2202.10341","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-augmented-reinforcement-learning-1","title":"Retrieval-Augmented Reinforcement Learning","date":"2022-02-17","arxiv_id":"2202.08417","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-via-genetic","title":"Robust Reinforcement Learning via Genetic Curriculum","date":"2022-02-17","arxiv_id":"2202.08393","repositories_listed":0,"syntology":null},{"url":null,"slug":"should-i-send-this-notification-optimizing","title":"Should I send this notification? Optimizing push notifications decision making by modeling the future","date":"2022-02-17","arxiv_id":"2202.08812","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-base-station-trajectory-optimization","title":"UAV Base Station Trajectory Optimization Based on Reinforcement Learning in Post-disaster Search and Rescue Operations","date":"2022-02-17","arxiv_id":"2202.10338","repositories_listed":0,"syntology":null},{"url":null,"slug":"branching-reinforcement-learning","title":"Branching Reinforcement Learning","date":"2022-02-16","arxiv_id":"2202.07995","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptive-fake-news-detection-via","title":"Domain Adaptive Fake News Detection via Reinforcement Learning","date":"2022-02-16","arxiv_id":"2202.08159","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-learning-and-evaluation-with","title":"Policy Learning and Evaluation with Randomized Quasi-Monte Carlo","date":"2022-02-16","arxiv_id":"2202.07808","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-multi","title":"Deep Reinforcement Learning Based Multi-Access Edge Computing Schedule for Internet of Vehicle","date":"2022-02-15","arxiv_id":"2202.08972","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-reinforcement-learning-with-2","title":"Interpretable Reinforcement Learning with Multilevel Subgoal Discovery","date":"2022-02-15","arxiv_id":"2202.07414","repositories_listed":0,"syntology":null},{"url":null,"slug":"l2c2-locally-lipschitz-continuous-constraint","title":"L2C2: Locally Lipschitz Continuous Constraint towards Stable and Smooth Reinforcement Learning","date":"2022-02-15","arxiv_id":"2202.07152","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-mitigate-ai-collusion-on-economic","title":"Learning to Mitigate AI Collusion on Economic Platforms","date":"2022-02-15","arxiv_id":"2202.07106","repositories_listed":0,"syntology":null},{"url":null,"slug":"user-oriented-robust-reinforcement-learning","title":"User-Oriented Robust Reinforcement Learning","date":"2022-02-15","arxiv_id":"2202.07301","repositories_listed":0,"syntology":null},{"url":null,"slug":"convex-programs-and-lyapunov-functions-for","title":"Convex Programs and Lyapunov Functions for Reinforcement Learning: A Unified Perspective on the Analysis of Value-Based Methods","date":"2022-02-14","arxiv_id":"2202.06922","repositories_listed":0,"syntology":null},{"url":null,"slug":"motivating-physical-activity-via-competitive","title":"Motivating Physical Activity via Competitive Human-Robot Interaction","date":"2022-02-14","arxiv_id":"2202.07068","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-causal-model-based","title":"Provably Efficient Causal Model-Based Reinforcement Learning for Systematic Generalization","date":"2022-02-14","arxiv_id":"2202.06545","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-presence-of-1","title":"Reinforcement Learning in Presence of Discrete Markovian Context Evolution","date":"2022-02-14","arxiv_id":"2202.06557","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-policy-learning-over-multiple","title":"Robust Policy Learning over Multiple Uncertainty Sets","date":"2022-02-14","arxiv_id":"2202.07013","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-bayesian-experimental-designs-via","title":"Sequential Bayesian experimental designs via reinforcement learning","date":"2022-02-14","arxiv_id":"2202.07472","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-inference-after-adaptive-sampling","title":"Statistical Inference After Adaptive Sampling for Longitudinal Data","date":"2022-02-14","arxiv_id":"2202.07098","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-deployment-efficient-reinforcement-1","title":"Towards Deployment-Efficient Reinforcement Learning: Lower Bound and Optimality","date":"2022-02-14","arxiv_id":"2202.06450","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-drone-swarm-navigation-and-multi","title":"Autonomous Drone Swarm Navigation and Multi-target Tracking in 3D Environments with Dynamic Obstacles","date":"2022-02-13","arxiv_id":"2202.06253","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-and-convex-mean","title":"Deep Reinforcement Learning and Convex Mean-Variance Optimisation for Portfolio Management","date":"2022-02-13","arxiv_id":"2203.11318","repositories_listed":0,"syntology":null},{"url":null,"slug":"individual-level-inverse-reinforcement","title":"Individual-Level Inverse Reinforcement Learning for Mean Field Games","date":"2022-02-13","arxiv_id":"2202.06401","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-with-3","title":"Sample-Efficient Reinforcement Learning with loglog(T) Switching Cost","date":"2022-02-13","arxiv_id":"2202.06385","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-reinforcement-learning-of-robotic","title":"End-to-end Reinforcement Learning of Robotic Manipulation with Robust Keypoints Representation","date":"2022-02-12","arxiv_id":"2202.06027","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-nid-rules","title":"Neural NID Rules","date":"2022-02-12","arxiv_id":"2202.06036","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-perspective-on-value-backup-and","title":"A Unified Perspective on Value Backup and Exploration in Monte-Carlo Tree Search","date":"2022-02-11","arxiv_id":"2202.07071","repositories_listed":0,"syntology":null},{"url":null,"slug":"computational-statistical-gaps-in","title":"Computational-Statistical Gaps in Reinforcement Learning","date":"2022-02-11","arxiv_id":"2202.05444","repositories_listed":0,"syntology":null},{"url":null,"slug":"rate-matching-the-regret-lower-bound-in-the","title":"Rate-matching the regret lower-bound in the linear quadratic regulator with unknown dynamics","date":"2022-02-11","arxiv_id":"2202.05799","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-q-learning","title":"Regularized Q-learning","date":"2022-02-11","arxiv_id":"2202.05404","repositories_listed":0,"syntology":null},{"url":null,"slug":"abstraction-for-deep-reinforcement-learning","title":"Abstraction for Deep Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.05839","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-based-robust-resource-allocation-in-end-to","title":"AI-based Robust Resource Allocation in End-to-End Network Slicing under Demand and CSI Uncertainties","date":"2022-02-10","arxiv_id":"2202.05131","repositories_listed":0,"syntology":null},{"url":null,"slug":"dda3c-cooperative-distributed-deep","title":"Group-Agent Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.05135","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-pipelines-with-evolutionarily","title":"Interpretable pipelines with evolutionarily optimized modules for RL tasks with visual inputs","date":"2022-02-10","arxiv_id":"2202.04943","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-fitted-q-evaluation-with","title":"Off-Policy Fitted Q-Evaluation with Differentiable Function Approximators: Z-Estimation and Inference Theory","date":"2022-02-10","arxiv_id":"2202.04970","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-the-wild-scalable","title":"Reinforcement Learning in the Wild: Scalable RL Dispatching Algorithm Deployed in Ridehailing Marketplace","date":"2022-02-10","arxiv_id":"2202.05118","repositories_listed":0,"syntology":null},{"url":null,"slug":"safer-data-efficient-and-safe-reinforcement-1","title":"SAFER: Data-Efficient and Safe Reinforcement Learning via Skill Acquisition","date":"2022-02-10","arxiv_id":"2202.04849","repositories_listed":0,"syntology":null},{"url":null,"slug":"settling-the-communication-complexity-for","title":"Settling the Communication Complexity for Distributed Offline Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.04862","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-value-decomposition-algorithms","title":"Understanding Value Decomposition Algorithms in Deep Cooperative Multi-Agent Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.04868","repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-learning-waveform-selection","title":"Universal Learning Waveform Selection Strategies for Adaptive Target Tracking","date":"2022-02-10","arxiv_id":"2202.05294","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-autonomous-intersection","title":"Intelligent Autonomous Intersection Management","date":"2022-02-09","arxiv_id":"2202.04224","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-2","title":"Offline Reinforcement Learning with Realizability and Single-policy Concentrability","date":"2022-02-09","arxiv_id":"2202.04634","repositories_listed":0,"syntology":null},{"url":null,"slug":"scenario-assisted-deep-reinforcement-learning","title":"Scenario-Assisted Deep Reinforcement Learning","date":"2022-02-09","arxiv_id":"2202.04337","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferred-q-learning","title":"Transferred Q-learning","date":"2022-02-09","arxiv_id":"2202.04709","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-shifting-preferences-for","title":"Understanding and Shifting Preferences for Battery Electric Vehicles","date":"2022-02-09","arxiv_id":"2202.08963","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdoor-detection-in-reinforcement-learning","title":"PolicyCleanse: Backdoor Detection and Mitigation in Reinforcement Learning","date":"2022-02-08","arxiv_id":"2202.03609","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-management-based-on-multi-agent-deep","title":"Energy Management Based on Multi-Agent Deep Reinforcement Learning for A Multi-Energy Industrial Park","date":"2022-02-08","arxiv_id":"2202.03771","repositories_listed":0,"syntology":null},{"url":null,"slug":"grasp-gradient-based-affordance-selection-for-1","title":"GrASP: Gradient-Based Affordance Selection for Planning","date":"2022-02-08","arxiv_id":"2202.04772","repositories_listed":0,"syntology":null},{"url":null,"slug":"independent-policy-gradient-for-large-scale","title":"Independent Policy Gradient for Large-Scale Markov Potential Games: Sharper Rates, Function Approximation, and Game-Agnostic Convergence","date":"2022-02-08","arxiv_id":"2202.04129","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-explanations-for-reinforcement-learning","title":"Local Explanations for Reinforcement Learning","date":"2022-02-08","arxiv_id":"2202.03597","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-reinforcement-learning-with-a-short","title":"Provable Reinforcement Learning with a Short-Term Memory","date":"2022-02-08","arxiv_id":"2202.03983","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-deep-and-reinforcement-learning-for","title":"Robust, Deep, and Reinforcement Learning for Management of Communication and Power Networks","date":"2022-02-08","arxiv_id":"2202.05395","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-robustness-of-cooperative-marl-a","title":"Attacking c-MARL More Effectively: A Data Driven Approach","date":"2022-02-07","arxiv_id":"2202.03558","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-offline-meta-reinforcement-1","title":"Model-Based Offline Meta-Reinforcement Learning with Regularization","date":"2022-02-07","arxiv_id":"2202.02929","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-for-stochastic-shortest","title":"Policy Optimization for Stochastic Shortest Path","date":"2022-02-07","arxiv_id":"2202.03334","repositories_listed":0,"syntology":null}],"record_sha256":"4bc3ee8abe3e5a123561100e80acf62be85b9a8e2b3fb211bd731ce775c4822d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}