{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/85","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":85,"pages_in_order":152,"rows_per_page":100,"rows":[8401,8500],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/84","next":"/task/reinforcement-learning-1/papers/86","papers":[{"url":null,"slug":"deep-reinforcement-learning-for-optimal-2","title":"Deep Reinforcement Learning for Optimal Investment and Saving Strategy Selection in Heterogeneous Profiles: Intelligent Agents working towards retirement","date":"2022-06-12","arxiv_id":"2206.05835","repositories_listed":0,"syntology":null},{"url":null,"slug":"matching-options-to-tasks-using-option","title":"Matching options to tasks using Option-Indexed Hierarchical Reinforcement Learning","date":"2022-06-12","arxiv_id":"2206.05750","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-ea-a-reinforcement-learning-based","title":"RL-GA: A Reinforcement Learning-Based Genetic Algorithm for Electromagnetic Detection Satellite Scheduling Problem","date":"2022-06-12","arxiv_id":"2206.05694","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-offline-reinforcement-learning","title":"Federated Offline Reinforcement Learning","date":"2022-06-11","arxiv_id":"2206.05581","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-application-of-neural-networks-to-a","title":"An application of neural networks to a problem in knot theory and group theory (untangling braids)","date":"2022-06-10","arxiv_id":"2206.05373","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-multi-agent-reinforcement-learning-with-2","title":"Deep Multi-Agent Reinforcement Learning with Hybrid Action Spaces based on Maximum Entropy","date":"2022-06-10","arxiv_id":"2206.05108","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-retrieval-for-reinforcement","title":"Large-Scale Retrieval for Reinforcement Learning","date":"2022-06-10","arxiv_id":"2206.05314","repositories_listed":0,"syntology":null},{"url":null,"slug":"multifidelity-reinforcement-learning-with","title":"Multifidelity Reinforcement Learning with Control Variates","date":"2022-06-10","arxiv_id":"2206.05165","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-reinforcement-learning-for-1","title":"Policy Gradient Reinforcement Learning for Uncertain Polytopic LPV Systems based on MHE-MPC","date":"2022-06-10","arxiv_id":"2206.05089","repositories_listed":0,"syntology":null},{"url":null,"slug":"social-network-structure-shapes-innovation","title":"Social Network Structure Shapes Innovation: Experience-sharing in RL with SAPIENS","date":"2022-06-10","arxiv_id":"2206.05060","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optimization-method-assisted-ensemble-deep","title":"An Optimization Method-Assisted Ensemble Deep Reinforcement Learning Algorithm to Solve Unit Commitment Problems","date":"2022-06-09","arxiv_id":"2206.04249","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-surrogate-assisted-generation-of","title":"Deep Surrogate Assisted Generation of Environments","date":"2022-06-09","arxiv_id":"2206.04199","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-the-spectral-bias-of-neural-value-1","title":"Overcoming the Spectral Bias of Neural Value Approximation","date":"2022-06-09","arxiv_id":"2206.04672","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-policy-iteration-via-amplitude","title":"Quantum Policy Iteration via Amplitude Estimation and Grover Search -- Towards Quantum Advantage for Reinforcement Learning","date":"2022-06-09","arxiv_id":"2206.04741","repositories_listed":0,"syntology":null},{"url":null,"slug":"receding-horizon-inverse-reinforcement","title":"Receding Horizon Inverse Reinforcement Learning","date":"2022-06-09","arxiv_id":"2206.04477","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-analysis-of-certainty-equivalence","title":"Regret Analysis of Certainty Equivalence Policies in Continuous-Time Linear-Quadratic Systems","date":"2022-06-09","arxiv_id":"2206.04434","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bounds-for-information-directed","title":"Regret Bounds for Information-Directed Reinforcement Learning","date":"2022-06-09","arxiv_id":"2206.04640","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-in-2","title":"Sample-Efficient Reinforcement Learning in the Presence of Exogenous Information","date":"2022-06-09","arxiv_id":"2206.04282","repositories_listed":0,"syntology":null},{"url":null,"slug":"there-is-no-accuracy-interpretability","title":"There is no Accuracy-Interpretability Tradeoff in Reinforcement Learning for Mazes","date":"2022-06-09","arxiv_id":"2206.04266","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-continual-learning-methods-for-q","title":"A Study of Continual Learning Methods for Q-Learning","date":"2022-06-08","arxiv_id":"2206.03934","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-noise-in-off-policy-deep-reinforcement","title":"Action Noise in Off-Policy Deep Reinforcement Learning: Impact on Exploration and Performance","date":"2022-06-08","arxiv_id":"2206.03787","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-prompting-toward-controllable","title":"Learning to Generate Prompts for Dialogue Generation through Reinforcement Learning","date":"2022-06-08","arxiv_id":"2206.03931","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-is-minimax","title":"Model-Based Reinforcement Learning for Offline Zero-Sum Markov Games","date":"2022-06-08","arxiv_id":"2206.04044","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-inverse-scattering","title":"Reinforced Inverse Scattering","date":"2022-06-08","arxiv_id":"2206.04186","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-joint-learning-of-wireless-multiple","title":"Scalable Joint Learning of Wireless Multiple-Access Policies and their Signaling","date":"2022-06-08","arxiv_id":"2206.03844","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-online-disease-diagnosis-via-multi","title":"Scalable Online Disease Diagnosis via Multi-Model-Fused Actor-Critic Reinforcement Learning","date":"2022-06-08","arxiv_id":"2206.03659","repositories_listed":0,"syntology":null},{"url":null,"slug":"sim2real-for-reinforcement-learning-driven","title":"Sim2real for Reinforcement Learning Driven Next Generation Networks","date":"2022-06-08","arxiv_id":"2206.03846","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-the-spike-feature-information","title":"Solving the Spike Feature Information Vanishing Problem in Spiking Deep Q Network with Potential Based Normalization","date":"2022-06-08","arxiv_id":"2206.03654","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-model-based-reinforcement-learning-approach-1","title":"A Model-Based Reinforcement Learning Approach for PID Design","date":"2022-06-07","arxiv_id":"2206.03567","repositories_listed":0,"syntology":null},{"url":null,"slug":"driving-in-real-life-with-inverse","title":"Driving in Real Life with Inverse Reinforcement Learning","date":"2022-06-07","arxiv_id":"2206.03004","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitating-past-successes-can-be-very","title":"Imitating Past Successes can be Very Suboptimal","date":"2022-06-07","arxiv_id":"2206.03378","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-in-observable-pomdps-without","title":"Learning in Observable POMDPs, without Computationally Intractable Oracles","date":"2022-06-07","arxiv_id":"2206.03446","repositories_listed":0,"syntology":null},{"url":null,"slug":"mix-mab-reinforcement-learning-based-resource","title":"MIX-MAB: Reinforcement Learning-based Resource Allocation Algorithm for LoRaWAN","date":"2022-06-07","arxiv_id":"2206.03401","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effectiveness-of-fine-tuning-versus","title":"On the Effectiveness of Fine-tuning Versus Meta-reinforcement Learning","date":"2022-06-07","arxiv_id":"2206.03271","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-role-of-discount-factor-in-offline","title":"On the Role of Discount Factor in Offline Reinforcement Learning","date":"2022-06-07","arxiv_id":"2206.03383","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-meta-reinforcement-learning-for","title":"Variational Meta Reinforcement Learning for Social Robotics","date":"2022-06-07","arxiv_id":"2206.03211","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-rollout-length-for-model-based-rl","title":"Adaptive Rollout Length for Model-Based RL Using Model-Free Deep RL","date":"2022-06-06","arxiv_id":"2206.02380","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotic-instance-optimal-algorithms-for","title":"Asymptotic Instance-Optimal Algorithms for Interactive Decision Making","date":"2022-06-06","arxiv_id":"2206.02326","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-profit-risk-and-sustainability-for","title":"Balancing Profit, Risk, and Sustainability for Portfolio Management","date":"2022-06-06","arxiv_id":"2207.02134","repositories_listed":0,"syntology":null},{"url":null,"slug":"consensus-learning-for-cooperative-multi","title":"Consensus Learning for Cooperative Multi-Agent Reinforcement Learning","date":"2022-06-06","arxiv_id":"2206.02583","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-cybersecurity-1","title":"Deep Reinforcement Learning for Cybersecurity Threat Detection and Protection: A Review","date":"2022-06-06","arxiv_id":"2206.02733","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-entity-based-reinforcement-learning","title":"Efficient entity-based reinforcement learning","date":"2022-06-06","arxiv_id":"2206.02855","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-space-planning-with-subgoal-models","title":"Goal-Space Planning with Subgoal Models","date":"2022-06-06","arxiv_id":"2206.02902","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-generalized-wireless-mac","title":"Learning Generalized Wireless MAC Communication Protocols via Abstraction","date":"2022-06-06","arxiv_id":"2206.06331","repositories_listed":0,"syntology":null},{"url":null,"slug":"markovian-interference-in-experiments","title":"Markovian Interference in Experiments","date":"2022-06-06","arxiv_id":"2206.02371","repositories_listed":0,"syntology":null},{"url":null,"slug":"real2sim-or-sim2real-robotics-visual","title":"Real2Sim or Sim2Real: Robotics Visual Insertion using Deep Reinforcement Learning and Real2Sim Policy Adaptation","date":"2022-06-06","arxiv_id":"2206.02679","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-1","title":"Provably Efficient Risk-Sensitive Reinforcement Learning: Iterated CVaR and Worst Path","date":"2022-06-06","arxiv_id":"2206.02678","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-adversarial-attacks-detection-based-on","title":"Robust Adversarial Attacks Detection based on Explainable Deep Reinforcement Learning For UAV Guidance and Planning","date":"2022-06-06","arxiv_id":"2206.02670","repositories_listed":0,"syntology":null},{"url":null,"slug":"specification-guided-learning-of-nash","title":"Specification-Guided Learning of Nash Equilibria with High Social Welfare","date":"2022-06-06","arxiv_id":"2206.03348","repositories_listed":0,"syntology":null},{"url":null,"slug":"arc-actor-residual-critic-for-adversarial","title":"ARC -- Actor Residual Critic for Adversarial Imitation Learning","date":"2022-06-05","arxiv_id":"2206.02095","repositories_listed":0,"syntology":null},{"url":null,"slug":"ddpg-based-on-multi-scale-strokes-for","title":"DDPG based on multi-scale strokes for financial time series trading strategy","date":"2022-06-05","arxiv_id":"2207.10071","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamics-and-generalization-in","title":"Learning Dynamics and Generalization in Reinforcement Learning","date":"2022-06-05","arxiv_id":"2206.02126","repositories_listed":0,"syntology":null},{"url":null,"slug":"rapid-learning-of-spatial-representations-for","title":"Rapid Learning of Spatial Representations for Goal-Directed Navigation Based on a Novel Model of Hippocampal Place Fields","date":"2022-06-05","arxiv_id":"2206.02249","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-tree-backup-algorithms-for-temporal","title":"Adaptive Tree Backup Algorithms for Temporal-Difference Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.01896","repositories_listed":0,"syntology":null},{"url":null,"slug":"between-rate-distortion-theory-value","title":"Between Rate-Distortion Theory & Value Equivalence in Model-Based Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.02025","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-value-checklist-for-testing-inferences","title":"Beyond Value: CHECKLIST for Testing Inferences in Planning-Based RL","date":"2022-06-04","arxiv_id":"2206.02039","repositories_listed":0,"syntology":null},{"url":null,"slug":"deciding-what-to-model-value-equivalent","title":"Deciding What to Model: Value-Equivalent Sampling for Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.02072","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-value-estimation-for-off-policy","title":"Hybrid Value Estimation for Off-policy Evaluation and Offline Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.02000","repositories_listed":0,"syntology":null},{"url":null,"slug":"macc-cross-layer-multi-agent-congestion","title":"MACC: Cross-Layer Multi-Agent Congestion Control with Deep Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.01972","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-poisoning-attacks-on-offline-multi","title":"Reward Poisoning Attacks on Offline Multi-Agent Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.01888","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-6","title":"A Deep Reinforcement Learning Framework For Column Generation","date":"2022-06-03","arxiv_id":"2206.02568","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-epistemic-and-aleatoric","title":"Disentangling Epistemic and Aleatoric Uncertainty in Reinforcement Learning","date":"2022-06-03","arxiv_id":"2206.01558","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-energy-dispatch-and-unit-commitment-in","title":"Joint Energy Dispatch and Unit Commitment in Microgrids Based on Deep Reinforcement Learning","date":"2022-06-03","arxiv_id":"2206.01663","repositories_listed":0,"syntology":null},{"url":null,"slug":"kcrl-krasovskii-constrained-reinforcement","title":"KCRL: Krasovskii-Constrained Reinforcement Learning with Guaranteed Stability in Nonlinear Dynamical Systems","date":"2022-06-03","arxiv_id":"2206.01704","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-causal","title":"Offline Reinforcement Learning with Causal Structured World Models","date":"2022-06-03","arxiv_id":"2206.01474","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-neural-radiance","title":"Reinforcement Learning with Neural Radiance Fields","date":"2022-06-03","arxiv_id":"2206.01634","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivariant-reinforcement-learning-for","title":"Equivariant Reinforcement Learning for Quadrotor UAV","date":"2022-06-02","arxiv_id":"2206.01233","repositories_listed":0,"syntology":null},{"url":null,"slug":"hex-human-in-the-loop-explainability-via-deep","title":"HEX: Human-in-the-loop Explainability via Deep Reinforcement Learning","date":"2022-06-02","arxiv_id":"2206.01343","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-explicit-uncertainty-estimates","title":"Incorporating Explicit Uncertainty Estimates into Deep Offline Reinforcement Learning","date":"2022-06-02","arxiv_id":"2206.01085","repositories_listed":0,"syntology":null},{"url":null,"slug":"incrementality-bidding-via-reinforcement","title":"Incrementality Bidding via Reinforcement Learning under Mixed and Delayed Rewards","date":"2022-06-02","arxiv_id":"2206.01293","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-3","title":"Offline Reinforcement Learning with Differential Privacy","date":"2022-06-02","arxiv_id":"2206.00810","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-algorithms-with-monte-carlo","title":"Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes","date":"2022-06-02","arxiv_id":"2206.01011","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-coreset-construction-with","title":"Posterior Coreset Construction with Kernelized Stein Discrepancy for Model-Based Reinforcement Learning","date":"2022-06-02","arxiv_id":"2206.01162","repositories_listed":0,"syntology":null},{"url":null,"slug":"raca-relation-aware-credit-assignment-for-ad","title":"RACA: Relation-Aware Credit Assignment for Ad-Hoc Cooperation in Multi-Agent Deep Reinforcement Learning","date":"2022-06-02","arxiv_id":"2206.01207","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-parameters","title":"Reinforcement learning based parameters adaption method for particle swarm optimization","date":"2022-06-02","arxiv_id":"2206.00835","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-of-1","title":"Sample-Efficient Reinforcement Learning of Partially Observable Markov Games","date":"2022-06-02","arxiv_id":"2206.01315","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-database-of-multimodal-data-to-construct-a","title":"A Database of Multimodal Data to Construct a Simulated Dialogue Partner with Varying Degrees of Cognitive Health","date":"2022-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"byzantine-robust-online-and-offline","title":"Byzantine-Robust Online and Offline Distributed Reinforcement Learning","date":"2022-06-01","arxiv_id":"2206.00165","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-scheduling-of-data-augmentation-for","title":"Efficient Scheduling of Data Augmentation for Deep Reinforcement Learning","date":"2022-06-01","arxiv_id":"2206.00518","repositories_listed":0,"syntology":null},{"url":null,"slug":"know-your-boundaries-the-necessity-of","title":"Know Your Boundaries: The Necessity of Explicit Behavioral Cloning in Offline RL","date":"2022-06-01","arxiv_id":"2206.00695","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-generation-with-provable-coverability","title":"Model Generation with Provable Coverability for Offline Reinforcement Learning","date":"2022-06-01","arxiv_id":"2206.00316","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-gap-dependent-bounds-for-offline","title":"On Gap-dependent Bounds for Offline Reinforcement Learning","date":"2022-06-01","arxiv_id":"2206.00177","repositories_listed":0,"syntology":null},{"url":null,"slug":"predecessor-features","title":"Predecessor Features","date":"2022-06-01","arxiv_id":"2206.00303","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-lifelong-reinforcement","title":"Provably Efficient Lifelong Reinforcement Learning with Linear Function Approximation","date":"2022-06-01","arxiv_id":"2206.00270","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-offline-multi-agent","title":"Provably Efficient Offline Multi-agent Reinforcement Learning via Strategy-wise Bonus","date":"2022-06-01","arxiv_id":"2206.00159","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlss-a-deep-reinforcement-learning-algorithm","title":"RLSS: A Deep Reinforcement Learning Algorithm for Sequential Scene Generation","date":"2022-06-01","arxiv_id":"2206.02544","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-phenomenon-of-policy-churn","title":"The Phenomenon of Policy Churn","date":"2022-06-01","arxiv_id":"2206.00730","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-mixture-of-expert-approach-to-rl-based","title":"A Mixture-of-Expert Approach to RL-based Dialogue Management","date":"2022-05-31","arxiv_id":"2206.00059","repositories_listed":0,"syntology":null},{"url":null,"slug":"k-means-maximum-entropy-exploration","title":"k-Means Maximum Entropy Exploration","date":"2022-05-31","arxiv_id":"2205.15623","repositories_listed":0,"syntology":null},{"url":null,"slug":"lessons-learned-from-data-driven-building","title":"Lessons Learned from Data-Driven Building Control Experiments: Contrasting Gaussian Process-based MPC, Bilevel DeePC, and Deep Reinforcement Learning","date":"2022-05-31","arxiv_id":"2205.15703","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-learning-of-numerical-methods-for","title":"Multi-Agent Learning of Numerical Methods for Hyperbolic PDEs with Factored Dec-MDP","date":"2022-05-31","arxiv_id":"2205.15716","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-minimax-optimal-offline-reinforcement","title":"Nearly Minimax Optimal Offline Reinforcement Learning with Linear Function Approximation: Single-Agent MDP and Markov Game","date":"2022-05-31","arxiv_id":"2205.15512","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-policy-is-enough-parallel-exploration","title":"One Policy is Enough: Parallel Exploration with a Single Policy is Near-Optimal for Reward-Free Reinforcement Learning","date":"2022-05-31","arxiv_id":"2205.15891","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-general-function-class","title":"Provable General Function Class Representation Learning in Multitask Bandits and MDPs","date":"2022-05-31","arxiv_id":"2205.15701","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-longitudinal-control-for-vehicular","title":"Robust Longitudinal Control for Vehicular Autonomous Platoons Using Deep Reinforcement Learning","date":"2022-05-31","arxiv_id":"2206.01175","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-exploration-based-policy","title":"Sample-Efficient, Exploration-Based Policy Optimisation for Routing Problems","date":"2022-05-31","arxiv_id":"2205.15656","repositories_listed":0,"syntology":null},{"url":null,"slug":"timing-is-everything-learning-to-act","title":"Timing is Everything: Learning to Act Selectively with Costly Actions and Budgetary Constraints","date":"2022-05-31","arxiv_id":"2205.15953","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-rewards-for-fast-learning","title":"Designing Rewards for Fast Learning","date":"2022-05-30","arxiv_id":"2205.15400","repositories_listed":0,"syntology":null},{"url":null,"slug":"gldqn-explicitly-parameterized-quantile","title":"A Simulation Environment and Reinforcement Learning Method for Waste Reduction","date":"2022-05-30","arxiv_id":"2205.15455","repositories_listed":0,"syntology":null},{"url":null,"slug":"gramer-graph-meta-reinforcement-learning-for","title":"GraMeR: Graph Meta Reinforcement Learning for Multi-Objective Influence Maximization","date":"2022-05-30","arxiv_id":"2205.14834","repositories_listed":0,"syntology":null}],"record_sha256":"794e28ff928e49877cc0afe89dd8c6119432e76d6ccf63af40e6d0104b34e115","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}