{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/107","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":107,"pages_in_order":135,"rows_per_page":100,"rows":[10601,10700],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/106","next":"/task/reinforcement-learning-2/papers/108","papers":[{"url":null,"slug":"inverse-reinforcement-learning-from-a","title":"Inverse Reinforcement Learning from a Gradient-based Learner","date":"2020-07-15","arxiv_id":"2007.07812","repositories_listed":0,"syntology":null},{"url":null,"slug":"qgraph-bounded-q-learning-stabilizing-model-1","title":"Qgraph-bounded Q-learning: Stabilizing Model-Free Off-Policy Deep Reinforcement Learning","date":"2020-07-15","arxiv_id":"2007.07582","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-memory-placement-using","title":"Optimizing Memory Placement using Evolutionary Graph Reinforcement Learning","date":"2020-07-14","arxiv_id":"2007.07298","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustifying-reinforcement-learning-agents","title":"Robustifying Reinforcement Learning Agents via Action Space Adversarial Training","date":"2020-07-14","arxiv_id":"2007.07176","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-provably-efficient-sample-collection","title":"A Provably Efficient Sample Collection Strategy for Reinforcement Learning","date":"2020-07-13","arxiv_id":"2007.06437","repositories_listed":0,"syntology":null},{"url":null,"slug":"aircaprl-autonomous-aerial-human-motion","title":"AirCapRL: Autonomous Aerial Human Motion Capture using Deep Reinforcement Learning","date":"2020-07-13","arxiv_id":"2007.06343","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-jamming-attacks-and-defense","title":"Adversarial jamming attacks and defense strategies via adaptive deep reinforcement learning","date":"2020-07-12","arxiv_id":"2007.06055","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-sentiment-controllable","title":"Investigation of Sentiment Controllable Chatbot","date":"2020-07-11","arxiv_id":"2007.07196","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulating-multi-exit-evacuation-using-deep","title":"Simulating multi-exit evacuation using deep reinforcement learning","date":"2020-07-11","arxiv_id":"2007.05783","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-logical-rules-into-neural-multi","title":"Integrating Logical Rules Into Neural Multi-Hop Reasoning for Drug Repurposing","date":"2020-07-10","arxiv_id":"2007.05292","repositories_listed":0,"syntology":null},{"url":null,"slug":"maps-multi-agent-reinforcement-learning-based","title":"MAPS: Multi-agent Reinforcement Learning-based Portfolio Management System","date":"2020-07-10","arxiv_id":"2007.05402","repositories_listed":0,"syntology":null},{"url":null,"slug":"representations-for-stable-off-policy","title":"Representations for Stable Off-Policy Reinforcement Learning","date":"2020-07-10","arxiv_id":"2007.05520","repositories_listed":0,"syntology":null},{"url":null,"slug":"vizarel-a-system-to-help-better-understand-rl","title":"Vizarel: A System to Help Better Understand RL Agents","date":"2020-07-10","arxiv_id":"2007.05577","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-kernel-based-approach-to-non-stationary","title":"A Kernel-Based Approach to Non-Stationary Reinforcement Learning in Metric Spaces","date":"2020-07-09","arxiv_id":"2007.05078","repositories_listed":0,"syntology":null},{"url":null,"slug":"evo-rl-evolutionary-driven-reinforcement","title":"EVO-RL: Evolutionary-Driven Reinforcement Learning","date":"2020-07-09","arxiv_id":"2007.04725","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-prune-deep-neural-networks-via-2","title":"Learning to Prune Deep Neural Networks via Reinforcement Learning","date":"2020-07-09","arxiv_id":"2007.04756","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-dose-ct-denoising-via-joint-bilateral","title":"Low Dose CT Denoising via Joint Bilateral Filtering and Intelligent Parameter Optimization","date":"2020-07-09","arxiv_id":"2007.04768","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakness-analysis-of-cyberspace-configuration","title":"Weakness Analysis of Cyberspace Configuration Based on Reinforcement Learning","date":"2020-07-09","arxiv_id":"2007.04614","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-natural-actor-critic-algorithm-with","title":"A Natural Actor-Critic Algorithm with Downside Risk Constraints","date":"2020-07-08","arxiv_id":"2007.04203","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-map-a-dqn-framework-for-exploring","title":"Auto-MAP: A DQN Framework for Exploring Distributed Execution Plans for DNN Workloads","date":"2020-07-08","arxiv_id":"2007.04069","repositories_listed":0,"syntology":null},{"url":null,"slug":"discourse-coherence-reference-grounding-and","title":"Discourse Coherence, Reference Grounding and Goal Oriented Dialogue","date":"2020-07-08","arxiv_id":"2007.04428","repositories_listed":0,"syntology":null},{"url":null,"slug":"responsive-safety-in-reinforcement-learning","title":"Responsive Safety in Reinforcement Learning by PID Lagrangian Methods","date":"2020-07-08","arxiv_id":"2007.03964","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-model-based-on","title":"A deep reinforcement learning model based on deterministic policy gradient for collective neural crest cell migration","date":"2020-07-07","arxiv_id":"2007.03190","repositories_listed":0,"syntology":null},{"url":null,"slug":"cognitive-radio-network-throughput","title":"Cognitive Radio Network Throughput Maximization with Deep Reinforcement Learning","date":"2020-07-07","arxiv_id":"2007.03165","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-and-its","title":"Deep Reinforcement Learning and its Neuroscientific Implications","date":"2020-07-07","arxiv_id":"2007.03750","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-interactive","title":"Deep Reinforcement Learning with Interactive Feedback in a Human-Robot Environment","date":"2020-07-07","arxiv_id":"2007.03363","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-for-sequential","title":"Necessary and Sufficient Conditions for Inverse Reinforcement Learning of Bayesian Stopping Time Problems","date":"2020-07-07","arxiv_id":"2007.03481","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-provable-uniform-convergence-in","title":"Near-Optimal Provable Uniform Convergence in Offline Policy Evaluation for Reinforcement Learning","date":"2020-07-07","arxiv_id":"2007.03760","repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-maintenance-for-edge-based-sensor","title":"Predictive Maintenance for Edge-Based Sensor Networks: A Deep Reinforcement Learning Approach","date":"2020-07-07","arxiv_id":"2007.03313","repositories_listed":0,"syntology":null},{"url":null,"slug":"sharp-analysis-of-smoothed-bellman-error","title":"Sharp Analysis of Smoothed Bellman Error Embedding","date":"2020-07-07","arxiv_id":"2007.03749","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-practical-measure-of-interference","title":"Towards a practical measure of interference for reinforcement learning","date":"2020-07-07","arxiv_id":"2007.03807","repositories_listed":0,"syntology":null},{"url":null,"slug":"consensus-multi-agent-reinforcement-learning","title":"Consensus Multi-Agent Reinforcement Learning for Volt-VAR Control in Power Distribution Networks","date":"2020-07-06","arxiv_id":"2007.02991","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-efficient-connected-and-automated","title":"Efficient Connected and Automated Driving System with Multi-agent Graph Reinforcement Learning","date":"2020-07-06","arxiv_id":"2007.02794","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-reinforcement-learning-global","title":"Decentralized Reinforcement Learning: Global Decision-Making via Local Economic Transactions","date":"2020-07-05","arxiv_id":"2007.02382","repositories_listed":0,"syntology":null},{"url":null,"slug":"mission-schedule-of-agile-satellites-based-on","title":"Mission schedule of agile satellites based on Proximal Policy Optimization Algorithm","date":"2020-07-05","arxiv_id":"2007.02352","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-paraphrasing-via-deep","title":"Unsupervised Paraphrasing via Deep Reinforcement Learning","date":"2020-07-05","arxiv_id":"2007.02244","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-policy-gradient-method-for","title":"Variational Policy Gradient Method for Reinforcement Learning with General Utilities","date":"2020-07-04","arxiv_id":"2007.02151","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-conceptual-framework-for-externally","title":"A Conceptual Framework for Externally-influenced Agents: An Assisted Reinforcement Learning Review","date":"2020-07-03","arxiv_id":"2007.01544","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unifying-view-of-optimism-in-episodic","title":"A Unifying View of Optimism in Episodic Reinforcement Learning","date":"2020-07-03","arxiv_id":"2007.01891","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-autonomous-free-airspace-en-route","title":"An Autonomous Free Airspace En-route Controller using Deep Reinforcement Learning Techniques","date":"2020-07-03","arxiv_id":"2007.01599","repositories_listed":0,"syntology":null},{"url":null,"slug":"hedging-using-reinforcement-learning","title":"Hedging using reinforcement learning: Contextual $k$-Armed Bandit versus $Q$-learning","date":"2020-07-03","arxiv_id":"2007.01623","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-logic-based-reward-shaping-for","title":"Temporal-Logic-Based Reward Shaping for Continuing Reinforcement Learning Tasks","date":"2020-07-03","arxiv_id":"2007.01498","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-inverse-reinforcement-learning-using","title":"Learning \"What-if\" Explanations for Sequential Decision-Making","date":"2020-07-02","arxiv_id":"2007.13531","repositories_listed":0,"syntology":null},{"url":null,"slug":"bosh-bayesian-optimization-by-sampling","title":"BOSH: Bayesian Optimization by Sampling Hierarchically","date":"2020-07-02","arxiv_id":"2007.00939","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-deep-reinforcement-learning-for-1","title":"Decentralized Deep Reinforcement Learning for Network Level Traffic Signal Control","date":"2020-07-02","arxiv_id":"2007.03433","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-driven-inspection","title":"Deep reinforcement learning driven inspection and maintenance planning under incomplete information and constraints","date":"2020-07-02","arxiv_id":"2007.01380","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-centered-collaborative-robots-with-deep","title":"Human-centered collaborative robots with deep reinforcement learning","date":"2020-07-02","arxiv_id":"2007.01009","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with-mixture","title":"Safe Reinforcement Learning with Mixture Density Network: A Case Study in Autonomous Highway Driving","date":"2020-07-02","arxiv_id":"2007.01698","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-generalized-reinforcement-learning","title":"A Generalized Reinforcement Learning Algorithm for Online 3D Bin-Packing","date":"2020-07-01","arxiv_id":"2007.00463","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-elementary-discourse-units-in","title":"Composing Elementary Discourse Units in Abstractive Summarization","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"falsification-based-robust-adversarial","title":"Falsification-Based Robust Adversarial Reinforcement Learning","date":"2020-07-01","arxiv_id":"2007.00691","repositories_listed":0,"syntology":null},{"url":null,"slug":"interaction-limited-inverse-reinforcement","title":"Interaction-limited Inverse Reinforcement Learning","date":"2020-07-01","arxiv_id":"2007.00425","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalization-of-hearing-aid-compression-by","title":"Personalization of Hearing Aid Compression by Human-In-Loop Deep Reinforcement Learning","date":"2020-07-01","arxiv_id":"2007.00192","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-guidance-of-dialogue-generation-with","title":"Semantic Guidance of Dialogue Generation with Reinforcement Learning","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-transfer-in-reinforcement-learning","title":"Sequential Transfer in Reinforcement Learning with a Generative Model","date":"2020-07-01","arxiv_id":"2007.00722","repositories_listed":0,"syntology":null},{"url":null,"slug":"student-teacher-curriculum-learning-via","title":"Student-Teacher Curriculum Learning via Reinforcement Learning: Predicting Hospital Inpatient Admission Location","date":"2020-07-01","arxiv_id":"2007.01135","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-text-classification-via-reinforced","title":"Zero-shot Text Classification via Reinforced Self-training","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-agent","title":"Accelerating Reinforcement Learning Agent with EEG-based Implicit Human Feedback","date":"2020-06-30","arxiv_id":"2006.16498","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-approach-to-mimo","title":"Deep reinforcement learning approach to MIMO precoding problem: Optimality and Robustness","date":"2020-06-30","arxiv_id":"2006.16646","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-a-survey","title":"Model-based Reinforcement Learning: A Survey","date":"2020-06-30","arxiv_id":"2006.16712","repositories_listed":0,"syntology":null},{"url":null,"slug":"testing-match-3-video-games-with-deep","title":"Testing match-3 video games with Deep Reinforcement Learning","date":"2020-06-30","arxiv_id":"2007.01137","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-reinforcement-learning-for","title":"Distributed Deep Reinforcement Learning for Intelligent Load Scheduling in Residential Smart Grids","date":"2020-06-29","arxiv_id":"2006.16100","repositories_listed":0,"syntology":null},{"url":null,"slug":"empirically-verifying-hypotheses-using","title":"Empirically Verifying Hypotheses Using Reinforcement Learning","date":"2020-06-29","arxiv_id":"2006.15762","repositories_listed":0,"syntology":null},{"url":null,"slug":"extracting-latent-state-representations-with","title":"Extracting Latent State Representations with Linear Dynamics from Rich Observations","date":"2020-06-29","arxiv_id":"2006.16128","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-learning-automation-iot-attack","title":"Towards Learning-automation IoT Attack Detection through Reinforcement Learning","date":"2020-06-29","arxiv_id":"2006.15826","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-reinforcement-learning-to-herd-a","title":"Using Reinforcement Learning to Herd a Robotic Swarm to a Target Distribution","date":"2020-06-29","arxiv_id":"2006.15807","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-finite-reward-automaton-inference-and","title":"Active Finite Reward Automaton Inference and Reinforcement Learning Using Queries and Counterexamples","date":"2020-06-28","arxiv_id":"2006.15714","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-handwritten","title":"Reinforcement Learning Based Handwritten Digit Recognition with Two-State Q-Learning","date":"2020-06-28","arxiv_id":"2007.01193","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-framework-for-reinforcement-learning-and","title":"A Unifying Framework for Reinforcement Learning and Planning","date":"2020-06-26","arxiv_id":"2006.15009","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximating-euclidean-by-imprecise-markov","title":"Approximating Euclidean by Imprecise Markov Decision Processes","date":"2020-06-26","arxiv_id":"2006.14923","repositories_listed":0,"syntology":null},{"url":null,"slug":"ddpg-striving-for-simplicity-in-continuous","title":"DDPG++: Striving for Simplicity in Continuous-control Off-Policy Reinforcement Learning","date":"2020-06-26","arxiv_id":"2006.15199","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-uplink-beamforming-in-cell-free","title":"Distributed Uplink Beamforming in Cell-Free Networks Using Deep Reinforcement Learning","date":"2020-06-26","arxiv_id":"2006.15138","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-predictive-representations-in","title":"Learning predictive representations in autonomous driving to improve deep reinforcement learning","date":"2020-06-26","arxiv_id":"2006.15110","repositories_listed":0,"syntology":null},{"url":null,"slug":"perception-prediction-reaction-agents-for","title":"Perception-Prediction-Reaction Agents for Deep Reinforcement Learning","date":"2020-06-26","arxiv_id":"2006.15223","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-for-5","title":"Multi-Agent Deep Reinforcement Learning for HVAC Control in Commercial Buildings","date":"2020-06-25","arxiv_id":"2006.14156","repositories_listed":0,"syntology":null},{"url":null,"slug":"noise-overestimation-and-exploration-in-deep","title":"Some approaches used to overcome overestimation in Deep Reinforcement Learning algorithms","date":"2020-06-25","arxiv_id":"2006.14167","repositories_listed":0,"syntology":null},{"url":null,"slug":"psychological-and-neural-evidence-for","title":"Reinforcement Learning and its Connections with Neuroscience and Psychology","date":"2020-06-25","arxiv_id":"2007.01099","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approach-to-synaptic-learning-for","title":"A differential Hebbian framework for biologically-plausible motor control","date":"2020-06-24","arxiv_id":"2006.13471","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-aware-representations-for-model-based","title":"Control-Aware Representations for Model-based Reinforcement Learning","date":"2020-06-24","arxiv_id":"2006.13408","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-robotic-systems-interpreting","title":"Explainable robotic systems: Understanding goal-driven actions in a reinforcement learning scenario","date":"2020-06-24","arxiv_id":"2006.13615","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-stochastic-approximation-a-unified-view","title":"Local Stochastic Approximation: A Unified View of Federated Learning and Distributed Multi-Task Reinforcement Learning Algorithms","date":"2020-06-24","arxiv_id":"2006.13460","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-non-stationary","title":"Reinforcement Learning for Non-Stationary Markov Decision Processes: The Blessing of (More) Optimism","date":"2020-06-24","arxiv_id":"2006.14389","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-minimax-optimal-reinforcement","title":"Towards Minimax Optimal Reinforcement Learning in Factored Markov Decision Processes","date":"2020-06-24","arxiv_id":"2006.13405","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-constrained-reinforcement-learning-for","title":"Batch-Constrained Reinforcement Learning for Dynamic Distribution Network Reconfiguration","date":"2020-06-23","arxiv_id":"2006.12749","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-control-for-radar","title":"Deep Reinforcement Learning Control for Radar Detection and Tracking in Congested Spectral Environments","date":"2020-06-23","arxiv_id":"2006.13173","repositories_listed":0,"syntology":null},{"url":null,"slug":"environment-shaping-in-reinforcement-learning","title":"Environment Shaping in Reinforcement Learning using State Abstraction","date":"2020-06-23","arxiv_id":"2006.13160","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-relationship-between-active-inference","title":"On the Relationship Between Active Inference and Control as Inference","date":"2020-06-23","arxiv_id":"2006.12964","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-multi-agent-reinforcement-learning-for","title":"Online Multi-agent Reinforcement Learning for Decentralized Inverter-based Volt-VAR Control","date":"2020-06-23","arxiv_id":"2006.12841","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-reinforcement-learning-for","title":"Provably Efficient Reinforcement Learning for Discounted MDPs with Feature Mapping","date":"2020-06-23","arxiv_id":"2006.13165","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-a-1","title":"Risk-Sensitive Reinforcement Learning: a Martingale Approach to Reward Uncertainty","date":"2020-06-23","arxiv_id":"2006.12686","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-effect-of-multi-step-methods-on","title":"The Effect of Multi-step Methods on Overestimation in Deep Reinforcement Learning","date":"2020-06-23","arxiv_id":"2006.12692","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-deep-reinforcement-learning-based","title":"Accelerated Deep Reinforcement Learning Based Load Shedding for Emergency Voltage Control","date":"2020-06-22","arxiv_id":"2006.12667","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-combinatorial-optimization-with","title":"Constrained Combinatorial Optimization with Reinforcement Learning","date":"2020-06-22","arxiv_id":"2006.11984","repositories_listed":0,"syntology":null},{"url":null,"slug":"ecological-reinforcement-learning-1","title":"Ecological Reinforcement Learning","date":"2020-06-22","arxiv_id":"2006.12478","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-sampling-based-maximum-entropy","title":"Efficient Sampling-Based Maximum Entropy Inverse Reinforcement Learning with Application to Autonomous Driving","date":"2020-06-22","arxiv_id":"2006.13704","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-reinforcement-learning-with-self","title":"Near-Optimal Reinforcement Learning with Self-Play","date":"2020-06-22","arxiv_id":"2006.12007","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-causal-reinforcement","title":"Provably Efficient Causal Reinforcement Learning with Confounded Observational Data","date":"2020-06-22","arxiv_id":"2006.12311","repositories_listed":0,"syntology":null},{"url":null,"slug":"qopt-optimistic-value-function","title":"QTRAN++: Improved Value Transformation for Cooperative Multi-Agent Reinforcement Learning","date":"2020-06-22","arxiv_id":"2006.12010","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-near","title":"Risk-Sensitive Reinforcement Learning: Near-Optimal Risk-Sample Tradeoff in Regret","date":"2020-06-22","arxiv_id":"2006.13827","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-of","title":"Sample-Efficient Reinforcement Learning of Undercomplete POMDPs","date":"2020-06-22","arxiv_id":"2006.12484","repositories_listed":0,"syntology":null}],"record_sha256":"b705b744ec2a885d558f073d75a50523f5f5f12ccfbbf86fdfd8c6bfe55084cf","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}