{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/102","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":102,"pages_in_order":135,"rows_per_page":100,"rows":[10101,10200],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/101","next":"/task/reinforcement-learning-2/papers/103","papers":[{"url":null,"slug":"a-local-temporal-difference-code-for","title":"A Local Temporal Difference Code for Distributional Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"almost-optimal-model-free-reinforcement-1","title":"Almost Optimal Model-Free Reinforcement Learningvia Reference-Advantage Decomposition","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-driven-deep-question-generation-based","title":"Answer-driven Deep Question Generation based on Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-and-accelerating-coverage-in-deep","title":"Assessing and Accelerating Coverage in Deep Reinforcement Learning","date":"2020-12-01","arxiv_id":"2012.00724","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-temporal-difference-and-q-learning-learn-1","title":"Can Temporal-Diﬀerence and Q-Learning Learn Representation? A Mean-Field Theory","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-cognitive-modeling-and","title":"Combining Cognitive Modeling and Reinforcement Learning for Clarification in Dialogue","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ecolight-intersection-control-in-developing","title":"EcoLight: Intersection Control in Developing Regions Under Extreme Budget and Network Constraints","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"expanrl-hierarchical-reinforcement-learning","title":"ExpanRL: Hierarchical Reinforcement Learning for Course Concept Expansion in MOOCs","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-neural-machine-translation-for","title":"Improving Neural Machine Translation for Sanskrit-English","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-based-generalization-in-1","title":"Instance-based Generalization in Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"is-long-horizon-rl-more-difficult-than-short","title":"Is Long Horizon RL More Difficult Than Short Horizon RL?","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"leverage-the-average-an-analysis-of-kl","title":"Leverage the Average: an Analysis of KL Regularization in Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"morel-model-based-offline-reinforcement-1","title":"MOReL: Model-Based Offline Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"non-crossing-quantile-regression-for","title":"Non-Crossing Quantile Regression for Distributional Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-efficiency-in-hierarchical-reinforcement","title":"On Efficiency in Hierarchical Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-smooth-regularized","title":"On the Convergence of Smooth Regularized Approximate Value Iteration Schemes","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"online-decision-based-visual-tracking-via","title":"Online Decision Based Visual Tracking via Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"promoting-stochasticity-for-expressive","title":"Promoting Stochasticity for Expressive Policies via a Simple and Efficient Regularization Method","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-reinforcement-learning-3","title":"Provably Efficient Reinforcement Learning with Kernel and Neural Function Approximations","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-good-batch-off-policy-reinforcement","title":"Provably Good Batch Off-Policy Reinforcement Learning Without Great Exploration","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-control-with-1","title":"Reinforcement Learning for Control with Multiple Frequencies","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-multi-agent-reinforcement-learning-1","title":"Robust Multi-Agent Reinforcement Learning with Model Uncertainty","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"security-analysis-of-safe-and-seldonian","title":"Security Analysis of Safe and Seldonian Reinforcement Learning Algorithms","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"storage-efficient-and-dynamic-flexible","title":"Storage Efficient and Dynamic Flexible Runtime Channel Pruning via Deep Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"text-simplification-with-reinforcement","title":"Text Simplification with Reinforcement Learning Using Supervised Rewards on Grammaticality, Meaning Preservation, and Simplicity","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"warren-at-semeval-2020-task-4-albert-and","title":"Warren at SemEval-2020 Task 4: ALBERT and Multi-Task Learning for Commonsense Validation","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"low-bandwidth-communication-emerges-naturally","title":"Low-Bandwidth Communication Emerges Naturally in Multi-Agent Learning Systems","date":"2020-11-30","arxiv_id":"2011.14890","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-robust-algorithms-for-handling-model","title":"Soft-Robust Algorithms for Batch Reinforcement Learning","date":"2020-11-30","arxiv_id":"2011.14495","repositories_listed":0,"syntology":null},{"url":null,"slug":"cluster-based-deep-contextual-reinforcement","title":"Cluster Based Deep Contextual Reinforcement Learning for top-k Recommendations","date":"2020-11-29","arxiv_id":"2012.02291","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-sample-complexity-for-turn-based","title":"Minimax Sample Complexity for Turn-based Stochastic Game","date":"2020-11-29","arxiv_id":"2011.14267","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-hands-on","title":"Offline Reinforcement Learning Hands-On","date":"2020-11-29","arxiv_id":"2011.14379","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-mixture-weights-for-off-policy","title":"Optimal Mixture Weights for Off-Policy Evaluation with Multiple Behavior Policies","date":"2020-11-29","arxiv_id":"2011.14359","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-agent-cooperation-in-bridge-bidding","title":"Human-Agent Cooperation in Bridge Bidding","date":"2020-11-28","arxiv_id":"2011.14124","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-benchmarking-frameworks-for","title":"A survey of benchmarking frameworks for reinforcement learning","date":"2020-11-27","arxiv_id":"2011.13577","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptable-automation-with-modular-deep","title":"Adaptable Automation with Modular Deep Reinforcement Learning and Policy Transfer","date":"2020-11-27","arxiv_id":"2012.01934","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-wireless-1","title":"Deep Reinforcement Learning for Resource Constrained Multiclass Scheduling in Wireless Networks","date":"2020-11-27","arxiv_id":"2011.13634","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-active-vision-for-a-humanoid-soccer","title":"Real-time Active Vision for a Humanoid Soccer Robot Using Deep Reinforcement Learning","date":"2020-11-27","arxiv_id":"2011.13851","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-grid-topology-reconfiguration-using","title":"Exploring grid topology reconfiguration using a simple deep reinforcement learning approach","date":"2020-11-26","arxiv_id":"2011.13465","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-simulation-racing-in-reality","title":"Learning from Simulation, Racing in Reality","date":"2020-11-26","arxiv_id":"2011.13332","repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-per-balancing-priority-and","title":"Predictive PER: Balancing Priority and Diversity towards Stable Deep Reinforcement Learning","date":"2020-11-26","arxiv_id":"2011.13093","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-robust-missile","title":"Reinforcement Learning for Robust Missile Autopilot Design","date":"2020-11-26","arxiv_id":"2011.12956","repositories_listed":0,"syntology":null},{"url":null,"slug":"metasensing-intelligent-metasurface-assisted","title":"MetaSensing: Intelligent Metasurface Assisted RF 3D Sensing by Deep Reinforcement Learning","date":"2020-11-25","arxiv_id":"2011.12515","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-playing-full-moba-games-with-deep-1","title":"Towards Playing Full MOBA Games with Deep Reinforcement Learning","date":"2020-11-25","arxiv_id":"2011.12692","repositories_listed":0,"syntology":null},{"url":null,"slug":"powernet-multi-agent-deep-reinforcement","title":"PowerNet: Multi-agent Deep Reinforcement Learning for Scalable Powergrid Control","date":"2020-11-24","arxiv_id":"2011.12354","repositories_listed":0,"syntology":null},{"url":null,"slug":"repaint-knowledge-transfer-in-deep-actor-1","title":"REPAINT: Knowledge Transfer in Deep Reinforcement Learning","date":"2020-11-24","arxiv_id":"2011.11827","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-estimation-and-calibration-with-1","title":"Uncertainty Estimation and Calibration with Finite-State Probabilistic RNNs","date":"2020-11-24","arxiv_id":"2011.12010","repositories_listed":0,"syntology":null},{"url":null,"slug":"consolidation-via-policy-information","title":"Consolidation via Policy Information Regularization in Deep RL for Multi-Agent Games","date":"2020-11-23","arxiv_id":"2011.11517","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-simulator","title":"Generative Adversarial Simulator","date":"2020-11-23","arxiv_id":"2011.11472","repositories_listed":0,"syntology":null},{"url":null,"slug":"logarithmic-regret-for-reinforcement-learning","title":"Logarithmic Regret for Reinforcement Learning with Linear Function Approximation","date":"2020-11-23","arxiv_id":"2011.11566","repositories_listed":0,"syntology":null},{"url":null,"slug":"path-design-and-resource-management-for-noma","title":"Path Design and Resource Management for NOMA enhanced Indoor Intelligent Robots","date":"2020-11-23","arxiv_id":"2011.11745","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-reinforcement-learning-an","title":"Distributed Deep Reinforcement Learning: An Overview","date":"2020-11-22","arxiv_id":"2011.11012","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-meta-learning-for-data-efficient","title":"Double Meta-Learning for Data Efficient Policy Optimization in Non-Stationary Environments","date":"2020-11-21","arxiv_id":"2011.10714","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-reinforcement-learning-1","title":"On the Convergence of Reinforcement Learning in Nonlinear Continuous State Space Problems","date":"2020-11-21","arxiv_id":"2011.10829","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-teaching-in-reinforcement-learning-via","title":"Policy Teaching in Reinforcement Learning via Environment Poisoning Attacks","date":"2020-11-21","arxiv_id":"2011.10824","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-scene-understanding-and-task","title":"Bridging Scene Understanding and Task Execution with Flexible Simulation Environments","date":"2020-11-20","arxiv_id":"2011.10452","repositories_listed":0,"syntology":null},{"url":null,"slug":"delay-constrained-buffer-aided-relay","title":"Delay Constrained Buffer-Aided Relay Selection in the Internet of Things with Decision-Assisted Reinforcement Learning","date":"2020-11-20","arxiv_id":"2011.10524","repositories_listed":0,"syntology":null},{"url":null,"slug":"mrac-rl-a-framework-for-on-line-policy","title":"MRAC-RL: A Framework for On-Line Policy Adaptation Under Parametric Model Uncertainty","date":"2020-11-20","arxiv_id":"2011.10562","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-aware-deep-reinforcement-learning","title":"Energy Aware Deep Reinforcement Learning Scheduling for Sensors Correlated in Time and Space","date":"2020-11-19","arxiv_id":"2011.09747","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-model-selection-for-reinforcement","title":"Online Model Selection for Reinforcement Learning with Function Approximation","date":"2020-11-19","arxiv_id":"2011.09750","repositories_listed":0,"syntology":null},{"url":null,"slug":"parrot-data-driven-behavioral-priors-for-1","title":"Parrot: Data-Driven Behavioral Priors for Reinforcement Learning","date":"2020-11-19","arxiv_id":"2011.10024","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-multi-objective-reinforcement","title":"Provable Multi-Objective Reinforcement Learning with Generative Models","date":"2020-11-19","arxiv_id":"2011.10134","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactual-credit-assignment-in-model","title":"Counterfactual Credit Assignment in Model-Free Reinforcement Learning","date":"2020-11-18","arxiv_id":"2011.09464","repositories_listed":0,"syntology":null},{"url":null,"slug":"experimental-study-on-reinforcement-learning","title":"Experimental Study on Reinforcement Learning-based Control of an Acrobot","date":"2020-11-18","arxiv_id":"2011.09246","repositories_listed":0,"syntology":null},{"url":null,"slug":"indoor-point-to-point-navigation-with-deep","title":"Indoor Point-to-Point Navigation with Deep Reinforcement Learning and Ultra-wideband","date":"2020-11-18","arxiv_id":"2011.09241","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-via-matching","title":"Inverse Reinforcement Learning via Matching of Optimality Profiles","date":"2020-11-18","arxiv_id":"2011.09264","repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-entropy-modification-for-soft-actor","title":"Weighted Entropy Modification for Soft Actor-Critic","date":"2020-11-18","arxiv_id":"2011.09083","repositories_listed":0,"syntology":null},{"url":null,"slug":"curiosity-based-reinforcement-learning-on","title":"Curiosity Based Reinforcement Learning on Robot Manufacturing Cell","date":"2020-11-17","arxiv_id":"2011.08743","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-stochastic","title":"Deep Reinforcement Learning for Stochastic Computation Offloading in Digital Twin Networks","date":"2020-11-17","arxiv_id":"2011.08430","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-of-reward-functions-in-1","title":"Efficient Exploration of Reward Functions in Inverse Reinforcement Learning via Bayesian Optimization","date":"2020-11-17","arxiv_id":"2011.08541","repositories_listed":0,"syntology":null},{"url":null,"slug":"explaining-conditions-for-reinforcement","title":"Explaining Conditions for Reinforcement Learning Behaviors from Real and Imagined Data","date":"2020-11-17","arxiv_id":"2011.09004","repositories_listed":0,"syntology":null},{"url":null,"slug":"fault-aware-robust-control-via-adversarial","title":"Fault-Aware Robust Control via Adversarial Reinforcement Learning","date":"2020-11-17","arxiv_id":"2011.08728","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-the-variance-of-return-sequences-1","title":"Leveraging the Variance of Return Sequences for Exploration Policy","date":"2020-11-17","arxiv_id":"2011.08649","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning","title":"Multi-agent Reinforcement Learning Accelerated MCMC on Multiscale Inversion Problem","date":"2020-11-17","arxiv_id":"2011.08954","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-graph-neural","title":"Reinforcement Learning of Graph Neural Networks for Service Function Chaining","date":"2020-11-17","arxiv_id":"2011.08406","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeknet-improved-human-instance-segmentation","title":"SeekNet: Improved Human Instance Segmentation and Tracking via Reinforcement Learning Based Optimized Robot Relocation","date":"2020-11-17","arxiv_id":"2011.08682","repositories_listed":0,"syntology":null},{"url":null,"slug":"analog-circuit-design-with-dyna-style","title":"Analog Circuit Design with Dyna-Style Reinforcement Learning","date":"2020-11-16","arxiv_id":"2011.07665","repositories_listed":0,"syntology":null},{"url":null,"slug":"blind-decision-making-reinforcement-learning","title":"Blind Decision Making: Reinforcement Learning with Delayed Observations","date":"2020-11-16","arxiv_id":"2011.07715","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-model-free-reinforcement-learning","title":"Constrained Model-Free Reinforcement Learning for Process Optimization","date":"2020-11-16","arxiv_id":"2011.07925","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-a-hierarchical-policy-for-planning","title":"Distilling a Hierarchical Policy for Planning and Control via Representation and Reinforcement Learning","date":"2020-11-16","arxiv_id":"2011.08345","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-reinforcement-learning-with-value","title":"Value Function Approximations via Kernel Embeddings for No-Regret Reinforcement Learning","date":"2020-11-16","arxiv_id":"2011.07881","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-biased-maximum-likelihood-estimation-1","title":"Reward Biased Maximum Likelihood Estimation for Reinforcement Learning","date":"2020-11-16","arxiv_id":"2011.07738","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-learning-controllable-representations","title":"Towards Learning Controllable Representations of Physical Systems","date":"2020-11-16","arxiv_id":"2011.09906","repositories_listed":0,"syntology":null},{"url":null,"slug":"placement-in-integrated-circuits-using-cyclic","title":"Placement in Integrated Circuits using Cyclic Reinforcement Learning and Simulated Annealing","date":"2020-11-15","arxiv_id":"2011.07577","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-qn-a-reinforcement-learning-framework-for","title":"RL-QN: A Reinforcement Learning Framework for Optimal Control of Queueing Systems","date":"2020-11-14","arxiv_id":"2011.07401","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-human-level-learning-of-complex","title":"Data-Efficient Learning for Complex and Real-Time Physical Problem Solving using Augmented Simulation","date":"2020-11-14","arxiv_id":"2011.07193","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-observing","title":"Active Reinforcement Learning: Observing Rewards at a Cost","date":"2020-11-13","arxiv_id":"2011.06709","repositories_listed":0,"syntology":null},{"url":null,"slug":"critic-pi2-master-continuous-planning-via","title":"Critic PI2: Master Continuous Planning via Policy Improvement with Path Integrals and Deep Actor-Critic Reinforcement Learning","date":"2020-11-13","arxiv_id":"2011.06752","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-of-transition","title":"Deep Reinforcement Learning of Transition States","date":"2020-11-13","arxiv_id":"2011.06700","repositories_listed":0,"syntology":null},{"url":null,"slug":"phoebe-reuse-aware-online-caching-with","title":"Phoebe: Reuse-Aware Online Caching with Reinforcement Learning for Emerging Storage Models","date":"2020-11-13","arxiv_id":"2011.07160","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-control-of-a","title":"Reinforcement Learning Control of a Biomechanical Model of the Upper Extremity","date":"2020-11-13","arxiv_id":"2011.07105","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-control-of-constrained","title":"Reinforcement Learning Control of Constrained Dynamic Systems with Uniformly Ultimate Boundedness Stability Guarantee","date":"2020-11-13","arxiv_id":"2011.06882","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-self-representation-improves","title":"Robotic self-representation improves manipulation skills and transfer learning","date":"2020-11-13","arxiv_id":"2011.06985","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-quadruped-jumping-via-deep","title":"Robust Quadruped Jumping via Deep Reinforcement Learning","date":"2020-11-13","arxiv_id":"2011.07089","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaffolding-reflection-in-reinforcement","title":"Scaffolding Reflection in Reinforcement Learning Framework for Confinement Escape Problem","date":"2020-11-13","arxiv_id":"2011.06764","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for-3","title":"Hierarchical reinforcement learning for efficient exploration and transfer","date":"2020-11-12","arxiv_id":"2011.06335","repositories_listed":0,"syntology":null},{"url":null,"slug":"imposing-robust-structured-control-constraint","title":"Imposing Robust Structured Control Constraint on Reinforcement Learning of Linear Quadratic Regulator","date":"2020-11-12","arxiv_id":"2011.07011","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-reinforcement-learning-for","title":"Self-supervised reinforcement learning for speaker localisation with the iCub humanoid robot","date":"2020-11-12","arxiv_id":"2011.06544","repositories_listed":0,"syntology":null},{"url":null,"slug":"steady-state-analysis-of-episodic-1","title":"Steady State Analysis of Episodic Reinforcement Learning","date":"2020-11-12","arxiv_id":"2011.06631","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-primal-approach-to-constrained-policy-1","title":"CRPO: A New Approach for Safe Reinforcement Learning with Convergence Guarantee","date":"2020-11-11","arxiv_id":"2011.05869","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-neural-architectures-for-recommender","title":"Adaptive Neural Architectures for Recommender Systems","date":"2020-11-11","arxiv_id":"2012.00743","repositories_listed":0,"syntology":null}],"record_sha256":"6392f4f57442957729882f42f50452973a06e179a04047e4123e8525345d1c2f","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}