{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/71","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":71,"pages_in_order":132,"rows_per_page":100,"rows":[7001,7100],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/70","next":"/task/reinforcement-learning/papers/72","papers":[{"url":null,"slug":"reinforcement-learning-in-computing-and","title":"Reinforcement Learning in Computing and Network Convergence Orchestration","date":"2022-09-22","arxiv_id":"2209.10753","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-look-ahead-economic-dispatch","title":"Evaluation of Look-ahead Economic Dispatch Using Reinforcement Learning","date":"2022-09-21","arxiv_id":"2209.10207","repositories_listed":0,"syntology":null},{"url":null,"slug":"lamarckian-platform-pushing-the-boundaries-of","title":"Lamarckian Platform: Pushing the Boundaries of Evolutionary Reinforcement Learning towards Asynchronous Commercial Games","date":"2022-09-21","arxiv_id":"2209.10055","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-symmetry-meta-reinforcement","title":"Learning from Symmetry: Meta-Reinforcement Learning with Symmetrical Behaviors and Language Instructions","date":"2022-09-21","arxiv_id":"2209.10656","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-for-asset","title":"Model-Free Reinforcement Learning for Asset Allocation","date":"2022-09-21","arxiv_id":"2209.10458","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-actor-critic-for-multi-agent","title":"Asynchronous Actor-Critic for Multi-Agent Reinforcement Learning","date":"2022-09-20","arxiv_id":"2209.10113","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-network-for-ai-soccer","title":"Deep Q-Network for AI Soccer","date":"2022-09-20","arxiv_id":"2209.09491","repositories_listed":0,"syntology":null},{"url":null,"slug":"locally-constrained-representations-in","title":"Locally Constrained Representations in Reinforcement Learning","date":"2022-09-20","arxiv_id":"2209.09441","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-crop-management-with-reinforcement","title":"Optimizing Crop Management with Reinforcement Learning and Imitation Learning","date":"2022-09-20","arxiv_id":"2209.09991","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-action-priors-towards-robust-policy","title":"Soft Action Priors: Towards Robust Policy Transfer","date":"2022-09-20","arxiv_id":"2209.09882","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-task-prioritized-policy-composition","title":"Towards Task-Prioritized Policy Composition","date":"2022-09-20","arxiv_id":"2209.09536","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-adaptive-3","title":"Meta-Reinforcement Learning for Adaptive Control of Second Order Systems","date":"2022-09-19","arxiv_id":"2209.09301","repositories_listed":0,"syntology":null},{"url":null,"slug":"msviper-improved-policy-distillation-for","title":"MSVIPER: Improved Policy Distillation for Reinforcement-Learning-Based Robot Navigation","date":"2022-09-19","arxiv_id":"2209.09079","repositories_listed":0,"syntology":null},{"url":null,"slug":"rewarding-episodic-visitation-discrepancy-for","title":"Rewarding Episodic Visitation Discrepancy for Exploration in Reinforcement Learning","date":"2022-09-19","arxiv_id":"2209.08842","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-knowledge-for-reinforcement","title":"Transferring Knowledge for Reinforcement Learning in Contact-Rich Manipulation","date":"2022-09-19","arxiv_id":"2210.02891","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-deep-reinforcement-learning","title":"Evolutionary Deep Reinforcement Learning Using Elite Buffer: A Novel Approach Towards DRL Combined with EA in Continuous Control Tasks","date":"2022-09-18","arxiv_id":"2209.08480","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-level-explanation-of-deep-reinforcement","title":"Multi-level Explanation of Deep Reinforcement Learning-based Scheduling","date":"2022-09-18","arxiv_id":"2209.09645","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsically-motivated-reinforcement-2","title":"Intrinsically Motivated Reinforcement Learning based Recommendation with Counterfactual Data Augmentation","date":"2022-09-17","arxiv_id":"2209.08228","repositories_listed":0,"syntology":null},{"url":null,"slug":"sub-optimal-policy-aided-multi-agent","title":"Sub-optimal Policy Aided Multi-Agent Reinforcement Learning for Flocking Control","date":"2022-09-17","arxiv_id":"2209.08347","repositories_listed":0,"syntology":null},{"url":null,"slug":"conservative-dual-policy-optimization-for","title":"Conservative Dual Policy Optimization for Efficient Model-Based Reinforcement Learning","date":"2022-09-16","arxiv_id":"2209.07676","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuromuscular-reinforcement-learning-to","title":"Neuromuscular Reinforcement Learning to Actuate Human Limbs through FES","date":"2022-09-16","arxiv_id":"2209.07849","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-industrial-hvac-systems-with","title":"Optimizing Industrial HVAC Systems with Hierarchical Reinforcement Learning","date":"2022-09-16","arxiv_id":"2209.08112","repositories_listed":0,"syntology":null},{"url":null,"slug":"trustworthy-reinforcement-learning-against","title":"Trustworthy Reinforcement Learning Against Intrinsic Vulnerabilities: Robustness, Safety, and Generalizability","date":"2022-09-16","arxiv_id":"2209.08025","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-offline-reinforcement-learning-help","title":"Can Offline Reinforcement Learning Help Natural Language Understanding?","date":"2022-09-15","arxiv_id":"2212.03864","repositories_listed":0,"syntology":null},{"url":null,"slug":"proapt-projection-of-apt-threats-with-deep","title":"ProAPT: Projection of APT Threats with Deep Reinforcement Learning","date":"2022-09-15","arxiv_id":"2209.07215","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-task-driven-robotic-swarm-control","title":"Scalable Task-Driven Robotic Swarm Control via Collision Avoidance and Learning Mean-Field Control","date":"2022-09-15","arxiv_id":"2209.07420","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-reinforcement-learning-for","title":"Analysis of Reinforcement Learning for determining task replication in workflows","date":"2022-09-14","arxiv_id":"2209.13531","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-robust-offline-reinforcement","title":"Distributionally Robust Offline Reinforcement Learning with Linear Function Approximation","date":"2022-09-14","arxiv_id":"2209.06620","repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-rich-long-term-bitcoin-trading","title":"Feature-Rich Long-term Bitcoin Trading Assistant","date":"2022-09-14","arxiv_id":"2209.12664","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-constrained-reinforcement-learning","title":"Robust Constrained Reinforcement Learning","date":"2022-09-14","arxiv_id":"2209.06866","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-reinforcement-learning-framework-to","title":"A new Reinforcement Learning framework to discover natural flavor molecules","date":"2022-09-13","arxiv_id":"2209.05859","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-biological-sequences-via-meta","title":"Designing Biological Sequences via Meta-Reinforcement Learning and Bayesian Optimization","date":"2022-09-13","arxiv_id":"2209.06259","repositories_listed":0,"syntology":null},{"url":null,"slug":"checklist-models-for-improved-output-fluency","title":"Checklist Models for Improved Output Fluency in Piano Fingering Prediction","date":"2022-09-12","arxiv_id":"2209.05622","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-sequencing-of-exploration-and","title":"Deterministic Sequencing of Exploration and Exploitation for Reinforcement Learning","date":"2022-09-12","arxiv_id":"2209.05408","repositories_listed":0,"syntology":null},{"url":null,"slug":"performance-driven-controller-tuning-via","title":"Performance-Driven Controller Tuning via Derivative-Free Reinforcement Learning","date":"2022-09-11","arxiv_id":"2209.04854","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperation-and-competition-flocking-with","title":"Cooperation and Competition: Flocking with Evolutionary Multi-Agent Reinforcement Learning","date":"2022-09-10","arxiv_id":"2209.04696","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with-contrastive","title":"Safe Reinforcement Learning with Contrastive Risk Prediction","date":"2022-09-10","arxiv_id":"2209.09648","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-large-population-systems-and","title":"A Survey on Large-Population Systems and Scalable Multi-Agent Reinforcement Learning","date":"2022-09-08","arxiv_id":"2209.03859","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-supervised-and-reinforcement-learning","title":"Hybrid Supervised and Reinforcement Learning for the Design and Optimization of Nanophotonic Structures","date":"2022-09-08","arxiv_id":"2209.04447","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-strategy-for","title":"A Deep Reinforcement Learning Strategy for UAV Autonomous Landing on a Platform","date":"2022-09-07","arxiv_id":"2209.02954","repositories_listed":0,"syntology":null},{"url":null,"slug":"concept-modulated-model-based-offline","title":"Concept-modulated model-based offline reinforcement learning for rapid generalization","date":"2022-09-07","arxiv_id":"2209.03207","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-deep-rl-models-into-interpretable","title":"Distilling Deep RL Models Into Interpretable Neuro-Fuzzy Systems","date":"2022-09-07","arxiv_id":"2209.03357","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-error-bounds-for-greedy-gq","title":"Finite-Time Error Bounds for Greedy-GQ","date":"2022-09-06","arxiv_id":"2209.02555","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-assistive-robotics-with-deep","title":"Improving Assistive Robotics with Deep Reinforcement Learning","date":"2022-09-05","arxiv_id":"2209.02160","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-policy-gradients-in-reinforcement","title":"Natural Policy Gradients In Reinforcement Learning Explained","date":"2022-09-05","arxiv_id":"2209.01820","repositories_listed":0,"syntology":null},{"url":null,"slug":"prediction-based-decision-making-for","title":"Prediction Based Decision Making for Autonomous Highway Driving","date":"2022-09-05","arxiv_id":"2209.02106","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-optimised","title":"Reinforcement learning-based optimised control for tracking of nonlinear systems with adversarial attacks","date":"2022-09-05","arxiv_id":"2209.02165","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-inference-for-model-free-and","title":"Variational Inference for Model-Free and Model-Based Reinforcement Learning","date":"2022-09-04","arxiv_id":"2209.01693","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-deep-reinforcement-learning-in","title":"Model-Free Deep Reinforcement Learning in Software-Defined Networks","date":"2022-09-03","arxiv_id":"2209.01490","repositories_listed":0,"syntology":null},{"url":null,"slug":"dialogue-evaluation-with-offline","title":"Dialogue Evaluation with Offline Reinforcement Learning","date":"2022-09-02","arxiv_id":"2209.00876","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-practical-communication-strategies","title":"Learning Practical Communication Strategies in Cooperative Multi-Agent Reinforcement Learning","date":"2022-09-02","arxiv_id":"2209.01288","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-centralised-multi-agent-reinforcement","title":"Taming Multi-Agent Reinforcement Learning with Estimator Variance Reduction","date":"2022-09-02","arxiv_id":"2209.01054","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-quantum-1","title":"Deep reinforcement learning for quantum multiparameter estimation","date":"2022-09-01","arxiv_id":"2209.00671","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamics-adaptive-continual-reinforcement","title":"Dynamics-Adaptive Continual Reinforcement Learning via Progressive Contextualization","date":"2022-09-01","arxiv_id":"2209.00347","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-stabilizing-reinforcement-learning-approach","title":"A stabilizing reinforcement learning approach for sampled systems with partially unknown models","date":"2022-08-31","arxiv_id":"2208.14714","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-anomaly-detection-and-search-via","title":"Deep Anomaly Detection and Search via Reinforcement Learning","date":"2022-08-31","arxiv_id":"2208.14834","repositories_listed":0,"syntology":null},{"url":null,"slug":"transmit-power-control-for-indoor-small-cells","title":"Transmit Power Control for Indoor Small Cells: A Method Based on Federated Reinforcement Learning","date":"2022-08-31","arxiv_id":"2209.13536","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-further-exploration-of-deep-multi-agent","title":"A further exploration of deep Multi-Agent Reinforcement Learning with Hybrid Action Space","date":"2022-08-30","arxiv_id":"2208.14447","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-abstracted-model-based-1","title":"An Analysis of Model-Based Reinforcement Learning From Abstracted Observations","date":"2022-08-30","arxiv_id":"2208.14407","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-ensembles-of-reinforcement","title":"Distributed Ensembles of Reinforcement Learning Agents for Electricity Control","date":"2022-08-30","arxiv_id":"2208.14338","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-with-sindy","title":"Model-Based Reinforcement Learning with SINDy","date":"2022-08-30","arxiv_id":"2208.14501","repositories_listed":0,"syntology":null},{"url":null,"slug":"categorical-semantics-of-compositional","title":"Categorical semantics of compositional reinforcement learning","date":"2022-08-29","arxiv_id":"2208.13687","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-hardware-security","title":"Reinforcement Learning for Hardware Security: Opportunities, Developments, and Challenges","date":"2022-08-29","arxiv_id":"2208.13885","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-limits-of-poisoning-attacks","title":"Understanding the Limits of Poisoning Attacks in Episodic Reinforcement Learning","date":"2022-08-29","arxiv_id":"2208.13663","repositories_listed":0,"syntology":null},{"url":null,"slug":"normality-guided-distributional-reinforcement","title":"Normality-Guided Distributional Reinforcement Learning for Continuous Control","date":"2022-08-28","arxiv_id":"2208.13125","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approach-to-implement-reinforcement","title":"An approach to implement Reinforcement Learning for Heterogeneous Vehicular Networks","date":"2022-08-26","arxiv_id":"2208.12466","repositories_listed":0,"syntology":null},{"url":null,"slug":"attrition-attacking-static-hardware-trojan","title":"ATTRITION: Attacking Static Hardware Trojan Detection Techniques Using Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.12897","repositories_listed":0,"syntology":null},{"url":null,"slug":"ch-marl-a-multimodal-benchmark-for","title":"CH-MARL: A Multimodal Benchmark for Cooperative, Heterogeneous Multi-Agent Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.13626","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterrent-detecting-trojans-using","title":"DETERRENT: Detecting Trojans using Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.12878","repositories_listed":0,"syntology":null},{"url":null,"slug":"play-with-emotion-affect-driven-reinforcement","title":"Play with Emotion: Affect-Driven Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.12622","repositories_listed":0,"syntology":null},{"url":null,"slug":"socially-fair-reinforcement-learning","title":"Socially Fair Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.12584","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-processing-in-context-of-reinforcement","title":"Visual processing in context of reinforcement learning","date":"2022-08-26","arxiv_id":"2208.12525","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-task-automata-for-reinforcement","title":"Learning Task Automata for Reinforcement Learning using Hidden Markov Models","date":"2022-08-25","arxiv_id":"2208.11838","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-based","title":"Hierarchical Reinforcement Learning Based Video Semantic Coding for Segmentation","date":"2022-08-24","arxiv_id":"2208.11529","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-exploration-via-temporal","title":"Self-Supervised Exploration via Temporal Inconsistency in Reinforcement Learning","date":"2022-08-24","arxiv_id":"2208.11361","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-provably-efficient-model-free-posterior-1","title":"A Provably Efficient Model-Free Posterior Sampling Method for Episodic Reinforcement Learning","date":"2022-08-23","arxiv_id":"2208.10904","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-intelligent-algorithmic-trading-based-on-a","title":"An intelligent algorithmic trading based on a risk-return reinforcement learning algorithm","date":"2022-08-23","arxiv_id":"2208.10707","repositories_listed":0,"syntology":null},{"url":null,"slug":"gentus-simulating-user-behaviour-and-language","title":"GenTUS: Simulating User Behaviour and Language in Task-oriented Dialogues with Generative Transformers","date":"2022-08-23","arxiv_id":"2208.10817","repositories_listed":0,"syntology":null},{"url":null,"slug":"barrel-bottleneck-attention-for-adversarial","title":"BARReL: Bottleneck Attention for Adversarial Robustness in Vision-Based Reinforcement Learning","date":"2022-08-22","arxiv_id":"2208.10481","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-multi-agent-meta-reinforcement","title":"Quantum Multi-Agent Meta Reinforcement Learning","date":"2022-08-22","arxiv_id":"2208.11510","repositories_listed":0,"syntology":null},{"url":null,"slug":"some-supervision-required-incorporating","title":"Some Supervision Required: Incorporating Oracle Policies in Reinforcement Learning via Epistemic Uncertainty Metrics","date":"2022-08-22","arxiv_id":"2208.10533","repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-maximum-entropy-inverse","title":"Weighted Maximum Entropy Inverse Reinforcement Learning","date":"2022-08-20","arxiv_id":"2208.09611","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-augmented-reinforcement-learning","title":"Entropy Augmented Reinforcement Learning","date":"2022-08-19","arxiv_id":"2208.09322","repositories_listed":0,"syntology":null},{"url":null,"slug":"spectral-decomposition-representation-for","title":"Spectral Decomposition Representation for Reinforcement Learning","date":"2022-08-19","arxiv_id":"2208.09515","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-uncertainty-for-deep","title":"A Review of Uncertainty for Deep Reinforcement Learning","date":"2022-08-18","arxiv_id":"2208.09052","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-reinforcement-learning-on","title":"Explainable Reinforcement Learning on Financial Stock Trading using SHAP","date":"2022-08-18","arxiv_id":"2208.08790","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-problem-solving-as-integrated","title":"Intelligent problem-solving as integrated hierarchical reinforcement learning","date":"2022-08-18","arxiv_id":"2208.08731","repositories_listed":0,"syntology":null},{"url":null,"slug":"choquet-regularization-for-reinforcement","title":"Choquet regularization for reinforcement learning","date":"2022-08-17","arxiv_id":"2208.08497","repositories_listed":0,"syntology":null},{"url":null,"slug":"path-planning-of-cleaning-robot-with","title":"Path Planning of Cleaning Robot with Reinforcement Learning","date":"2022-08-17","arxiv_id":"2208.08211","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-based-adaptive","title":"A Deep Reinforcement Learning-based Adaptive Charging Policy for Wireless Rechargeable Sensor Networks","date":"2022-08-16","arxiv_id":"2208.07824","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-end-to-end-learning-of-pole","title":"Data-driven End-to-end Learning of Pole Placement Control for Nonlinear Dynamics via Koopman Invariant Subspaces","date":"2022-08-16","arxiv_id":"2208.08883","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-uav-enabled-secure-offloading-via-deep","title":"Hybrid UAV-enabled Secure Offloading via Deep Reinforcement Learning","date":"2022-08-16","arxiv_id":"2208.07550","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-reinforcement-learning-work-on-swimmer","title":"Making Reinforcement Learning Work on Swimmer","date":"2022-08-16","arxiv_id":"2208.07587","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-to-rank-with-coarse","title":"Reinforcement Learning to Rank with Coarse-grained Labels","date":"2022-08-16","arxiv_id":"2208.07563","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-3d-bin-packing-reinforcement-learning","title":"Online 3D Bin Packing Reinforcement Learning Solution with Buffer","date":"2022-08-15","arxiv_id":"2208.07123","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-emission-building-control-with-zero-shot","title":"Low Emission Building Control with Zero-Shot Reinforcement Learning","date":"2022-08-12","arxiv_id":"2208.06385","repositories_listed":0,"syntology":null},{"url":null,"slug":"attribute-controllable-beautiful-caucasian","title":"Attribute Controllable Beautiful Caucasian Face Generation by Aesthetics Driven Reinforcement Learning","date":"2022-08-09","arxiv_id":"2208.04517","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-trade-off-between-human-driving","title":"Exploring the trade off between human driving imitation and safety for traffic simulation","date":"2022-08-09","arxiv_id":"2208.04803","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-reinforcement-learning-with-tella","title":"Continual Reinforcement Learning with TELLA","date":"2022-08-08","arxiv_id":"2208.04287","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-game-theoretic-perspective-of","title":"A Game-Theoretic Perspective of Generalization in Reinforcement Learning","date":"2022-08-07","arxiv_id":"2208.03650","repositories_listed":0,"syntology":null}],"record_sha256":"203e582bf8420d16cf96b1eda24a4c19b3beedfae7ecb2f69a655bc5fd74f5a7","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}