{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/77","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":77,"pages_in_order":135,"rows_per_page":100,"rows":[7601,7700],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/76","next":"/task/reinforcement-learning-2/papers/78","papers":[{"url":null,"slug":"categorical-semantics-of-compositional","title":"Categorical semantics of compositional reinforcement learning","date":"2022-08-29","arxiv_id":"2208.13687","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-hardware-security","title":"Reinforcement Learning for Hardware Security: Opportunities, Developments, and Challenges","date":"2022-08-29","arxiv_id":"2208.13885","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-limits-of-poisoning-attacks","title":"Understanding the Limits of Poisoning Attacks in Episodic Reinforcement Learning","date":"2022-08-29","arxiv_id":"2208.13663","repositories_listed":0,"syntology":null},{"url":null,"slug":"normality-guided-distributional-reinforcement","title":"Normality-Guided Distributional Reinforcement Learning for Continuous Control","date":"2022-08-28","arxiv_id":"2208.13125","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approach-to-implement-reinforcement","title":"An approach to implement Reinforcement Learning for Heterogeneous Vehicular Networks","date":"2022-08-26","arxiv_id":"2208.12466","repositories_listed":0,"syntology":null},{"url":null,"slug":"attrition-attacking-static-hardware-trojan","title":"ATTRITION: Attacking Static Hardware Trojan Detection Techniques Using Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.12897","repositories_listed":0,"syntology":null},{"url":null,"slug":"ch-marl-a-multimodal-benchmark-for","title":"CH-MARL: A Multimodal Benchmark for Cooperative, Heterogeneous Multi-Agent Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.13626","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterrent-detecting-trojans-using","title":"DETERRENT: Detecting Trojans using Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.12878","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-deep-reinforcement-learning-for","title":"Exploiting Deep Reinforcement Learning for Edge Caching in Cell-Free Massive MIMO Systems","date":"2022-08-26","arxiv_id":"2208.12453","repositories_listed":0,"syntology":null},{"url":null,"slug":"play-with-emotion-affect-driven-reinforcement","title":"Play with Emotion: Affect-Driven Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.12622","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-multi","title":"Reinforcement Learning based Multi-connectivity Resource Allocation in Factory Automation Systems","date":"2022-08-26","arxiv_id":"2208.12662","repositories_listed":0,"syntology":null},{"url":null,"slug":"socially-fair-reinforcement-learning","title":"Socially Fair Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.12584","repositories_listed":0,"syntology":null},{"url":null,"slug":"symbolic-explanation-of-affinity-based","title":"Symbolic Explanation of Affinity-Based Reinforcement Learning Agents with Markov Models","date":"2022-08-26","arxiv_id":"2208.12627","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-processing-in-context-of-reinforcement","title":"Visual processing in context of reinforcement learning","date":"2022-08-26","arxiv_id":"2208.12525","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-unmanned-aerial-vehicle-navigation","title":"Autonomous Unmanned Aerial Vehicle Navigation using Reinforcement Learning: A Systematic Review","date":"2022-08-25","arxiv_id":"2208.12328","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-task-automata-for-reinforcement","title":"Learning Task Automata for Reinforcement Learning using Hidden Markov Models","date":"2022-08-25","arxiv_id":"2208.11838","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-model-based-approach-to-meta-reinforcement","title":"A model-based approach to meta-Reinforcement Learning: Transformers and tree search","date":"2022-08-24","arxiv_id":"2208.11535","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-based","title":"Hierarchical Reinforcement Learning Based Video Semantic Coding for Segmentation","date":"2022-08-24","arxiv_id":"2208.11529","repositories_listed":0,"syntology":null},{"url":null,"slug":"oracle-free-reinforcement-learning-in-mean","title":"Oracle-free Reinforcement Learning in Mean-Field Games along a Single Sample Path","date":"2022-08-24","arxiv_id":"2208.11639","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-exploration-via-temporal","title":"Self-Supervised Exploration via Temporal Inconsistency in Reinforcement Learning","date":"2022-08-24","arxiv_id":"2208.11361","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-provably-efficient-model-free-posterior-1","title":"A Provably Efficient Model-Free Posterior Sampling Method for Episodic Reinforcement Learning","date":"2022-08-23","arxiv_id":"2208.10904","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-intelligent-algorithmic-trading-based-on-a","title":"An intelligent algorithmic trading based on a risk-return reinforcement learning algorithm","date":"2022-08-23","arxiv_id":"2208.10707","repositories_listed":0,"syntology":null},{"url":null,"slug":"gentus-simulating-user-behaviour-and-language","title":"GenTUS: Simulating User Behaviour and Language in Task-oriented Dialogues with Generative Transformers","date":"2022-08-23","arxiv_id":"2208.10817","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-deep-reinforcement-learning-tells-us","title":"What deep reinforcement learning tells us about human motor learning and vice-versa","date":"2022-08-23","arxiv_id":"2208.10892","repositories_listed":0,"syntology":null},{"url":null,"slug":"barrel-bottleneck-attention-for-adversarial","title":"BARReL: Bottleneck Attention for Adversarial Robustness in Vision-Based Reinforcement Learning","date":"2022-08-22","arxiv_id":"2208.10481","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-multi-agent-meta-reinforcement","title":"Quantum Multi-Agent Meta Reinforcement Learning","date":"2022-08-22","arxiv_id":"2208.11510","repositories_listed":0,"syntology":null},{"url":null,"slug":"some-supervision-required-incorporating","title":"Some Supervision Required: Incorporating Oracle Policies in Reinforcement Learning via Epistemic Uncertainty Metrics","date":"2022-08-22","arxiv_id":"2208.10533","repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-maximum-entropy-inverse","title":"Weighted Maximum Entropy Inverse Reinforcement Learning","date":"2022-08-20","arxiv_id":"2208.09611","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-augmented-reinforcement-learning","title":"Entropy Augmented Reinforcement Learning","date":"2022-08-19","arxiv_id":"2208.09322","repositories_listed":0,"syntology":null},{"url":null,"slug":"spectral-decomposition-representation-for","title":"Spectral Decomposition Representation for Reinforcement Learning","date":"2022-08-19","arxiv_id":"2208.09515","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-uncertainty-for-deep","title":"A Review of Uncertainty for Deep Reinforcement Learning","date":"2022-08-18","arxiv_id":"2208.09052","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-reinforcement-learning-on","title":"Explainable Reinforcement Learning on Financial Stock Trading using SHAP","date":"2022-08-18","arxiv_id":"2208.08790","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-problem-solving-as-integrated","title":"Intelligent problem-solving as integrated hierarchical reinforcement learning","date":"2022-08-18","arxiv_id":"2208.08731","repositories_listed":0,"syntology":null},{"url":null,"slug":"marti-4-new-model-of-human-brain-considering","title":"MARTI-4: new model of human brain, considering neocortex and basal ganglia -- learns to play Atari game by reinforcement learning on a single CPU","date":"2022-08-18","arxiv_id":"2209.02387","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-resource-management-in","title":"Autonomous Resource Management in Construction Companies Using Deep Reinforcement Learning Based on IoT","date":"2022-08-17","arxiv_id":"2208.08087","repositories_listed":0,"syntology":null},{"url":null,"slug":"choquet-regularization-for-reinforcement","title":"Choquet regularization for reinforcement learning","date":"2022-08-17","arxiv_id":"2208.08497","repositories_listed":0,"syntology":null},{"url":null,"slug":"path-planning-of-cleaning-robot-with","title":"Path Planning of Cleaning Robot with Reinforcement Learning","date":"2022-08-17","arxiv_id":"2208.08211","repositories_listed":0,"syntology":null},{"url":null,"slug":"performance-optimization-for-semantic","title":"Performance Optimization for Semantic Communications: An Attention-based Reinforcement Learning Approach","date":"2022-08-17","arxiv_id":"2208.08239","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-based-adaptive","title":"A Deep Reinforcement Learning-based Adaptive Charging Policy for Wireless Rechargeable Sensor Networks","date":"2022-08-16","arxiv_id":"2208.07824","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-end-to-end-learning-of-pole","title":"Data-driven End-to-end Learning of Pole Placement Control for Nonlinear Dynamics via Koopman Invariant Subspaces","date":"2022-08-16","arxiv_id":"2208.08883","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-uav-enabled-secure-offloading-via-deep","title":"Hybrid UAV-enabled Secure Offloading via Deep Reinforcement Learning","date":"2022-08-16","arxiv_id":"2208.07550","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-reinforcement-learning-work-on-swimmer","title":"Making Reinforcement Learning Work on Swimmer","date":"2022-08-16","arxiv_id":"2208.07587","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-to-rank-with-coarse","title":"Reinforcement Learning to Rank with Coarse-grained Labels","date":"2022-08-16","arxiv_id":"2208.07563","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-ris-assisted","title":"Deep Reinforcement Learning for RIS-Assisted FD Systems: Single or Distributed RIS?","date":"2022-08-15","arxiv_id":"2208.07424","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-3d-bin-packing-reinforcement-learning","title":"Online 3D Bin Packing Reinforcement Learning Solution with Buffer","date":"2022-08-15","arxiv_id":"2208.07123","repositories_listed":0,"syntology":null},{"url":null,"slug":"trustworthy-federated-learning-via-blockchain","title":"Trustworthy Federated Learning via Blockchain","date":"2022-08-13","arxiv_id":"2209.04418","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-emission-building-control-with-zero-shot","title":"Low Emission Building Control with Zero-Shot Reinforcement Learning","date":"2022-08-12","arxiv_id":"2208.06385","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlang-a-declarative-language-for-expression","title":"RLang: A Declarative Language for Describing Partial World Knowledge to Reinforcement Learning Agents","date":"2022-08-12","arxiv_id":"2208.06448","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-robust-model-based-offline","title":"Distributionally Robust Model-Based Offline Reinforcement Learning with Near-Optimal Sample Complexity","date":"2022-08-11","arxiv_id":"2208.05767","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-graph-1","title":"Multi-Agent Reinforcement Learning with Graph Convolutional Neural Networks for optimal Bidding Strategies of Generation Units in Electricity Markets","date":"2022-08-11","arxiv_id":"2208.06242","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-dynamic-4","title":"Plug-and-Play Model-Agnostic Counterfactual Policy Synthesis for Deep Reinforcement Learning based Recommendation","date":"2022-08-10","arxiv_id":"2208.05142","repositories_listed":0,"syntology":null},{"url":null,"slug":"attribute-controllable-beautiful-caucasian","title":"Attribute Controllable Beautiful Caucasian Face Generation by Aesthetics Driven Reinforcement Learning","date":"2022-08-09","arxiv_id":"2208.04517","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-trade-off-between-human-driving","title":"Exploring the trade off between human driving imitation and safety for traffic simulation","date":"2022-08-09","arxiv_id":"2208.04803","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsically-motivated-learning-of-causal","title":"Intrinsically Motivated Learning of Causal World Models","date":"2022-08-09","arxiv_id":"2208.04892","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-generative-replay-for-lifelong","title":"Model-Free Generative Replay for Lifelong Reinforcement Learning: Application to Starcraft-2","date":"2022-08-09","arxiv_id":"2208.05056","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-importance-of-critical-period-in-multi","title":"On the Importance of Critical Period in Multi-stage Reinforcement Learning","date":"2022-08-09","arxiv_id":"2208.04832","repositories_listed":0,"syntology":null},{"url":null,"slug":"vehicle-type-specific-waypoint-generation","title":"Vehicle Type Specific Waypoint Generation","date":"2022-08-09","arxiv_id":"2208.04987","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-reinforcement-learning-with-tella","title":"Continual Reinforcement Learning with TELLA","date":"2022-08-08","arxiv_id":"2208.04287","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-based-client-selection-for-federated","title":"Learning-Based Client Selection for Federated Learning Services Over Wireless Networks with Constrained Monetary Budgets","date":"2022-08-08","arxiv_id":"2208.04322","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-scheduling-of-entropy-regulariser-for","title":"Optimal scheduling of entropy regulariser for continuous-time linear-quadratic reinforcement learning","date":"2022-08-08","arxiv_id":"2208.04466","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-game-theoretic-perspective-of","title":"A Game-Theoretic Perspective of Generalization in Reinforcement Learning","date":"2022-08-07","arxiv_id":"2208.03650","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-intent","title":"Multi-agent reinforcement learning for intent-based service assurance in cellular networks","date":"2022-08-07","arxiv_id":"2208.03740","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-reinforcement-learning-for","title":"Compositional Reinforcement Learning for Discrete-Time Stochastic Control Systems","date":"2022-08-06","arxiv_id":"2208.03485","repositories_listed":0,"syntology":null},{"url":null,"slug":"backward-imitation-and-forward-reinforcement","title":"Backward Imitation and Forward Reinforcement Learning via Bi-directional Model Rollouts","date":"2022-08-04","arxiv_id":"2208.02434","repositories_listed":0,"syntology":null},{"url":null,"slug":"dl-drl-a-double-layer-deep-reinforcement","title":"DL-DRL: A double-level deep reinforcement learning approach for large-scale task scheduling of multi-UAV","date":"2022-08-04","arxiv_id":"2208.02447","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-decision-makings-on-curriculum","title":"Human Decision Makings on Curriculum Reinforcement Learning with Difficulty Adjustment","date":"2022-08-04","arxiv_id":"2208.02932","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferable-multi-agent-reinforcement","title":"Transferable Multi-Agent Reinforcement Learning with Dynamic Participating Agents","date":"2022-08-04","arxiv_id":"2208.02424","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-lightweight-transmission-parameter","title":"A Lightweight Transmission Parameter Selection Scheme Using Reinforcement Learning for LoRaWAN","date":"2022-08-03","arxiv_id":"2208.01824","repositories_listed":0,"syntology":null},{"url":null,"slug":"aacc-asymmetric-actor-critic-in-contextual","title":"AACC: Asymmetric Actor-Critic in Contextual Reinforcement Learning","date":"2022-08-03","arxiv_id":"2208.02376","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-vulman-a-deep-reinforcement-learning","title":"Deep VULMAN: A Deep Reinforcement Learning-Enabled Cyber Vulnerability Management Framework","date":"2022-08-03","arxiv_id":"2208.02369","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-sensing-and-communications-for-deep","title":"Joint Sensing and Communications for Deep Reinforcement Learning-based Beam Management in 6G","date":"2022-08-03","arxiv_id":"2208.01880","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-joint-v2i-network","title":"Reinforcement Learning for Joint V2I Network Selection and Autonomous Driving Policies","date":"2022-08-03","arxiv_id":"2208.02249","repositories_listed":0,"syntology":null},{"url":null,"slug":"supervised-and-reinforcement-learning-from","title":"Supervised and Reinforcement Learning from Observations in Reconnaissance Blind Chess","date":"2022-08-03","arxiv_id":"2208.02029","repositories_listed":0,"syntology":null},{"url":null,"slug":"chemotaxis-of-sea-urchin-sperm-cells-through","title":"Chemotaxis of sea urchin sperm cells through deep reinforcement learning","date":"2022-08-02","arxiv_id":"2209.07407","repositories_listed":0,"syntology":null},{"url":null,"slug":"digital-twin-assisted-efficient-reinforcement","title":"Digital Twin-Assisted Efficient Reinforcement Learning for Edge Task Scheduling","date":"2022-08-02","arxiv_id":"2208.01781","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-caching-in-a-data-lake-for-high-energy","title":"Smart caching in a Data Lake for High Energy Physics analysis","date":"2022-08-02","arxiv_id":"2208.06437","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-maintenance-planning-framework-using-online","title":"A Maintenance Planning Framework using Online and Offline Deep Reinforcement Learning","date":"2022-08-01","arxiv_id":"2208.00808","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for-6","title":"Hierarchical Reinforcement Learning for Precise Soccer Shooting Skills using a Quadrupedal Robot","date":"2022-08-01","arxiv_id":"2208.01160","repositories_listed":0,"syntology":null},{"url":null,"slug":"replacing-backpropagation-with-biological","title":"Biologically Plausible Training of Deep Neural Networks Using a Top-down Credit Assignment Network","date":"2022-08-01","arxiv_id":"2208.01416","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-of-surgical-phase-transitions-using","title":"Retrieval of surgical phase transitions using reinforcement learning","date":"2022-08-01","arxiv_id":"2208.00902","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-generate-reliable-broadcast","title":"Learning to generate Reliable Broadcast Algorithms","date":"2022-07-31","arxiv_id":"2208.00525","repositories_listed":0,"syntology":null},{"url":null,"slug":"robot-policy-learning-from-demonstration","title":"Robot Policy Learning from Demonstration Using Advantage Weighting and Early Termination","date":"2022-07-31","arxiv_id":"2208.00478","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-chatbots-to-teach-languages","title":"Using Chatbots to Teach Languages","date":"2022-07-31","arxiv_id":"2208.00376","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bayesian-approach-to-learning-bandit","title":"A Bayesian Approach to Learning Bandit Structure in Markov Decision Processes","date":"2022-07-30","arxiv_id":"2208.00250","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-experience-replay","title":"Reinforcement learning with experience replay and adaptation of action dispersion","date":"2022-07-30","arxiv_id":"2208.00156","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-the-vehicle-routing-problem-with-deep","title":"Solving the vehicle routing problem with deep reinforcement learning","date":"2022-07-30","arxiv_id":"2208.00202","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-system-on","title":"Deep Reinforcement Learning for System-on-Chip: Myths and Realities","date":"2022-07-29","arxiv_id":"2207.14595","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-with-successor","title":"Meta Reinforcement Learning with Successor Feature Based Context","date":"2022-07-29","arxiv_id":"2207.14723","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-from-diverse","title":"Graph Inverse Reinforcement Learning from Diverse Videos","date":"2022-07-28","arxiv_id":"2207.14299","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-properties-of-lifelong-learning","title":"Latent Properties of Lifelong Learning Systems","date":"2022-07-28","arxiv_id":"2207.14378","repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-a-2d-game-indefinitely-using-neat-and","title":"Playing a 2D Game Indefinitely using NEAT and Reinforcement Learning","date":"2022-07-28","arxiv_id":"2207.14140","repositories_listed":0,"syntology":null},{"url":null,"slug":"raising-student-completion-rates-with","title":"Raising Student Completion Rates with Adaptive Curriculum and Contextual Bandits","date":"2022-07-28","arxiv_id":"2207.14003","repositories_listed":0,"syntology":null},{"url":null,"slug":"rangl-a-reinforcement-learning-competition","title":"RangL: A Reinforcement Learning Competition Platform","date":"2022-07-28","arxiv_id":"2208.00003","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-contact-safe-reinforcement-learning","title":"A Contact-Safe Reinforcement Learning Framework for Contact-Rich Robot Manipulation","date":"2022-07-27","arxiv_id":"2207.13438","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-actor-critic-ensemble-for","title":"Distributional Actor-Critic Ensemble for Uncertainty-Aware Continuous Control","date":"2022-07-27","arxiv_id":"2207.13730","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-shielding-for-reinforcement-learning","title":"Dynamic Shielding for Reinforcement Learning in Black-Box Environments","date":"2022-07-27","arxiv_id":"2207.13446","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-provisioning-of-network","title":"Multi-Objective Provisioning of Network Slices using Deep Reinforcement Learning","date":"2022-07-27","arxiv_id":"2207.13821","repositories_listed":0,"syntology":null},{"url":null,"slug":"poset-rl-phase-ordering-for-optimizing-size","title":"POSET-RL: Phase ordering for Optimizing Size and Execution Time using Reinforcement Learning","date":"2022-07-27","arxiv_id":"2208.04238","repositories_listed":0,"syntology":null},{"url":null,"slug":"structural-similarity-for-improved-transfer","title":"Structural Similarity for Improved Transfer in Reinforcement Learning","date":"2022-07-27","arxiv_id":"2207.13813","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-training-for-neural-tsp-solver","title":"Unsupervised Training for Neural TSP Solver","date":"2022-07-27","arxiv_id":"2207.13667","repositories_listed":0,"syntology":null}],"record_sha256":"40d3cad874e00c45ecdff5419046833188e9fbda4b1448d35f9ba1c50471c55d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}