{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/77","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":77,"pages_in_order":152,"rows_per_page":100,"rows":[7601,7700],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/76","next":"/task/reinforcement-learning-1/papers/78","papers":[{"url":null,"slug":"accelerating-interactive-human-like","title":"Accelerating Interactive Human-like Manipulation Learning with GPU-based Simulation and High-quality Demonstrations","date":"2022-12-05","arxiv_id":"2212.02126","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-offline-reinforcement-learning","title":"Benchmarking Offline Reinforcement Learning Algorithms for E-Commerce Order Fraud Evaluation","date":"2022-12-05","arxiv_id":"2212.02620","repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-level-optimization-augmented-with","title":"Bi-Level Optimization Augmented with Conditional Variational Autoencoder for Autonomous Driving in Dense Traffic","date":"2022-12-05","arxiv_id":"2212.02224","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentiated-federated-reinforcement","title":"Differentiated Federated Reinforcement Learning Based Traffic Offloading on Space-Air-Ground Integrated Networks","date":"2022-12-05","arxiv_id":"2212.02075","repositories_listed":0,"syntology":null},{"url":null,"slug":"e-mapp-efficient-multi-agent-reinforcement","title":"E-MAPP: Efficient Multi-Agent Reinforcement Learning with Parallel Program Guidance","date":"2022-12-05","arxiv_id":"2212.02064","repositories_listed":0,"syntology":null},{"url":null,"slug":"powrl-a-reinforcement-learning-framework-for","title":"PowRL: A Reinforcement Learning Framework for Robust Management of Power Networks","date":"2022-12-05","arxiv_id":"2212.02397","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-shielding-for-reinforcement-learning","title":"Online Shielding for Reinforcement Learning","date":"2022-12-04","arxiv_id":"2212.01861","repositories_listed":0,"syntology":null},{"url":null,"slug":"winning-the-citylearn-challenge-adaptive","title":"Winning the CityLearn Challenge: Adaptive Optimization with Evolutionary Search under Trajectory-based Guidance","date":"2022-12-04","arxiv_id":"2212.01939","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-reinforcement-learning-via","title":"Constrained Reinforcement Learning via Dissipative Saddle Flow Dynamics","date":"2022-12-03","arxiv_id":"2212.01505","repositories_listed":0,"syntology":null},{"url":null,"slug":"dacom-learning-delay-aware-communication-for","title":"DACOM: Learning Delay-Aware Communication for Multi-Agent Reinforcement Learning","date":"2022-12-03","arxiv_id":"2212.01619","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-demonstrations","title":"Reinforcement learning with Demonstrations from Mismatched Task under Sparse Reward","date":"2022-12-03","arxiv_id":"2212.01509","repositories_listed":0,"syntology":null},{"url":null,"slug":"ct-dqn-control-tutored-deep-reinforcement","title":"CT-DQN: Control-Tutored Deep Reinforcement Learning","date":"2022-12-02","arxiv_id":"2212.01343","repositories_listed":0,"syntology":null},{"url":null,"slug":"flow-to-control-offline-reinforcement","title":"Flow to Control: Offline Reinforcement Learning with Lossless Primitive Discovery","date":"2022-12-02","arxiv_id":"2212.01105","repositories_listed":0,"syntology":null},{"url":null,"slug":"fuse-and-adapt-investigating-the-use-of-pre","title":"Fuse and Adapt: Investigating the Use of Pre-Trained Self-Supervising Learning Models in Limited Data NLU problems","date":"2022-12-02","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-energy-and-communication-efficiency","title":"On the Energy and Communication Efficiency Tradeoffs in Federated and Multi-Task Learning","date":"2022-12-02","arxiv_id":"2212.01049","repositories_listed":0,"syntology":null},{"url":null,"slug":"selecting-mechanical-parameters-of-a-monopode","title":"Selecting Mechanical Parameters of a Monopode Jumping System with Reinforcement Learning","date":"2022-12-02","arxiv_id":"2212.01303","repositories_listed":0,"syntology":null},{"url":null,"slug":"utilizing-prior-solutions-for-reward-shaping","title":"Utilizing Prior Solutions for Reward Shaping and Composition in Entropy-Regularized Reinforcement Learning","date":"2022-12-02","arxiv_id":"2212.01174","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-reinforcement-learning-a","title":"Distributed Deep Reinforcement Learning: A Survey and A Multi-Player Multi-Agent Learning Toolbox","date":"2022-12-01","arxiv_id":"2212.00253","repositories_listed":0,"syntology":null},{"url":null,"slug":"five-properties-of-specific-curiosity-you","title":"Five Properties of Specific Curiosity You Didn't Know Curious Machines Should Have","date":"2022-12-01","arxiv_id":"2212.00187","repositories_listed":0,"syntology":null},{"url":null,"slug":"kick-motion-training-with-dqn-in-ai-soccer","title":"Kick-motion Training with DQN in AI Soccer Environment","date":"2022-12-01","arxiv_id":"2212.00389","repositories_listed":0,"syntology":null},{"url":null,"slug":"launchpad-learning-to-schedule-using-offline","title":"Launchpad: Learning to Schedule Using Offline and Online RL Methods","date":"2022-12-01","arxiv_id":"2212.00639","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-mobile-health-users-as-reinforcement","title":"Modeling Mobile Health Users as Reinforcement Learning Agents","date":"2022-12-01","arxiv_id":"2212.00863","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-learning-based-waveform-selection-for","title":"Online Learning-based Waveform Selection for Improved Vehicle Recognition in Automotive Radar","date":"2022-12-01","arxiv_id":"2212.00615","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-function-optimization-of-a-deep","title":"Reward Function Optimization of a Deep Reinforcement Learning Collision Avoidance System","date":"2022-12-01","arxiv_id":"2212.00855","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with","title":"Safe Reinforcement Learning with Probabilistic Control Barrier Functions for Ramp Merging","date":"2022-12-01","arxiv_id":"2212.00618","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-discovery-of-multi-perspective","title":"Automatic Discovery of Multi-perspective Process Model using Reinforcement Learning","date":"2022-11-30","arxiv_id":"2211.16687","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-erl-targeted","title":"Computationally Efficient Reinforcement Learning: Targeted Exploration leveraging Simple Rules","date":"2022-11-30","arxiv_id":"2211.16691","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-localized-policy","title":"Global Convergence of Localized Policy Iteration in Networked Multi-Agent Reinforcement Learning","date":"2022-11-30","arxiv_id":"2211.17116","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-over-general-state-and","title":"Policy Optimization over General State and Action Spaces","date":"2022-11-30","arxiv_id":"2211.16715","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-copolymer-inverse-design-system","title":"Random Copolymer inverse design system orienting on Accurate discovering of Antimicrobial peptide-mimetic copolymers","date":"2022-11-30","arxiv_id":"2212.00023","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-multi-truck","title":"Reinforcement Learning for Multi-Truck Vehicle Routing Problems","date":"2022-11-30","arxiv_id":"2211.17078","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-signal-temporal","title":"Funnel-based Reward Shaping for Signal Temporal Logic Tasks in Reinforcement Learning","date":"2022-11-30","arxiv_id":"2212.03181","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-model-free-reinforcement-learning-using","title":"Safe and Efficient Reinforcement Learning Using Disturbance-Observer-Based Control Barrier Functions","date":"2022-11-30","arxiv_id":"2211.17250","repositories_listed":0,"syntology":null},{"url":null,"slug":"targets-in-reinforcement-learning-to-solve","title":"Targets in Reinforcement Learning to solve Stackelberg Security Games","date":"2022-11-30","arxiv_id":"2211.17132","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximating-martingale-process-for-variance","title":"Approximating Martingale Process for Variance Reduction in Deep Reinforcement Learning with Large State Space","date":"2022-11-29","arxiv_id":"2211.15886","repositories_listed":0,"syntology":null},{"url":null,"slug":"autotuning-pid-control-using-actor-critic","title":"Autotuning PID control using Actor-Critic Deep Reinforcement Learning","date":"2022-11-29","arxiv_id":"2212.00013","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-control-in-real-world-driving","title":"Discrete Control in Real-World Driving Environments using Deep Reinforcement Learning","date":"2022-11-29","arxiv_id":"2211.15920","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-energy-management-and-demand","title":"Distributed Energy Management and Demand Response in Smart Grids: A Multi-Agent Deep Reinforcement Learning Framework","date":"2022-11-29","arxiv_id":"2211.15858","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-understanding-a-disentangled","title":"Learning and Understanding a Disentangled Feature Representation for Hidden Parameters in Reinforcement Learning","date":"2022-11-29","arxiv_id":"2211.16315","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-14","title":"Multi-Agent Reinforcement Learning for Microprocessor Design Space Exploration","date":"2022-11-29","arxiv_id":"2211.16385","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-policy-evaluation-and-optimization","title":"Offline Policy Evaluation and Optimization under Confounding","date":"2022-11-29","arxiv_id":"2211.16583","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-closed","title":"Offline Reinforcement Learning with Closed-Form Policy Improvement Operators","date":"2022-11-29","arxiv_id":"2211.15956","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetry-detection-in-trajectory-data-for","title":"Symmetry Detection in Trajectory Data for More Meaningful Reinforcement Learning Representations","date":"2022-11-29","arxiv_id":"2211.16381","repositories_listed":0,"syntology":null},{"url":null,"slug":"accerl-policy-acceleration-framework-for-deep","title":"AcceRL: Policy Acceleration Framework for Deep Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15023","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-assessment-of-demonstration","title":"Autonomous Assessment of Demonstration Sufficiency via Bayesian Inverse Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15542","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-cage-investigating-generalization-of","title":"Beyond CAGE: Investigating Generalization of Learned Autonomous Network Defense Policies","date":"2022-11-28","arxiv_id":"2211.15557","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-deep-reinforcement-learning-using","title":"Causal Deep Reinforcement Learning Using Observational Data","date":"2022-11-28","arxiv_id":"2211.15355","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-episodic-control","title":"Continuous Episodic Control","date":"2022-11-28","arxiv_id":"2211.15183","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypernetworks-for-zero-shot-transfer-in","title":"Hypernetworks for Zero-shot Transfer in Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15457","repositories_listed":0,"syntology":null},{"url":null,"slug":"inapplicable-actions-learning-for-knowledge","title":"Inapplicable Actions Learning for Knowledge Transfer in Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15589","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-conditional-generative-modeling-all-you","title":"Is Conditional Generative Modeling all you need for Decision-Making?","date":"2022-11-28","arxiv_id":"2211.15657","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-good-trajectories-in-offline","title":"Learning from Good Trajectories in Offline Multi-Agent Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15612","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-q-learning-on-diverse-multi-task-data","title":"Offline Q-Learning on Diverse Multi-Task Data Both Scales And Generalizes","date":"2022-11-28","arxiv_id":"2211.15144","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-aware-proximal-pessimistic-algorithms","title":"State-Aware Proximal Pessimistic Algorithms for Offline Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15065","repositories_listed":0,"syntology":null},{"url":null,"slug":"tackling-visual-control-via-multi-view","title":"Tackling Visual Control via Multi-View Exploration Maximization","date":"2022-11-28","arxiv_id":"2211.15233","repositories_listed":0,"syntology":null},{"url":null,"slug":"combined-peak-reduction-and-self-consumption","title":"Combined Peak Reduction and Self-Consumption Using Proximal Policy Optimization","date":"2022-11-27","arxiv_id":"2211.14831","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-generalization-for-robust-model-based","title":"Domain Generalization for Robust Model-Based Offline Reinforcement Learning","date":"2022-11-27","arxiv_id":"2211.14827","repositories_listed":0,"syntology":null},{"url":null,"slug":"computational-co-design-for-variable-geometry","title":"Computational Co-Design for Variable Geometry Truss","date":"2022-11-26","arxiv_id":"2211.14663","repositories_listed":0,"syntology":null},{"url":null,"slug":"isolation-scheme-for-virtual-network","title":"An Isolation-Aware Online Virtual Network Embedding via Deep Reinforcement Learning","date":"2022-11-25","arxiv_id":"2211.14158","repositories_listed":0,"syntology":null},{"url":null,"slug":"operator-splitting-value-iteration","title":"Operator Splitting Value Iteration","date":"2022-11-25","arxiv_id":"2211.13937","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-improving-proactive-dialog-agents","title":"Improving Proactive Dialog Agents Using Socially-Aware Reinforcement Learning","date":"2022-11-25","arxiv_id":"2211.15359","repositories_listed":0,"syntology":null},{"url":null,"slug":"skills-adaptive-skill-sequencing-for","title":"SkillS: Adaptive Skill Sequencing for Efficient Temporally-Extended Exploration","date":"2022-11-24","arxiv_id":"2211.13743","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-simulation-software-demonstration-for","title":"Software Simulation and Visualization of Quantum Multi-Drone Reinforcement Learning","date":"2022-11-24","arxiv_id":"2211.15375","repositories_listed":0,"syntology":null},{"url":null,"slug":"introspection-based-explainable-reinforcement","title":"Introspection-based Explainable Reinforcement Learning in Episodic and Non-episodic Scenarios","date":"2022-11-23","arxiv_id":"2211.12930","repositories_listed":0,"syntology":null},{"url":null,"slug":"monte-carlo-tree-search-algorithms-for-risk","title":"Monte Carlo Tree Search Algorithms for Risk-Aware and Multi-Objective Reinforcement Learning","date":"2022-11-23","arxiv_id":"2211.13032","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-instance-dependent-bounds-for-offline","title":"On Instance-Dependent Bounds for Offline Reinforcement Learning with Linear Function Approximation","date":"2022-11-23","arxiv_id":"2211.13208","repositories_listed":0,"syntology":null},{"url":null,"slug":"powderworld-a-platform-for-understanding","title":"Powderworld: A Platform for Understanding Generalization via Rich Task Distributions","date":"2022-11-23","arxiv_id":"2211.13051","repositories_listed":0,"syntology":null},{"url":null,"slug":"prototypical-context-aware-dynamics","title":"Prototypical context-aware dynamics generalization for high-dimensional model-based reinforcement learning","date":"2022-11-23","arxiv_id":"2211.12774","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-agent-design-and","title":"Reinforcement Learning Agent Design and Optimization with Bandwidth Allocation Model","date":"2022-11-23","arxiv_id":"2211.12987","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-traffic-signal-1","title":"Reinforcement learning for traffic signal control in hybrid action space","date":"2022-11-23","arxiv_id":"2211.12956","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-for-continuous-action","title":"Representation Learning for Continuous Action Spaces is Beneficial for Efficient Policy Learning","date":"2022-11-23","arxiv_id":"2211.13257","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-5","title":"A Deep Reinforcement Learning Approach to Rare Event Estimation","date":"2022-11-22","arxiv_id":"2211.12470","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-optimize","title":"A Reinforcement Learning Approach to Optimize Available Network Bandwidth Utilization","date":"2022-11-22","arxiv_id":"2211.11949","repositories_listed":0,"syntology":null},{"url":null,"slug":"gitfl-adaptive-asynchronous-federated","title":"GitFL: Adaptive Asynchronous Federated Learning using Version Control","date":"2022-11-22","arxiv_id":"2211.12049","repositories_listed":0,"syntology":null},{"url":null,"slug":"greedy-based-value-representation-for-optimal-1","title":"Greedy based Value Representation for Optimal Coordination in Multi-agent Reinforcement Learning","date":"2022-11-22","arxiv_id":"2211.12075","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-control-and-learning-using-generalized","title":"Safe Control and Learning Using the Generalized Action Governor","date":"2022-11-22","arxiv_id":"2211.12628","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impact-of-moving-expenses-on-social","title":"The impact of moving expenses on social segregation: a simulation with RL and ABM","date":"2022-11-22","arxiv_id":"2211.12475","repositories_listed":0,"syntology":null},{"url":null,"slug":"bbreach-tight-and-scalable-black-box","title":"Taming Reachability Analysis of DNN-Controlled Systems via Abstraction-Based Training","date":"2022-11-21","arxiv_id":"2211.11127","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-offline-decision-making-via","title":"Data-Driven Offline Decision-Making via Invariant Representation Learning","date":"2022-11-21","arxiv_id":"2211.11349","repositories_listed":0,"syntology":null},{"url":null,"slug":"harl-hierarchical-adaptive-reinforcement","title":"HARL: Hierarchical Adaptive Reinforcement Learning Based Auto Scheduler for Neural Networks","date":"2022-11-21","arxiv_id":"2211.11172","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-multimodal-interactive-agents-with","title":"Improving Multimodal Interactive Agents with Reinforcement Learning from Human Feedback","date":"2022-11-21","arxiv_id":"2211.11602","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-td3-bc-relaxed-policy-constraint","title":"Improving TD3-BC: Relaxed Policy Constraint for Offline Learning and Stable Online Fine-Tuning","date":"2022-11-21","arxiv_id":"2211.11802","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-cooperative-oversubscription-for","title":"Learning Cooperative Oversubscription for Cloud by Chance-Constrained Multi-Agent Reinforcement Learning","date":"2022-11-21","arxiv_id":"2211.11759","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-trajectory-stitching-for-improved","title":"Model-based Trajectory Stitching for Improved Offline Reinforcement Learning","date":"2022-11-21","arxiv_id":"2211.11603","repositories_listed":0,"syntology":null},{"url":null,"slug":"physq-a-physics-informed-reinforcement","title":"PhysQ: A Physics Informed Reinforcement Learning Framework for Building Control","date":"2022-11-21","arxiv_id":"2211.11830","repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneously-updating-all-persistence","title":"Simultaneously Updating All Persistence Values in Reinforcement Learning","date":"2022-11-21","arxiv_id":"2211.11620","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-representations-of-object-geometry","title":"Efficient Representations of Object Geometry for Reinforcement Learning of Interactive Grasping Policies","date":"2022-11-20","arxiv_id":"2211.10957","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-local-feature-with-global-visual","title":"Real-time Local Feature with Global Visual Information Enhancement","date":"2022-11-20","arxiv_id":"2211.10981","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-using-data-driven","title":"Safe Reinforcement Learning using Data-Driven Predictive Control","date":"2022-11-20","arxiv_id":"2211.11027","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-enhanced-deep-reinforcement","title":"Structure-Enhanced Deep Reinforcement Learning for Optimal Transmission Scheduling","date":"2022-11-20","arxiv_id":"2211.10827","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-perceived-safety-of-urban-city","title":"Evaluating the Perceived Safety of Urban City via Maximum Entropy Deep Inverse Reinforcement Learning","date":"2022-11-19","arxiv_id":"2211.10660","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-risk-sensitive-reinforcement","title":"Non-stationary Risk-sensitive Reinforcement Learning: Near-optimal Dynamic Regret, Adaptive Detection, and Separation Design","date":"2022-11-19","arxiv_id":"2211.10815","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-reinforcement-learning-schemes","title":"Analysis of Reinforcement Learning Schemes for Trajectory Optimization of an Aerial Radio Unit","date":"2022-11-18","arxiv_id":"2211.10524","repositories_listed":0,"syntology":null},{"url":null,"slug":"credit-cognisant-reinforcement-learning-for","title":"Credit-cognisant reinforcement learning for multi-agent cooperation","date":"2022-11-18","arxiv_id":"2211.10100","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-process","title":"A Reinforcement Learning Approach for Process Parameter Optimization in Additive Manufacturing","date":"2022-11-17","arxiv_id":"2211.09545","repositories_listed":0,"syntology":null},{"url":null,"slug":"alphasnake-policy-iteration-on-a","title":"AlphaSnake: Policy Iteration on a Nondeterministic NP-hard Markov Decision Process","date":"2022-11-17","arxiv_id":"2211.09622","repositories_listed":0,"syntology":null},{"url":null,"slug":"dexpoint-generalizable-point-cloud","title":"DexPoint: Generalizable Point Cloud Reinforcement Learning for Sim-to-Real Dexterous Manipulation","date":"2022-11-17","arxiv_id":"2211.09423","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-communicate-with-intent-an","title":"Learning to Communicate with Intent: An Introduction","date":"2022-11-17","arxiv_id":"2211.09613","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-irregular-object-packing-via","title":"Planning Irregular Object Packing via Hierarchical Reinforcement Learning","date":"2022-11-17","arxiv_id":"2211.09382","repositories_listed":0,"syntology":null},{"url":null,"slug":"solar-power-driven-ev-charging-optimization","title":"Solar Power driven EV Charging Optimization with Deep Reinforcement Learning","date":"2022-11-17","arxiv_id":"2211.09479","repositories_listed":0,"syntology":null}],"record_sha256":"cdc6daf40dae743aa6fea7c740bd5a30e3c0e22c080e73306db217485e4e3b36","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}