{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/84","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":84,"pages_in_order":135,"rows_per_page":100,"rows":[8301,8400],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/83","next":"/task/reinforcement-learning-2/papers/85","papers":[{"url":null,"slug":"sample-efficient-reinforcement-learning-with-3","title":"Sample-Efficient Reinforcement Learning with loglog(T) Switching Cost","date":"2022-02-13","arxiv_id":"2202.06385","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-reinforcement-learning-of-robotic","title":"End-to-end Reinforcement Learning of Robotic Manipulation with Robust Keypoints Representation","date":"2022-02-12","arxiv_id":"2202.06027","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-nid-rules","title":"Neural NID Rules","date":"2022-02-12","arxiv_id":"2202.06036","repositories_listed":0,"syntology":null},{"url":null,"slug":"computational-statistical-gaps-in","title":"Computational-Statistical Gaps in Reinforcement Learning","date":"2022-02-11","arxiv_id":"2202.05444","repositories_listed":0,"syntology":null},{"url":null,"slug":"rate-matching-the-regret-lower-bound-in-the","title":"Rate-matching the regret lower-bound in the linear quadratic regulator with unknown dynamics","date":"2022-02-11","arxiv_id":"2202.05799","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-q-learning","title":"Regularized Q-learning","date":"2022-02-11","arxiv_id":"2202.05404","repositories_listed":0,"syntology":null},{"url":null,"slug":"abstraction-for-deep-reinforcement-learning","title":"Abstraction for Deep Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.05839","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-based-robust-resource-allocation-in-end-to","title":"AI-based Robust Resource Allocation in End-to-End Network Slicing under Demand and CSI Uncertainties","date":"2022-02-10","arxiv_id":"2202.05131","repositories_listed":0,"syntology":null},{"url":null,"slug":"dda3c-cooperative-distributed-deep","title":"Group-Agent Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.05135","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-pipelines-with-evolutionarily","title":"Interpretable pipelines with evolutionarily optimized modules for RL tasks with visual inputs","date":"2022-02-10","arxiv_id":"2202.04943","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-the-wild-scalable","title":"Reinforcement Learning in the Wild: Scalable RL Dispatching Algorithm Deployed in Ridehailing Marketplace","date":"2022-02-10","arxiv_id":"2202.05118","repositories_listed":0,"syntology":null},{"url":null,"slug":"safer-data-efficient-and-safe-reinforcement-1","title":"SAFER: Data-Efficient and Safe Reinforcement Learning via Skill Acquisition","date":"2022-02-10","arxiv_id":"2202.04849","repositories_listed":0,"syntology":null},{"url":null,"slug":"settling-the-communication-complexity-for","title":"Settling the Communication Complexity for Distributed Offline Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.04862","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-value-decomposition-algorithms","title":"Understanding Value Decomposition Algorithms in Deep Cooperative Multi-Agent Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.04868","repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-learning-waveform-selection","title":"Universal Learning Waveform Selection Strategies for Adaptive Target Tracking","date":"2022-02-10","arxiv_id":"2202.05294","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-2","title":"Offline Reinforcement Learning with Realizability and Single-policy Concentrability","date":"2022-02-09","arxiv_id":"2202.04634","repositories_listed":0,"syntology":null},{"url":null,"slug":"scenario-assisted-deep-reinforcement-learning","title":"Scenario-Assisted Deep Reinforcement Learning","date":"2022-02-09","arxiv_id":"2202.04337","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdoor-detection-in-reinforcement-learning","title":"PolicyCleanse: Backdoor Detection and Mitigation in Reinforcement Learning","date":"2022-02-08","arxiv_id":"2202.03609","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-explanations-for-reinforcement-learning","title":"Local Explanations for Reinforcement Learning","date":"2022-02-08","arxiv_id":"2202.03597","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-reinforcement-learning-with-a-short","title":"Provable Reinforcement Learning with a Short-Term Memory","date":"2022-02-08","arxiv_id":"2202.03983","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-deep-and-reinforcement-learning-for","title":"Robust, Deep, and Reinforcement Learning for Management of Communication and Power Networks","date":"2022-02-08","arxiv_id":"2202.05395","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-robustness-of-cooperative-marl-a","title":"Attacking c-MARL More Effectively: A Data Driven Approach","date":"2022-02-07","arxiv_id":"2202.03558","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-offline-meta-reinforcement-1","title":"Model-Based Offline Meta-Reinforcement Learning with Regularization","date":"2022-02-07","arxiv_id":"2202.02929","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-for-stochastic-shortest","title":"Policy Optimization for Stochastic Shortest Path","date":"2022-02-07","arxiv_id":"2202.03334","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-respecting-subtasks-for-model-based","title":"Reward-Respecting Subtasks for Model-Based Reinforcement Learning","date":"2022-02-07","arxiv_id":"2202.03466","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-with-multi-sample-target-values","title":"Exploration with Multi-Sample Target Values for Distributional Reinforcement Learning","date":"2022-02-06","arxiv_id":"2202.02693","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-gradient-descent-with-dependent","title":"Stochastic Gradient Descent with Dependent Data for Offline Reinforcement Learning","date":"2022-02-06","arxiv_id":"2202.02850","repositories_listed":0,"syntology":null},{"url":null,"slug":"asha-assistive-teleoperation-via-human-in-the","title":"ASHA: Assistive Teleoperation via Human-in-the-Loop Reinforcement Learning","date":"2022-02-05","arxiv_id":"2202.02465","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-discourse-on-metods-meta-optimized","title":"Meta-Reinforcement Learning with Self-Modifying Networks","date":"2022-02-04","arxiv_id":"2202.02363","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-framework-for-pqos","title":"A Reinforcement Learning Framework for PQoS in a Teleoperated Driving Scenario","date":"2022-02-04","arxiv_id":"2202.01949","repositories_listed":0,"syntology":null},{"url":null,"slug":"malleable-agents-for-re-configurable-robotic","title":"Malleable Agents for Re-Configurable Robotic Manipulators","date":"2022-02-04","arxiv_id":"2202.02395","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-for-3","title":"Model-Free Reinforcement Learning for Symbolic Automata-encoded Objectives","date":"2022-02-04","arxiv_id":"2202.02404","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-mobile","title":"Offline Reinforcement Learning for Mobile Notifications","date":"2022-02-04","arxiv_id":"2202.03867","repositories_listed":0,"syntology":null},{"url":"/paper/video-violence-recognition-and-localization","slug":"video-violence-recognition-and-localization","title":"Video Violence Recognition and Localization Using a Semi-Supervised Hard Attention Model","date":"2022-02-04","arxiv_id":"2202.02212","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-as-a-service-toolkit-for-human-centered","title":"AI-as-a-Service Toolkit for Human-Centered Intelligence in Autonomous Driving","date":"2022-02-03","arxiv_id":"2202.01645","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenging-common-assumptions-in-convex","title":"Challenging Common Assumptions in Convex Reinforcement Learning","date":"2022-02-03","arxiv_id":"2202.01511","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-assisted","title":"Deep Reinforcement Learning Assisted Federated Learning Algorithm for Data Management of IIoT","date":"2022-02-03","arxiv_id":"2202.03575","repositories_listed":0,"syntology":null},{"url":null,"slug":"financial-vision-based-reinforcement-learning","title":"Financial Vision Based Reinforcement Learning Trading Strategy","date":"2022-02-03","arxiv_id":"2202.04115","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-leverage-unlabeled-data-in-offline","title":"How to Leverage Unlabeled Data in Offline Reinforcement Learning","date":"2022-02-03","arxiv_id":"2202.01741","repositories_listed":0,"syntology":null},{"url":null,"slug":"network-resource-allocation-strategy-based-on","title":"Network Resource Allocation Strategy Based on Deep Reinforcement Learning","date":"2022-02-03","arxiv_id":"2202.03193","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-is-not-enough-can-we-liberate-ai-from","title":"Reward is not enough: can we liberate AI from the reinforcement learning paradigm?","date":"2022-02-03","arxiv_id":"2202.03192","repositories_listed":0,"syntology":null},{"url":null,"slug":"security-aware-virtual-network-embedding","title":"Security-Aware Virtual Network Embedding Algorithm based on Reinforcement Learning","date":"2022-02-03","arxiv_id":"2202.02452","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-discrete-communication-bottlenecks","title":"Adaptive Discrete Communication Bottlenecks with Dynamic Vector Quantization","date":"2022-02-02","arxiv_id":"2202.01334","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-reinforcement-learning-for","title":"Federated Reinforcement Learning for Collective Navigation of Robotic Swarms","date":"2022-02-02","arxiv_id":"2202.01141","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-in-reinforcement-learning-via-regret","title":"Transfer in Reinforcement Learning via Regret Bounds for Learning Agents","date":"2022-02-02","arxiv_id":"2202.01182","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-sample-efficiency-of-value-based","title":"Improving Sample Efficiency of Value Based Models Using Attention and Vision Transformers","date":"2022-02-01","arxiv_id":"2202.00710","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-optimal-active","title":"Reinforcement learning of optimal active particle navigation","date":"2022-02-01","arxiv_id":"2202.00812","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-fragment-based-3d-molecular-design","title":"Scalable Fragment-Based 3D Molecular Design with Reinforcement Learning","date":"2022-02-01","arxiv_id":"2202.00658","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-search-with-off-policy","title":"Sequential Search with Off-Policy Reinforcement Learning","date":"2022-02-01","arxiv_id":"2202.00245","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-multi-object-reinforcement","title":"Compositional Multi-Object Reinforcement Learning with Linear Relation Networks","date":"2022-01-31","arxiv_id":"2201.13388","repositories_listed":0,"syntology":null},{"url":null,"slug":"leela-zero-score-a-study-of-a-score-based","title":"Score vs. Winrate in Score-Based Games: which Reward for Reinforcement Learning?","date":"2022-01-31","arxiv_id":"2201.13176","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-regret-for-adversarial-mdp-with","title":"Near-Optimal Regret for Adversarial MDP with Delayed Bandit Feedback","date":"2022-01-31","arxiv_id":"2201.13172","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-solutions-of-the-distributional-bellman","title":"On solutions of the distributional Bellman equation","date":"2022-01-31","arxiv_id":"2202.00081","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-heterogeneous","title":"Reinforcement Learning with Heterogeneous Data: Estimation and Inference","date":"2022-01-31","arxiv_id":"2202.00088","repositories_listed":0,"syntology":null},{"url":null,"slug":"warmth-and-competence-in-human-agent","title":"Warmth and competence in human-agent cooperation","date":"2022-01-31","arxiv_id":"2201.13448","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-consensus-mechanism","title":"Communication-Efficient Consensus Mechanism for Federated Reinforcement Learning","date":"2022-01-30","arxiv_id":"2201.12718","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-learning-from-demonstrations","title":"Contrastive Learning from Demonstrations","date":"2022-01-30","arxiv_id":"2201.12813","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-frequency-control-through-safe","title":"Coordinated Frequency Control through Safe Reinforcement Learning","date":"2022-01-30","arxiv_id":"2202.00530","repositories_listed":0,"syntology":null},{"url":null,"slug":"dearfsac-an-approach-to-optimizing-unreliable","title":"DearFSAC: An Approach to Optimizing Unreliable Federated Learning via Deep Reinforcement Learning","date":"2022-01-30","arxiv_id":"2201.12701","repositories_listed":0,"syntology":null},{"url":null,"slug":"apollorl-a-reinforcement-learning-platform","title":"ApolloRL: a Reinforcement Learning Platform for Autonomous Driving","date":"2022-01-29","arxiv_id":"2201.12609","repositories_listed":0,"syntology":null},{"url":null,"slug":"deeprng-towards-deep-reinforcement-learning","title":"DeepRNG: Towards Deep Reinforcement Learning-Assisted Generative Testing of Software","date":"2022-01-29","arxiv_id":"2201.12602","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-q-learning-method-for-optimizing","title":"A deep Q-learning method for optimizing visual search strategies in backgrounds of dynamic noise","date":"2022-01-28","arxiv_id":"2201.12385","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-exfiltration-paths-using","title":"Discovering Exfiltration Paths Using Reinforcement Learning with Attack Graphs","date":"2022-01-28","arxiv_id":"2201.12416","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-temporal-reconciliation-by","title":"Dynamic Temporal Reconciliation by Reinforcement learning","date":"2022-01-28","arxiv_id":"2201.11964","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-differentiable-optimization-and","title":"Joint Differentiable Optimization and Verification for Certified Reinforcement Learning","date":"2022-01-28","arxiv_id":"2201.12243","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-exploration-deep-reinforcement","title":"Overcoming Exploration: Deep Reinforcement Learning for Continuous Control in Cluttered Environments from Temporal Logic Specifications","date":"2022-01-28","arxiv_id":"2201.12231","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-exploration-for","title":"Generative Adversarial Exploration for Reinforcement Learning","date":"2022-01-27","arxiv_id":"2201.11685","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-centered-mechanism-design-with","title":"Human-centered mechanism design with Democratic AI","date":"2022-01-27","arxiv_id":"2201.11441","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantile-based-policy-optimization-for","title":"Quantile-Based Policy Optimization for Reinforcement Learning","date":"2022-01-27","arxiv_id":"2201.11463","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-cooperative-load-balancing-in-data","title":"Multi-Agent Reinforcement Learning for Network Load Balancing in Data Center","date":"2022-01-27","arxiv_id":"2201.11727","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-empowered-mobile-edge","title":"Reinforcement Learning-Empowered Mobile Edge Computing for 6G Edge Intelligence","date":"2022-01-27","arxiv_id":"2201.11410","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-challenges-of-exploration-for-offline","title":"The Challenges of Exploration for Offline Reinforcement Learning","date":"2022-01-27","arxiv_id":"2201.11861","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-semantic-epsilon-greedy","title":"Exploiting Semantic Epsilon Greedy Exploration Strategy in Multi-Agent Reinforcement Learning","date":"2022-01-26","arxiv_id":"2201.10803","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperparameter-tuning-for-deep-reinforcement","title":"Hyperparameter Tuning for Deep Reinforcement Learning Applications","date":"2022-01-26","arxiv_id":"2201.11182","repositories_listed":0,"syntology":null},{"url":null,"slug":"probe-based-interventions-for-modifying-agent","title":"Probe-Based Interventions for Modifying Agent Behavior","date":"2022-01-26","arxiv_id":"2201.12938","repositories_listed":0,"syntology":null},{"url":null,"slug":"moore-model-based-offline-to-online","title":"MOORe: Model-based Offline-to-Online Reinforcement Learning","date":"2022-01-25","arxiv_id":"2201.10070","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-query-vertex","title":"Reinforcement Learning Based Query Vertex Ordering Model for Subgraph Matching","date":"2022-01-25","arxiv_id":"2201.11251","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-for-zero","title":"Using Deep Reinforcement Learning for Zero Defect Smart Forging","date":"2022-01-25","arxiv_id":"2201.10268","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-intravascular-ultrasound-imaging","title":"Accelerated Intravascular Ultrasound Imaging using Deep Reinforcement Learning","date":"2022-01-24","arxiv_id":"2201.09522","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarially-guided-subgoal-generation-for","title":"State-Conditioned Adversarial Subgoal Generation","date":"2022-01-24","arxiv_id":"2201.09635","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-reinforcement-learning-for-wireless","title":"Large-Scale Graph Reinforcement Learning in Wireless Control Systems","date":"2022-01-24","arxiv_id":"2201.09859","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-under-signal","title":"Deep reinforcement learning under signal temporal logic constraints using Lagrangian relaxation","date":"2022-01-21","arxiv_id":"2201.08504","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-spiking-q","title":"Deep Reinforcement Learning with Spiking Q-learning","date":"2022-01-21","arxiv_id":"2201.09754","repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-dependent-confidence-and-early","title":"Instance-Dependent Confidence and Early Stopping for Reinforcement Learning","date":"2022-01-21","arxiv_id":"2201.08536","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-two-step-hybrid-policy-for-graph-1","title":"Learning Two-Step Hybrid Policy for Graph-Based Interpretable Reinforcement Learning","date":"2022-01-21","arxiv_id":"2201.08520","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-personalized-drug","title":"Reinforcement Learning for Personalized Drug Discovery and Design for Complex Diseases: A Systems Pharmacology Perspective","date":"2022-01-21","arxiv_id":"2201.08894","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-your-way-agent","title":"Reinforcement Learning Your Way: Agent Characterization through Policy Regularization","date":"2022-01-21","arxiv_id":"2201.10003","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-prescriptive-dirichlet-power-allocation","title":"A Prescriptive Dirichlet Power Allocation Policy with Deep Reinforcement Learning","date":"2022-01-20","arxiv_id":"2201.08445","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-covering-option-discovery-based","title":"Learning Multi-agent Skills for Tabular Reinforcement Learning using Factor Graphs","date":"2022-01-20","arxiv_id":"2201.08227","repositories_listed":0,"syntology":null},{"url":null,"slug":"priors-hierarchy-and-information-asymmetry","title":"Priors, Hierarchy, and Information Asymmetry for Skill Transfer in Reinforcement Learning","date":"2022-01-20","arxiv_id":"2201.08115","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-constraints-to-prevent-instability","title":"Recursive Constraints to Prevent Instability in Constrained Reinforcement Learning","date":"2022-01-20","arxiv_id":"2201.07958","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-allocation-algorithm-for-mec-based","title":"Resource allocation algorithm for MEC based on Deep Reinforcement Learning","date":"2022-01-20","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-awaremulti-agent-apprenticeship","title":"Safety-Aware Multi-Agent Apprenticeship Learning","date":"2022-01-20","arxiv_id":"2201.08111","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-awareness-safety-of-deep-reinforcement","title":"Self-Awareness Safety of Deep Reinforcement Learning in Road Traffic Junction Driving","date":"2022-01-20","arxiv_id":"2201.08116","repositories_listed":0,"syntology":null},{"url":null,"slug":"sim-to-lab-to-real-safe-reinforcement","title":"Sim-to-Lab-to-Real: Safe Reinforcement Learning with Shielding and Generalization Guarantees","date":"2022-01-20","arxiv_id":"2201.08355","repositories_listed":0,"syntology":null},{"url":null,"slug":"anytime-optimal-psro-for-two-player-zero-sum","title":"Anytime PSRO for Two-Player Zero-Sum Games","date":"2022-01-19","arxiv_id":"2201.07700","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-reinforcement-learning-based-eco","title":"Hybrid Reinforcement Learning-Based Eco-Driving Strategy for Connected and Automated Vehicles at Signalized Intersections","date":"2022-01-19","arxiv_id":"2201.07833","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-poi-recommendation-learning-dynamic","title":"Online POI Recommendation: Learning Dynamic Geo-Human Interactions in Streams","date":"2022-01-19","arxiv_id":"2201.10983","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-representation-learning-with","title":"Accelerating Representation Learning with View-Consistent Dynamics in Data-Efficient Reinforcement Learning","date":"2022-01-18","arxiv_id":"2201.07016","repositories_listed":0,"syntology":null},{"url":null,"slug":"conservative-distributional-reinforcement","title":"Conservative Distributional Reinforcement Learning with Safety Constraints","date":"2022-01-18","arxiv_id":"2201.07286","repositories_listed":0,"syntology":null}],"record_sha256":"fdb9d46d421829086b180a39902813de41b188f8afa58f7cab43c967290b31b0","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}