{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/93","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":93,"pages_in_order":152,"rows_per_page":100,"rows":[9201,9300],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/92","next":"/task/reinforcement-learning-1/papers/94","papers":[{"url":null,"slug":"multi-agent-communication-with-graph","title":"CGIBNet: Bandwidth-constrained Communication with Graph Information Bottleneck in Multi-Agent Reinforcement Learning","date":"2021-12-20","arxiv_id":"2112.10374","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-multi-agent-deep-reinforcement-learning","title":"Safe multi-agent deep reinforcement learning for joint bidding and maintenance scheduling of generation units","date":"2021-12-20","arxiv_id":"2112.10459","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-exploitation-trade-off-for","title":"Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models","date":"2021-12-19","arxiv_id":"2112.10264","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-deep-q-recommender-for-effective","title":"Masked Deep Q-Recommender for Effective Question Scheduling","date":"2021-12-19","arxiv_id":"2112.10125","repositories_listed":0,"syntology":null},{"url":null,"slug":"roboassembly-learning-generalizable-furniture","title":"RoboAssembly: Learning Generalizable Furniture Assembly Policy in a Novel Multi-robot Contact-rich Simulation Environment","date":"2021-12-19","arxiv_id":"2112.10143","repositories_listed":0,"syntology":null},{"url":null,"slug":"creativity-of-ai-automatic-symbolic-option","title":"Creativity of AI: Hierarchical Planning Model Learning for Facilitating Deep Reinforcement Learning","date":"2021-12-18","arxiv_id":"2112.09836","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-based-reinforcement-learning-of","title":"Curriculum Based Reinforcement Learning of Grid Topology Controllers to Prevent Thermal Cascading","date":"2021-12-18","arxiv_id":"2112.09996","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-safe-reinforcement-learning-with","title":"Model-Based Safe Reinforcement Learning with Time-Varying State and Control Constraints: An Application to Intelligent Vehicles","date":"2021-12-18","arxiv_id":"2112.11217","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-explanations-for-comparing","title":"Contrastive Explanations for Comparing Preferences of Reinforcement Learning Agents","date":"2021-12-17","arxiv_id":"2112.09462","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-authentic","title":"Deep Reinforcement Learning-based Authentic Dialogue Generation To Protect Youth From Cybergrooming","date":"2021-12-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-reward-machines-a-study-in-partially","title":"Learning Reward Machines: A Study in Partially Observable Reinforcement Learning","date":"2021-12-17","arxiv_id":"2112.09477","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-lane-change-decision-algorithm","title":"Personalized Lane Change Decision Algorithm Using Deep Reinforcement Learning Approach","date":"2021-12-17","arxiv_id":"2112.13646","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetry-aware-neural-architecture-for","title":"Symmetry-aware Neural Architecture for Embodied Visual Navigation","date":"2021-12-17","arxiv_id":"2112.09515","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-compressive-text-summarisation","title":"Unsupervised Compressive Text Summarisation with Reinforcement Learning","date":"2021-12-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-safe-deep-reinforcement-learning","title":"Benchmarking Safe Deep Reinforcement Learning in Aquatic Navigation","date":"2021-12-16","arxiv_id":"2112.10593","repositories_listed":0,"syntology":null},{"url":null,"slug":"centralizing-state-values-in-dueling-networks","title":"Centralizing State-Values in Dueling Networks for Multi-Robot Reinforcement Learning Mapless Navigation","date":"2021-12-16","arxiv_id":"2112.09012","repositories_listed":0,"syntology":null},{"url":null,"slug":"conqrr-conversational-query-rewriting-for","title":"CONQRR: Conversational Query Rewriting for Retrieval with Reinforcement Learning","date":"2021-12-16","arxiv_id":"2112.08558","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-policies-learn","title":"Deep Reinforcement Learning Policies Learn Shared Adversarial Features Across MDPs","date":"2021-12-16","arxiv_id":"2112.09025","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-directed-story-generation-augmenting","title":"Goal-Directed Story Generation: Augmenting Generative Language Models with Reinforcement Learning","date":"2021-12-16","arxiv_id":"2112.08593","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-tuning-of-hyper-parameters-of","title":"Automatic tuning of hyper-parameters of reinforcement learning algorithms using Bayesian optimization with behavioral cloning","date":"2021-12-15","arxiv_id":"2112.08094","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepscalper-a-risk-aware-deep-reinforcement","title":"DeepScalper: A Risk-Aware Reinforcement Learning Framework to Capture Fleeting Intraday Trading Opportunities","date":"2021-12-15","arxiv_id":"2201.09058","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-human-interaction-in-virtual","title":"Assessing Human Interaction in Virtual Reality With Continually Learning Prediction Agents Based on Reinforcement Learning Algorithms: A Pilot Study","date":"2021-12-14","arxiv_id":"2112.07774","repositories_listed":0,"syntology":null},{"url":null,"slug":"biased-gradient-estimate-with-drastic","title":"Biased Gradient Estimate with Drastic Variance Reduction for Meta Reinforcement Learning","date":"2021-12-14","arxiv_id":"2112.07328","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-cpr-generalize-to-unseen-large-number-of","title":"Meta-CPR: Generalize to Unseen Large Number of Agents with Communication Pattern Recognition Module","date":"2021-12-14","arxiv_id":"2112.07222","repositories_listed":0,"syntology":null},{"url":null,"slug":"programmatic-reward-design-by-example","title":"Programmatic Reward Design by Example","date":"2021-12-14","arxiv_id":"2112.08438","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantifying-multimodality-in-world-models","title":"Quantifying Multimodality in World Models","date":"2021-12-14","arxiv_id":"2112.07263","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcing-semantic-symmetry-for-document","title":"Reinforcing Semantic-Symmetry for Document Summarization","date":"2021-12-14","arxiv_id":"2112.07583","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-and-invariance-in","title":"Representation and Invariance in Reinforcement Learning","date":"2021-12-14","arxiv_id":"2112.07752","repositories_listed":0,"syntology":null},{"url":null,"slug":"scientific-discovery-and-the-cost-of","title":"Scientific Discovery and the Cost of Measurement -- Balancing Information and Cost in Reinforcement Learning","date":"2021-12-14","arxiv_id":"2112.07535","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-benchmark-for-low-switching-cost","title":"A Benchmark for Low-Switching-Cost Reinforcement Learning","date":"2021-12-13","arxiv_id":"2112.06424","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-exploration-using-a-linear","title":"Contextual Exploration Using a Linear Approximation Method Based on Satisficing","date":"2021-12-13","arxiv_id":"2112.06452","repositories_listed":0,"syntology":null},{"url":null,"slug":"teaching-a-robot-to-walk-using-reinforcement","title":"Teaching a Robot to Walk Using Reinforcement Learning","date":"2021-12-13","arxiv_id":"2112.07031","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-tutored-reinforcement-learning-1","title":"Control-Tutored Reinforcement Learning: Towards the Integration of Data-Driven and Model-Based Control","date":"2021-12-11","arxiv_id":"2112.06018","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-reinforcement-learning-at-the-edge","title":"Federated Reinforcement Learning at the Edge","date":"2021-12-11","arxiv_id":"2112.05908","repositories_listed":0,"syntology":null},{"url":null,"slug":"formalising-the-foundations-of-discrete","title":"Formalising the Foundations of Discrete Reinforcement Learning in Isabelle/HOL","date":"2021-12-11","arxiv_id":"2112.05996","repositories_listed":0,"syntology":null},{"url":null,"slug":"medattacker-exploring-black-box-adversarial","title":"MedAttacker: Exploring Black-Box Adversarial Attacks on Risk Prediction Models in Healthcare","date":"2021-12-11","arxiv_id":"2112.06063","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-validation-tool-for-designing-reinforcement","title":"A Validation Tool for Designing Reinforcement Learning Environments","date":"2021-12-10","arxiv_id":"2112.05519","repositories_listed":0,"syntology":null},{"url":null,"slug":"edge-compatible-reinforcement-learning-for","title":"Edge-Compatible Reinforcement Learning for Recommendations","date":"2021-12-10","arxiv_id":"2112.05812","repositories_listed":0,"syntology":null},{"url":null,"slug":"encoding-priors-in-the-brain-a-reinforcement","title":"Encoding priors in the brain: a reinforcement learning model for mouse decision making","date":"2021-12-10","arxiv_id":"2112.05816","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-architecture-search-via-continual","title":"Quantum Architecture Search via Continual Reinforcement Learning","date":"2021-12-10","arxiv_id":"2112.05779","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-uncertainty-aware-deployment-of","title":"Zero-Shot Uncertainty-Aware Deployment of Simulation Trained Policies on Real-World Robots","date":"2021-12-10","arxiv_id":"2112.05299","repositories_listed":0,"syntology":null},{"url":null,"slug":"dr3-value-based-deep-reinforcement-learning-1","title":"DR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization","date":"2021-12-09","arxiv_id":"2112.04716","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-dimensional-stock-portfolio-trading-with","title":"High-Dimensional Stock Portfolio Trading with Deep Reinforcement Learning","date":"2021-12-09","arxiv_id":"2112.04755","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-almost-sure","title":"Reinforcement Learning with Almost Sure Constraints","date":"2021-12-09","arxiv_id":"2112.05198","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-for-deep-reinforcement-learning-in-1","title":"A Review for Deep Reinforcement Learning in Atari:Benchmarks, Challenges, and Solutions","date":"2021-12-08","arxiv_id":"2112.04145","repositories_listed":0,"syntology":null},{"url":null,"slug":"ambiguous-dynamic-treatment-regimes-a","title":"Ambiguous Dynamic Treatment Regimes: A Reinforcement Learning Approach","date":"2021-12-08","arxiv_id":"2112.04571","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-deep-reinforcement-learning-to","title":"Application of Deep Reinforcement Learning to Payment Fraud","date":"2021-12-08","arxiv_id":"2112.04236","repositories_listed":0,"syntology":null},{"url":null,"slug":"comps-continual-meta-policy-search-1","title":"CoMPS: Continual Meta Policy Search","date":"2021-12-08","arxiv_id":"2112.04467","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-market-makers-in-a-multi","title":"Deep Q-Learning Market Makers in a Multi-Agent Simulated Stock Market","date":"2021-12-08","arxiv_id":"2112.04494","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyper-parameter-optimization-based-on-soft","title":"Hyper-parameter optimization based on soft actor critic and hierarchical mixture regularization","date":"2021-12-08","arxiv_id":"2112.04084","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-over-all-stabilizing-nonlinear","title":"Learning over All Stabilizing Nonlinear Controllers for a Partially-Observed Linear System","date":"2021-12-08","arxiv_id":"2112.04219","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-select-the-next-reasonable","title":"Learning to Select the Next Reasonable Mention for Entity Linking","date":"2021-12-08","arxiv_id":"2112.04104","repositories_listed":0,"syntology":null},{"url":null,"slug":"recent-advances-in-reinforcement-learning-in","title":"Recent Advances in Reinforcement Learning in Finance","date":"2021-12-08","arxiv_id":"2112.04553","repositories_listed":0,"syntology":null},{"url":null,"slug":"suboptimal-and-trait-like-reinforcement","title":"Suboptimal and trait-like reinforcement learning strategies correlate with midbrain encoding of prediction errors","date":"2021-12-08","arxiv_id":"2112.04327","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-transferable-approach-for-partitioning","title":"A Transferable Approach for Partitioning Machine Learning Models on Multi-Chip-Modules","date":"2021-12-07","arxiv_id":"2112.04041","repositories_listed":0,"syntology":null},{"url":null,"slug":"first-order-regret-in-reinforcement-learning","title":"First-Order Regret in Reinforcement Learning with Linear Function Approximation: A Robust Estimation Approach","date":"2021-12-07","arxiv_id":"2112.03432","repositories_listed":0,"syntology":null},{"url":null,"slug":"juewu-mc-playing-minecraft-with-sample","title":"JueWu-MC: Playing Minecraft with Sample-efficient Hierarchical Reinforcement Learning","date":"2021-12-07","arxiv_id":"2112.04907","repositories_listed":0,"syntology":null},{"url":null,"slug":"mesa-offline-meta-rl-for-safe-adaptation-and","title":"MESA: Offline Meta-RL for Safe Adaptation and Fault Tolerance","date":"2021-12-07","arxiv_id":"2112.03575","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-nearly-optimal-control-of","title":"Model-free Nearly Optimal Control of Constrained-Input Nonlinear Systems Based on Synchronous Reinforcement Learning","date":"2021-12-07","arxiv_id":"2112.03510","repositories_listed":0,"syntology":null},{"url":null,"slug":"qksa-quantum-knowledge-seeking-agent-resource","title":"QKSA: Quantum Knowledge Seeking Agent -- resource-optimized reinforcement learning using quantum process tomography","date":"2021-12-07","arxiv_id":"2112.03643","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthetic-acute-hypotension-and-sepsis","title":"Synthetic Acute Hypotension and Sepsis Datasets Based on MIMIC-III and Published as Part of the Health Gym Project","date":"2021-12-07","arxiv_id":"2112.03914","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-differentiable-reinforcement-learning","title":"Deep differentiable reinforcement learning and optimal trading","date":"2021-12-06","arxiv_id":"2112.02944","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilled-domain-randomization","title":"Distilled Domain Randomization","date":"2021-12-06","arxiv_id":"2112.03149","repositories_listed":0,"syntology":null},{"url":null,"slug":"lecture-notes-on-partially-known-mdps","title":"Lecture Notes on Partially Known MDPs","date":"2021-12-06","arxiv_id":"2112.02976","repositories_listed":0,"syntology":null},{"url":null,"slug":"mdpfuzzer-finding-crash-triggering-state","title":"MDPFuzz: Testing Models Solving Markov Decision Processes","date":"2021-12-06","arxiv_id":"2112.02807","repositories_listed":0,"syntology":null},{"url":null,"slug":"organ-localisation-using-supervised-and-semi","title":"Organ localisation using supervised and semi supervised approaches combining reinforcement learning with imitation learning","date":"2021-12-06","arxiv_id":"2112.03276","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-spatial-causal-interpretations-for","title":"Temporal-Spatial Causal Interpretations for Vision-Based Reinforcement Learning","date":"2021-12-06","arxiv_id":"2112.03020","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmark-for-out-of-distribution-detection","title":"Benchmark for Out-of-Distribution Detection in Deep Reinforcement Learning","date":"2021-12-05","arxiv_id":"2112.02694","repositories_listed":0,"syntology":null},{"url":null,"slug":"math-programming-based-reinforcement-learning","title":"Deep Policy Iteration with Integer Programming for Inventory Management","date":"2021-12-04","arxiv_id":"2112.02215","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analytical-update-rule-for-general-policy","title":"An Analytical Update Rule for General Policy Optimization","date":"2021-12-03","arxiv_id":"2112.02045","repositories_listed":0,"syntology":null},{"url":null,"slug":"divergent-representations-of-ethological-1","title":"Divergent representations of ethological visual inputs emerge from supervised, unsupervised, and reinforcement learning","date":"2021-12-03","arxiv_id":"2112.02027","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-options-on-target","title":"Reinforcement learning for options on target volatility funds","date":"2021-12-03","arxiv_id":"2112.01841","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-robustness-of-deep-reinforcement","title":"Adversarial Robustness of Deep Reinforcement Learning based Dynamic Recommender Systems","date":"2021-12-02","arxiv_id":"2112.00973","repositories_listed":0,"syntology":null},{"url":null,"slug":"architecting-and-visualizing-deep","title":"Architecting and Visualizing Deep Reinforcement Learning Models","date":"2021-12-02","arxiv_id":"2112.01451","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-guarantees-for-deep-epsilon","title":"Convergence Guarantees for Deep Epsilon Greedy Policy Learning","date":"2021-12-02","arxiv_id":"2112.03376","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-exploration-in","title":"Differentially Private Exploration in Reinforcement Learning with Linear Representation","date":"2021-12-02","arxiv_id":"2112.01585","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-model-based-reinforcement","title":"Maximum Entropy Model-based Reinforcement Learning","date":"2021-12-02","arxiv_id":"2112.01195","repositories_listed":0,"syntology":null},{"url":null,"slug":"personal-comfort-estimation-in-partial","title":"Towards Personalization of User Preferences in Partially Observable Smart Home Environments","date":"2021-12-02","arxiv_id":"2112.00971","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-free-attacks-in-multi-agent","title":"Reward-Free Attacks in Multi-Agent Reinforcement Learning","date":"2021-12-02","arxiv_id":"2112.00940","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-for-grid-voltage","title":"Safe Reinforcement Learning for Grid Voltage Control","date":"2021-12-02","arxiv_id":"2112.01484","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-intrinsic-interactive-reinforcement","title":"Towards Interactive Reinforcement Learning with Intrinsic Feedback","date":"2021-12-02","arxiv_id":"2112.01575","repositories_listed":0,"syntology":null},{"url":null,"slug":"boovi-provably-efficient-bootstrapped-value","title":"BooVI: Provably Efficient Bootstrapped Value Iteration","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-offline-imitating-learning","title":"Curriculum Offline Imitating Learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"design-and-development-of-spoken-dialogue","title":"Design and Development of Spoken Dialogue System in Indic Languages","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-robust-imitation-learning","title":"Distributionally Robust Imitation Learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-algorithms-for-l-infty-constrained-s","title":"Fast Algorithms for $L_\\infty$-constrained S-rectangular Robust MDPs","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"homotopy-based-reinforcement-learning-with","title":"Homotopy Based Reinforcement Learning with Maximum Entropy for Autonomous Air Combat","date":"2021-12-01","arxiv_id":"2112.01328","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-gearshift-controllers-for-electric","title":"Improving gearshift controllers for electric vehicles with reinforcement learning","date":"2021-12-01","arxiv_id":"2112.00529","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-tree-interpretation-from-object","title":"Learning Tree Interpretation from Object Representation for Deep Reinforcement Learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-via","title":"Model-Based Reinforcement Learning via Imagination with Derived Memory","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-transfer-learning-in","title":"Multi-Agent Transfer Learning in Reinforcement Learning-Based Ride-Sharing Systems","date":"2021-12-01","arxiv_id":"2112.00424","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-constrained-multi-objective","title":"Offline Constrained Multi-Objective Reinforcement Learning via Pessimistic Dual Value Iteration","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-practical-consistency-of-meta","title":"On the Practical Consistency of Meta-Reinforcement Learning Algorithms","date":"2021-12-01","arxiv_id":"2112.00478","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-enhanced-explainer-for","title":"Reinforcement Learning Enhanced Explainer for Graph Neural Networks","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-newcomblike","title":"Reinforcement Learning in Newcomblike Environments","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rmix-learning-risk-sensitive-policies","title":"RMIX: Learning Risk-Sensitive Policies forCooperative Reinforcement Learning Agents","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"structural-credit-assignment-in-neural","title":"Structural Credit Assignment in Neural Networks using Reinforcement Learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-communication-and-sample-complexities","title":"Taming Communication and Sample Complexities in Decentralized Policy Evaluation for Cooperative Multi-Agent Reinforcement Learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-end-to-end-model-based","title":"Understanding End-to-End Model-Based Reinforcement Learning Methods as Implicit Parameterization","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-model-estimation-for-offline-model","title":"Weighted model estimation for offline model-based reinforcement learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"e4dfd9e3415d637f859592ea2d5d87ce46b3b27c7579b128965f00e5aa535818","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}