{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/98","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":98,"pages_in_order":135,"rows_per_page":100,"rows":[9701,9800],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/97","next":"/task/reinforcement-learning-2/papers/99","papers":[{"url":null,"slug":"inverse-reinforcement-learning-with-explicit","title":"Inverse Reinforcement Learning with Explicit Policy Estimates","date":"2021-03-04","arxiv_id":"2103.02863","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuromechanics-based-deep-reinforcement","title":"Neuromechanics-based Deep Reinforcement Learning of Neurostimulation Control in FES cycling","date":"2021-03-04","arxiv_id":"2103.03057","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-uav-trajectory-planning-using","title":"Efficient UAV Trajectory-Planning using Economic Reinforcement Learning","date":"2021-03-03","arxiv_id":"2103.02676","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-orientation","title":"Reinforcement Learning for Orientation Estimation Using Inertial Sensors with Performance Guarantee","date":"2021-03-03","arxiv_id":"2103.02357","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-external-1","title":"Reinforcement Learning with External Knowledge by using Logical Neural Networks","date":"2021-03-03","arxiv_id":"2103.02363","repositories_listed":0,"syntology":null},{"url":null,"slug":"shape-driven-coordinate-ordering-for-star","title":"Shape-driven Coordinate Ordering for Star Glyph Sets via Reinforcement Learning","date":"2021-03-03","arxiv_id":"2103.02380","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-model-learning","title":"Minimax Model Learning","date":"2021-03-02","arxiv_id":"2103.02084","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with","title":"Offline Reinforcement Learning with Pseudometric Learning","date":"2021-03-02","arxiv_id":"2103.01948","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-monopoly-gameplay-a-hybrid-model","title":"Decision Making in Monopoly using a Hybrid Deep Reinforcement Learning Approach","date":"2021-03-01","arxiv_id":"2103.00683","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-adaptive-mesh","title":"Reinforcement Learning for Adaptive Mesh Refinement","date":"2021-03-01","arxiv_id":"2103.01342","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-and-incentives-in-reinforcement","title":"Exploration and Incentives in Reinforcement Learning","date":"2021-02-28","arxiv_id":"2103.00360","repositories_listed":0,"syntology":null},{"url":null,"slug":"hamiltonian-policy-optimization","title":"Hamiltonian Policy Optimization","date":"2021-02-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-conservativeness-oriented-offline","title":"Reducing Conservativeness Oriented Offline Reinforcement Learning","date":"2021-02-27","arxiv_id":"2103.00098","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-peng-s-q-l-for-modern","title":"Revisiting Peng's Q($λ$) for Modern Reinforcement Learning","date":"2021-02-27","arxiv_id":"2103.00107","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-precision-reinforcement-learning","title":"Low-Precision Reinforcement Learning: Running Soft Actor-Critic in Half Precision","date":"2021-02-26","arxiv_id":"2102.13565","repositories_listed":0,"syntology":null},{"url":null,"slug":"potential-impacts-of-smart-homes-on-human","title":"Potential Impacts of Smart Homes on Human Behavior: A Reinforcement Learning Approach","date":"2021-02-26","arxiv_id":"2102.13307","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-distributional-reinforcement-learning","title":"Safe Distributional Reinforcement Learning","date":"2021-02-26","arxiv_id":"2102.13446","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-load-shedding-for-grid-emergency","title":"Adaptive Load Shedding for Grid Emergency Control via Deep Reinforcement Learning","date":"2021-02-25","arxiv_id":"2102.12908","repositories_listed":0,"syntology":null},{"url":null,"slug":"bias-reduced-multi-step-hindsight-experience","title":"Bias-reduced Multi-step Hindsight Experience Replay for Efficient Multi-goal Reinforcement Learning","date":"2021-02-25","arxiv_id":"2102.12962","repositories_listed":0,"syntology":null},{"url":null,"slug":"emerging-trends-in-federated-learning-from","title":"Emerging Trends in Federated Learning: From Model Fusion to Federated X Learning","date":"2021-02-25","arxiv_id":"2102.12920","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-bounding-mdps-learning","title":"Iterative Bounding MDPs: Learning Interpretable Policies via Non-Interpretable Methods","date":"2021-02-25","arxiv_id":"2102.13045","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-reinforcement-learning-with-heavy","title":"No-Regret Reinforcement Learning with Heavy-Tailed Rewards","date":"2021-02-25","arxiv_id":"2102.12769","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effect-of-auxiliary-tasks-on","title":"On The Effect of Auxiliary Tasks on Representation Dynamics","date":"2021-02-25","arxiv_id":"2102.13089","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-approach-for-resource","title":"Reinforcement learning approach for resource allocation in humanitarian logistics","date":"2021-02-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-implicit-and","title":"Reinforcement Learning of Implicit and Explicit Control Flow in Instructions","date":"2021-02-25","arxiv_id":"2102.13195","repositories_listed":0,"syntology":null},{"url":null,"slug":"annotating-motion-primitives-for-simplifying","title":"Annotating Motion Primitives for Simplifying Action Search in Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12017","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-off-and-on-policy-training-in-model","title":"Combining Off and On-Policy Training in Model-Based Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12194","repositories_listed":0,"syntology":null},{"url":null,"slug":"coverage-as-a-principle-for-discovering-1","title":"Beyond Fine-Tuning: Transferring Behavior in Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.13515","repositories_listed":0,"syntology":null},{"url":null,"slug":"credit-assignment-with-meta-policy-gradient","title":"Credit Assignment with Meta-Policy Gradient for Multi-Agent Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12957","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-emergent-discrete-message","title":"Learning Emergent Discrete Message Communication for Cooperative Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12550","repositories_listed":0,"syntology":null},{"url":null,"slug":"pfrl-pose-free-reinforcement-learning-for-6d-1","title":"PFRL: Pose-Free Reinforcement Learning for 6D Pose Estimation","date":"2021-02-24","arxiv_id":"2102.12096","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-logical-options-framework-1","title":"The Logical Options Framework","date":"2021-02-24","arxiv_id":"2102.12571","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-safe-continuing-task-reinforcement","title":"Towards Safe Continuing Task Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12585","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-robotic-model-of-hippocampal-reverse-replay","title":"A Robotic Model of Hippocampal Reverse Replay for Reinforcement Learning","date":"2021-02-23","arxiv_id":"2102.11914","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepthermal-combustion-optimization-for","title":"DeepThermal: Combustion Optimization for Thermal Power Generating Units Using Offline Reinforcement Learning","date":"2021-02-23","arxiv_id":"2102.11492","repositories_listed":0,"syntology":null},{"url":null,"slug":"greedy-multi-step-off-policy-reinforcement-1","title":"Greedy-Step Off-Policy Reinforcement Learning","date":"2021-02-23","arxiv_id":"2102.11717","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-augmented-constrained-reinforcement","title":"State Augmented Constrained Reinforcement Learning: Overcoming the Limitations of Learning with Rewards","date":"2021-02-23","arxiv_id":"2102.11941","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-redundancy-in-reinforcement-learning","title":"Action Redundancy in Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.11329","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-parallel","title":"Communication Efficient Parallel Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.10740","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-dynamic-3","title":"Deep Reinforcement Learning for Dynamic Spectrum Sharing of LTE and NR","date":"2021-02-22","arxiv_id":"2102.11176","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-text-based-reinforcement-learning-1","title":"Efficient Text-based Reinforcement Learning by Jointly Leveraging State and Commonsense Graph Representations","date":"2021-02-22","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"gelato-geometrically-enriched-latent-model","title":"Uncertainty Estimation Using Riemannian Model~Dynamics for Offline Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.11327","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-context-based-offline-meta-rl-with","title":"Provably Improved Context-Based Offline Meta-RL with Attention and Contrastive Learning","date":"2021-02-22","arxiv_id":"2102.10774","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-learning-of-robot-manipulation-tasks","title":"Improved Learning of Robot Manipulation Tasks via Tactile Intrinsic Motivation","date":"2021-02-22","arxiv_id":"2102.11051","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-the-prediction","title":"Reinforcement Learning of the Prediction Horizon in Model Predictive Control","date":"2021-02-22","arxiv_id":"2102.11122","repositories_listed":0,"syntology":null},{"url":null,"slug":"return-based-contrastive-representation-1","title":"Return-Based Contrastive Representation Learning for Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.10960","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentinel-taming-uncertainty-with-ensemble","title":"SENTINEL: Taming Uncertainty with Ensemble-based Distributional Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.11075","repositories_listed":0,"syntology":null},{"url":null,"slug":"stratified-experience-replay-correcting","title":"Stratified Experience Replay: Correcting Multiplicity Bias in Off-Policy Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.11319","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-navigation-in-vortical","title":"Learning Efficient Navigation in Vortical Flow Fields","date":"2021-02-21","arxiv_id":"2102.10536","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-using-robust","title":"Safe Reinforcement Learning Using Robust Action Governor","date":"2021-02-21","arxiv_id":"2102.10643","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-train-your-heron","title":"How To Train Your HERON","date":"2021-02-20","arxiv_id":"2102.10357","repositories_listed":0,"syntology":null},{"url":null,"slug":"importance-of-environment-design-in","title":"Importance of Environment Design in Reinforcement Learning: A Study of a Robotic Environment","date":"2021-02-20","arxiv_id":"2102.10447","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-age-of-1","title":"A Reinforcement Learning Approach to Age of Information in Multi-User Networks with HARQ","date":"2021-02-19","arxiv_id":"2102.09774","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-deterministic-multi-agent-1","title":"Decentralized Deterministic Multi-Agent Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09745","repositories_listed":0,"syntology":null},{"url":null,"slug":"instrumental-variable-value-iteration-for","title":"Instrumental Variable Value Iteration for Causal Offline Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09907","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-invariant-state-abstractions-for-model","title":"Model-Invariant State Abstractions for Model-Based Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09850","repositories_listed":0,"syntology":null},{"url":null,"slug":"tacticzero-learning-to-prove-theorems-from","title":"TacticZero: Learning to Prove Theorems from Scratch with Deep Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09756","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-in-resource-1","title":"Efficient Reinforcement Learning in Resource Allocation Problems Through Permutation Invariant Multi-task Learning","date":"2021-02-18","arxiv_id":"2102.09361","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-memory-dependent-continuous-control","title":"Learning Memory-Dependent Continuous Control from Demonstrations","date":"2021-02-18","arxiv_id":"2102.09208","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserving-teacher-student-deep","title":"Privacy-Preserving Kickstarting Deep Reinforcement Learning with Privacy-Aware Learners","date":"2021-02-18","arxiv_id":"2102.09599","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-beam-pattern","title":"Reinforcement Learning for Beam Pattern Design in Millimeter Wave and Massive MIMO Systems","date":"2021-02-18","arxiv_id":"2102.09084","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-datacenter","title":"Reinforcement Learning for Datacenter Congestion Control","date":"2021-02-18","arxiv_id":"2102.09337","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-feasibility-pump-reinforcement-learning","title":"Smart Feasibility Pump: Reinforcement Learning for (Mixed) Integer Programming","date":"2021-02-18","arxiv_id":"2102.09663","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategic-bidding-in-freight-transport-using","title":"Strategic bidding in freight transport using deep reinforcement learning","date":"2021-02-18","arxiv_id":"2102.09253","repositories_listed":0,"syntology":null},{"url":null,"slug":"separated-proportional-integral-lagrangian","title":"Separated Proportional-Integral Lagrangian for Chance Constrained Reinforcement Learning","date":"2021-02-17","arxiv_id":"2102.08539","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-matters-in-using-data-augmentation-for","title":"Efficient Scheduling of Data Augmentation for Deep Reinforcement Learning","date":"2021-02-17","arxiv_id":"2102.08581","repositories_listed":0,"syntology":null},{"url":null,"slug":"improper-learning-with-gradient-based-policy","title":"Improper Reinforcement Learning with Gradient-based Policy Optimization","date":"2021-02-16","arxiv_id":"2102.08201","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-in-the","title":"Inverse Reinforcement Learning in a Continuous State Space with Formal Guarantees","date":"2021-02-16","arxiv_id":"2102.07937","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-meta-reinforcement-learning-using","title":"Model-based Meta Reinforcement Learning using Graph Structured Surrogate Models","date":"2021-02-16","arxiv_id":"2102.08291","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-stage-transmission-line-flow-control","title":"Multi-Stage Transmission Line Flow Control Using Centralized and Decentralized Reinforcement Learning Agents","date":"2021-02-16","arxiv_id":"2102.08430","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantifying-environment-and-population","title":"Quantifying the effects of environment and population diversity in multi-agent reinforcement learning","date":"2021-02-16","arxiv_id":"2102.08370","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-poisoning-in-reinforcement-learning","title":"Reward Poisoning in Reinforcement Learning: Attacks Against Unknown Learners in Unknown Environments","date":"2021-02-16","arxiv_id":"2102.08492","repositories_listed":0,"syntology":null},{"url":null,"slug":"rmix-learning-risk-sensitive-policies-for","title":"RMIX: Learning Risk-Sensitive Policies for Cooperative Reinforcement Learning Agents","date":"2021-02-16","arxiv_id":"2102.08159","repositories_listed":0,"syntology":null},{"url":null,"slug":"trader-practical-deep-hierarchical","title":"TradeR: Practical Deep Hierarchical Reinforcement Learning for Trade Execution","date":"2021-02-16","arxiv_id":"2104.00620","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-larger-networks-for-deep","title":"Training Larger Networks for Deep Reinforcement Learning","date":"2021-02-16","arxiv_id":"2102.07920","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-domain-knowledge-with-an-adviser","title":"Transferring Domain Knowledge with an Adviser in Continuous Tasks","date":"2021-02-16","arxiv_id":"2102.08029","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperation-and-reputation-dynamics-with","title":"Cooperation and Reputation Dynamics with Reinforcement Learning","date":"2021-02-15","arxiv_id":"2102.07523","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-constrained-policy","title":"Distributionally-Constrained Policy Optimization via Unbalanced Optimal Transport","date":"2021-02-15","arxiv_id":"2102.07889","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-demonstrations-using-signal","title":"Learning from Demonstrations using Signal Temporal Logic","date":"2021-02-15","arxiv_id":"2102.07730","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-by-haptic-glance-reinforcement","title":"Seeing by haptic glance: reinforcement learning-based 3D object Recognition","date":"2021-02-15","arxiv_id":"2102.07599","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adversarial-reinforcement-learning","title":"Domain Adversarial Reinforcement Learning","date":"2021-02-14","arxiv_id":"2102.07097","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-iot-security-a","title":"Reinforcement Learning for IoT Security: A Comprehensive Survey","date":"2021-02-14","arxiv_id":"2102.07247","repositories_listed":0,"syntology":null},{"url":null,"slug":"reversible-action-design-for-combinatorial","title":"Reversible Action Design for Combinatorial Optimization with Reinforcement Learning","date":"2021-02-14","arxiv_id":"2102.07210","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-attention-guided-dynamic-value","title":"Sparse Attention Guided Dynamic Value Estimation for Single-Task Multi-Scene Reinforcement Learning","date":"2021-02-14","arxiv_id":"2102.07266","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-method-for-optical","title":"A Reinforcement learning method for Optical Thin-Film Design","date":"2021-02-13","arxiv_id":"2102.09398","repositories_listed":0,"syntology":null},{"url":null,"slug":"equilibrium-inverse-reinforcement-learning","title":"Equilibrium Inverse Reinforcement Learning for Ride-hailing Vehicle Network","date":"2021-02-13","arxiv_id":"2102.06854","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-corruption-robust-algorithms-for","title":"Improved Corruption Robust Algorithms for Episodic Reinforcement Learning","date":"2021-02-13","arxiv_id":"2102.06875","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-cooperation-in-network-games-with","title":"Modelling Cooperation in Network Games with Spatio-Temporal Complexity","date":"2021-02-13","arxiv_id":"2102.06911","repositories_listed":0,"syntology":null},{"url":null,"slug":"persim-data-efficient-offline-reinforcement","title":"PerSim: Data-Efficient Offline Reinforcement Learning with Heterogeneous Agents via Personalized Simulators","date":"2021-02-13","arxiv_id":"2102.06961","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-backup","title":"Deep Reinforcement Learning for Backup Strategies against Adversaries","date":"2021-02-12","arxiv_id":"2102.06632","repositories_listed":0,"syntology":null},{"url":null,"slug":"disturbing-reinforcement-learning-agents-with","title":"Disturbing Reinforcement Learning Agents with Corrupted Rewards","date":"2021-02-12","arxiv_id":"2102.06587","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-data-poisoning-on","title":"Reinforcement Learning For Data Poisoning on Graph Neural Networks","date":"2021-02-12","arxiv_id":"2102.06800","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-combinatorial","title":"Deep Reinforcement Learning for Combinatorial Optimization: Covering Salesman Problems","date":"2021-02-11","arxiv_id":"2102.05875","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-portfolio-1","title":"Deep Reinforcement Learning for Portfolio Optimization using Latent Feature State Space (LFSS) Module","date":"2021-02-11","arxiv_id":"2102.06233","repositories_listed":0,"syntology":null},{"url":null,"slug":"hedging-of-financial-derivative-contracts-via","title":"Hedging of Financial Derivative Contracts via Monte Carlo Tree Search","date":"2021-02-11","arxiv_id":"2102.06274","repositories_listed":0,"syntology":null},{"url":null,"slug":"defense-against-reward-poisoning-attacks-in","title":"Defense Against Reward Poisoning Attacks in Reinforcement Learning","date":"2021-02-10","arxiv_id":"2102.05776","repositories_listed":0,"syntology":null},{"url":null,"slug":"derivative-free-reinforcement-learning-a","title":"Derivative-Free Reinforcement Learning: A Review","date":"2021-02-10","arxiv_id":"2102.05710","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-reinforcement-learning-for","title":"Leveraging Reinforcement Learning for evaluating Robustness of KNN Search Algorithms","date":"2021-02-10","arxiv_id":"2102.06525","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-the-interaction-between-agents-in","title":"Modeling the Interaction between Agents in Cooperative Multi-Agent Reinforcement Learning","date":"2021-02-10","arxiv_id":"2102.06042","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-reinforcement-learning-without","title":"Non-stationary Reinforcement Learning without Prior Knowledge: An Optimal Black-box Approach","date":"2021-02-10","arxiv_id":"2102.05406","repositories_listed":0,"syntology":null}],"record_sha256":"2e8f6778b102b61387de6890e7bccbb208d1c8cd97411705c36314e52f63b4bc","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}