{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/97","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":97,"pages_in_order":152,"rows_per_page":100,"rows":[9601,9700],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/96","next":"/task/reinforcement-learning-1/papers/98","papers":[{"url":null,"slug":"a-multimodal-social-robot-toward-personalized","title":"A MultiModal Social Robot Toward Personalized Emotion Interaction","date":"2021-10-08","arxiv_id":"2110.05186","repositories_listed":0,"syntology":null},{"url":null,"slug":"cheerbots-chatbots-toward-empathy-and","title":"CheerBots: Chatbots toward Empathy and Emotionusing Reinforcement Learning","date":"2021-10-08","arxiv_id":"2110.03949","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-centralize-dual-arm-assembly","title":"Learning to Centralize Dual-Arm Assembly","date":"2021-10-08","arxiv_id":"2110.04003","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-design-choices-in-model-based","title":"Revisiting Design Choices in Offline Model-Based Reinforcement Learning","date":"2021-10-08","arxiv_id":"2110.04135","repositories_listed":0,"syntology":null},{"url":null,"slug":"showing-your-offline-reinforcement-learning","title":"Showing Your Offline Reinforcement Learning Work: Online Evaluation Budget Matters","date":"2021-10-08","arxiv_id":"2110.04156","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-model-selection-approach-for-corruption","title":"A Model Selection Approach for Corruption Robust Reinforcement Learning","date":"2021-10-07","arxiv_id":"2110.03580","repositories_listed":0,"syntology":null},{"url":null,"slug":"bad-policy-density-a-measure-of-reinforcement","title":"Bad-Policy Density: A Measure of Reinforcement Learning Hardness","date":"2021-10-07","arxiv_id":"2110.03424","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-composites-with-target-effective","title":"Designing Composites with Target Effective Young's Modulus using Reinforcement Learning","date":"2021-10-07","arxiv_id":"2110.05260","repositories_listed":0,"syntology":null},{"url":null,"slug":"explaining-deep-reinforcement-learning-agents","title":"Explaining Deep Reinforcement Learning Agents In The Atari Domain through a Surrogate Model","date":"2021-10-07","arxiv_id":"2110.03184","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-in-deep-rl-for-tsp-problems","title":"Generalization in Deep RL for TSP Problems via Equivariance and Local Search","date":"2021-10-07","arxiv_id":"2110.03595","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-pessimism-for-robust-and-efficient","title":"Learning Pessimism for Robust and Efficient Off-Policy Reinforcement Learning","date":"2021-10-07","arxiv_id":"2110.03375","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-reward-free-exploration-for","title":"Near-Optimal Reward-Free Exploration for Linear Mixture MDPs with Plug-in Solver","date":"2021-10-07","arxiv_id":"2110.03244","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-reward-mixing-mdps","title":"Reinforcement Learning in Reward-Mixing MDPs","date":"2021-10-07","arxiv_id":"2110.03743","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-lever-manipulation-using-hindsight","title":"Robotic Lever Manipulation using Hindsight Experience Replay and Shapley Additive Explanations","date":"2021-10-07","arxiv_id":"2110.03292","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-distributional","title":"The Benefits of Being Categorical Distributional: Uncertainty-aware Regularized Exploration in Reinforcement Learning","date":"2021-10-07","arxiv_id":"2110.03155","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-control-of-a-mechatronic-system","title":"Adaptive control of a mechatronic system using constrained residual reinforcement learning","date":"2021-10-06","arxiv_id":"2110.02566","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-actor-critic-for","title":"Scalable Multi-Agent Reinforcement Learning for Residential Load Scheduling under Data Governance","date":"2021-10-06","arxiv_id":"2110.02784","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-attentions-for-solving-pickup","title":"Heterogeneous Attentions for Solving Pickup and Delivery Problem via Deep Reinforcement Learning","date":"2021-10-06","arxiv_id":"2110.02634","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-deep","title":"Improving Generalization of Deep Reinforcement Learning-based TSP Solvers","date":"2021-10-06","arxiv_id":"2110.02843","repositories_listed":0,"syntology":null},{"url":null,"slug":"nested-policy-reinforcement-learning","title":"Compositional Q-learning for electrolyte repletion with imbalanced patient sub-populations","date":"2021-10-06","arxiv_id":"2110.02879","repositories_listed":0,"syntology":null},{"url":null,"slug":"pretraining-reinforcement-learning-sharpening","title":"Pretraining & Reinforcement Learning: Sharpening the Axe Before Cutting the Tree","date":"2021-10-06","arxiv_id":"2110.02497","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-4","title":"A Deep Reinforcement Learning Framework for Contention-Based Spectrum Sharing","date":"2021-10-05","arxiv_id":"2110.02736","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-first-passage-time-minimization","title":"A study of first-passage time minimization via Q-learning in heated gridworlds","date":"2021-10-05","arxiv_id":"2110.02129","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cooperative-lane-changing-at","title":"Decentralized Cooperative Lane Changing at Freeway Weaving Areas Using Multi-Agent Deep Reinforcement Learning","date":"2021-10-05","arxiv_id":"2110.08124","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-guidewire","title":"Deep reinforcement learning for guidewire navigation in coronary artery phantom","date":"2021-10-05","arxiv_id":"2110.01840","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepedge-a-deep-reinforcement-learning-based","title":"DeepEdge: A Deep Reinforcement Learning based Task Orchestrator for Edge Computing","date":"2021-10-05","arxiv_id":"2110.01863","repositories_listed":0,"syntology":null},{"url":null,"slug":"narle-natural-language-models-using","title":"NaRLE: Natural Language Models using Reinforcement Learning with Emotion Feedback","date":"2021-10-05","arxiv_id":"2110.02148","repositories_listed":0,"syntology":null},{"url":null,"slug":"ottr-off-road-trajectory-tracking-using","title":"OTTR: Off-Road Trajectory Tracking using Reinforcement Learning","date":"2021-10-05","arxiv_id":"2110.02332","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-real-time-docking","title":"Mining for Potent Inhibitors through Artificial Intelligence and Physics: A Unified Methodology for Ligand Based and Structure Based Drug Design","date":"2021-10-05","arxiv_id":"2110.01806","repositories_listed":0,"syntology":null},{"url":null,"slug":"you-only-evaluate-once-a-simple-baseline","title":"You Only Evaluate Once: a Simple Baseline Algorithm for Offline RL","date":"2021-10-05","arxiv_id":"2110.02304","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-modified-q-learning-algorithm-for-rate","title":"A Modified Q-Learning Algorithm for Rate-Profiling of Polarization Adjusted Convolutional (PAC) Codes","date":"2021-10-04","arxiv_id":"2110.01563","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-privilege-escalation-with-deep","title":"Automating Privilege Escalation with Deep Reinforcement Learning","date":"2021-10-04","arxiv_id":"2110.01362","repositories_listed":0,"syntology":null},{"url":null,"slug":"behaviour-conditioned-policies-for","title":"Behaviour-conditioned policies for cooperative reinforcement learning tasks","date":"2021-10-04","arxiv_id":"2110.01266","repositories_listed":0,"syntology":null},{"url":"/paper/hit-and-lead-discovery-with-explorative-rl","slug":"hit-and-lead-discovery-with-explorative-rl","title":"Hit and Lead Discovery with Explorative RL and Fragment-based Molecule Generation","date":"2021-10-04","arxiv_id":"2110.01219","repositories_listed":0,"syntology":{"n":5,"n_ran":4,"n_constructed":0,"n_ran_checked":3,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":2,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/hit-and-lead-discovery-with-explorative-rl#ran","syntology_url":"https://syntology.ai/paper/2110.01219","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2110.01219"}},"official":null}},{"url":null,"slug":"learning-to-assist-agents-by-observing-them","title":"Learning to Assist Agents by Observing Them","date":"2021-10-04","arxiv_id":"2110.01311","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-path-planning-using-deep","title":"Multi-Agent Path Planning Using Deep Reinforcement Learning","date":"2021-10-04","arxiv_id":"2110.01460","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-admission-control-1","title":"Reinforcement Learning for Admission Control in Wireless Virtual Network Embedding","date":"2021-10-04","arxiv_id":"2110.01262","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-automated-curriculum-strategy-to-1","title":"A Novel Automated Curriculum Strategy to Solve Hard Sokoban Planning Instances","date":"2021-10-03","arxiv_id":"2110.00898","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-safe-reinforcement-learning-for","title":"Decentralized Safe Reinforcement Learning for Voltage Control","date":"2021-10-03","arxiv_id":"2110.01126","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-clusters-buffer-management-with","title":"DRL-Clusters: Buffer Management with Clustering based Deep Reinforcement Learning","date":"2021-10-03","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-actors-and-learners-a-framework-for","title":"Parallel Actors and Learners: A Framework for Generating Scalable RL Implementations","date":"2021-10-03","arxiv_id":"2110.01101","repositories_listed":0,"syntology":null},{"url":null,"slug":"feel-good-thompson-sampling-for-contextual","title":"Feel-Good Thompson Sampling for Contextual Bandits and Reinforcement Learning","date":"2021-10-02","arxiv_id":"2110.00871","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeking-visual-discomfort-curiosity-driven","title":"Seeking Visual Discomfort: Curiosity-driven Representations for Reinforcement Learning","date":"2021-10-02","arxiv_id":"2110.00784","repositories_listed":0,"syntology":null},{"url":null,"slug":"cellular-traffic-offloading-via-opportunistic","title":"Cellular traffic offloading via Opportunistic Networking with Reinforcement Learning","date":"2021-10-01","arxiv_id":"2110.00397","repositories_listed":0,"syntology":null},{"url":null,"slug":"divergence-regularized-multi-agent-actor","title":"Divergence-Regularized Multi-Agent Actor-Critic","date":"2021-10-01","arxiv_id":"2110.00304","repositories_listed":0,"syntology":null},{"url":null,"slug":"dnn-opt-an-rl-inspired-optimization-for","title":"DNN-Opt: An RL Inspired Optimization for Analog Circuit Sizing using Deep Neural Networks","date":"2021-10-01","arxiv_id":"2110.00211","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-planning-for-autonomous-vehicles-in","title":"Motion Planning for Autonomous Vehicles in the Presence of Uncertainty Using Reinforcement Learning","date":"2021-10-01","arxiv_id":"2110.00640","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-lane-cruising-using-hierarchical","title":"Multi-lane Cruising Using Hierarchical Planning and Reinforcement Learning","date":"2021-10-01","arxiv_id":"2110.00650","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-aware-model-based-reinforcement","title":"Safety aware model-based reinforcement learning for optimal control of a class of output-feedback nonlinear systems","date":"2021-10-01","arxiv_id":"2110.00271","repositories_listed":0,"syntology":null},{"url":null,"slug":"terminal-adaptive-guidance-for-autonomous","title":"Terminal Adaptive Guidance for Autonomous Hypersonic Strike Weapons via Reinforcement Learning","date":"2021-10-01","arxiv_id":"2110.00634","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-privacy-preserving-distributed-training","title":"A Privacy-preserving Distributed Training Framework for Cooperative Multi-agent Deep Reinforcement Learning","date":"2021-09-30","arxiv_id":"2109.14998","repositories_listed":0,"syntology":null},{"url":null,"slug":"bitcoin-transaction-strategy-construction","title":"Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning","date":"2021-09-30","arxiv_id":"2109.14789","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-reinforcement-learning-for","title":"Coordinated Reinforcement Learning for Optimizing Mobile Networks","date":"2021-09-30","arxiv_id":"2109.15175","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-graph-based-multi-agent","title":"Decentralized Graph-Based Multi-Agent Reinforcement Learning Using Reward Machines","date":"2021-09-30","arxiv_id":"2110.00096","repositories_listed":0,"syntology":null},{"url":null,"slug":"hlic-harmonizing-optimization-metrics-in","title":"HLIC: Harmonizing Optimization Metrics in Learned Image Compression by Reinforcement Learning","date":"2021-09-30","arxiv_id":"2109.14863","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-interactions-of-autonomous-vehicles","title":"Modeling Interactions of Autonomous Vehicles and Pedestrians with Deep Multi-Agent Reinforcement Learning for Collision Avoidance","date":"2021-09-30","arxiv_id":"2109.15266","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-classical-planning","title":"Reinforcement Learning for Classical Planning: Viewing Heuristics as Dense Reward Generators","date":"2021-09-30","arxiv_id":"2109.14830","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-information","title":"Reinforcement Learning with Information-Theoretic Actuation","date":"2021-09-30","arxiv_id":"2109.15147","repositories_listed":0,"syntology":null},{"url":null,"slug":"stability-constrained-reinforcement-learning","title":"Stability Constrained Reinforcement Learning for Real-Time Voltage Control","date":"2021-09-30","arxiv_id":"2109.14854","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-planning-with-deep-reinforcement","title":"Trajectory Planning with Deep Reinforcement Learning in High-Level Action Spaces","date":"2021-09-30","arxiv_id":"2110.00044","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-flexible-measurement-of-diversity-in","title":"A Flexible Measurement of Diversity in Datasets with Random Network Distillation","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-theory-of-relativity-in","title":"A General Theory of Relativity in Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-principled-permutation-invariant-approach","title":"A Principled Permutation Invariant Approach to Mean-Field Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-two-time-scale-stochastic-optimization","title":"A Two-Time-Scale Stochastic Optimization Framework with Applications in Control and Reinforcement Learning","date":"2021-09-29","arxiv_id":"2109.14756","repositories_listed":0,"syntology":null},{"url":null,"slug":"aarl-automated-auxiliary-loss-for","title":"AARL: Automated Auxiliary Loss for Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-graph-capsule-convolutional-networks","title":"Adaptive Graph Capsule Convolutional Networks","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-q-learning-for-interaction-limited","title":"Adaptive Q-learning for Interaction-Limited Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-style-transfer-for-robust-policy","title":"Adversarial Style Transfer for Robust Policy Optimization in Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-attempt-to-model-human-trust-with","title":"An Attempt to Model Human Trust with Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-experimental-design-perspective-on-1","title":"An Experimental Design Perspective on Exploration in Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optics-controlling-environment-and","title":"An Optics Controlling Environment and Reinforcement Learning Benchmarks","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-deep-reinforcement-learning","title":"Assessing Deep Reinforcement Learning Policies via Natural Corruptions at the Edge of Imperceptibility","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-encoding-inverse-reinforcement-learning","title":"Auto-Encoding Inverse Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-exploration-for-lifelong","title":"Bayesian Exploration for Lifelong Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-sample-selection-strategies-for","title":"Benchmarking Sample Selection Strategies for Batch Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"better-state-exploration-using-action","title":"Better state exploration using action sequence equivalence","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-linear-value-networks-for-multi-goal","title":"Bi-linear Value Networks for Multi-goal Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"boosted-curriculum-reinforcement-learning","title":"Boosted Curriculum Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"can-reinforcement-learning-efficiently-find","title":"Can Reinforcement Learning Efficiently Find Stackelberg-Nash Equilibria in General-Sum Markov Games?","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"causaldyna-improving-generalization-of-dyna","title":"CausalDyna: Improving Generalization of Dyna-style Reinforcement Learning via Counterfactual-Based Data Augmentation","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"closed-loop-control-of-additive-manufacturing","title":"Closed-Loop Control of Additive Manufacturing via Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-reinforcement-learning-based","title":"Combinatorial Reinforcement Learning Based Scheduling for DNN Execution on Edge","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"conditional-value-at-risk-for-quantitative","title":"Conditional Value-at-Risk for Quantitative Trading: A Direct Reinforcement Learning Approach","date":"2021-09-29","arxiv_id":"2109.14438","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-deep-q-learning-in-optimal-control","title":"Continuous Deep Q-Learning in Optimal Control Problems: Normalized Advantage Functions Analysis","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"convergent-and-efficient-deep-q-learning","title":"Convergent and Efficient Deep Q Learning Algorithm","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-attacks-against-federated","title":"Coordinated Attacks Against Federated Learning: A Multi-Agent Reinforcement Learning Approach","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cubetr-learning-to-solve-the-rubik-s-cube","title":"CubeTR: Learning to Solve the Rubik's Cube using Transformers","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-sharing-without-rewards-in-multi-task","title":"Data Sharing without Rewards in Multi-Task Offline Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cooperative-multi-agent","title":"Decentralized Cooperative Multi-Agent Reinforcement Learning with Exploration","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cross-entropy-method-for-model","title":"Decentralized Cross-Entropy Method for Model-Based Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decoupling-strategy-and-surface-realization","title":"Decoupling Strategy and Surface Realization for Task-oriented Dialogues","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-ensemble-policy-learning","title":"Deep Ensemble Policy Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-inverse-reinforcement-learning-via","title":"Deep Inverse Reinforcement Learning via Adversarial One-Class Classification","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-of-intrinsically-motivated","title":"Deep Learning of Intrinsically Motivated Options in the Arcade Learning Environment","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-worst-case-corruptions-via-loss","title":"Detecting Worst-case Corruptions via Loss Landscape Curvature in Deep Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dibb-distributing-black-box-optimization","title":"DiBB: Distributing Black-Box Optimization","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-generalization-in-reinforcement","title":"Disentangling Generalization in Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/disentangling-sources-of-risk-for","slug":"disentangling-sources-of-risk-for","title":"Disentangling Sources of Risk for Distributional Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-decision-transformer-for","title":"Distributional Decision Transformer for Hindsight Information Matching","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-perturbation-for-efficient","title":"Distributional Perturbation for Efficient Exploration in Distributional Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"87f059d0002e62f947fc55f595053788b19973100f3edfcbd8458d30c727a098","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}