{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/128","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":128,"pages_in_order":152,"rows_per_page":100,"rows":[12701,12800],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/127","next":"/task/reinforcement-learning-1/papers/129","papers":[{"url":null,"slug":"manga-method-agnostic-neural-policy","title":"MANGA: Method Agnostic Neural-policy Generalization and Adaptation","date":"2019-11-19","arxiv_id":"1911.08444","repositories_listed":0,"syntology":null},{"url":null,"slug":"placement-optimization-of-aerial-base","title":"Placement Optimization of Aerial Base Stations with Deep Reinforcement Learning","date":"2019-11-19","arxiv_id":"1911.08111","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduced-advantage-estimation-with","title":"Variance Reduced Advantage Estimation with $δ$ Hindsight Credit Assignment","date":"2019-11-19","arxiv_id":"1911.08362","repositories_listed":0,"syntology":null},{"url":null,"slug":"comments-on-the-du-kakade-wang-yang-lower","title":"Comments on the Du-Kakade-Wang-Yang Lower Bounds","date":"2019-11-18","arxiv_id":"1911.07910","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-through-intrinsic","title":"Efficient Exploration through Intrinsic Motivation Learning for Unsupervised Subgoal Discovery in Model-Free Hierarchical Reinforcement Learning","date":"2019-11-18","arxiv_id":"1911.10164","repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-cooperation-via-team-regret","title":"Inducing Cooperation via Team Regret Minimization based Multi-Agent Deep Reinforcement Learning","date":"2019-11-18","arxiv_id":"1911.07712","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-reinforcement-learning-of","title":"Unsupervised Reinforcement Learning of Transferable Meta-Skills for Embodied Navigation","date":"2019-11-18","arxiv_id":"1911.07450","repositories_listed":0,"syntology":null},{"url":null,"slug":"hebbian-synaptic-modifications-in-spiking","title":"Hebbian Synaptic Modifications in Spiking Neurons that Learn","date":"2019-11-17","arxiv_id":"1911.07247","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-maximum-causal-entropy-for","title":"Generalized Maximum Causal Entropy for Inverse Reinforcement Learning","date":"2019-11-16","arxiv_id":"1911.06928","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-with-missing","title":"Inverse Reinforcement Learning with Missing Data","date":"2019-11-16","arxiv_id":"1911.06930","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-policy-gradient-algorithms-by","title":"Off-Policy Policy Gradient Algorithms by Constraining the State Distribution Shift","date":"2019-11-16","arxiv_id":"1911.06970","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-imperfect-2","title":"Reinforcement Learning from Imperfect Demonstrations under Soft Expert Guidance","date":"2019-11-16","arxiv_id":"1911.07109","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-co-adaptation-of-morphology","title":"Data-efficient Co-Adaptation of Morphology and Behaviour with Deep Reinforcement Learning","date":"2019-11-15","arxiv_id":"1911.06832","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-exploration-through-latent","title":"Improved Exploration through Latent Trajectory Optimization in Deep Deterministic Policy Gradient","date":"2019-11-15","arxiv_id":"1911.06833","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reduction-from-reinforcement-learning-to-no","title":"A Reduction from Reinforcement Learning to No-Regret Online Learning","date":"2019-11-14","arxiv_id":"1911.05873","repositories_listed":0,"syntology":null},{"url":null,"slug":"atari-fying-the-vehicle-routing-problem-with","title":"Gamifying the Vehicle Routing Problem with Stochastic Requests","date":"2019-11-14","arxiv_id":"1911.05922","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-adaptive","title":"Deep Reinforcement Learning for Adaptive Traffic Signal Control","date":"2019-11-14","arxiv_id":"1911.06294","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotics-of-reinforcement-learning-with","title":"Asymptotics of Reinforcement Learning with Neural Networks","date":"2019-11-13","arxiv_id":"1911.07304","repositories_listed":0,"syntology":null},{"url":null,"slug":"buffer-aware-wireless-scheduling-based-on","title":"Buffer-aware Wireless Scheduling based on Deep Reinforcement Learning","date":"2019-11-13","arxiv_id":"1911.05281","repositories_listed":0,"syntology":null},{"url":null,"slug":"kinematic-state-abstraction-and-provably","title":"Kinematic State Abstraction and Provably Efficient Rich-Observation Reinforcement Learning","date":"2019-11-13","arxiv_id":"1911.05815","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-communicate-in-multi-agent","title":"Learning to Communicate in Multi-Agent Reinforcement Learning : A Review","date":"2019-11-13","arxiv_id":"1911.05438","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-driven-test-generation","title":"Reinforcement Learning-Driven Test Generation for Android GUI Applications using Formal Specifications","date":"2019-11-13","arxiv_id":"1911.05403","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-training-in-pommerman-with","title":"Accelerating Training in Pommerman with Imitation and Reinforcement Learning","date":"2019-11-12","arxiv_id":"1911.04947","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-planning-under-partial","title":"Efficient Planning under Partial Observability with Unnormalized Q Functions and Spectral Learning","date":"2019-11-12","arxiv_id":"1911.05010","repositories_listed":0,"syntology":null},{"url":null,"slug":"msdf-a-deep-reinforcement-learning-framework","title":"MSDF: A Deep Reinforcement Learning Framework for Service Function Chain Migration","date":"2019-11-12","arxiv_id":"1911.04801","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-shot-learning-and-behavioral-eligibility","title":"One-shot learning and behavioral eligibility traces in sequential decision making","date":"2019-11-12","arxiv_id":"1707.04192","repositories_listed":0,"syntology":null},{"url":null,"slug":"schedule-earth-observation-satellites-with","title":"Schedule Earth Observation satellites with Deep Reinforcement Learning","date":"2019-11-12","arxiv_id":"1911.05696","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-active-multi-step-reinforcement","title":"Context-aware Active Multi-Step Reinforcement Learning","date":"2019-11-11","arxiv_id":"1911.04107","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-order-sub-questions-for-complex","title":"Learning to Order Sub-questions for Complex Question Answering","date":"2019-11-11","arxiv_id":"1911.04065","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-variational","title":"Reinforcement-Learning-Based Variational Quantum Circuits Optimization for Combinatorial Problems","date":"2019-11-11","arxiv_id":"1911.04574","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-dynamic","title":"Deep Reinforcement Learning Based Dynamic Trajectory Control for UAV-assisted Mobile Edge Computing","date":"2019-11-10","arxiv_id":"1911.03887","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimalistic-attacks-how-little-it-takes-to","title":"Minimalistic Attacks: How Little it Takes to Fool a Deep Reinforcement Learning Policy","date":"2019-11-10","arxiv_id":"1911.03849","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-added-chemical-discovery-using","title":"Value-Added Chemical Discovery Using Reinforcement Learning","date":"2019-11-10","arxiv_id":"1911.07630","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-method","title":"Hierarchical Reinforcement Learning Method for Autonomous Vehicle Behavior Planning","date":"2019-11-09","arxiv_id":"1911.03799","repositories_listed":0,"syntology":null},{"url":null,"slug":"worst-cases-policy-gradients","title":"Worst Cases Policy Gradients","date":"2019-11-09","arxiv_id":"1911.03618","repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-bayesian-recurrent-neural-networks-for","title":"Fully Bayesian Recurrent Neural Networks for Safe Reinforcement Learning","date":"2019-11-08","arxiv_id":"1911.03308","repositories_listed":0,"syntology":null},{"url":null,"slug":"option-compatible-reward-inverse","title":"Option Compatible Reward Inverse Reinforcement Learning","date":"2019-11-07","arxiv_id":"1911.02723","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reward-decomposition-for","title":"Distributional Reward Decomposition for Reinforcement Learning","date":"2019-11-06","arxiv_id":"1911.02166","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-sharing-between-cooperative","title":"Experience Sharing Between Cooperative Reinforcement Learning Agents","date":"2019-11-06","arxiv_id":"1911.02191","repositories_listed":0,"syntology":null},{"url":null,"slug":"mbcal-a-simple-and-efficient-reinforcement","title":"MBCAL: Sample Efficient and Variance Reduced Reinforcement Learning for Recommender Systems","date":"2019-11-06","arxiv_id":"1911.02248","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-the-factual-correctness-of-a","title":"Optimizing the Factual Correctness of a Summary: A Study of Summarizing Radiology Reports","date":"2019-11-06","arxiv_id":"1911.02541","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepracer-educational-autonomous-racing","title":"DeepRacer: Educational Autonomous Racing Platform for Experimentation with Sim2Real Reinforcement Learning","date":"2019-11-05","arxiv_id":"1911.01562","repositories_listed":0,"syntology":null},{"url":null,"slug":"quinoa-a-q-function-you-infer-normalized-over","title":"Quinoa: a Q-function You Infer Normalized Over Actions","date":"2019-11-05","arxiv_id":"1911.01831","repositories_listed":0,"syntology":null},{"url":null,"slug":"robo-advising-learning-investors-risk","title":"Robo-advising: Learning Investors' Risk Preferences via Portfolio Choices","date":"2019-11-05","arxiv_id":"1911.02067","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-end-to-end-deep-rl-framework-for-task","title":"An End-to-End Deep RL Framework for Task Arrangement in Crowdsourcing Platforms","date":"2019-11-04","arxiv_id":"1911.01030","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-tracking-control-with-kernel-trick","title":"Robotic Tracking Control with Kernel Trick-based Reinforcement Learning","date":"2019-11-04","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-diverse-exploration","title":"Maximum Entropy Diverse Exploration: Disentangling Maximum Entropy Reinforcement Learning","date":"2019-11-03","arxiv_id":"1911.00828","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-cooperative-inverse-reinforcement-1","title":"Non-Cooperative Inverse Reinforcement Learning","date":"2019-11-03","arxiv_id":"1911.04220","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-robustness-training-for-deep","title":"Online Robustness Training for Deep Reinforcement Learning","date":"2019-11-03","arxiv_id":"1911.00887","repositories_listed":0,"syntology":null},{"url":null,"slug":"problem-dependent-reinforcement-learning-1","title":"Problem Dependent Reinforcement Learning Bounds Which Can Identify Bandit Structure in MDPs","date":"2019-11-03","arxiv_id":"1911.00954","repositories_listed":0,"syntology":null},{"url":null,"slug":"a2-extracting-cyclic-switchings-from-dob-nets","title":"A2: Extracting Cyclic Switchings from DOB-nets for Rejecting Excessive Disturbances","date":"2019-11-01","arxiv_id":"1911.00165","repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-supervised-question-reformulation-for","title":"Answer-Supervised Question Reformulation for Enhancing Conversational Machine Comprehension","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-text","title":"Deep Reinforcement Learning-based Text Anonymization against Private-Attribute Inference","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"divine-a-generative-adversarial-imitation","title":"DIVINE: A Generative Adversarial Imitation Learning Framework for Knowledge Graph Reasoning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-diverse-expressions-for-paraphrase","title":"Exploring Diverse Expressions for Paraphrase Generation","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-formality-tuned-summaries-using","title":"Generating Formality-Tuned Summaries Using Input-Dependent Rewards","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-graph-attention-mechanism-into","title":"Incorporating Graph Attention Mechanism into Knowledge Graph Reasoning Based on Deep Reinforcement Learning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-the-extraction-order-of-multiple","title":"Learning the Extraction Order of Multiple Relational Facts in a Sentence with Reinforcement Learning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-topic-model-with-reinforcement","title":"Neural Topic Model with Reinforcement Learning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"situated-gail-multitask-imitation-using-task","title":"Situated GAIL: Multitask imitation using task-conditioned adversarial inverse reinforcement learning","date":"2019-11-01","arxiv_id":"1911.00238","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepline-automl-tool-for-pipelines-generation","title":"DeepLine: AutoML Tool for Pipelines Generation using Deep Reinforcement Learning and Hierarchical Actions Filtering","date":"2019-10-31","arxiv_id":"1911.00061","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-expert-networks-for-meta","title":"Hierarchical Expert Networks for Meta-Learning","date":"2019-10-31","arxiv_id":"1911.00348","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlink-deep-reinforcement-learning-for-user","title":"RLINK: Deep Reinforcement Learning for User Identity Linkage","date":"2019-10-31","arxiv_id":"1910.14273","repositories_listed":0,"syntology":null},{"url":null,"slug":"vase-variational-assorted-surprise","title":"VASE: Variational Assorted Surprise Exploration for Reinforcement Learning","date":"2019-10-31","arxiv_id":"1910.14351","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-distributed-model-free-algorithm-for-multi","title":"A Distributed Model-Free Algorithm for Multi-hop Ride-sharing using Deep Reinforcement Learning","date":"2019-10-30","arxiv_id":"1910.14002","repositories_listed":0,"syntology":null},{"url":null,"slug":"dadi-dynamic-discovery-of-fair-information","title":"DADI: Dynamic Discovery of Fair Information with Adversarial Reinforcement Learning","date":"2019-10-30","arxiv_id":"1910.13983","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-algorithmic-solutions-to-symbolic","title":"Learning Algorithmic Solutions to Symbolic Planning Tasks with a Neural Computer Architecture","date":"2019-10-30","arxiv_id":"1911.00926","repositories_listed":0,"syntology":null},{"url":null,"slug":"rbed-reward-based-epsilon-decay","title":"RBED: Reward Based Epsilon Decay","date":"2019-10-30","arxiv_id":"1910.13701","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013196","title":"Deep Decentralized Reinforcement Learning for Cooperative Control","date":"2019-10-29","arxiv_id":"1910.13196","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013213","title":"Overcoming Catastrophic Interference in Online Reinforcement Learning with Dynamic Self-Organizing Maps","date":"2019-10-29","arxiv_id":"1910.13213","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013272","title":"Feedback Linearization for Unknown Systems via Reinforcement Learning","date":"2019-10-29","arxiv_id":"1910.13272","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013393","title":"Constrained Reinforcement Learning Has Zero Duality Gap","date":"2019-10-29","arxiv_id":"1910.13393","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013399","title":"Robust Model-free Reinforcement Learning with Multi-objective Bayesian Optimization","date":"2019-10-29","arxiv_id":"1910.13399","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-sampling-quasi-newton-methods-for","title":"Adaptive Sampling Quasi-Newton Methods for Derivative-Free Stochastic Optimization","date":"2019-10-29","arxiv_id":"1910.13516","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-distributed","title":"Deep Reinforcement Learning for Distributed Uncoordinated Cognitive Radios Resource Allocation","date":"2019-10-29","arxiv_id":"1911.03366","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-market-making","title":"Deep reinforcement learning for market making in corporate bonds: beating the curse of dimensionality","date":"2019-10-29","arxiv_id":"1910.13205","repositories_listed":0,"syntology":null},{"url":null,"slug":"biomimetic-ultra-broadband-perfect-absorbers","title":"Biomimetic Ultra-Broadband Perfect Absorbers Optimised with Reinforcement Learning","date":"2019-10-28","arxiv_id":"1910.12465","repositories_listed":0,"syntology":null},{"url":null,"slug":"certified-adversarial-robustness-for-deep","title":"Certified Adversarial Robustness for Deep Reinforcement Learning","date":"2019-10-28","arxiv_id":"1910.12908","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-weight-and-q-function-learning-for","title":"Minimax Weight and Q-Function Learning for Off-Policy Evaluation","date":"2019-10-28","arxiv_id":"1910.12809","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-mean-field-reinforcement-learning","title":"Model-Free Mean-Field Reinforcement Learning: Mean-Field MDP and Mean-Field Q-Learning","date":"2019-10-28","arxiv_id":"1910.12802","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-evolution-in-deep","title":"Neural Architecture Evolution in Deep Reinforcement Learning for Continuous Control","date":"2019-10-28","arxiv_id":"1910.12824","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-enabled-reliable","title":"Reinforcement Learning-Enabled Reliable Wireless Sensor Networks in Dynamic Underground Environments","date":"2019-10-26","arxiv_id":"1908.05804","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamps-safe-multi-agent-reinforcement-learning","title":"MAMPS: Safe Multi-Agent Reinforcement Learning via Model Predictive Shielding","date":"2019-10-25","arxiv_id":"1910.12639","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-projective-simulation","title":"On the convergence of projective-simulation-based reinforcement learning in Markov decision processes","date":"2019-10-25","arxiv_id":"1910.11914","repositories_listed":0,"syntology":null},{"url":null,"slug":"case-study-verifying-the-safety-of-an","title":"Case Study: Verifying the Safety of an Autonomous Racing Car with a Neural Network Controller","date":"2019-10-24","arxiv_id":"1910.11309","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-in-deep-reinforcement-learning","title":"Pre-training in Deep Reinforcement Learning for Automatic Speech Recognition","date":"2019-10-24","arxiv_id":"1910.11256","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-model-predictive-shielding-for-safe","title":"Robust Model Predictive Shielding for Safe Reinforcement Learning with Stochastic Dynamics","date":"2019-10-24","arxiv_id":"1910.10885","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-confidence-policy-optimization-reshaping","title":"Optimizing Percentile Criterion Using Robust MDPs","date":"2019-10-23","arxiv_id":"1910.10786","repositories_listed":0,"syntology":null},{"url":null,"slug":"partially-detected-intelligent-traffic-signal","title":"Partially Detected Intelligent Traffic Signal Control: Environmental Adaptation","date":"2019-10-23","arxiv_id":"1910.10808","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-reinforcement-learning","title":"Sample Complexity of Reinforcement Learning using Linearly Combined Model Ensembles","date":"2019-10-23","arxiv_id":"1910.10597","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-and-safer-training-by-embedding-high","title":"Faster and Safer Training by Embedding High-Level Knowledge into Deep Reinforcement Learning","date":"2019-10-22","arxiv_id":"1910.09986","repositories_listed":0,"syntology":null},{"url":null,"slug":"state2vec-off-policy-successor-features","title":"State2vec: Off-Policy Successor Features Approximators","date":"2019-10-22","arxiv_id":"1910.10277","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-reinforcement-learning-for-5g","title":"Application of Reinforcement Learning for 5G Scheduling Parameter Optimization","date":"2019-10-21","arxiv_id":"1911.07608","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-benefits-from-trajectory","title":"Combining Benefits from Trajectory Optimization and Deep Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09667","repositories_listed":0,"syntology":null},{"url":null,"slug":"good-better-best-textual-distractors","title":"Good, Better, Best: Textual Distractors Generation for Multiple-Choice Visual Question Answering via Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09134","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-like-decision-making-document-level","title":"Human-Like Decision Making: Document-level Aspect Sentiment Classification via Hierarchical Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09260","repositories_listed":0,"syntology":null},{"url":null,"slug":"ipo-interior-point-policy-optimization-under","title":"IPO: Interior-point Policy Optimization under Constraints","date":"2019-10-21","arxiv_id":"1910.09615","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-generalized-forces-with","title":"Modelling Generalized Forces with Reinforcement Learning for Sim-to-Real Transfer","date":"2019-10-21","arxiv_id":"1910.09471","repositories_listed":0,"syntology":null},{"url":null,"slug":"momentum-in-reinforcement-learning","title":"Momentum in Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09322","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-hierarchical-reinforcement","title":"Multi-agent Hierarchical Reinforcement Learning with Dynamic Termination","date":"2019-10-21","arxiv_id":"1910.09508","repositories_listed":0,"syntology":null}],"record_sha256":"213799aa463302f8382658ccbdb478dd72e07defd2d1cc0c5eb6ef9bb72140e8","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}