{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/q-learning/papers/17","list_of":"/task/q-learning","task":"Q-Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":17,"pages_in_order":20,"rows_per_page":100,"rows":[1601,1700],"of":1918,"counts":{"archive_papers_tagged":1918,"with_a_code_link":463,"where_syntology_ran_a_sample":119,"not_listed_spam_title":0,"listed":1918,"listed_where_code_ran":119,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":102,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":102,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/q-learning","prev":"/task/q-learning/papers/16","next":"/task/q-learning/papers/18","papers":[{"url":null,"slug":"quantum-observables-for-continuous-control-of","title":"Quantum Observables for continuous control of the Quantum Approximate Optimization Algorithm via Reinforcement Learning","date":"2019-11-21","arxiv_id":"1911.09682","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotics-of-reinforcement-learning-with","title":"Asymptotics of Reinforcement Learning with Neural Networks","date":"2019-11-13","arxiv_id":"1911.07304","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-bahdanau-attention-using-election","title":"Modelling Bahdanau Attention using Election methods aided by Q-Learning","date":"2019-11-10","arxiv_id":"1911.03853","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stage-wecc-composite-load-modeling-a","title":"Two-stage WECC Composite Load Modeling: A Double Deep Q-Learning Networks Approach","date":"2019-11-08","arxiv_id":"1911.04894","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenging-on-car-racing-problem-from-openai","title":"Challenging On Car Racing Problem from OpenAI gym","date":"2019-11-02","arxiv_id":"1911.04868","repositories_listed":0,"syntology":null},{"url":null,"slug":"biomimetic-ultra-broadband-perfect-absorbers","title":"Biomimetic Ultra-Broadband Perfect Absorbers Optimised with Reinforcement Learning","date":"2019-10-28","arxiv_id":"1910.12465","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-mean-field-reinforcement-learning","title":"Model-Free Mean-Field Reinforcement Learning: Mean-Field MDP and Mean-Field Q-Learning","date":"2019-10-28","arxiv_id":"1910.12802","repositories_listed":0,"syntology":null},{"url":null,"slug":"d-point-trigonometric-path-planning-based-on","title":"D-Point Trigonometric Path Planning based on Q-Learning in Uncertain Environments","date":"2019-10-26","arxiv_id":"1910.12020","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-for-same-day-delivery-with-a","title":"Deep Q-Learning for Same-Day Delivery with Vehicles and Drones","date":"2019-10-25","arxiv_id":"1910.11901","repositories_listed":0,"syntology":null},{"url":null,"slug":"partially-detected-intelligent-traffic-signal","title":"Partially Detected Intelligent Traffic Signal Control: Environmental Adaptation","date":"2019-10-23","arxiv_id":"1910.10808","repositories_listed":0,"syntology":null},{"url":null,"slug":"reverse-experience-replay","title":"Reverse Experience Replay","date":"2019-10-19","arxiv_id":"1910.08780","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-reduction-of-variance-and","title":"On the Reduction of Variance and Overestimation of Deep Q-Learning","date":"2019-10-14","arxiv_id":"1910.05983","repositories_listed":0,"syntology":null},{"url":null,"slug":"zap-q-learning-with-nonlinear-function","title":"Zap Q-Learning With Nonlinear Function Approximation","date":"2019-10-11","arxiv_id":"1910.05405","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-hormone-closed-loop-delivery-system","title":"A Dual-Hormone Closed-Loop Delivery System for Type 1 Diabetes Using Deep Reinforcement Learning","date":"2019-10-09","arxiv_id":"1910.04059","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-behavior-cloning-and","title":"Integrating Behavior Cloning and Reinforcement Learning for Improved Performance in Dense and Sparse Reward Environments","date":"2019-10-09","arxiv_id":"1910.04281","repositories_listed":0,"syntology":null},{"url":null,"slug":"tactical-reward-shaping-bypassing","title":"Tactical Reward Shaping: Bypassing Reinforcement Learning with Strategy-Based Goals","date":"2019-10-08","arxiv_id":"1910.03144","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-synergic-learning-for-autonomous","title":"Toward Synergic Learning for Autonomous Manipulation of Deformable Tissues via Surgical Robots: An Approximate Q-Learning Approach","date":"2019-10-08","arxiv_id":"1910.03398","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-structured-1","title":"Reinforcement Learning with Structured Hierarchical Grammar Representations of Actions","date":"2019-10-07","arxiv_id":"1910.02876","repositories_listed":0,"syntology":null},{"url":null,"slug":"im-sorry-dave-im-afraid-i-cant-do-that-deep-q","title":"I'm sorry Dave, I'm afraid I can't do that, Deep Q-learning from forbidden action","date":"2019-10-04","arxiv_id":"1910.02078","repositories_listed":0,"syntology":null},{"url":null,"slug":"fair-loss-margin-aware-reinforcement-learning","title":"Fair Loss: Margin-Aware Reinforcement Learning for Deep Face Recognition","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"quantile-qt-opt-for-risk-aware-vision-based","title":"Quantile QT-Opt for Risk-Aware Vision-Based Robotic Grasping","date":"2019-10-01","arxiv_id":"1910.02787","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-multi-step-q-learning","title":"Composite Q-learning: Multi-scale Q-function Decomposition and Separable Optimization","date":"2019-09-30","arxiv_id":"1909.13518","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-for-pomdp-an-application-to","title":"Q-learning for POMDP: An application to learning locomotion gaits","date":"2019-09-30","arxiv_id":"1910.00107","repositories_listed":0,"syntology":null},{"url":null,"slug":"caql-continuous-action-q-learning","title":"CAQL: Continuous Action Q-Learning","date":"2019-09-26","arxiv_id":"1909.12397","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-altq-learn-faster-experiments-and-theory","title":"CAN ALTQ LEARN FASTER: EXPERIMENTS AND THEORY","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"long-term-planning-short-term-adjustments","title":"Long-term planning, short-term adjustments","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-fake-news-in-social-networks-with","title":"Modeling Fake News in Social Networks with Deep Multi-Agent Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-multi-step-q-learning-1","title":"Off-policy Multi-step Q-learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-tree-network","title":"Policy Tree Network","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"qxplore-q-learning-exploration-by-maximizing-1","title":"QXplore: Q-Learning Exploration by Maximizing Temporal Difference Error","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"striving-for-simplicity-in-off-policy-deep-1","title":"Striving for Simplicity in Off-Policy Deep Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-approximate-and","title":"On the Convergence of Approximate and Regularized Policy Iteration Schemes","date":"2019-09-20","arxiv_id":"1909.09621","repositories_listed":0,"syntology":null},{"url":null,"slug":"dependency-aware-computation-offloading-in","title":"Dependency-Aware Computation Offloading in Mobile Edge Computing: A Reinforcement Learning Approach","date":"2019-09-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"split-deep-q-learning-for-robust-object","title":"Split Deep Q-Learning for Robust Object Singulation","date":"2019-09-17","arxiv_id":"1909.08105","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-inference-of-reward-machines-and","title":"Joint Inference of Reward Machines and Policies for Reinforcement Learning","date":"2019-09-12","arxiv_id":"1909.05912","repositories_listed":0,"syntology":null},{"url":null,"slug":"sqlr-short-term-memory-q-learning-for-elastic","title":"SQLR: Short-Term Memory Q-Learning for Elastic Provisioning","date":"2019-09-12","arxiv_id":"1909.05772","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutual-information-regularization-in-markov","title":"Mutual-Information Regularization in Markov Decision Processes and Actor-Critic Learning","date":"2019-09-11","arxiv_id":"1909.05950","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-assisted-energy-aware-traffic","title":"Q-learning Assisted Energy-Aware Traffic Offloading and Cell Switching in Heterogeneous Networks","date":"2019-09-11","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-models-of-human-1","title":"Reinforcement Learning Models of Human Behavior: Reward Processing in Mental Disorders","date":"2019-09-11","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multistep-lyapunov-approach-for-finite-time","title":"A Multistep Lyapunov Approach for Finite-Time Analysis of Biased Stochastic Approximation","date":"2019-09-10","arxiv_id":"1909.04299","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-based-aerial-base-station","title":"Q-Learning Based Aerial Base Station Placement for Fairness Enhancement in Mobile Networks","date":"2019-09-10","arxiv_id":"1909.08093","repositories_listed":0,"syntology":null},{"url":null,"slug":"fixed-horizon-temporal-difference-methods-for","title":"Fixed-Horizon Temporal Difference Methods for Stable Reinforcement Learning","date":"2019-09-09","arxiv_id":"1909.03906","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-driving-scale-car-trained-by-deep","title":"Self-driving scale car trained by Deep reinforcement learning","date":"2019-09-08","arxiv_id":"1909.03467","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-pseudo-q-learning-based-deterministic","title":"Multi Pseudo Q-learning Based Deterministic Policy Gradient for Tracking Control of Autonomous Underwater Vehicles","date":"2019-09-07","arxiv_id":"1909.03204","repositories_listed":0,"syntology":null},{"url":null,"slug":"encoders-and-decoders-for-quantum-expander","title":"Encoders and Decoders for Quantum Expander Codes Using Machine Learning","date":"2019-09-06","arxiv_id":"1909.02945","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-q-a-unified-algorithm-with-function","title":"Gradient Q$(σ, λ)$: A Unified Algorithm with Function Approximation for Reinforcement Learning","date":"2019-09-06","arxiv_id":"1909.02877","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-data-enhanced-traffic-flow-monitoring-in","title":"Q-DATA: Enhanced Traffic Flow Monitoring in Software-Defined Networks applying Q-learning","date":"2019-09-04","arxiv_id":"1909.01544","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-discounted-stochastic-two-player","title":"Solving Discounted Stochastic Two-Player Games with Near-Optimal Time and Sample Complexity","date":"2019-08-29","arxiv_id":"1908.11071","repositories_listed":0,"syntology":null},{"url":null,"slug":"networked-control-of-nonlinear-systems-under","title":"Networked Control of Nonlinear Systems under Partial Observation Using Continuous Deep Q-Learning","date":"2019-08-28","arxiv_id":"1908.10722","repositories_listed":0,"syntology":null},{"url":null,"slug":"stmarl-a-spatio-temporal-multi-agent","title":"STMARL: A Spatio-Temporal Multi-Agent Reinforcement Learning Approach for Cooperative Traffic Light Control","date":"2019-08-28","arxiv_id":"1908.10577","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-foreign","title":"Deep Reinforcement Learning for Foreign Exchange Trading","date":"2019-08-21","arxiv_id":"1908.08036","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-traffic-signal-control-using-a","title":"Large-Scale Traffic Signal Control Using a Novel Multi-Agent Reinforcement Learning","date":"2019-08-10","arxiv_id":"1908.03761","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-recurrent-q-learning-for-backchannel","title":"Batch Recurrent Q-Learning for Backchannel Generation Towards Engaging Agents","date":"2019-08-06","arxiv_id":"1908.02037","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-mind-defeating-stealthy-dos-attacks-in-sdn","title":"Q-MIND: Defeating Stealthy DoS Attacks in SDN with a Machine-learning based Defense Framework","date":"2019-07-27","arxiv_id":"1907.11887","repositories_listed":0,"syntology":null},{"url":null,"slug":"potential-based-advice-for-stochastic-policy","title":"Potential-Based Advice for Stochastic Policy Learning","date":"2019-07-20","arxiv_id":"1907.08823","repositories_listed":0,"syntology":null},{"url":null,"slug":"photonic-architecture-for-reinforcement","title":"Photonic architecture for reinforcement learning","date":"2019-07-17","arxiv_id":"1907.07503","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-control-of-chaos-with-continuous","title":"Model-free Control of Chaos with Continuous Deep Q-learning","date":"2019-07-16","arxiv_id":"1907.07775","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-pour-la-r-esolution-des-anaphores","title":"Q-learning pour la r\\'esolution des anaphores pronominales en langue arabe (Q-learning for pronominal anaphora resolution in Arabic texts)","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-inspired-self-tuning-for-energy","title":"Q-Learning Inspired Self-Tuning for Energy Efficiency in HPC","date":"2019-06-26","arxiv_id":"1906.10970","repositories_listed":0,"syntology":null},{"url":null,"slug":"deceptive-reinforcement-learning-under","title":"Deceptive Reinforcement Learning Under Adversarial Manipulations on Cost Signals","date":"2019-06-24","arxiv_id":"1906.10571","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-hindsight-a-smooth-reward-for-steady","title":"In Hindsight: A Smooth Reward for Steady Exploration","date":"2019-06-24","arxiv_id":"1906.09781","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-use-of-experience-in-first-person","title":"Optimal Use of Experience in First Person Shooter Environments","date":"2019-06-24","arxiv_id":"1906.09734","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-networks-with-motivation","title":"Neural networks with motivation","date":"2019-06-23","arxiv_id":"1906.09528","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-trajectory","title":"Reinforcement Learning-Based Trajectory Design for the Aerial Base Stations","date":"2019-06-23","arxiv_id":"1906.09550","repositories_listed":0,"syntology":null},{"url":null,"slug":"cache-aided-noma-mobile-edge-computing-a","title":"Cache-Aided NOMA Mobile Edge Computing: A Reinforcement Learning Approach","date":"2019-06-20","arxiv_id":"1906.08812","repositories_listed":0,"syntology":null},{"url":null,"slug":"qxplore-q-learning-exploration-by-maximizing","title":"Reward Prediction Error as an Exploration Objective in Deep RL","date":"2019-06-19","arxiv_id":"1906.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"solution-of-two-player-zero-sum-game-by","title":"A Generalized Minimax Q-learning Algorithm for Two-Player Zero-Sum Stochastic Games","date":"2019-06-16","arxiv_id":"1906.06659","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-q-learning-with-function","title":"Provably Efficient $Q$-learning with Function Approximation via Distribution Shift Error Checking Oracle","date":"2019-06-14","arxiv_id":"1906.06321","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduced-q-learning-is-minimax","title":"Variance-reduced $Q$-learning is minimax optimal","date":"2019-06-11","arxiv_id":"1906.04697","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-discrete","title":"Deep Reinforcement Learning with Discrete Normalized Advantage Functions for Resource Management in Network Slicing","date":"2019-06-10","arxiv_id":"1906.04594","repositories_listed":0,"syntology":null},{"url":null,"slug":"did-you-hear-that-learning-to-play-video","title":"\"Did You Hear That?\" Learning to Play Video Games from Audio Cues","date":"2019-06-10","arxiv_id":"1906.04027","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-for-directed-acyclic-graph","title":"Deep Q-Learning for Directed Acyclic Graph Generation","date":"2019-06-05","arxiv_id":"1906.02280","repositories_listed":0,"syntology":null},{"url":null,"slug":"escaping-the-state-of-nature-a-hobbesian","title":"Escaping the State of Nature: A Hobbesian Approach to Cooperation in Multi-agent Reinforcement Learning","date":"2019-06-05","arxiv_id":"1906.09874","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-with-unreliable-intrinsic-reward","title":"Exploration with Unreliable Intrinsic Reward in Multi-Agent Reinforcement Learning","date":"2019-06-05","arxiv_id":"1906.02138","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-compact-decision-trees-for","title":"Risk-Sensitive Compact Decision Trees for Autonomous Execution in Presence of Simulated Market Response","date":"2019-06-05","arxiv_id":"1906.02312","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-board-deep-q-network-for-uav-assisted","title":"On-board Deep Q-Network for UAV-assisted Online Power Transfer and Data Collection","date":"2019-06-04","arxiv_id":"1906.07064","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600423","title":"Feature-Based Q-Learning for Two-Player Stochastic Games","date":"2019-06-02","arxiv_id":"1906.00423","repositories_listed":0,"syntology":null},{"url":null,"slug":"rss-based-q-learning-for-indoor-uav","title":"RSS-Based Q-Learning for Indoor UAV Navigation","date":"2019-05-31","arxiv_id":"1905.13406","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-q-learning-with-low","title":"Provably Efficient Q-Learning with Low Switching Cost","date":"2019-05-30","arxiv_id":"1905.12849","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-transferable-learning-of","title":"Learning NP-Hard Multi-Agent Assignment Planning using GNN: Inference on a Random Graph and Provable Auction-Fitted Q-learning","date":"2019-05-29","arxiv_id":"1905.12204","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-control-model-based-approach-for","title":"A General Markov Decision Process Framework for Directly Learning Optimal Control Policies","date":"2019-05-28","arxiv_id":"1905.12009","repositories_listed":0,"syntology":null},{"url":null,"slug":"190512726","title":"Prioritized Sequence Experience Replay","date":"2019-05-25","arxiv_id":"1905.12726","repositories_listed":0,"syntology":null},{"url":null,"slug":"190512567","title":"MQLV: Optimal Policy of Money Management in Retail Banking with Q-Learning","date":"2019-05-24","arxiv_id":"1905.12567","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-with-q-matrix-transfer","title":"Deep Q-Learning with Q-Matrix Transfer Learning for Novel Fire Evacuation Environment","date":"2019-05-23","arxiv_id":"1905.09673","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-variance-reduction-for-deep-q","title":"Stochastic Variance Reduction for Deep Q-learning","date":"2019-05-20","arxiv_id":"1905.08152","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-learning-of","title":"Reinforcement Learning for Learning of Dynamical Systems in Uncertain Environment: a Tutorial","date":"2019-05-19","arxiv_id":"1905.07727","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-penetration-testing-using","title":"Autonomous Penetration Testing using Reinforcement Learning","date":"2019-05-15","arxiv_id":"1905.05965","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-robotics-and","title":"Reinforcement Learning for Robotics and Control with Active Uncertainty Reduction","date":"2019-05-15","arxiv_id":"1905.06274","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-of-artificial-intelligence-agents-for","title":"Design of Artificial Intelligence Agents for Games using Deep Reinforcement Learning","date":"2019-05-10","arxiv_id":"1905.04127","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adversarial-reinforcement-learning-for","title":"Domain Adversarial Reinforcement Learning for Partial Domain Adaptation","date":"2019-05-10","arxiv_id":"1905.04094","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503494","title":"Toward Packet Routing with Fully-distributed Multi-agent Deep Reinforcement Learning","date":"2019-05-09","arxiv_id":"1905.03494","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503501","title":"Pretrain Soft Q-Learning with Imperfect Demonstrations","date":"2019-05-09","arxiv_id":"1905.03501","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503726","title":"A Reinforcement Learning Perspective on the Optimal Control of Mutation Probabilities for the (1+1) Evolutionary Algorithm: First Results on the OneMax Problem","date":"2019-05-09","arxiv_id":"1905.03726","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-target-updates-for-q-learning","title":"Accelerated Target Updates for Q-learning","date":"2019-05-07","arxiv_id":"1905.02841","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-agents-with-prioritization-and","title":"Learning agents with prioritization and parameter noise in continuous state and action space","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-q-learning-with-mutual-information","title":"Soft Q-Learning with Mutual-Information Regularization","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"two-timescale-networks-for-nonlinear-value","title":"Two-Timescale Networks for Nonlinear Value Function Approximation","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-q-learning-method-for-downlink-power","title":"A Deep Q-Learning Method for Downlink Power Allocation in Multi-Cell Networks","date":"2019-04-30","arxiv_id":"1904.13032","repositories_listed":0,"syntology":null},{"url":null,"slug":"zapq-learning-for-optimal-stopping-time","title":"Zap Q-Learning for Optimal Stopping Time Problems","date":"2019-04-25","arxiv_id":"1904.11538","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-lipschitz-q-learning","title":"Stochastic Lipschitz Q-Learning","date":"2019-04-24","arxiv_id":"1904.10653","repositories_listed":0,"syntology":null}],"record_sha256":"6ee26ef6510ef1d69bb626291b6b5cb730c4b688d7acca1c14dc2cf0f0649356","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}