{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/122","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":122,"pages_in_order":132,"rows_per_page":100,"rows":[12101,12200],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/121","next":"/task/reinforcement-learning/papers/123","papers":[{"url":null,"slug":"model-free-control-for-distributed-stream","title":"Model-Free Control for Distributed Stream Data Processing using Deep Reinforcement Learning","date":"2018-03-02","arxiv_id":"1803.01016","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-for-signal-authentication-and","title":"Deep Learning for Signal Authentication and Security in Massive Internet of Things Systems","date":"2018-03-01","arxiv_id":"1803.00916","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-sponsored","title":"Deep Reinforcement Learning for Sponsored Search Real-time Bidding","date":"2018-03-01","arxiv_id":"1803.00259","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-imitation-and-reinforcement","title":"Hierarchical Imitation and Reinforcement Learning","date":"2018-03-01","arxiv_id":"1803.00590","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-via","title":"Inverse Reinforcement Learning via Nonparametric Spatio-Temporal Subgoal Modeling","date":"2018-03-01","arxiv_id":"1803.00444","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-oracle-efficient-pac-rl-with-rich","title":"On Oracle-Efficient PAC RL with Rich Observations","date":"2018-03-01","arxiv_id":"1803.00606","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-cp-learning-action-values-for-cooperative","title":"Q-CP: Learning Action Values for Cooperative Planning","date":"2018-03-01","arxiv_id":"1803.00297","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-cooperation-in-sequential-prisoners","title":"Towards Cooperation in Sequential Prisoner's Dilemmas: a Deep Multiagent Reinforcement Learning Approach","date":"2018-03-01","arxiv_id":"1803.00162","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-join-order","title":"Deep Reinforcement Learning for Join Order Enumeration","date":"2018-02-28","arxiv_id":"1803.00055","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-value-estimation-for-efficient","title":"Model-Based Value Estimation for Efficient Model-Free Reinforcement Learning","date":"2018-02-28","arxiv_id":"1803.00101","repositories_listed":0,"syntology":null},{"url":null,"slug":"digrad-multi-task-reinforcement-learning-with","title":"DiGrad: Multi-Task Reinforcement Learning with Shared Actions","date":"2018-02-27","arxiv_id":"1802.10463","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-bidding-with-multi-agent","title":"Real-Time Bidding with Multi-Agent Reinforcement Learning in Display Advertising","date":"2018-02-27","arxiv_id":"1802.09756","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduction-methods-for-sublinear","title":"Variance Reduction Methods for Sublinear Reinforcement Learning","date":"2018-02-26","arxiv_id":"1802.09184","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-bidding-for-advance-commitments-in","title":"Reinforcement Learning for Dynamic Bidding in Truckload Markets: an Application to Large-Scale Fleet Management with Advance Commitments","date":"2018-02-25","arxiv_id":"1802.08976","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-difference-models-model-free-deep-rl","title":"Temporal Difference Models: Model-Free Deep RL for Model-Based Control","date":"2018-02-25","arxiv_id":"1802.09081","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-big-net-for-everything","title":"One Big Net For Everything","date":"2018-02-24","arxiv_id":"1802.08864","repositories_listed":0,"syntology":null},{"url":null,"slug":"budget-constrained-bidding-by-model-free","title":"Budget Constrained Bidding by Model-free Reinforcement Learning in Display Advertising","date":"2018-02-23","arxiv_id":"1802.08365","repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-double-deep-multiagent-reinforcement","title":"Weighted Double Deep Multiagent Reinforcement Learning in Stochastic Cooperative Environments","date":"2018-02-23","arxiv_id":"1802.08534","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-categorical-distributional","title":"An Analysis of Categorical Distributional Reinforcement Learning","date":"2018-02-22","arxiv_id":"1802.08163","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-exploration-for-fast-and-safe-policy","title":"Diverse Exploration for Fast and Safe Policy Improvement","date":"2018-02-22","arxiv_id":"1802.08331","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergent-actor-critic-algorithms-under-off","title":"Convergent Actor-Critic Algorithms Under Off-Policy Training and Function Approximation","date":"2018-02-21","arxiv_id":"1802.07842","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-theory-of-mind","title":"Machine Theory of Mind","date":"2018-02-21","arxiv_id":"1802.07740","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-inference-for-policy-gradient","title":"Variational Inference for Policy Gradient","date":"2018-02-21","arxiv_id":"1802.07833","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-reinforcement-learning-with-complex","title":"Continual Reinforcement Learning with Complex Synapses","date":"2018-02-20","arxiv_id":"1802.07239","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-primal-dual-policy-optimization","title":"Accelerated Primal-Dual Policy Optimization for Safe Reinforcement Learning","date":"2018-02-19","arxiv_id":"1802.06480","repositories_listed":0,"syntology":null},{"url":null,"slug":"fourier-policy-gradients","title":"Fourier Policy Gradients","date":"2018-02-19","arxiv_id":"1802.06891","repositories_listed":0,"syntology":null},{"url":null,"slug":"recommendations-with-negative-feedback-via","title":"Recommendations with Negative Feedback via Pairwise Deep Reinforcement Learning","date":"2018-02-19","arxiv_id":"1802.06501","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-scale-invariant-future-in","title":"Estimating scale-invariant future in continuous time","date":"2018-02-18","arxiv_id":"1802.06426","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-mild-cognitive-impairment","title":"Improving Mild Cognitive Impairment Prediction via Reinforcement Learning and Dialogue Simulation","date":"2018-02-18","arxiv_id":"1802.06428","repositories_listed":0,"syntology":null},{"url":null,"slug":"sim-to-real-optimization-of-complex-real","title":"Sim-to-Real Optimization of Complex Real World Mobile Network with Imperfect Information via Deep Reinforcement Learning from Self-play","date":"2018-02-18","arxiv_id":"1802.06416","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-cognitive-programs-and-machine","title":"Bridging Cognitive Programs and Machine Learning","date":"2018-02-16","arxiv_id":"1802.06091","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-the-formation-of-social-conventions","title":"Modeling the Formation of Social Conventions from Embodied Real-Time Interactions","date":"2018-02-16","arxiv_id":"1802.06108","repositories_listed":0,"syntology":null},{"url":null,"slug":"reactive-reinforcement-learning-in","title":"Reactive Reinforcement Learning in Asynchronous Environments","date":"2018-02-16","arxiv_id":"1802.06139","repositories_listed":0,"syntology":null},{"url":null,"slug":"prioritized-sweeping-neural-dynaq-with","title":"Prioritized Sweeping Neural DynaQ with Multiple Predecessors, and Hippocampal Replays","date":"2018-02-15","arxiv_id":"1802.05594","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-imperfect","title":"Reinforcement Learning from Imperfect Demonstrations","date":"2018-02-14","arxiv_id":"1802.05313","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-1","title":"A Deep Reinforcement Learning Framework for Rebalancing Dockless Bike Sharing Systems","date":"2018-02-13","arxiv_id":"1802.04592","repositories_listed":0,"syntology":null},{"url":null,"slug":"diversity-driven-exploration-strategy-for","title":"Diversity-Driven Exploration Strategy for Deep Reinforcement Learning","date":"2018-02-13","arxiv_id":"1802.04564","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robust-and-adaptive-real-world","title":"Learning Robust and Adaptive Real-World Continuous Control Using Simulation and Transfer Learning","date":"2018-02-13","arxiv_id":"1802.04520","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-reinforcement-learning-with","title":"Progressive Reinforcement Learning with Distillation for Multi-Skilled Motion Control","date":"2018-02-13","arxiv_id":"1802.04765","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-note-on-reinforcement-learning-with","title":"Reinforcement Learning with Wasserstein Distance Regularisation, with Applications to Multipolicy Learning","date":"2018-02-12","arxiv_id":"1802.03976","repositories_listed":0,"syntology":null},{"url":"/paper/m-walk-learning-to-walk-over-graphs-using","slug":"m-walk-learning-to-walk-over-graphs-using","title":"M-Walk: Learning to Walk over Graphs using Monte Carlo Tree Search","date":"2018-02-12","arxiv_id":"1802.04394","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-with-nearest-neighbors","title":"Q-learning with Nearest Neighbors","date":"2018-02-12","arxiv_id":"1802.03900","repositories_listed":0,"syntology":null},{"url":null,"slug":"taking-gradients-through-experiments-lstms","title":"Taking gradients through experiments: LSTMs and memory proximal policy optimization for black-box quantum control","date":"2018-02-12","arxiv_id":"1802.04063","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-deep-reinforcement-learning","title":"Sample Efficient Deep Reinforcement Learning for Dialogue Systems with Large Action Spaces","date":"2018-02-11","arxiv_id":"1802.03753","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-the-one-step-greedy-approach-in-1","title":"Beyond the One Step Greedy Approach in Reinforcement Learning","date":"2018-02-10","arxiv_id":"1802.03654","repositories_listed":0,"syntology":null},{"url":null,"slug":"path-consistency-learning-in-tsallis-entropy","title":"Path Consistency Learning in Tsallis Entropy Regularized MDPs","date":"2018-02-10","arxiv_id":"1802.03501","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-approach-for-multi-step-temporal","title":"A Unified Approach for Multi-step Temporal-Difference Learning with Eligibility Traces in Reinforcement Learning","date":"2018-02-09","arxiv_id":"1802.03171","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-two-player-stochastic-games-with","title":"Balancing Two-Player Stochastic Games with Soft Q-Learning","date":"2018-02-09","arxiv_id":"1802.03216","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robust-options","title":"Learning Robust Options","date":"2018-02-09","arxiv_id":"1802.03236","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-the-universality-and-learnability","title":"Improving the Universality and Learnability of Neural Programmer-Interpreters with Combinator Abstraction","date":"2018-02-08","arxiv_id":"1802.02696","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-querying-fast-generative-models","title":"Learning and Querying Fast Generative Models for Reinforcement Learning","date":"2018-02-08","arxiv_id":"1802.03006","repositories_listed":0,"syntology":null},{"url":null,"slug":"precision-medicine-as-a-control-problem-using","title":"Precision medicine as a control problem: Using simulation and deep reinforcement learning to discover adaptive, personalized multi-cytokine therapy for sepsis","date":"2018-02-08","arxiv_id":"1802.10440","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-image-hashing","title":"Deep Reinforcement Learning for Image Hashing","date":"2018-02-07","arxiv_id":"1802.02904","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-collective-swimming-by-harnessing","title":"Efficient collective swimming by harnessing vortices through deep reinforcement learning","date":"2018-02-07","arxiv_id":"1802.02674","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-game-theoretic-multi-agent-log-linear","title":"From Game-theoretic Multi-agent Log Linear Learning to Reinforcement Learning","date":"2018-02-07","arxiv_id":"1802.02277","repositories_listed":0,"syntology":null},{"url":null,"slug":"sch-gan-semi-supervised-cross-modal-hashing","title":"SCH-GAN: Semi-supervised Cross-modal Hashing by Generative Adversarial Network","date":"2018-02-07","arxiv_id":"1802.02488","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-exploration-in-concurrent","title":"Coordinated Exploration in Concurrent Reinforcement Learning","date":"2018-02-05","arxiv_id":"1802.01282","repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-policy-exploration-for-markov-decision","title":"Guided Policy Exploration for Markov Decision Processes using an Uncertainty-Based Value-of-Information Criterion","date":"2018-02-05","arxiv_id":"1802.01518","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-parametric-closed-loop-policies-for","title":"Learning Parametric Closed-Loop Policies for Markov Potential Games","date":"2018-02-03","arxiv_id":"1802.00899","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-learning-for-continuous-control","title":"Multi-task Learning for Continuous Control","date":"2018-02-03","arxiv_id":"1802.01034","repositories_listed":0,"syntology":null},{"url":null,"slug":"elements-of-effective-deep-reinforcement","title":"Elements of Effective Deep Reinforcement Learning towards Tactical Driving Decision Making","date":"2018-02-01","arxiv_id":"1802.00332","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-chatbot-dialog-management","title":"Goal-Oriented Chatbot Dialog Management Bootstrapping with Transfer Learning","date":"2018-02-01","arxiv_id":"1802.00500","repositories_listed":0,"syntology":null},{"url":null,"slug":"virtual-to-real-learning-to-control-in-visual","title":"Virtual-to-Real: Learning to Control in Visual Semantic Segmentation","date":"2018-02-01","arxiv_id":"1802.00285","repositories_listed":0,"syntology":null},{"url":null,"slug":"vr-goggles-for-robots-real-to-sim-domain","title":"VR-Goggles for Robots: Real-to-sim Domain Adaptation for Visual Control","date":"2018-02-01","arxiv_id":"1802.00265","repositories_listed":0,"syntology":null},{"url":null,"slug":"pretraining-deep-actor-critic-reinforcement","title":"Pretraining Deep Actor-Critic Reinforcement Learning Algorithms With Expert Demonstrations","date":"2018-01-31","arxiv_id":"1801.10459","repositories_listed":0,"syntology":null},{"url":null,"slug":"barrier-certified-adaptive-reinforcement","title":"Barrier-Certified Adaptive Reinforcement Learning with Applications to Brushbot Navigation","date":"2018-01-29","arxiv_id":"1801.09627","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-using-capsules-in","title":"Deep Reinforcement Learning using Capsules in Advanced Game Environments","date":"2018-01-29","arxiv_id":"1801.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-dynamic","title":"Deep Reinforcement Learning for Dynamic Treatment Regimes on Medical Registry Data","date":"2018-01-28","arxiv_id":"1801.09271","repositories_listed":0,"syntology":null},{"url":null,"slug":"flashrl-a-reinforcement-learning-platform-for","title":"FlashRL: A Reinforcement Learning Platform for Flash Games","date":"2018-01-26","arxiv_id":"1801.08841","repositories_listed":0,"syntology":null},{"url":null,"slug":"directly-estimating-the-variance-of-the","title":"Directly Estimating the Variance of the λ-Return Using Temporal-Difference Methods","date":"2018-01-25","arxiv_id":"1801.08287","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-language-learned-by-an-active","title":"Analyzing Language Learned by an Active Question Answering Agent","date":"2018-01-23","arxiv_id":"1801.07537","repositories_listed":0,"syntology":null},{"url":null,"slug":"curiosity-driven-reinforcement-learning-with","title":"Curiosity-driven reinforcement learning with homeostatic regulation","date":"2018-01-23","arxiv_id":"1801.07440","repositories_listed":0,"syntology":null},{"url":null,"slug":"simple-hyper-heuristics-optimise-leadingones","title":"Simple Hyper-heuristics Control the Neighbourhood Size of Randomised Local Search Optimally for LeadingOnes","date":"2018-01-23","arxiv_id":"1801.07546","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-domain-transfer-in-reinforcement","title":"Cross-Domain Transfer in Reinforcement Learning using Target Apprentice","date":"2018-01-22","arxiv_id":"1801.06920","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-chatbot-short","title":"A Deep Reinforcement Learning Chatbot (Short Version)","date":"2018-01-20","arxiv_id":"1801.06700","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-driven-networking-a-deep","title":"Experience-driven Networking: A Deep Reinforcement Learning based Approach","date":"2018-01-17","arxiv_id":"1801.05757","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-recommender","title":"Reinforcement Learning based Recommender System using Biclustering Technique","date":"2018-01-17","arxiv_id":"1801.05532","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-case-for-automatic-database","title":"The Case for Automatic Database Administration using Deep Reinforcement Learning","date":"2018-01-17","arxiv_id":"1801.05643","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-qlbs-q-learner-goes-nuqlear-fitted-q","title":"The QLBS Q-Learner Goes NuQLear: Fitted Q Iteration, Inverse RL, and Option Portfolios","date":"2018-01-17","arxiv_id":"1801.06077","repositories_listed":0,"syntology":null},{"url":null,"slug":"cellular-connected-uavs-over-5g-deep","title":"Cellular-Connected UAVs over 5G: Deep Reinforcement Learning for Interference Management","date":"2018-01-16","arxiv_id":"1801.05500","repositories_listed":0,"syntology":null},{"url":null,"slug":"gitgraph-architecture-search-space-creation","title":"GitGraph - Architecture Search Space Creation through Frequent Computational Subgraph Mining","date":"2018-01-16","arxiv_id":"1801.05159","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-policy-gradient-methods","title":"Global Convergence of Policy Gradient Methods for the Linear Quadratic Regulator","date":"2018-01-15","arxiv_id":"1801.05039","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-reinforcement","title":"Cooperative Multi-Agent Reinforcement Learning for Low-Level Wireless Communication","date":"2018-01-14","arxiv_id":"1801.04541","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-fuzzing","title":"Deep Reinforcement Fuzzing","date":"2018-01-14","arxiv_id":"1801.04589","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-of-cell-movement","title":"Deep Reinforcement Learning of Cell Movement in the Early Stage of C. elegans Embryogenesis","date":"2018-01-14","arxiv_id":"1801.04600","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-machine-learning-fameworks-on","title":"Evaluation of Machine Learning Fameworks on Finis Terrae II","date":"2018-01-14","arxiv_id":"1801.04546","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-driving-in-reality-with","title":"Autonomous Driving in Reality with Reinforcement Learning and Image Translation","date":"2018-01-13","arxiv_id":"1801.05299","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-action-exploration-for-learning","title":"Model-Based Action Exploration for Learning Dynamic Motion Skills","date":"2018-01-11","arxiv_id":"1801.03954","repositories_listed":0,"syntology":null},{"url":null,"slug":"expected-policy-gradients-for-reinforcement","title":"Expected Policy Gradients for Reinforcement Learning","date":"2018-01-10","arxiv_id":"1801.03326","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-in-gpu-experience-replay","title":"Deep In-GPU Experience Replay","date":"2018-01-09","arxiv_id":"1801.03138","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-1","title":"Sample-Efficient Reinforcement Learning through Transfer and Architectural Priors","date":"2018-01-07","arxiv_id":"1801.02268","repositories_listed":0,"syntology":null},{"url":null,"slug":"trading-the-twitter-sentiment-with","title":"Trading the Twitter Sentiment with Reinforcement Learning","date":"2018-01-07","arxiv_id":"1801.02243","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-deep-q-learning-using-neural-episodic","title":"Faster Deep Q-learning using Neural Episodic Control","date":"2018-01-06","arxiv_id":"1801.01968","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-optimal","title":"Deep Reinforcement Learning based Optimal Control of Hot Water Systems","date":"2018-01-04","arxiv_id":"1801.01467","repositories_listed":0,"syntology":null},{"url":null,"slug":"screenernet-learning-self-paced-curriculum","title":"ScreenerNet: Learning Self-Paced Curriculum for Deep Neural Networks","date":"2018-01-03","arxiv_id":"1801.00904","repositories_listed":0,"syntology":null},{"url":null,"slug":"vizdoom-drqn-with-prioritized-experience","title":"ViZDoom: DRQN with Prioritized Experience Replay, Double-Q Learning, & Snapshot Ensembling","date":"2018-01-03","arxiv_id":"1801.01000","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dynamic-game-approach-to-training-robust","title":"A dynamic game approach to training robust deep policies","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-model-for-device-placement","title":"A Hierarchical Model for Device Placement","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"action-dependent-control-variates-for-policy","title":"Action-dependent Control Variates for Policy Optimization via Stein Identity","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-policy-gradient-for-alternating","title":"Adversarial Policy Gradient for Alternating Markov Games","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"2cfa1b0a11b51d1469cfe43bf970cfaf05f90028a751df6c3ad55c1d31011d5b","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}