{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/127","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":127,"pages_in_order":152,"rows_per_page":100,"rows":[12601,12700],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/126","next":"/task/reinforcement-learning-1/papers/128","papers":[{"url":null,"slug":"text-as-environment-a-deep-reinforcement","title":"Text as Environment: A Deep Reinforcement Learning Text Readability Assessment Model","date":"2019-12-12","arxiv_id":"1912.05957","repositories_listed":0,"syntology":null},{"url":null,"slug":"biases-for-emergent-communication-in-multi-1","title":"Biases for Emergent Communication in Multi-agent Reinforcement Learning","date":"2019-12-11","arxiv_id":"1912.05676","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubly-robust-off-policy-actor-critic","title":"Doubly Robust Off-Policy Actor-Critic Algorithms for Reinforcement Learning","date":"2019-12-11","arxiv_id":"1912.05109","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-robotic-task-generalization-using","title":"Efficient Robotic Task Generalization Using Deep Model Fusion Reinforcement Learning","date":"2019-12-11","arxiv_id":"1912.05205","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-aware-scheduling-of-jobs-in","title":"Energy-aware Scheduling of Jobs in Heterogeneous Cluster Systems Using Deep Reinforcement Learning","date":"2019-12-11","arxiv_id":"1912.05160","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-deep-reinforcement-learning-for","title":"Online Deep Reinforcement Learning for Autonomous UAV Navigation and Exploration of Outdoor Environments","date":"2019-12-11","arxiv_id":"1912.05684","repositories_listed":0,"syntology":null},{"url":null,"slug":"quality-of-syntactic-implication-of-rl-based","title":"Quality of syntactic implication of RL-based sentence summarization","date":"2019-12-11","arxiv_id":"1912.05493","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-finite-time-analysis-of-q-learning-with-1","title":"A Finite-Time Analysis of Q-Learning with Neural Network Function Approximation","date":"2019-12-10","arxiv_id":"1912.04511","repositories_listed":0,"syntology":null},{"url":null,"slug":"avid-learning-multi-stage-tasks-via-pixel","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","date":"2019-12-10","arxiv_id":"1912.04443","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-and-robust-reinforcement-learning","title":"Efficient and Robust Reinforcement Learning with Uncertainty-based Value Expansion","date":"2019-12-10","arxiv_id":"1912.05328","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-multi-agent-reinforcement","title":"Decentralized Multi-Agent Reinforcement Learning with Networked Agents: Recent Advances","date":"2019-12-09","arxiv_id":"1912.03821","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-rl-based-trajectory-planning-for-aoi","title":"Deep RL-based Trajectory Planning for AoI Minimization in UAV-assisted IoT","date":"2019-12-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-coordination-among-multiple","title":"Intelligent Coordination among Multiple Traffic Intersections Using Multi-Agent Reinforcement Learning","date":"2019-12-09","arxiv_id":"1912.03851","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-latent-state-spaces-for-planning-1","title":"Learning Latent State Spaces for Planning through Reward Prediction","date":"2019-12-09","arxiv_id":"1912.04201","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-sparse-representations-incrementally","title":"Learning Sparse Representations Incrementally in Deep Reinforcement Learning","date":"2019-12-09","arxiv_id":"1912.04002","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-code-coded-caching-via-deep","title":"Learning to Code: Coded Caching via Deep Reinforcement Learning","date":"2019-12-09","arxiv_id":"1912.04321","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimism-in-reinforcement-learning-with","title":"Optimism in Reinforcement Learning with Generalized Linear Function Approximation","date":"2019-12-09","arxiv_id":"1912.04136","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-reinforcement-learning-for","title":"Transformer Based Reinforcement Learning For Games","date":"2019-12-09","arxiv_id":"1912.03918","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-curricula-for-visual-meta-1","title":"Unsupervised Curricula for Visual Meta-Reinforcement Learning","date":"2019-12-09","arxiv_id":"1912.04226","repositories_listed":0,"syntology":null},{"url":null,"slug":"effects-of-a-social-force-model-reward-in","title":"Effects of a Social Force Model reward in Robot Navigation based on Deep Reinforcement Learning","date":"2019-12-08","arxiv_id":"1912.03747","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-reinforcement-learning-to-optimal","title":"From Reinforcement Learning to Optimal Control: A unified framework for sequential decisions","date":"2019-12-07","arxiv_id":"1912.03513","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-exploration-in-goal-oriented","title":"No-Regret Exploration in Goal-Oriented Reinforcement Learning","date":"2019-12-07","arxiv_id":"1912.03517","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-pedestrian-path-planning-model-in","title":"A pedestrian path-planning model in accordance with obstacle's danger with reinforcement learning","date":"2019-12-06","arxiv_id":"1912.02945","repositories_listed":0,"syntology":null},{"url":null,"slug":"alternative-function-approximation","title":"Alternative Function Approximation Parameterizations for Solving Games: An Analysis of $f$-Regression Counterfactual Regret Minimization","date":"2019-12-06","arxiv_id":"1912.02967","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-routing-a","title":"Deep Reinforcement Learning for Routing a Heterogeneous Fleet of Vehicles","date":"2019-12-06","arxiv_id":"1912.03341","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-knowledge-transfer-always-help-to-learn","title":"How Does an Approximate Model Help in Reinforcement Learning?","date":"2019-12-06","arxiv_id":"1912.02986","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-smart-homes-smarter-optimizing-energy","title":"Making Smart Homes Smarter: Optimizing Energy Consumption with Human in the Loop","date":"2019-12-06","arxiv_id":"1912.03298","repositories_listed":0,"syntology":null},{"url":null,"slug":"observational-overfitting-in-reinforcement-1","title":"Observational Overfitting in Reinforcement Learning","date":"2019-12-06","arxiv_id":"1912.02975","repositories_listed":0,"syntology":null},{"url":null,"slug":"191202552","title":"Reinforcement Learning with Non-Markovian Rewards","date":"2019-12-05","arxiv_id":"1912.02552","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-pricing-on-e-commerce-platform-with","title":"Dynamic Pricing on E-commerce Platform with Deep Reinforcement Learning: A Field Experiment","date":"2019-12-05","arxiv_id":"1912.02572","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-policy-space-expansion-in","title":"Iterative Policy-Space Expansion in Reinforcement Learning","date":"2019-12-05","arxiv_id":"1912.02532","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-convolutional","title":"Reinforcement Learning with Convolutional Reservoir Computing","date":"2019-12-05","arxiv_id":"1912.04161","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-reinforcement-learning-of-localized","title":"Scalable Reinforcement Learning for Multi-Agent Networked Systems","date":"2019-12-05","arxiv_id":"1912.02906","repositories_listed":0,"syntology":null},{"url":null,"slug":"algaedice-policy-gradient-from-arbitrary","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","date":"2019-12-04","arxiv_id":"1912.02074","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-model-compression-via-deep-reinforcement","title":"Deep Model Compression Via Two-Stage Deep Reinforcement Learning","date":"2019-12-04","arxiv_id":"1912.02254","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-bandwidth","title":"Reinforcement learning for bandwidth estimation and congestion control in real-time communications","date":"2019-12-04","arxiv_id":"1912.02222","repositories_listed":0,"syntology":null},{"url":null,"slug":"neighborhood-cognition-consistent-multi-agent","title":"Neighborhood Cognition Consistent Multi-Agent Reinforcement Learning","date":"2019-12-03","arxiv_id":"1912.01160","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-learned-formula-synthesis-in-set-theory","title":"Self-Learned Formula Synthesis in Set Theory","date":"2019-12-03","arxiv_id":"1912.01525","repositories_listed":0,"syntology":null},{"url":null,"slug":"191201715","title":"Human-Robot Collaboration via Deep Reinforcement Learning of Real-World Interactions","date":"2019-12-02","arxiv_id":"1912.01715","repositories_listed":0,"syntology":null},{"url":null,"slug":"just-askan-interactive-learning-framework-for","title":"Just Ask:An Interactive Learning Framework for Vision and Language Navigation","date":"2019-12-02","arxiv_id":"1912.00915","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-reinforcement-learning-with-entropy","title":"Policy Optimization Reinforcement Learning with Entropy Regularization","date":"2019-12-02","arxiv_id":"1912.01557","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-family-of-robust-stochastic-operators-for","title":"A Family of Robust Stochastic Operators for Reinforcement Learning","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversary-a3c-for-robust-reinforcement-1","title":"Adversary A3C for Robust Reinforcement Learning","date":"2019-12-01","arxiv_id":"1912.00330","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-planning-for-efficient-exploration","title":"Explicit Planning for Efficient Exploration in Reinforcement Learning","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"flow-rate-control-in-smart-district-heating","title":"Flow Rate Control in Smart District Heating Systems Using Deep Reinforcement Learning","date":"2019-12-01","arxiv_id":"1912.05313","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-cognitive-radar-a-revealed","title":"Identifying Cognitive Radars -- Inverse Reinforcement Learning using Revealed Preferences","date":"2019-12-01","arxiv_id":"1912.00331","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-reinforcement-learning-in-2","title":"Near-Optimal Reinforcement Learning in Dynamic Treatment Regimes","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-temporal-difference-learning-converges-1","title":"Neural Temporal-Difference Learning Converges to Global Optima","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-trust-regionproximal-policy","title":"Neural Trust Region/Proximal Policy Optimization Attains Globally Optimal Policy","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"no-press-diplomacy-modeling-multi-agent-1","title":"No-Press Diplomacy: Modeling Multi-Agent Gameplay","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-for-reinforcement-learning-from","title":"Optimization for Reinforcement Learning: From Single Agent to Cooperative Agents","date":"2019-12-01","arxiv_id":"1912.00498","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-q-learning-with-function-1","title":"Provably Efficient Q-learning with Function Approximation via Distribution Shift Error Checking Oracle","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bounds-for-learning-state","title":"Regret Bounds for Learning State Representations in Reinforcement Learning","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"text-based-interactive-recommendation-via","title":"Text-Based Interactive Recommendation via Constraint-Augmented Reinforcement Learning","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"impact-importance-weighted-asynchronous-1","title":"IMPACT: Importance Weighted Asynchronous Architectures with Clipped Target Networks","date":"2019-11-30","arxiv_id":"1912.00167","repositories_listed":0,"syntology":null},{"url":null,"slug":"mix-and-match-markov-chains-mixing-times-for","title":"Mix and Match: Markov Chains & Mixing Times for Matching in Rideshare","date":"2019-11-30","arxiv_id":"1912.00225","repositories_listed":0,"syntology":null},{"url":null,"slug":"induction-of-subgoal-automata-for","title":"Induction of Subgoal Automata for Reinforcement Learning","date":"2019-11-29","arxiv_id":"1911.13152","repositories_listed":0,"syntology":null},{"url":null,"slug":"quadratic-q-network-for-learning-continuous","title":"Quadratic Q-network for Learning Continuous Control for Autonomous Vehicles","date":"2019-11-29","arxiv_id":"1912.00074","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithmic-improvements-for-deep","title":"Algorithmic Improvements for Deep Reinforcement Learning applied to Interactive Fiction","date":"2019-11-28","arxiv_id":"1911.12511","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-random-search-for-quadcopter","title":"Augmented Random Search for Quadcopter Control: An alternative to Reinforcement Learning","date":"2019-11-28","arxiv_id":"1911.12553","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-neural-relation-extraction-with-1","title":"Improving Neural Relation Extraction with Positive and Unlabeled Learning","date":"2019-11-28","arxiv_id":"1911.12556","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-with-2","title":"Multi-Agent Deep Reinforcement Learning with Adaptive Policies","date":"2019-11-28","arxiv_id":"1912.00949","repositories_listed":0,"syntology":null},{"url":null,"slug":"stigmergic-independent-reinforcement-learning","title":"Stigmergic Independent Reinforcement Learning for Multi-Agent Collaboration","date":"2019-11-28","arxiv_id":"1911.12504","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-adaptive","title":"Adversarial Deep Reinforcement Learning based Adaptive Moving Target Defense","date":"2019-11-27","arxiv_id":"1911.11972","repositories_listed":0,"syntology":null},{"url":null,"slug":"grim-repr-prioritising-generating-important","title":"GRIm-RePR: Prioritising Generating Important Features for Pseudo-Rehearsal","date":"2019-11-27","arxiv_id":"1911.11988","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-fictitious-play-reinforcement","title":"Improving Fictitious Play Reinforcement Learning with Expanding Models","date":"2019-11-27","arxiv_id":"1911.11928","repositories_listed":0,"syntology":null},{"url":null,"slug":"restoring-chaos-using-deep-reinforcement","title":"Restoring Chaos Using Deep Reinforcement Learning","date":"2019-11-27","arxiv_id":"1912.00947","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-tutored-reinforcement-learning-an","title":"Control-Tutored Reinforcement Learning: an application to the Herding Problem","date":"2019-11-26","arxiv_id":"1911.11444","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-portfolio-management-with","title":"A General Framework on Enhancing Portfolio Management with Reinforcement Learning","date":"2019-11-26","arxiv_id":"1911.11880","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-vehicle-mixed-reality-reinforcement","title":"Multi-Vehicle Mixed-Reality Reinforcement Learning for Autonomous Multi-Lane Driving","date":"2019-11-26","arxiv_id":"1911.11699","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-architecture","title":"A Deep Reinforcement Learning Architecture for Multi-stage Optimal Control","date":"2019-11-25","arxiv_id":"1911.10684","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-modulation-and-coding-based-on","title":"Adaptive Modulation and Coding based on Reinforcement Learning for 5G Networks","date":"2019-11-25","arxiv_id":"1912.04030","repositories_listed":0,"syntology":null},{"url":null,"slug":"biologically-inspired-architectures-for","title":"Biologically inspired architectures for sample-efficient deep reinforcement learning","date":"2019-11-25","arxiv_id":"1911.11285","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi-driver","title":"Deep Reinforcement Learning for Multi-Driver Vehicle Dispatching and Repositioning Problem","date":"2019-11-25","arxiv_id":"1911.11260","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigate-bias-in-face-recognition-using","title":"Mitigate Bias in Face Recognition using Skewness-Aware Reinforcement Learning","date":"2019-11-25","arxiv_id":"1911.10692","repositories_listed":0,"syntology":null},{"url":null,"slug":"theory-based-causal-transfer-integrating","title":"Theory-based Causal Transfer: Integrating Instance-level Induction and Abstract-level Structure Learning","date":"2019-11-25","arxiv_id":"1911.11185","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-a","title":"Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms","date":"2019-11-24","arxiv_id":"1911.10635","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-active-inference","title":"Scaling active inference","date":"2019-11-24","arxiv_id":"1911.10601","repositories_listed":0,"syntology":null},{"url":null,"slug":"which-channel-to-ask-my-question-personalized","title":"Which Channel to Ask My Question? Personalized Customer Service RequestStream Routing using DeepReinforcement Learning","date":"2019-11-24","arxiv_id":"1911.10521","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-persistent-homology-to-reinforcement","title":"From Persistent Homology to Reinforcement Learning with Applications for Retail Banking","date":"2019-11-23","arxiv_id":"1911.11573","repositories_listed":0,"syntology":null},{"url":null,"slug":"iteratively-refined-interactive-3d-medical","title":"Iteratively-Refined Interactive 3D Medical Image Segmentation with Multi-Agent Reinforcement Learning","date":"2019-11-23","arxiv_id":"1911.10334","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-evolutionary-behavior-in-self","title":"Analysis of Evolutionary Behavior in Self-Learning Media Search Engines","date":"2019-11-22","arxiv_id":"1911.09882","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-trading","title":"Deep Reinforcement Learning for Trading","date":"2019-11-22","arxiv_id":"1911.10107","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-pruning-for-model-compression","title":"Graph Pruning for Model Compression","date":"2019-11-22","arxiv_id":"1911.09817","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-with","title":"Accelerating Reinforcement Learning with Suboptimal Guidance","date":"2019-11-21","arxiv_id":"1911.09391","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-probing-interaction-policies","title":"Agent Probing Interaction Policies","date":"2019-11-21","arxiv_id":"1911.09535","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-drone-mobility-support-using","title":"Efficient Drone Mobility Support Using Reinforcement Learning","date":"2019-11-21","arxiv_id":"1911.09715","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-theoretic-confidence-bounds-for-1","title":"Information-Theoretic Confidence Bounds for Reinforcement Learning","date":"2019-11-21","arxiv_id":"1911.09724","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-alignment-based-imitation-learning-1","title":"State Alignment-based Imitation Learning","date":"2019-11-21","arxiv_id":"1911.10947","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tale-of-two-timescale-reinforcement","title":"A Tale of Two-Timescale Reinforcement Learning with the Tightest Finite-Time Bound","date":"2019-11-20","arxiv_id":"1911.09157","repositories_listed":0,"syntology":null},{"url":null,"slug":"avoiding-jammers-a-reinforcement-learning","title":"Avoiding Jammers: A Reinforcement Learning Approach","date":"2019-11-20","arxiv_id":"1911.08874","repositories_listed":0,"syntology":null},{"url":null,"slug":"corruption-robust-exploration-in-episodic","title":"Corruption-robust exploration in episodic reinforcement learning","date":"2019-11-20","arxiv_id":"1911.08689","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-cryptocurrency","title":"Deep Reinforcement Learning in Cryptocurrency Market Making","date":"2019-11-20","arxiv_id":"1911.08647","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-average-reward-policy-gradient","title":"Hierarchical Average Reward Policy Gradient Algorithms","date":"2019-11-20","arxiv_id":"1911.08826","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-learning-robust-to-irreversible","title":"On Policy Learning Robust to Irreversible Events: An Application to Robotic In-Hand Manipulation","date":"2019-11-20","arxiv_id":"1911.08927","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-policies-for-reinforcement-learning-via","title":"Safe Policies for Reinforcement Learning via Primal-Dual Methods","date":"2019-11-20","arxiv_id":"1911.09101","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-online-threat-screening-games-using","title":"Solving Online Threat Screening Games using Constrained Action Space Reinforcement Learning","date":"2019-11-20","arxiv_id":"1911.08799","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-inverse-reinforcement-learning","title":"Decision Making for Autonomous Driving via Augmented Adversarial Inverse Reinforcement Learning","date":"2019-11-19","arxiv_id":"1911.08044","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-privileged-reinforcement-learning-1","title":"Attention-Privileged Reinforcement Learning","date":"2019-11-19","arxiv_id":"1911.08363","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-decorrelation-of-features-using","title":"Efficient decorrelation of features using Gramian in Reinforcement Learning","date":"2019-11-19","arxiv_id":"1911.08610","repositories_listed":0,"syntology":null}],"record_sha256":"4468b618f05522ba37c4fb293e8936c71ab77cb3fdde6fbc19c2007697c2ae0f","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}