{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/101","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":101,"pages_in_order":132,"rows_per_page":100,"rows":[10001,10100],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/100","next":"/task/reinforcement-learning/papers/102","papers":[{"url":null,"slug":"regret-bounds-for-learning-state","title":"Regret Bounds for Learning State Representations in Reinforcement Learning","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"text-based-interactive-recommendation-via","title":"Text-Based Interactive Recommendation via Constraint-Augmented Reinforcement Learning","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"value-function-in-frequency-domain-and-the","title":"Value Function in Frequency Domain and the Characteristic Value Iteration Algorithm","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduced-policy-evaluation-with","title":"Variance Reduced Policy Evaluation with Smooth Function Approximation","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"impact-importance-weighted-asynchronous-1","title":"IMPACT: Importance Weighted Asynchronous Architectures with Clipped Target Networks","date":"2019-11-30","arxiv_id":"1912.00167","repositories_listed":0,"syntology":null},{"url":null,"slug":"mix-and-match-markov-chains-mixing-times-for","title":"Mix and Match: Markov Chains & Mixing Times for Matching in Rideshare","date":"2019-11-30","arxiv_id":"1912.00225","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferable-force-torque-dynamics-model-for","title":"Transferable Force-Torque Dynamics Model for Peg-in-hole Task","date":"2019-11-30","arxiv_id":"1912.00260","repositories_listed":0,"syntology":null},{"url":null,"slug":"bimodal-speech-emotion-recognition-using-pre","title":"Bimodal Speech Emotion Recognition Using Pre-Trained Language Models","date":"2019-11-29","arxiv_id":"1912.02610","repositories_listed":0,"syntology":null},{"url":null,"slug":"induction-of-subgoal-automata-for","title":"Induction of Subgoal Automata for Reinforcement Learning","date":"2019-11-29","arxiv_id":"1911.13152","repositories_listed":0,"syntology":null},{"url":null,"slug":"quadratic-q-network-for-learning-continuous","title":"Quadratic Q-network for Learning Continuous Control for Autonomous Vehicles","date":"2019-11-29","arxiv_id":"1912.00074","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-guarantees-for-planning-based-on","title":"Safety Guarantees for Planning Based on Iterative Gaussian Processes","date":"2019-11-29","arxiv_id":"1912.00071","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithmic-improvements-for-deep","title":"Algorithmic Improvements for Deep Reinforcement Learning applied to Interactive Fiction","date":"2019-11-28","arxiv_id":"1911.12511","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-random-search-for-quadcopter","title":"Augmented Random Search for Quadcopter Control: An alternative to Reinforcement Learning","date":"2019-11-28","arxiv_id":"1911.12553","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-compression-of-convolutional","title":"Data-Driven Compression of Convolutional Neural Networks","date":"2019-11-28","arxiv_id":"1911.12740","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-neural-relation-extraction-with-1","title":"Improving Neural Relation Extraction with Positive and Unlabeled Learning","date":"2019-11-28","arxiv_id":"1911.12556","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-with-2","title":"Multi-Agent Deep Reinforcement Learning with Adaptive Policies","date":"2019-11-28","arxiv_id":"1912.00949","repositories_listed":0,"syntology":null},{"url":null,"slug":"stigmergic-independent-reinforcement-learning","title":"Stigmergic Independent Reinforcement Learning for Multi-Agent Collaboration","date":"2019-11-28","arxiv_id":"1911.12504","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-adaptive","title":"Adversarial Deep Reinforcement Learning based Adaptive Moving Target Defense","date":"2019-11-27","arxiv_id":"1911.11972","repositories_listed":0,"syntology":null},{"url":null,"slug":"grim-repr-prioritising-generating-important","title":"GRIm-RePR: Prioritising Generating Important Features for Pseudo-Rehearsal","date":"2019-11-27","arxiv_id":"1911.11988","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-fictitious-play-reinforcement","title":"Improving Fictitious Play Reinforcement Learning with Expanding Models","date":"2019-11-27","arxiv_id":"1911.11928","repositories_listed":0,"syntology":null},{"url":null,"slug":"restoring-chaos-using-deep-reinforcement","title":"Restoring Chaos Using Deep Reinforcement Learning","date":"2019-11-27","arxiv_id":"1912.00947","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-tutored-reinforcement-learning-an","title":"Control-Tutored Reinforcement Learning: an application to the Herding Problem","date":"2019-11-26","arxiv_id":"1911.11444","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-portfolio-management-with","title":"A General Framework on Enhancing Portfolio Management with Reinforcement Learning","date":"2019-11-26","arxiv_id":"1911.11880","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-vehicle-mixed-reality-reinforcement","title":"Multi-Vehicle Mixed-Reality Reinforcement Learning for Autonomous Multi-Lane Driving","date":"2019-11-26","arxiv_id":"1911.11699","repositories_listed":0,"syntology":null},{"url":null,"slug":"qos-aware-machine-learning-based-multiple","title":"Intelligent Resource Scheduling for Co-located Latency-critical Services: A Multi-Model Collaborative Learning Approach","date":"2019-11-26","arxiv_id":"1911.13208","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-problem-with-ddpg-understanding-failures-1","title":"The problem with DDPG: understanding failures in deterministic environments with sparse rewards","date":"2019-11-26","arxiv_id":"1911.11679","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-architecture","title":"A Deep Reinforcement Learning Architecture for Multi-stage Optimal Control","date":"2019-11-25","arxiv_id":"1911.10684","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-modulation-and-coding-based-on","title":"Adaptive Modulation and Coding based on Reinforcement Learning for 5G Networks","date":"2019-11-25","arxiv_id":"1912.04030","repositories_listed":0,"syntology":null},{"url":null,"slug":"biologically-inspired-architectures-for","title":"Biologically inspired architectures for sample-efficient deep reinforcement learning","date":"2019-11-25","arxiv_id":"1911.11285","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi-driver","title":"Deep Reinforcement Learning for Multi-Driver Vehicle Dispatching and Repositioning Problem","date":"2019-11-25","arxiv_id":"1911.11260","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangled-cumulants-help-successor-1","title":"Disentangled Cumulants Help Successor Representations Transfer to New Tasks","date":"2019-11-25","arxiv_id":"1911.10866","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigate-bias-in-face-recognition-using","title":"Mitigate Bias in Face Recognition using Skewness-Aware Reinforcement Learning","date":"2019-11-25","arxiv_id":"1911.10692","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-game-abstraction-via-graph","title":"Multi-Agent Game Abstraction via Graph Attention Neural Network","date":"2019-11-25","arxiv_id":"1911.10715","repositories_listed":0,"syntology":null},{"url":null,"slug":"theory-based-causal-transfer-integrating","title":"Theory-based Causal Transfer: Integrating Instance-level Induction and Abstract-level Structure Learning","date":"2019-11-25","arxiv_id":"1911.11185","repositories_listed":0,"syntology":null},{"url":null,"slug":"merging-deterministic-policy-gradient","title":"Merging Deterministic Policy Gradient Estimations with Varied Bias-Variance Tradeoff for Effective Deep Reinforcement Learning","date":"2019-11-24","arxiv_id":"1911.10527","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-a","title":"Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms","date":"2019-11-24","arxiv_id":"1911.10635","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-active-inference","title":"Scaling active inference","date":"2019-11-24","arxiv_id":"1911.10601","repositories_listed":0,"syntology":null},{"url":null,"slug":"which-channel-to-ask-my-question-personalized","title":"Which Channel to Ask My Question? Personalized Customer Service RequestStream Routing using DeepReinforcement Learning","date":"2019-11-24","arxiv_id":"1911.10521","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-persistent-homology-to-reinforcement","title":"From Persistent Homology to Reinforcement Learning with Applications for Retail Banking","date":"2019-11-23","arxiv_id":"1911.11573","repositories_listed":0,"syntology":null},{"url":null,"slug":"iteratively-refined-interactive-3d-medical","title":"Iteratively-Refined Interactive 3D Medical Image Segmentation with Multi-Agent Reinforcement Learning","date":"2019-11-23","arxiv_id":"1911.10334","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-evolutionary-behavior-in-self","title":"Analysis of Evolutionary Behavior in Self-Learning Media Search Engines","date":"2019-11-22","arxiv_id":"1911.09882","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-trading","title":"Deep Reinforcement Learning for Trading","date":"2019-11-22","arxiv_id":"1911.10107","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-pruning-for-model-compression","title":"Graph Pruning for Model Compression","date":"2019-11-22","arxiv_id":"1911.09817","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-with","title":"Accelerating Reinforcement Learning with Suboptimal Guidance","date":"2019-11-21","arxiv_id":"1911.09391","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-probing-interaction-policies","title":"Agent Probing Interaction Policies","date":"2019-11-21","arxiv_id":"1911.09535","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-drone-mobility-support-using","title":"Efficient Drone Mobility Support Using Reinforcement Learning","date":"2019-11-21","arxiv_id":"1911.09715","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-theoretic-confidence-bounds-for-1","title":"Information-Theoretic Confidence Bounds for Reinforcement Learning","date":"2019-11-21","arxiv_id":"1911.09724","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-observables-for-continuous-control-of","title":"Quantum Observables for continuous control of the Quantum Approximate Optimization Algorithm via Reinforcement Learning","date":"2019-11-21","arxiv_id":"1911.09682","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcing-an-image-caption-generator-using","title":"Reinforcing an Image Caption Generator Using Off-Line Human Feedback","date":"2019-11-21","arxiv_id":"1911.09753","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-alignment-based-imitation-learning-1","title":"State Alignment-based Imitation Learning","date":"2019-11-21","arxiv_id":"1911.10947","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tale-of-two-timescale-reinforcement","title":"A Tale of Two-Timescale Reinforcement Learning with the Tightest Finite-Time Bound","date":"2019-11-20","arxiv_id":"1911.09157","repositories_listed":0,"syntology":null},{"url":null,"slug":"avoiding-jammers-a-reinforcement-learning","title":"Avoiding Jammers: A Reinforcement Learning Approach","date":"2019-11-20","arxiv_id":"1911.08874","repositories_listed":0,"syntology":null},{"url":null,"slug":"corruption-robust-exploration-in-episodic","title":"Corruption-robust exploration in episodic reinforcement learning","date":"2019-11-20","arxiv_id":"1911.08689","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-cryptocurrency","title":"Deep Reinforcement Learning in Cryptocurrency Market Making","date":"2019-11-20","arxiv_id":"1911.08647","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-average-reward-policy-gradient","title":"Hierarchical Average Reward Policy Gradient Algorithms","date":"2019-11-20","arxiv_id":"1911.08826","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-learning-robust-to-irreversible","title":"On Policy Learning Robust to Irreversible Events: An Application to Robotic In-Hand Manipulation","date":"2019-11-20","arxiv_id":"1911.08927","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-policies-for-reinforcement-learning-via","title":"Safe Policies for Reinforcement Learning via Primal-Dual Methods","date":"2019-11-20","arxiv_id":"1911.09101","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-online-threat-screening-games-using","title":"Solving Online Threat Screening Games using Constrained Action Space Reinforcement Learning","date":"2019-11-20","arxiv_id":"1911.08799","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-inverse-reinforcement-learning","title":"Decision Making for Autonomous Driving via Augmented Adversarial Inverse Reinforcement Learning","date":"2019-11-19","arxiv_id":"1911.08044","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-privileged-reinforcement-learning-1","title":"Attention-Privileged Reinforcement Learning","date":"2019-11-19","arxiv_id":"1911.08363","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-decorrelation-of-features-using","title":"Efficient decorrelation of features using Gramian in Reinforcement Learning","date":"2019-11-19","arxiv_id":"1911.08610","repositories_listed":0,"syntology":null},{"url":null,"slug":"implicit-generative-modeling-for-efficient-1","title":"Implicit Generative Modeling for Efficient Exploration","date":"2019-11-19","arxiv_id":"1911.08017","repositories_listed":0,"syntology":null},{"url":null,"slug":"manga-method-agnostic-neural-policy","title":"MANGA: Method Agnostic Neural-policy Generalization and Adaptation","date":"2019-11-19","arxiv_id":"1911.08444","repositories_listed":0,"syntology":null},{"url":null,"slug":"placement-optimization-of-aerial-base","title":"Placement Optimization of Aerial Base Stations with Deep Reinforcement Learning","date":"2019-11-19","arxiv_id":"1911.08111","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduced-advantage-estimation-with","title":"Variance Reduced Advantage Estimation with $δ$ Hindsight Credit Assignment","date":"2019-11-19","arxiv_id":"1911.08362","repositories_listed":0,"syntology":null},{"url":null,"slug":"bias-aware-heapified-policy-for-active","title":"Bias-Aware Heapified Policy for Active Learning","date":"2019-11-18","arxiv_id":"1911.07574","repositories_listed":0,"syntology":null},{"url":null,"slug":"comments-on-the-du-kakade-wang-yang-lower","title":"Comments on the Du-Kakade-Wang-Yang Lower Bounds","date":"2019-11-18","arxiv_id":"1911.07910","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-through-intrinsic","title":"Efficient Exploration through Intrinsic Motivation Learning for Unsupervised Subgoal Discovery in Model-Free Hierarchical Reinforcement Learning","date":"2019-11-18","arxiv_id":"1911.10164","repositories_listed":0,"syntology":null},{"url":null,"slug":"gamma-nets-generalizing-value-estimation-over","title":"Gamma-Nets: Generalizing Value Estimation over Timescale","date":"2019-11-18","arxiv_id":"1911.07794","repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-cooperation-via-team-regret","title":"Inducing Cooperation via Team Regret Minimization based Multi-Agent Deep Reinforcement Learning","date":"2019-11-18","arxiv_id":"1911.07712","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-with-good-feature-representations-in","title":"Learning with Good Feature Representations in Bandits and in RL with a Generative Model","date":"2019-11-18","arxiv_id":"1911.07676","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-reinforcement-learning-of","title":"Unsupervised Reinforcement Learning of Transferable Meta-Skills for Embodied Navigation","date":"2019-11-18","arxiv_id":"1911.07450","repositories_listed":0,"syntology":null},{"url":null,"slug":"hebbian-synaptic-modifications-in-spiking","title":"Hebbian Synaptic Modifications in Spiking Neurons that Learn","date":"2019-11-17","arxiv_id":"1911.07247","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-maximum-causal-entropy-for","title":"Generalized Maximum Causal Entropy for Inverse Reinforcement Learning","date":"2019-11-16","arxiv_id":"1911.06928","repositories_listed":0,"syntology":null},{"url":null,"slug":"inferring-the-optimal-policy-using-markov","title":"Inferring the Optimal Policy using Markov Chain Monte Carlo","date":"2019-11-16","arxiv_id":"1912.02714","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-with-missing","title":"Inverse Reinforcement Learning with Missing Data","date":"2019-11-16","arxiv_id":"1911.06930","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-multi-agent-communication","title":"Learning Efficient Multi-agent Communication: An Information Bottleneck Approach","date":"2019-11-16","arxiv_id":"1911.06992","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-policy-gradient-algorithms-by","title":"Off-Policy Policy Gradient Algorithms by Constraining the State Distribution Shift","date":"2019-11-16","arxiv_id":"1911.06970","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-value-discrepancy-of-imitation-learning","title":"On Value Discrepancy of Imitation Learning","date":"2019-11-16","arxiv_id":"1911.07027","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-imperfect-2","title":"Reinforcement Learning from Imperfect Demonstrations under Soft Expert Guidance","date":"2019-11-16","arxiv_id":"1911.07109","repositories_listed":0,"syntology":null},{"url":null,"slug":"s2dnas-transforming-static-cnn-model-for","title":"S2DNAS:Transforming Static CNN Model for Dynamic Inference via Neural Architecture Search","date":"2019-11-16","arxiv_id":"1911.07033","repositories_listed":0,"syntology":null},{"url":null,"slug":"ascai-adaptive-sampling-for-acquiring-compact","title":"ASCAI: Adaptive Sampling for acquiring Compact AI","date":"2019-11-15","arxiv_id":"1911.06471","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-augmentation-with-reinforcement","title":"Automated Augmentation with Reinforcement Learning and GANs for Robust Identification of Traffic Signs using Front Camera Images","date":"2019-11-15","arxiv_id":"1911.06486","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-co-adaptation-of-morphology","title":"Data-efficient Co-Adaptation of Morphology and Behaviour with Deep Reinforcement Learning","date":"2019-11-15","arxiv_id":"1911.06832","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-exploration-through-latent","title":"Improved Exploration through Latent Trajectory Optimization in Deep Deterministic Policy Gradient","date":"2019-11-15","arxiv_id":"1911.06833","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-personalized-dialog-policies-for","title":"Towards Personalized Dialog Policies for Conversational Skill Discovery","date":"2019-11-15","arxiv_id":"1911.06747","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reduction-from-reinforcement-learning-to-no","title":"A Reduction from Reinforcement Learning to No-Regret Online Learning","date":"2019-11-14","arxiv_id":"1911.05873","repositories_listed":0,"syntology":null},{"url":null,"slug":"atari-fying-the-vehicle-routing-problem-with","title":"Gamifying the Vehicle Routing Problem with Stochastic Requests","date":"2019-11-14","arxiv_id":"1911.05922","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-adaptive","title":"Deep Reinforcement Learning for Adaptive Traffic Signal Control","date":"2019-11-14","arxiv_id":"1911.06294","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotics-of-reinforcement-learning-with","title":"Asymptotics of Reinforcement Learning with Neural Networks","date":"2019-11-13","arxiv_id":"1911.07304","repositories_listed":0,"syntology":null},{"url":null,"slug":"buffer-aware-wireless-scheduling-based-on","title":"Buffer-aware Wireless Scheduling based on Deep Reinforcement Learning","date":"2019-11-13","arxiv_id":"1911.05281","repositories_listed":0,"syntology":null},{"url":null,"slug":"kinematic-state-abstraction-and-provably","title":"Kinematic State Abstraction and Provably Efficient Rich-Observation Reinforcement Learning","date":"2019-11-13","arxiv_id":"1911.05815","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-communicate-in-multi-agent","title":"Learning to Communicate in Multi-Agent Reinforcement Learning : A Review","date":"2019-11-13","arxiv_id":"1911.05438","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-driven-test-generation","title":"Reinforcement Learning-Driven Test Generation for Android GUI Applications using Formal Specifications","date":"2019-11-13","arxiv_id":"1911.05403","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-training-in-pommerman-with","title":"Accelerating Training in Pommerman with Imitation and Reinforcement Learning","date":"2019-11-12","arxiv_id":"1911.04947","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-planning-under-partial","title":"Efficient Planning under Partial Observability with Unnormalized Q Functions and Spectral Learning","date":"2019-11-12","arxiv_id":"1911.05010","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-representations-in-reinforcement","title":"Learning Representations in Reinforcement Learning:An Information Bottleneck Approach","date":"2019-11-12","arxiv_id":"1911.05695","repositories_listed":0,"syntology":null},{"url":null,"slug":"msdf-a-deep-reinforcement-learning-framework","title":"MSDF: A Deep Reinforcement Learning Framework for Service Function Chain Migration","date":"2019-11-12","arxiv_id":"1911.04801","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-shot-learning-and-behavioral-eligibility","title":"One-shot learning and behavioral eligibility traces in sequential decision making","date":"2019-11-12","arxiv_id":"1707.04192","repositories_listed":0,"syntology":null},{"url":null,"slug":"schedule-earth-observation-satellites-with","title":"Schedule Earth Observation satellites with Deep Reinforcement Learning","date":"2019-11-12","arxiv_id":"1911.05696","repositories_listed":0,"syntology":null}],"record_sha256":"f7f0681c916023d600f3b43f97fbd39ba0e1251adeba1268fca0f158e1368015","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}