{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/102","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":102,"pages_in_order":132,"rows_per_page":100,"rows":[10101,10200],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/101","next":"/task/reinforcement-learning/papers/103","papers":[{"url":null,"slug":"context-aware-active-multi-step-reinforcement","title":"Context-aware Active Multi-Step Reinforcement Learning","date":"2019-11-11","arxiv_id":"1911.04107","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-order-sub-questions-for-complex","title":"Learning to Order Sub-questions for Complex Question Answering","date":"2019-11-11","arxiv_id":"1911.04065","repositories_listed":0,"syntology":null},{"url":null,"slug":"mame-model-agnostic-meta-exploration","title":"MAME : Model-Agnostic Meta-Exploration","date":"2019-11-11","arxiv_id":"1911.04024","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-path-policy-optimization","title":"Multi-Path Policy Optimization","date":"2019-11-11","arxiv_id":"1911.04207","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-variational","title":"Reinforcement-Learning-Based Variational Quantum Circuits Optimization for Combinatorial Problems","date":"2019-11-11","arxiv_id":"1911.04574","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-value-iteration-networks","title":"Transfer Value Iteration Networks","date":"2019-11-11","arxiv_id":"1911.05701","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-dynamic","title":"Deep Reinforcement Learning Based Dynamic Trajectory Control for UAV-assisted Mobile Edge Computing","date":"2019-11-10","arxiv_id":"1911.03887","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimalistic-attacks-how-little-it-takes-to","title":"Minimalistic Attacks: How Little it Takes to Fool a Deep Reinforcement Learning Policy","date":"2019-11-10","arxiv_id":"1911.03849","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-bahdanau-attention-using-election","title":"Modelling Bahdanau Attention using Election methods aided by Q-Learning","date":"2019-11-10","arxiv_id":"1911.03853","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-added-chemical-discovery-using","title":"Value-Added Chemical Discovery Using Reinforcement Learning","date":"2019-11-10","arxiv_id":"1911.07630","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-method","title":"Hierarchical Reinforcement Learning Method for Autonomous Vehicle Behavior Planning","date":"2019-11-09","arxiv_id":"1911.03799","repositories_listed":0,"syntology":null},{"url":null,"slug":"robo-planet-learning-to-poke-in-a-day","title":"Robo-PlaNet: Learning to Poke in a Day","date":"2019-11-09","arxiv_id":"1911.03594","repositories_listed":0,"syntology":null},{"url":null,"slug":"worst-cases-policy-gradients","title":"Worst Cases Policy Gradients","date":"2019-11-09","arxiv_id":"1911.03618","repositories_listed":0,"syntology":null},{"url":null,"slug":"ask-to-learn-a-study-on-curiosity-driven","title":"Ask to Learn: A Study on Curiosity-driven Question Generation","date":"2019-11-08","arxiv_id":"1911.03350","repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-bayesian-recurrent-neural-networks-for","title":"Fully Bayesian Recurrent Neural Networks for Safe Reinforcement Learning","date":"2019-11-08","arxiv_id":"1911.03308","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-grounding-through-social","title":"Language Grounding through Social Interactions and Curiosity-Driven Multi-Goal Learning","date":"2019-11-08","arxiv_id":"1911.03219","repositories_listed":0,"syntology":null},{"url":null,"slug":"option-compatible-reward-inverse","title":"Option Compatible Reward Inverse Reinforcement Learning","date":"2019-11-07","arxiv_id":"1911.02723","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reward-decomposition-for","title":"Distributional Reward Decomposition for Reinforcement Learning","date":"2019-11-06","arxiv_id":"1911.02166","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-sharing-between-cooperative","title":"Experience Sharing Between Cooperative Reinforcement Learning Agents","date":"2019-11-06","arxiv_id":"1911.02191","repositories_listed":0,"syntology":null},{"url":null,"slug":"mbcal-a-simple-and-efficient-reinforcement","title":"MBCAL: Sample Efficient and Variance Reduced Reinforcement Learning for Recommender Systems","date":"2019-11-06","arxiv_id":"1911.02248","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-the-factual-correctness-of-a","title":"Optimizing the Factual Correctness of a Summary: A Study of Summarizing Radiology Reports","date":"2019-11-06","arxiv_id":"1911.02541","repositories_listed":0,"syntology":null},{"url":null,"slug":"resilient-load-restoration-in-microgrids","title":"Resilient Load Restoration in Microgrids Considering Mobile Energy Storage Fleets: A Deep Reinforcement Learning Approach","date":"2019-11-06","arxiv_id":"1911.02206","repositories_listed":0,"syntology":null},{"url":null,"slug":"being-optimistic-to-be-conservative-quickly","title":"Being Optimistic to Be Conservative: Quickly Learning a CVaR Policy","date":"2019-11-05","arxiv_id":"1911.01546","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepracer-educational-autonomous-racing","title":"DeepRacer: Educational Autonomous Racing Platform for Experimentation with Sim2Real Reinforcement Learning","date":"2019-11-05","arxiv_id":"1911.01562","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-multi-robot-exploration-via-multi","title":"Efficient Multi-robot Exploration via Multi-head Attention-based Cooperation Strategy","date":"2019-11-05","arxiv_id":"1911.01774","repositories_listed":0,"syntology":null},{"url":null,"slug":"quinoa-a-q-function-you-infer-normalized-over","title":"Quinoa: a Q-function You Infer Normalized Over Actions","date":"2019-11-05","arxiv_id":"1911.01831","repositories_listed":0,"syntology":null},{"url":null,"slug":"robo-advising-learning-investors-risk","title":"Robo-advising: Learning Investors' Risk Preferences via Portfolio Choices","date":"2019-11-05","arxiv_id":"1911.02067","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-end-to-end-deep-rl-framework-for-task","title":"An End-to-End Deep RL Framework for Task Arrangement in Crowdsourcing Platforms","date":"2019-11-04","arxiv_id":"1911.01030","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-tracking-control-with-kernel-trick","title":"Robotic Tracking Control with Kernel Trick-based Reinforcement Learning","date":"2019-11-04","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tustin-neural-networks-a-class-of-recurrent","title":"Tustin neural networks: a class of recurrent nets for adaptive MPC of mechanical systems","date":"2019-11-04","arxiv_id":"1911.01310","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analysis-of-decentralized","title":"Finite-Sample Analysis of Decentralized Temporal-Difference Learning with Linear Function Approximation","date":"2019-11-03","arxiv_id":"1911.00934","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-diverse-exploration","title":"Maximum Entropy Diverse Exploration: Disentangling Maximum Entropy Reinforcement Learning","date":"2019-11-03","arxiv_id":"1911.00828","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-cooperative-inverse-reinforcement-1","title":"Non-Cooperative Inverse Reinforcement Learning","date":"2019-11-03","arxiv_id":"1911.04220","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-robustness-training-for-deep","title":"Online Robustness Training for Deep Reinforcement Learning","date":"2019-11-03","arxiv_id":"1911.00887","repositories_listed":0,"syntology":null},{"url":null,"slug":"problem-dependent-reinforcement-learning-1","title":"Problem Dependent Reinforcement Learning Bounds Which Can Identify Bandit Structure in MDPs","date":"2019-11-03","arxiv_id":"1911.00954","repositories_listed":0,"syntology":null},{"url":null,"slug":"a2-extracting-cyclic-switchings-from-dob-nets","title":"A2: Extracting Cyclic Switchings from DOB-nets for Rejecting Excessive Disturbances","date":"2019-11-01","arxiv_id":"1911.00165","repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-guided-and-semantic-coherent-question","title":"Answer-guided and Semantic Coherent Question Generation in Open-domain Conversation","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-supervised-question-reformulation-for","title":"Answer-Supervised Question Reformulation for Enhancing Conversational Machine Comprehension","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-text","title":"Deep Reinforcement Learning-based Text Anonymization against Private-Attribute Inference","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"divine-a-generative-adversarial-imitation","title":"DIVINE: A Generative Adversarial Imitation Learning Framework for Knowledge Graph Reasoning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"experienced-deep-reinforcement-learning-with","title":"Experienced Deep Reinforcement Learning with Generative Adversarial Networks (GANs) for Model-Free Ultra Reliable Low Latency Communication","date":"2019-11-01","arxiv_id":"1911.03264","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-diverse-expressions-for-paraphrase","title":"Exploring Diverse Expressions for Paraphrase Generation","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-formality-tuned-summaries-using","title":"Generating Formality-Tuned Summaries Using Input-Dependent Rewards","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-graph-attention-mechanism-into","title":"Incorporating Graph Attention Mechanism into Knowledge Graph Reasoning Based on Deep Reinforcement Learning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-the-extraction-order-of-multiple","title":"Learning the Extraction Order of Multiple Relational Facts in a Sentence with Reinforcement Learning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-ask-for-conversational-machine","title":"Learning to Ask for Conversational Machine Learning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lexicalat-lexical-based-adversarial","title":"LexicalAT: Lexical-Based Adversarial Reinforcement Training for Robust Sentiment Classification","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-topic-model-with-reinforcement","title":"Neural Topic Model with Reinforcement Learning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-based-denoising-of-distantly","title":"Reinforcement-based denoising of distantly supervised NER with partial annotation","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"seeded-self-play-for-language-learning","title":"Seeded self-play for language learning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"situated-gail-multitask-imitation-using-task","title":"Situated GAIL: Multitask imitation using task-conditioned adversarial inverse reinforcement learning","date":"2019-11-01","arxiv_id":"1911.00238","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-neural-machine-translation-with-3","title":"Unsupervised Neural Machine Translation with Future Rewarding","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-narration-based-reward-shaping-approach","title":"A Narration-based Reward Shaping Approach using Grounded Natural Language Commands","date":"2019-10-31","arxiv_id":"1911.00497","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepline-automl-tool-for-pipelines-generation","title":"DeepLine: AutoML Tool for Pipelines Generation using Deep Reinforcement Learning and Hierarchical Actions Filtering","date":"2019-10-31","arxiv_id":"1911.00061","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-expert-networks-for-meta","title":"Hierarchical Expert Networks for Meta-Learning","date":"2019-10-31","arxiv_id":"1911.00348","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlink-deep-reinforcement-learning-for-user","title":"RLINK: Deep Reinforcement Learning for User Identity Linkage","date":"2019-10-31","arxiv_id":"1910.14273","repositories_listed":0,"syntology":null},{"url":null,"slug":"vase-variational-assorted-surprise","title":"VASE: Variational Assorted Surprise Exploration for Reinforcement Learning","date":"2019-10-31","arxiv_id":"1910.14351","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-distributed-model-free-algorithm-for-multi","title":"A Distributed Model-Free Algorithm for Multi-hop Ride-sharing using Deep Reinforcement Learning","date":"2019-10-30","arxiv_id":"1910.14002","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-testing-and-falsification-with","title":"Automatic Testing With Reusable Adversarial Agents","date":"2019-10-30","arxiv_id":"1910.13645","repositories_listed":0,"syntology":null},{"url":null,"slug":"dadi-dynamic-discovery-of-fair-information","title":"DADI: Dynamic Discovery of Fair Information with Adversarial Reinforcement Learning","date":"2019-10-30","arxiv_id":"1910.13983","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-algorithmic-solutions-to-symbolic","title":"Learning Algorithmic Solutions to Symbolic Planning Tasks with a Neural Computer Architecture","date":"2019-10-30","arxiv_id":"1911.00926","repositories_listed":0,"syntology":null},{"url":null,"slug":"rbed-reward-based-epsilon-decay","title":"RBED: Reward Based Epsilon Decay","date":"2019-10-30","arxiv_id":"1910.13701","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013196","title":"Deep Decentralized Reinforcement Learning for Cooperative Control","date":"2019-10-29","arxiv_id":"1910.13196","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013213","title":"Overcoming Catastrophic Interference in Online Reinforcement Learning with Dynamic Self-Organizing Maps","date":"2019-10-29","arxiv_id":"1910.13213","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013272","title":"Feedback Linearization for Unknown Systems via Reinforcement Learning","date":"2019-10-29","arxiv_id":"1910.13272","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013393","title":"Constrained Reinforcement Learning Has Zero Duality Gap","date":"2019-10-29","arxiv_id":"1910.13393","repositories_listed":0,"syntology":null},{"url":null,"slug":"191013399","title":"Robust Model-free Reinforcement Learning with Multi-objective Bayesian Optimization","date":"2019-10-29","arxiv_id":"1910.13399","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-sampling-quasi-newton-methods-for","title":"Adaptive Sampling Quasi-Newton Methods for Derivative-Free Stochastic Optimization","date":"2019-10-29","arxiv_id":"1910.13516","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-distributed","title":"Deep Reinforcement Learning for Distributed Uncoordinated Cognitive Radios Resource Allocation","date":"2019-10-29","arxiv_id":"1911.03366","repositories_listed":0,"syntology":null},{"url":null,"slug":"better-exploration-with-optimistic-actor","title":"Better Exploration with Optimistic Actor-Critic","date":"2019-10-28","arxiv_id":"1910.12807","repositories_listed":0,"syntology":null},{"url":null,"slug":"biomimetic-ultra-broadband-perfect-absorbers","title":"Biomimetic Ultra-Broadband Perfect Absorbers Optimised with Reinforcement Learning","date":"2019-10-28","arxiv_id":"1910.12465","repositories_listed":0,"syntology":null},{"url":null,"slug":"certified-adversarial-robustness-for-deep","title":"Certified Adversarial Robustness for Deep Reinforcement Learning","date":"2019-10-28","arxiv_id":"1910.12908","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-transferable-graph-exploration","title":"Learning Transferable Graph Exploration","date":"2019-10-28","arxiv_id":"1910.12980","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-weight-and-q-function-learning-for","title":"Minimax Weight and Q-Function Learning for Off-Policy Evaluation","date":"2019-10-28","arxiv_id":"1910.12809","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-mean-field-reinforcement-learning","title":"Model-Free Mean-Field Reinforcement Learning: Mean-Field MDP and Mean-Field Q-Learning","date":"2019-10-28","arxiv_id":"1910.12802","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-evolution-in-deep","title":"Neural Architecture Evolution in Deep Reinforcement Learning for Continuous Control","date":"2019-10-28","arxiv_id":"1910.12824","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamps-safe-multi-agent-reinforcement-learning","title":"MAMPS: Safe Multi-Agent Reinforcement Learning via Model Predictive Shielding","date":"2019-10-25","arxiv_id":"1910.12639","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-projective-simulation","title":"On the convergence of projective-simulation-based reinforcement learning in Markov decision processes","date":"2019-10-25","arxiv_id":"1910.11914","repositories_listed":0,"syntology":null},{"url":null,"slug":"case-study-verifying-the-safety-of-an","title":"Case Study: Verifying the Safety of an Autonomous Racing Car with a Neural Network Controller","date":"2019-10-24","arxiv_id":"1910.11309","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-in-deep-reinforcement-learning","title":"Pre-training in Deep Reinforcement Learning for Automatic Speech Recognition","date":"2019-10-24","arxiv_id":"1910.11256","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-model-predictive-shielding-for-safe","title":"Robust Model Predictive Shielding for Safe Reinforcement Learning with Stochastic Dynamics","date":"2019-10-24","arxiv_id":"1910.10885","repositories_listed":0,"syntology":null},{"url":null,"slug":"banditrank-learning-to-rank-using-contextual","title":"BanditRank: Learning to Rank Using Contextual Bandits","date":"2019-10-23","arxiv_id":"1910.10410","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-confidence-policy-optimization-reshaping","title":"Optimizing Percentile Criterion Using Robust MDPs","date":"2019-10-23","arxiv_id":"1910.10786","repositories_listed":0,"syntology":null},{"url":null,"slug":"partially-detected-intelligent-traffic-signal","title":"Partially Detected Intelligent Traffic Signal Control: Environmental Adaptation","date":"2019-10-23","arxiv_id":"1910.10808","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-reinforcement-learning","title":"Sample Complexity of Reinforcement Learning using Linearly Combined Model Ensembles","date":"2019-10-23","arxiv_id":"1910.10597","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-and-safer-training-by-embedding-high","title":"Faster and Safer Training by Embedding High-Level Knowledge into Deep Reinforcement Learning","date":"2019-10-22","arxiv_id":"1910.09986","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-resilient-behaviors-for-navigation","title":"Learning Resilient Behaviors for Navigation Under Uncertainty","date":"2019-10-22","arxiv_id":"1910.09998","repositories_listed":0,"syntology":null},{"url":null,"slug":"state2vec-off-policy-successor-features","title":"State2vec: Off-Policy Successor Features Approximators","date":"2019-10-22","arxiv_id":"1910.10277","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-an-intelligent-microscope-adaptively","title":"Towards an Intelligent Microscope: adaptively learned illumination for optimal sample classification","date":"2019-10-22","arxiv_id":"1910.10209","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-framework-for-multi-agent-reinforcement","title":"A New Framework for Multi-Agent Reinforcement Learning -- Centralized Training and Exploration with Decentralized Execution via Policy Distillation","date":"2019-10-21","arxiv_id":"1910.09152","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-reinforcement-learning-for-5g","title":"Application of Reinforcement Learning for 5G Scheduling Parameter Optimization","date":"2019-10-21","arxiv_id":"1911.07608","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-filtering-with-a-synthetic","title":"Learning to Recommend from Sparse Data via Generative User Feedback","date":"2019-10-21","arxiv_id":"1910.12735","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-benefits-from-trajectory","title":"Combining Benefits from Trajectory Optimization and Deep Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09667","repositories_listed":0,"syntology":null},{"url":null,"slug":"enforcing-reasoning-in-visual-commonsense","title":"Enforcing Reasoning in Visual Commonsense Reasoning","date":"2019-10-21","arxiv_id":"1910.11124","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-stochastic-algorithms-via-history","title":"History-Gradient Aided Batch Size Adaptation for Variance Reduced Algorithms","date":"2019-10-21","arxiv_id":"1910.09670","repositories_listed":0,"syntology":null},{"url":null,"slug":"good-better-best-textual-distractors","title":"Good, Better, Best: Textual Distractors Generation for Multiple-Choice Visual Question Answering via Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09134","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-like-decision-making-document-level","title":"Human-Like Decision Making: Document-level Aspect Sentiment Classification via Hierarchical Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09260","repositories_listed":0,"syntology":null},{"url":null,"slug":"ipo-interior-point-policy-optimization-under","title":"IPO: Interior-point Policy Optimization under Constraints","date":"2019-10-21","arxiv_id":"1910.09615","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-generalized-forces-with","title":"Modelling Generalized Forces with Reinforcement Learning for Sim-to-Real Transfer","date":"2019-10-21","arxiv_id":"1910.09471","repositories_listed":0,"syntology":null},{"url":null,"slug":"momentum-in-reinforcement-learning","title":"Momentum in Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09322","repositories_listed":0,"syntology":null}],"record_sha256":"e9cc27df31d98bcfd35d305e79972cdeb3426a7d10169e19b7a7d3f8a3a50d35","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}