{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/104","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":104,"pages_in_order":135,"rows_per_page":100,"rows":[10301,10400],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/103","next":"/task/reinforcement-learning-2/papers/105","papers":[{"url":null,"slug":"assessment-of-reward-functions-in","title":"Assessment of Reward Functions in Reinforcement Learning for Multi-Modal Urban Traffic Control under Real-World limitations","date":"2020-10-17","arxiv_id":"2010.08819","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-elimination-ordering-for-tree","title":"Learning Elimination Ordering for Tree Decomposition Problem","date":"2020-10-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-lower-bounds-for-graph-exploration","title":"Learning Lower Bounds for Graph Exploration With Reinforcement Learning","date":"2020-10-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-algorithms-for-graph-navigation","title":"Neural Algorithms for Graph Navigation","date":"2020-10-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-dynamic-for-self-supervised","title":"Variational Dynamic for Self-Supervised Exploration in Deep Reinforcement Learning","date":"2020-10-17","arxiv_id":"2010.08755","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-control-of-a-particle-accelerator","title":"Autonomous Control of a Particle Accelerator using Deep Reinforcement Learning","date":"2020-10-16","arxiv_id":"2010.08141","repositories_listed":0,"syntology":null},{"url":null,"slug":"doom-a-novel-adversarial-drl-based-op-code","title":"DOOM: A Novel Adversarial-DRL-Based Op-Code Level Metamorphic Malware Obfuscator for the Enhancement of IDS","date":"2020-10-16","arxiv_id":"2010.08608","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-robotic-object-search-via-hiem","title":"Efficient Robotic Object Search via HIEM: Hierarchical Policy Learning with Intrinsic-Extrinsic Modeling","date":"2020-10-16","arxiv_id":"2010.08596","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-efficient-and","title":"Reinforcement Learning for Efficient and Tuning-Free Link Adaptation","date":"2020-10-16","arxiv_id":"2010.08651","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-contact-safe-model-based","title":"Uncertainty-aware Contact-safe Model-based Reinforcement Learning","date":"2020-10-16","arxiv_id":"2010.08169","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-nesterov-s-accelerated-quasi-newton-method","title":"A Nesterov's Accelerated quasi-Newton method for Global Routing using Deep Reinforcement Learning","date":"2020-10-15","arxiv_id":"2010.09465","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empowerment-based-solution-to-robotic","title":"An Empowerment-based Solution to Robotic Manipulation Tasks with Sparse Rewards","date":"2020-10-15","arxiv_id":"2010.07986","repositories_listed":0,"syntology":null},{"url":null,"slug":"applicability-and-challenges-of-deep","title":"Applicability and Challenges of Deep Reinforcement Learning for Satellite Frequency Plan Design","date":"2020-10-15","arxiv_id":"2010.08015","repositories_listed":0,"syntology":null},{"url":null,"slug":"blending-search-and-discovery-tag-based-query","title":"Blending Search and Discovery: Tag-Based Query Refinement with Contextual Reinforcement Learning","date":"2020-10-15","arxiv_id":"2010.09495","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-competitive-reinforcement","title":"Cooperative-Competitive Reinforcement Learning with History-Dependent Rewards","date":"2020-10-15","arxiv_id":"2010.08030","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-of-koopman-representation-for","title":"Deep Learning of Koopman Representation for Control","date":"2020-10-15","arxiv_id":"2010.07546","repositories_listed":0,"syntology":null},{"url":null,"slug":"explanation-augmented-feedback-in-human-in-1","title":"Explanation Augmented Feedback in Human-in-the-Loop Reinforcement Learning","date":"2020-10-15","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"local-differentially-private-regret","title":"Local Differential Privacy for Regret Minimization in Reinforcement Learning","date":"2020-10-15","arxiv_id":"2010.07778","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-dispatch-in-emergency-service-system","title":"Optimal Dispatch in Emergency Service System via Reinforcement Learning","date":"2020-10-15","arxiv_id":"2010.07513","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-cost-optimal-control-of-stochastic","title":"Average Cost Optimal Control of Stochastic Systems Using Reinforcement Learning","date":"2020-10-13","arxiv_id":"2010.06236","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-and","title":"Deep Reinforcement Learning and Transportation Research: A Comprehensive Review","date":"2020-10-13","arxiv_id":"2010.06187","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-type","title":"Model-Based Reinforcement Learning for Type 1Diabetes Blood Glucose Control","date":"2020-10-13","arxiv_id":"2010.06266","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-network-distillation-as-a-diversity-1","title":"Random Network Distillation as a Diversity Metric for Both Image and Text Generation","date":"2020-10-13","arxiv_id":"2010.06715","repositories_listed":0,"syntology":null},{"url":null,"slug":"attendlight-universal-attention-based","title":"AttendLight: Universal Attention-Based Reinforcement Learning Model for Traffic Signal Control","date":"2020-10-12","arxiv_id":"2010.05772","repositories_listed":0,"syntology":null},{"url":"/paper/discrete-latent-space-world-models-for","slug":"discrete-latent-space-world-models-for","title":"Smaller World Models for Reinforcement Learning","date":"2020-10-12","arxiv_id":"2010.05767","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-plug-in-solver-sample-efficient-for","title":"Is Plug-in Solver Sample-Efficient for Feature-based Reinforcement Learning?","date":"2020-10-12","arxiv_id":"2010.05673","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-minimax-optimal-reward-free","title":"Nearly Minimax Optimal Reward-free Reinforcement Learning","date":"2020-10-12","arxiv_id":"2010.05901","repositories_listed":0,"syntology":null},{"url":null,"slug":"remote-electrical-tilt-optimization-via-safe","title":"Remote Electrical Tilt Optimization via Safe Reinforcement Learning","date":"2020-10-12","arxiv_id":"2010.05842","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-stop-epidemics-controlling-graph","title":"Controlling Graph Dynamics with Reinforcement Learning and Graph Neural Networks","date":"2020-10-11","arxiv_id":"2010.05313","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with-natural-1","title":"Safe Reinforcement Learning with Natural Language Constraints","date":"2020-10-11","arxiv_id":"2010.05150","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-on-computational","title":"Reinforcement Learning on Computational Resource Allocation of Cloud-based Wireless Networks","date":"2020-10-10","arxiv_id":"2010.05024","repositories_listed":0,"syntology":null},{"url":null,"slug":"characterizing-policy-divergence-for","title":"Characterizing Policy Divergence for Personalized Meta-Reinforcement Learning","date":"2020-10-09","arxiv_id":"2010.04816","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-asset","title":"Deep Reinforcement Learning for Asset Allocation in US Equities","date":"2020-10-09","arxiv_id":"2010.04404","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-rl-with-information-constrained-policies","title":"Deep RL With Information Constrained Policies: Generalization in Continuous Control","date":"2020-10-09","arxiv_id":"2010.04646","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-context-selection-for-document-level","title":"Dynamic Context Selection for Document-level Neural Machine Translation via Reinforcement Learning","date":"2020-10-09","arxiv_id":"2010.04314","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-state-action-embedding-for-efficient-1","title":"Jointly-Learned State-Action Embedding for Efficient Reinforcement Learning","date":"2020-10-09","arxiv_id":"2010.04444","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-locomote-understanding-how","title":"Learning to Locomote: Understanding How Environment Design Matters for Deep Reinforcement Learning","date":"2020-10-09","arxiv_id":"2010.04304","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameterized-reinforcement-learning-for","title":"Parameterized Reinforcement Learning for Optical System Optimization","date":"2020-10-09","arxiv_id":"2010.05769","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-intrinsic-symbolic-rewards-in-1","title":"Learning Intrinsic Symbolic Rewards in Reinforcement Learning","date":"2020-10-08","arxiv_id":"2010.03694","repositories_listed":0,"syntology":null},{"url":null,"slug":"nonstationary-reinforcement-learning-with","title":"Nonstationary Reinforcement Learning with Linear Function Approximation","date":"2020-10-08","arxiv_id":"2010.04244","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-fictitious-play-for-general-mean-1","title":"Provable Fictitious Play for General Mean-Field Games","date":"2020-10-08","arxiv_id":"2010.04211","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-critic-algorithm-for-high-dimensional","title":"Actor-Critic Algorithm for High-dimensional Partial Differential Equations","date":"2020-10-07","arxiv_id":"2010.03647","repositories_listed":0,"syntology":null},{"url":null,"slug":"episodic-reinforcement-learning-in-finite","title":"Episodic Reinforcement Learning in Finite MDPs: Minimax Lower Bounds Revisited","date":"2020-10-07","arxiv_id":"2010.03531","repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-dependent-complexity-of-contextual","title":"Instance-Dependent Complexity of Contextual Bandits and Reinforcement Learning: A Disagreement-Based Perspective","date":"2020-10-07","arxiv_id":"2010.03104","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-safety-assurance-for-deep","title":"Online Safety Assurance for Deep Reinforcement Learning","date":"2020-10-07","arxiv_id":"2010.03625","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-inverse-reinforcement-learning-1","title":"Regularized Inverse Reinforcement Learning","date":"2020-10-07","arxiv_id":"2010.03691","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-many-body-ground","title":"Reinforcement Learning for Many-Body Ground-State Preparation Inspired by Counterdiabatic Driving","date":"2020-10-07","arxiv_id":"2010.03655","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-intrinsic-control-revisited-1","title":"Variational Intrinsic Control Revisited","date":"2020-10-07","arxiv_id":"2010.03281","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-multi-agent-reinforcement","title":"Heterogeneous Multi-Agent Reinforcement Learning for Unknown Environment Mapping","date":"2020-10-06","arxiv_id":"2010.02663","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-aware-reinforcement-learning-sarl-1","title":"Safety Aware Reinforcement Learning (SARL)","date":"2020-10-06","arxiv_id":"2010.02846","repositories_listed":0,"syntology":null},{"url":null,"slug":"uneven-universal-value-exploration-for-multi-1","title":"UneVEn: Universal Value Exploration for Multi-Agent Reinforcement Learning","date":"2020-10-06","arxiv_id":"2010.02974","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-collaborative","title":"Deep Reinforcement Learning for Collaborative Edge Computing in Vehicular Networks","date":"2020-10-05","arxiv_id":"2010.01722","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-electric-1","title":"Deep Reinforcement Learning for Electric Vehicle Routing Problem with Time Windows","date":"2020-10-05","arxiv_id":"2010.02068","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-directed-generation-of-discrete","title":"Goal-directed Generation of Discrete Structures with Conditional Generative Models","date":"2020-10-05","arxiv_id":"2010.02311","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentiment-analysis-for-reinforcement-learning","title":"Sentiment Analysis for Reinforcement Learning","date":"2020-10-05","arxiv_id":"2010.02316","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-act-of-remembering-a-study-in-partially-1","title":"The act of remembering: a study in partially observable reinforcement learning","date":"2020-10-05","arxiv_id":"2010.01753","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-sharp-analysis-of-model-based-reinforcement-1","title":"A Sharp Analysis of Model-based Reinforcement Learning with Self-Play","date":"2020-10-04","arxiv_id":"2010.01604","repositories_listed":0,"syntology":null},{"url":null,"slug":"test-cost-sensitive-methods-for-identifying","title":"Test-Cost Sensitive Methods for Identifying Nearby Points","date":"2020-10-04","arxiv_id":"2010.03962","repositories_listed":0,"syntology":null},{"url":null,"slug":"attractor-selection-in-nonlinear-energy","title":"Attractor Selection in Nonlinear Energy Harvesting Using Deep Reinforcement Learning","date":"2020-10-03","arxiv_id":"2010.01255","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-tabula-rasa-a-modular-reinforcement","title":"Beyond Tabula-Rasa: a Modular Reinforcement Learning Approach for Physically Embedded 3D Sokoban","date":"2020-10-03","arxiv_id":"2010.01298","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-causal-effects-for-hierarchical","title":"Disentangling causal effects for hierarchical reinforcement learning","date":"2020-10-03","arxiv_id":"2010.01351","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-with-expected-quadratic-1","title":"Mean-Variance Efficient Reinforcement Learning with Applications to Dynamic Financial Investment","date":"2020-10-03","arxiv_id":"2010.01404","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-reinforcement-learning-for","title":"Interactive Reinforcement Learning for Feature Selection with Decision Tree in the Loop","date":"2020-10-02","arxiv_id":"2010.02506","repositories_listed":0,"syntology":null},{"url":null,"slug":"madras-multi-agent-driving-simulator","title":"MADRaS : Multi Agent Driving Simulator","date":"2020-10-02","arxiv_id":"2010.00993","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-simple-indirect","title":"Reinforcement Learning of Sequential Price Mechanisms","date":"2020-10-02","arxiv_id":"2010.01180","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-mixed","title":"Deep Reinforcement Learning with Mixed Convolutional Network","date":"2020-10-01","arxiv_id":"2010.00717","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-reinforcement-learning-for","title":"Nearly Minimax Optimal Reinforcement Learning for Discounted MDPs","date":"2020-10-01","arxiv_id":"2010.00587","repositories_listed":0,"syntology":null},{"url":"/paper/multi-agent-social-reinforcement-learning","slug":"multi-agent-social-reinforcement-learning","title":"Emergent Social Learning via Multi-agent Reinforcement Learning","date":"2020-10-01","arxiv_id":"2010.00581","repositories_listed":0,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/multi-agent-social-reinforcement-learning#ran","syntology_url":"https://syntology.ai/paper/2010.00581","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.00581"}},"official":null}},{"url":null,"slug":"multi-reward-based-reinforcement-learning-for","title":"Multi-Reward based Reinforcement Learning for Neural Machine Translation","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"recognition-method-of-important-words-in","title":"Recognition Method of Important Words in Korean Text based on Reinforcement Learning","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"value-based-bayesian-meta-reinforcement","title":"Bayesian Meta-reinforcement Learning for Traffic Signal Control","date":"2020-10-01","arxiv_id":"2010.00163","repositories_listed":0,"syntology":null},{"url":null,"slug":"aamdrl-augmented-asset-management-with-deep","title":"AAMDRL: Augmented Asset Management with Deep Reinforcement Learning","date":"2020-09-30","arxiv_id":"2010.08497","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-optimization-and-reinforcement","title":"Accelerating Optimization and Reinforcement Learning with Quasi-Stochastic Approximation","date":"2020-09-30","arxiv_id":"2009.14431","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-gap-between-markowitz-planning","title":"Bridging the gap between Markowitz planning and deep reinforcement learning","date":"2020-09-30","arxiv_id":"2010.09108","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-regularization-for-mean-field-games","title":"Entropy Regularization for Mean Field Games with Learning","date":"2020-09-30","arxiv_id":"2010.00145","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-based-heuristic-search-for-module","title":"Graph-based Heuristic Search for Module Selection Procedure in Neural Module Network","date":"2020-09-30","arxiv_id":"2009.14759","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategy-and-benchmark-for-converting-deep-q","title":"Strategy and Benchmark for Converting Deep Q-Networks to Event-Driven Spiking Neural Networks","date":"2020-09-30","arxiv_id":"2009.14456","repositories_listed":0,"syntology":null},{"url":null,"slug":"toolpath-design-for-additive-manufacturing","title":"Toolpath design for additive manufacturing using deep reinforcement learning","date":"2020-09-30","arxiv_id":"2009.14365","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-learning-in-deep-q-networks","title":"Cross Learning in Deep Q-Networks","date":"2020-09-29","arxiv_id":"2009.13780","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-design-space-adaptation-with-deep","title":"Trust-Region Method with Deep Reinforcement Learning in Analog Design Space Exploration","date":"2020-09-29","arxiv_id":"2009.13772","repositories_listed":0,"syntology":null},{"url":null,"slug":"reannealing-of-decaying-exploration-based-on","title":"Reannealing of Decaying Exploration Based On Heuristic Measure in Deep Q-Network","date":"2020-09-29","arxiv_id":"2009.14297","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-environment-cycle-games","title":"Agent Environment Cycle Games","date":"2020-09-28","arxiv_id":"2009.13051","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-der-cyber","title":"Deep Reinforcement Learning for DER Cyber-Attack Mitigation","date":"2020-09-28","arxiv_id":"2009.13088","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-for-model-based","title":"Efficient Exploration for Model-based Reinforcement Learning with Continuous States and Actions","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"is-reinforcement-learning-more-difficult-than","title":"Is Reinforcement Learning More Difficult Than Bandits? A Near-optimal Algorithm Escaping the Curse of Horizon","date":"2020-09-28","arxiv_id":"2009.13503","repositories_listed":0,"syntology":null},{"url":null,"slug":"jointly-trained-state-action-embedding-for","title":"Jointly-Trained State-Action Embedding for Efficient Reinforcement Learning","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neuron-activation-analysis-for-multi-joint","title":"Neuron Activation Analysis for Multi-Joint Robot Reinforcement Learning","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"repaint-knowledge-transfer-in-deep-actor","title":"REPAINT: Knowledge Transfer in Deep Actor-Critic Reinforcement Learning","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-emergence-of-individuality-in-multi-agent-1","title":"The Emergence of Individuality in Multi-Agent Reinforcement Learning","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-heterogeneous-multi-agent","title":"Towards Heterogeneous Multi-Agent Reinforcement Learning with Graph Neural Networks","date":"2020-09-28","arxiv_id":"2009.13161","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-in-event-triggered-control","title":"Machine Learning in Event-Triggered Control: Recent Advances and Open Issues","date":"2020-09-27","arxiv_id":"2009.12783","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-deep-reinforcement-learning-for-ride","title":"Scalable Deep Reinforcement Learning for Ride-Hailing","date":"2020-09-27","arxiv_id":"2009.14679","repositories_listed":0,"syntology":null},{"url":null,"slug":"scheduling-and-power-control-for-wireless","title":"Scheduling and Power Control for Wireless Multicast Systems via Deep Reinforcement Learning","date":"2020-09-27","arxiv_id":"2011.14799","repositories_listed":0,"syntology":null},{"url":null,"slug":"virtual-experience-to-real-world-application","title":"Virtual Experience to Real World Application: Sidewalk Obstacle Avoidance Using Reinforcement Learning for Visually Impaired","date":"2020-09-27","arxiv_id":"2009.12877","repositories_listed":0,"syntology":null},{"url":null,"slug":"complementary-meta-reinforcement-learning-for","title":"Complementary Meta-Reinforcement Learning for Fault-Adaptive Control","date":"2020-09-26","arxiv_id":"2009.12634","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-induction-of-value-iteration","title":"Graph neural induction of value iteration","date":"2020-09-26","arxiv_id":"2009.12604","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-rational-control-with-partially-1","title":"Inverse Rational Control with Partially Observable Continuous Nonlinear Dynamics","date":"2020-09-26","arxiv_id":"2009.12576","repositories_listed":0,"syntology":null},{"url":null,"slug":"lineage-evolution-reinforcement-learning","title":"Lineage Evolution Reinforcement Learning","date":"2020-09-26","arxiv_id":"2010.14616","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-n-ary-cross","title":"Reinforcement Learning-based N-ary Cross-Sentence Relation Extraction","date":"2020-09-26","arxiv_id":"2009.12683","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-planning-by-reinforcement-learning-for","title":"Motion Planning by Reinforcement Learning for an Unmanned Aerial Vehicle in Virtual Open Space with Static Obstacles","date":"2020-09-24","arxiv_id":"2009.11799","repositories_listed":0,"syntology":null}],"record_sha256":"6de883f686aff2d06b9bf2af66c8042ff9c232452c977e3a095b75890899aea4","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}