{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/125","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":125,"pages_in_order":152,"rows_per_page":100,"rows":[12401,12500],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/124","next":"/task/reinforcement-learning-1/papers/126","papers":[{"url":null,"slug":"deep-reinforcement-learning-based-beam","title":"Deep Reinforcement Learning-Based Beam Tracking for Low-Latency Services in Vehicular Networks","date":"2020-02-13","arxiv_id":"2002.05564","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-reinforcement-learning-for-anti-jamming","title":"Fast Reinforcement Learning for Anti-jamming Communications","date":"2020-02-13","arxiv_id":"2002.05364","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-reinforcement","title":"Improving Generalization of Reinforcement Learning with Minimax Distributional Soft Actor-Critic","date":"2020-02-13","arxiv_id":"2002.05502","repositories_listed":0,"syntology":null},{"url":null,"slug":"modrld-am-multiobjective-deep-reinforcement","title":"MODRL/D-AM: Multiobjective Deep Reinforcement Learning Algorithm Using Decomposition and Attention Model for Multiobjective Optimization","date":"2020-02-13","arxiv_id":"2002.05484","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-vehicle-routing-problems-with-soft-time","title":"Multi-Vehicle Routing Problems with Soft Time Windows: A Multi-Agent Reinforcement Learning Approach","date":"2020-02-13","arxiv_id":"2002.05513","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tensor-network-approach-to-finite-markov","title":"A Tensor Network Approach to Finite Markov Decision Processes","date":"2020-02-12","arxiv_id":"2002.05185","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-training-for-reinforcement","title":"Data Efficient Training for Reinforcement Learning with Adaptive Behavior Policy Sharing","date":"2020-02-12","arxiv_id":"2002.05229","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bounds-for-discounted-mdps","title":"Regret Bounds for Discounted MDPs","date":"2020-02-12","arxiv_id":"2002.05138","repositories_listed":0,"syntology":null},{"url":null,"slug":"confounding-robust-policy-evaluation-in","title":"Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.04518","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyper-meta-reinforcement-learning-with-sparse","title":"HMRL: Hyper-Meta Learning for Sparse Reward Reinforcement Learning Problem","date":"2020-02-11","arxiv_id":"2002.04238","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-structured-communication-for-multi-1","title":"Learning Structured Communication for Multi-agent Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.04235","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-switch-between-machines-and","title":"Learning to Switch Among Agents in a Team via 2-Layer Markov Decision Processes","date":"2020-02-11","arxiv_id":"2002.04258","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-approaches-for-motor","title":"Machine Learning Approaches For Motor Learning: A Short Review","date":"2020-02-11","arxiv_id":"2002.04317","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-intelligent-pick-and-place-assembly","title":"Towards Intelligent Pick and Place Assembly of Individualized Products Using Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.08333","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-off-policy-evaluation-in","title":"Interpretable Off-Policy Evaluation in Reinforcement Learning by Highlighting Influential Transitions","date":"2020-02-10","arxiv_id":"2002.03478","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-reward-shaping-for-mobile-robot-navigation","title":"On Reward Shaping for Mobile Robot Navigation: A Reinforcement Learning and SLAM Based Approach","date":"2020-02-10","arxiv_id":"2002.04109","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-the-monte-carlo","title":"On the Convergence of the Monte Carlo Exploring Starts Algorithm for Reinforcement Learning","date":"2020-02-10","arxiv_id":"2002.03585","repositories_listed":0,"syntology":null},{"url":null,"slug":"proficiency-aware-multi-agent-actor-critic","title":"Proficiency Constrained Multi-Agent Reinforcement Learning for Environment-Adaptive Multi UAV-UGV Teaming","date":"2020-02-10","arxiv_id":"2002.03910","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-self-play-algorithms-for-competitive","title":"Provable Self-Play Algorithms for Competitive Reinforcement Learning","date":"2020-02-10","arxiv_id":"2002.04017","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-the-total-reward-via-reward","title":"Reward Tweaking: Maximizing the Total Reward While Planning for Short Horizons","date":"2020-02-09","arxiv_id":"2002.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-data-driven-choice-of-misfit-function-for","title":"A data-driven choice of misfit function for FWI using reinforcement learning","date":"2020-02-08","arxiv_id":"2002.03154","repositories_listed":0,"syntology":null},{"url":"/paper/analyzing-policy-distillation-on-multi-task","slug":"analyzing-policy-distillation-on-multi-task","title":"Analyzing Policy Distillation on Multi-Task Learning and Meta-Reinforcement Learning in Meta-World","date":"2020-02-08","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"brpo-batch-residual-policy-optimization","title":"BRPO: Batch Residual Policy Optimization","date":"2020-02-08","arxiv_id":"2002.05522","repositories_listed":0,"syntology":null},{"url":null,"slug":"conservative-exploration-in-reinforcement","title":"Conservative Exploration in Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03218","repositories_listed":0,"syntology":null},{"url":null,"slug":"description-based-text-classification-with","title":"Description Based Text Classification with Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03067","repositories_listed":0,"syntology":null},{"url":null,"slug":"inferential-induction-joint-bayesian","title":"Inferential Induction: A Novel Framework for Bayesian Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03098","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-reinforcement-learning-with-a","title":"Multi-task Reinforcement Learning with a Planning Quasi-Metric","date":"2020-02-08","arxiv_id":"2002.03240","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-duet-online-music-accompaniment-generation","title":"RL-Duet: Online Music Accompaniment Generation Using Deep Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03082","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-for","title":"Accelerating Reinforcement Learning for Reaching using Continuous Curriculum Learning","date":"2020-02-07","arxiv_id":"2002.02697","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-lane-change-strategy-using-proximal","title":"Automated Lane Change Strategy using Proximal Policy Optimization-based Deep Reinforcement Learning","date":"2020-02-07","arxiv_id":"2002.02667","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-residual-policy-optimization-1","title":"Bayesian Residual Policy Optimization: Scalable Bayesian Reinforcement Learning with Clairvoyant Experts","date":"2020-02-07","arxiv_id":"2002.03042","repositories_listed":0,"syntology":null},{"url":null,"slug":"causally-correct-partial-models-for-1","title":"Causally Correct Partial Models for Reinforcement Learning","date":"2020-02-07","arxiv_id":"2002.02836","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-mean-square-error-bounds-for-monte","title":"Explicit Mean-Square Error Bounds for Monte-Carlo and Linear Stochastic Approximation","date":"2020-02-07","arxiv_id":"2002.02584","repositories_listed":0,"syntology":null},{"url":null,"slug":"manipulating-reinforcement-learning-poisoning","title":"Manipulating Reinforcement Learning: Poisoning Attacks on Cost Signals","date":"2020-02-07","arxiv_id":"2002.03827","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-reconstruction-of-policy","title":"Representation of Reinforcement Learning Policies in Reproducing Kernel Hilbert Spaces","date":"2020-02-07","arxiv_id":"2002.02863","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-free-exploration-for-reinforcement","title":"Reward-Free Exploration for Reinforcement Learning","date":"2020-02-07","arxiv_id":"2002.02794","repositories_listed":0,"syntology":null},{"url":null,"slug":"studentteacher-advising-through-reward","title":"Student/Teacher Advising through Reward Augmentation","date":"2020-02-07","arxiv_id":"2002.02938","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-reinforcement-learning-in-3","title":"Reinforcement Learning in Factored MDPs: Oracle-Efficient Algorithms and Tighter Regret Bounds for the Non-Episodic Setting","date":"2020-02-06","arxiv_id":"2002.02302","repositories_listed":0,"syntology":null},{"url":null,"slug":"social-diversity-and-social-preferences-in","title":"Social diversity and social preferences in mixed-motive reinforcement learning","date":"2020-02-06","arxiv_id":"2002.02325","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-adaptive-hierarchical-reinforcement","title":"Temporal-adaptive Hierarchical Reinforcement Learning","date":"2020-02-06","arxiv_id":"2002.02080","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-rbf-value-functions-for-continuous","title":"Deep Radial-Basis Value Functions for Continuous Control","date":"2020-02-05","arxiv_id":"2002.01883","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutual-information-based-state-control-for","title":"Mutual Information-based State-Control for Intrinsically Motivated Reinforcement Learning","date":"2020-02-05","arxiv_id":"2002.01963","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-a-dqn-replay-memory-with","title":"Bootstrapping a DQN Replay Memory with Synthetic Experiences","date":"2020-02-04","arxiv_id":"2002.01370","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-linear-two-timescale","title":"Finite Time Analysis of Linear Two-timescale Stochastic Approximation with Markovian Noise","date":"2020-02-04","arxiv_id":"2002.01268","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-task-driven-control-policies-via","title":"Learning Task-Driven Control Policies via Information Bottlenecks","date":"2020-02-04","arxiv_id":"2002.01428","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-based-quantum-approximate","title":"Policy Gradient based Quantum Approximate Optimization Algorithm","date":"2020-02-04","arxiv_id":"2002.01068","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-algorithms-for-constructing-an","title":"Evolutionary algorithms for constructing an ensemble of decision trees","date":"2020-02-03","arxiv_id":"2002.00721","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analysis-of-stochastic","title":"Finite-Sample Analysis of Stochastic Approximation Using Smooth Convex Envelopes","date":"2020-02-03","arxiv_id":"2002.00874","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-autonomous-2","title":"Deep Reinforcement Learning for Autonomous Driving: A Survey","date":"2020-02-02","arxiv_id":"2002.00444","repositories_listed":0,"syntology":null},{"url":null,"slug":"policygnn-aggregation-optimization-for-graph","title":"PolicyGNN: Aggregation Optimization for Graph Neural Networks","date":"2020-02-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-1","title":"A Deep Reinforcement Learning Approach to Concurrent Bilateral Negotiation","date":"2020-01-31","arxiv_id":"2001.11785","repositories_listed":0,"syntology":null},{"url":null,"slug":"locally-private-distributed-reinforcement","title":"Locally Private Distributed Reinforcement Learning","date":"2020-01-31","arxiv_id":"2001.11718","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-goal-directed-attention-control","title":"Predicting Goal-directed Attention Control Using Inverse-Reinforcement Learning","date":"2020-01-31","arxiv_id":"2001.11921","repositories_listed":0,"syntology":null},{"url":null,"slug":"preventing-imitation-learning-with-1","title":"Preventing Imitation Learning with Adversarial Policy Ensembles","date":"2020-01-31","arxiv_id":"2002.01059","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-deep-reinforcement-learning-for","title":"Survey of Deep Reinforcement Learning for Motion Planning of Autonomous Vehicles","date":"2020-01-30","arxiv_id":"2001.11231","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotically-efficient-off-policy","title":"Asymptotically Efficient Off-Policy Evaluation for Tabular Reinforcement Learning","date":"2020-01-29","arxiv_id":"2001.10742","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-multimodal-image-registration-using","title":"Robust Multimodal Image Registration Using Deep Recurrent Reinforcement Learning","date":"2020-01-29","arxiv_id":"2002.03733","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-control-of-micro-climate-in","title":"Data-driven control of micro-climate in buildings: an event-triggered reinforcement learning approach","date":"2020-01-28","arxiv_id":"2001.10505","repositories_listed":0,"syntology":null},{"url":null,"slug":"distal-explanations-for-explainable","title":"Distal Explanations for Model-free Explainable Reinforcement Learning","date":"2020-01-28","arxiv_id":"2001.10284","repositories_listed":0,"syntology":null},{"url":null,"slug":"developing-multi-task-recommendations-with","title":"Developing Multi-Task Recommendations with Long-Term Rewards via Policy Distilled Reinforcement Learning","date":"2020-01-27","arxiv_id":"2001.09595","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-autoscaling-of","title":"Reinforcement Learning-based Application Autoscaling in the Cloud: A Survey","date":"2020-01-27","arxiv_id":"2001.09957","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-program-synthesis-for-images","title":"Unsupervised Program Synthesis for Images By Sampling Without Replacement","date":"2020-01-27","arxiv_id":"2001.10119","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-upper-confidence-reinforcement","title":"Constrained Upper Confidence Reinforcement Learning","date":"2020-01-26","arxiv_id":"2001.09377","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentiment-and-knowledge-based-algorithmic","title":"Sentiment and Knowledge Based Algorithmic Trading with Deep Reinforcement Learning","date":"2020-01-26","arxiv_id":"2001.09403","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-blind","title":"Deep Reinforcement Learning based Blind mmWave MIMO Beam Alignment","date":"2020-01-25","arxiv_id":"2001.09251","repositories_listed":0,"syntology":null},{"url":null,"slug":"following-instructions-by-imagining-and","title":"Following Instructions by Imagining and Reaching Visual Goals","date":"2020-01-25","arxiv_id":"2001.09373","repositories_listed":0,"syntology":null},{"url":null,"slug":"egomap-projective-mapping-and-structured-1","title":"EgoMap: Projective mapping and structured egocentric memory for Deep RL","date":"2020-01-24","arxiv_id":"2002.02286","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-vision-based-adaptive-cruise","title":"End-to-End Vision-Based Adaptive Cruise Control (ACC) Using Deep Reinforcement Learning","date":"2020-01-24","arxiv_id":"2001.09181","repositories_listed":0,"syntology":null},{"url":null,"slug":"pricing-commodity-swing-options","title":"Pricing commodity swing options","date":"2020-01-24","arxiv_id":"2001.08906","repositories_listed":0,"syntology":null},{"url":null,"slug":"facial-feedback-for-reinforcement-learning-a","title":"Facial Feedback for Reinforcement Learning: A Case Study and Offline Analysis Using the TAMER Framework","date":"2020-01-23","arxiv_id":"2001.08703","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-a-transformer-based-language","title":"Reducing Non-Normative Text Generation from Language Models","date":"2020-01-23","arxiv_id":"2001.08764","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-neural-architecture-search-2","title":"Multi-objective Neural Architecture Search via Non-stationary Policy Gradient","date":"2020-01-23","arxiv_id":"2001.08437","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-policy-optimization-for-trajectory","title":"Local Policy Optimization for Trajectory-Centric Reinforcement Learning","date":"2020-01-22","arxiv_id":"2001.08092","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-solving-cooperative-marl-problems-with-a","title":"On Solving Cooperative MARL Problems with a Few Good Experiences","date":"2020-01-22","arxiv_id":"2001.07993","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-vehicle-cell","title":"Reinforcement Learning Based Vehicle-cell Association Algorithm for Highly Mobile Millimeter Wave Communication","date":"2020-01-22","arxiv_id":"2001.07915","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-highway-work-zone-merge-control","title":"Cooperative Highway Work Zone Merge Control based on Reinforcement Learning in A Connected and Automated Environment","date":"2020-01-21","arxiv_id":"2001.08581","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-interaction-quality-estimation-with-1","title":"Improving Interaction Quality Estimation with BiLSTMs and the Impact on Dialogue Policy Learning","date":"2020-01-21","arxiv_id":"2001.07615","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-bandwidth-allocation-for-latency","title":"Intelligent Bandwidth Allocation for Latency Management in NG-EPON using Reinforcement Learning Methods","date":"2020-01-21","arxiv_id":"2001.07698","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyceum-an-efficient-and-scalable-ecosystem-1","title":"Lyceum: An efficient and scalable ecosystem for robot learning","date":"2020-01-21","arxiv_id":"2001.07343","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervisedly-learned-representations-should","title":"Unsupervisedly Learned Representations: Should the Quest be Over?","date":"2020-01-21","arxiv_id":"2001.07495","repositories_listed":0,"syntology":null},{"url":null,"slug":"memristor-hardware-friendly-reinforcement","title":"Memristor Hardware-Friendly Reinforcement Learning","date":"2020-01-20","arxiv_id":"2001.06930","repositories_listed":0,"syntology":null},{"url":null,"slug":"nested-wasserstein-self-imitation-learning","title":"Nested-Wasserstein Self-Imitation Learning for Sequence Generation","date":"2020-01-20","arxiv_id":"2001.06944","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-probabilistically-1","title":"Reinforcement Learning with Probabilistically Complete Exploration","date":"2020-01-20","arxiv_id":"2001.06940","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-reinforcement-learning-techniques","title":"A Survey of Reinforcement Learning Techniques: Strategies, Recent Development, and Future Directions","date":"2020-01-19","arxiv_id":"2001.06921","repositories_listed":0,"syntology":null},{"url":null,"slug":"fresh-interactive-reward-shaping-in-high","title":"FRESH: Interactive Reward Shaping in High-Dimensional State Spaces using Human Feedback","date":"2020-01-19","arxiv_id":"2001.06781","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-options-from-demonstration-using","title":"Learning Options from Demonstration using Skill Segmentation","date":"2020-01-19","arxiv_id":"2001.06793","repositories_listed":0,"syntology":null},{"url":null,"slug":"cube2net-efficient-query-specific-network","title":"cube2net: Efficient Query-Specific Network Construction with Data Cube Organization","date":"2020-01-18","arxiv_id":"2002.00841","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-neural-architecture-search-a-broad","title":"BNAS:An Efficient Neural Architecture Search Approach Using Broad Scalable Architecture","date":"2020-01-18","arxiv_id":"2001.06679","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-motion-planning-for-dense-and","title":"Multi-agent Motion Planning for Dense and Dynamic Environments via Deep Reinforcement Learning","date":"2020-01-18","arxiv_id":"2001.06627","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithms-in-multi-agent-systems-a-holistic","title":"Algorithms in Multi-Agent Systems: A Holistic Perspective from Reinforcement Learning and Game Theory","date":"2020-01-17","arxiv_id":"2001.06487","repositories_listed":0,"syntology":null},{"url":null,"slug":"mime-mutual-information-minimisation","title":"MIME: Mutual Information Minimisation Exploration","date":"2020-01-16","arxiv_id":"2001.05636","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-shaping-for-reinforcement-learning","title":"Reward Shaping for Reinforcement Learning with Omega-Regular Objectives","date":"2020-01-16","arxiv_id":"2001.05977","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-multi-agent-reinforcement","title":"Model-based Multi-Agent Reinforcement Learning with Cooperative Prioritized Sweeping","date":"2020-01-15","arxiv_id":"2001.07527","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-grasp-manipulation-using-evolutionary","title":"Robotic Grasp Manipulation Using Evolutionary Computing and Deep Reinforcement Learning","date":"2020-01-15","arxiv_id":"2001.05443","repositories_listed":0,"syntology":null},{"url":null,"slug":"seerl-sample-efficient-ensemble-reinforcement-1","title":"SEERL: Sample Efficient Ensemble Reinforcement Learning","date":"2020-01-15","arxiv_id":"2001.05209","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-language-instructions-for","title":"Exploiting Language Instructions for Interpretable and Compositional Reinforcement Learning","date":"2020-01-13","arxiv_id":"2001.04418","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-locomote-with-deep-neural-network","title":"Learning to Locomote with Deep Neural-Network and CPG-based Control in a Soft Snake Robot","date":"2020-01-13","arxiv_id":"2001.04059","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-robot-formation-control-using","title":"Multi-Robot Formation Control Using Reinforcement Learning","date":"2020-01-13","arxiv_id":"2001.04527","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-complex-1","title":"Deep Reinforcement Learning for Complex Manipulation Tasks with Sparse Feedback","date":"2020-01-12","arxiv_id":"2001.03877","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-video-summarization-by","title":"Weakly Supervised Video Summarization by Hierarchical Reinforcement Learning","date":"2020-01-12","arxiv_id":"2001.05864","repositories_listed":0,"syntology":null}],"record_sha256":"03038c6cc8692cdc7cf351eb42fea63733eece0d2485b1ab261bc55c3bdf2362","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}