{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/112","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":112,"pages_in_order":135,"rows_per_page":100,"rows":[11101,11200],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/111","next":"/task/reinforcement-learning-2/papers/113","papers":[{"url":null,"slug":"multi-issue-bargaining-with-deep","title":"Multi-Issue Bargaining With Deep Reinforcement Learning","date":"2020-02-18","arxiv_id":"2002.07788","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-the-manipulation","title":"Reinforcement learning for the privacy preservation and manipulation of eye tracking data","date":"2020-02-17","arxiv_id":"2002.06806","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-design-for-driver-repositioning-using","title":"Reward Design for Driver Repositioning Using Multi-Agent Reinforcement Learning","date":"2020-02-17","arxiv_id":"2002.06723","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-simple-object-representations","title":"Investigating Simple Object Representations in Model-Free Deep Reinforcement Learning","date":"2020-02-16","arxiv_id":"2002.06703","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-asymptotic-convergence-of-adam-type","title":"Non-asymptotic Convergence of Adam-type Reinforcement Learning Algorithms under Markovian Sampling","date":"2020-02-15","arxiv_id":"2002.06286","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-archimedean-trap-why-traditional","title":"The Archimedean trap: Why traditional reinforcement learning will probably not yield AGI","date":"2020-02-15","arxiv_id":"2002.10221","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-management-in-wireless-networks-via","title":"Resource Management in Wireless Networks via Multi-Agent Deep Reinforcement Learning","date":"2020-02-14","arxiv_id":"2002.06215","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-beam","title":"Deep Reinforcement Learning-Based Beam Tracking for Low-Latency Services in Vehicular Networks","date":"2020-02-13","arxiv_id":"2002.05564","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-reinforcement-learning-for-anti-jamming","title":"Fast Reinforcement Learning for Anti-jamming Communications","date":"2020-02-13","arxiv_id":"2002.05364","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-reinforcement","title":"Improving Generalization of Reinforcement Learning with Minimax Distributional Soft Actor-Critic","date":"2020-02-13","arxiv_id":"2002.05502","repositories_listed":0,"syntology":null},{"url":null,"slug":"modrld-am-multiobjective-deep-reinforcement","title":"MODRL/D-AM: Multiobjective Deep Reinforcement Learning Algorithm Using Decomposition and Attention Model for Multiobjective Optimization","date":"2020-02-13","arxiv_id":"2002.05484","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-vehicle-routing-problems-with-soft-time","title":"Multi-Vehicle Routing Problems with Soft Time Windows: A Multi-Agent Reinforcement Learning Approach","date":"2020-02-13","arxiv_id":"2002.05513","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-training-for-reinforcement","title":"Data Efficient Training for Reinforcement Learning with Adaptive Behavior Policy Sharing","date":"2020-02-12","arxiv_id":"2002.05229","repositories_listed":0,"syntology":null},{"url":null,"slug":"confounding-robust-policy-evaluation-in","title":"Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.04518","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyper-meta-reinforcement-learning-with-sparse","title":"HMRL: Hyper-Meta Learning for Sparse Reward Reinforcement Learning Problem","date":"2020-02-11","arxiv_id":"2002.04238","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-structured-communication-for-multi-1","title":"Learning Structured Communication for Multi-agent Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.04235","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-switch-between-machines-and","title":"Learning to Switch Among Agents in a Team via 2-Layer Markov Decision Processes","date":"2020-02-11","arxiv_id":"2002.04258","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-approaches-for-motor","title":"Machine Learning Approaches For Motor Learning: A Short Review","date":"2020-02-11","arxiv_id":"2002.04317","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-intelligent-pick-and-place-assembly","title":"Towards Intelligent Pick and Place Assembly of Individualized Products Using Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.08333","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-off-policy-evaluation-in","title":"Interpretable Off-Policy Evaluation in Reinforcement Learning by Highlighting Influential Transitions","date":"2020-02-10","arxiv_id":"2002.03478","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-the-monte-carlo","title":"On the Convergence of the Monte Carlo Exploring Starts Algorithm for Reinforcement Learning","date":"2020-02-10","arxiv_id":"2002.03585","repositories_listed":0,"syntology":null},{"url":null,"slug":"proficiency-aware-multi-agent-actor-critic","title":"Proficiency Constrained Multi-Agent Reinforcement Learning for Environment-Adaptive Multi UAV-UGV Teaming","date":"2020-02-10","arxiv_id":"2002.03910","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-self-play-algorithms-for-competitive","title":"Provable Self-Play Algorithms for Competitive Reinforcement Learning","date":"2020-02-10","arxiv_id":"2002.04017","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-the-total-reward-via-reward","title":"Reward Tweaking: Maximizing the Total Reward While Planning for Short Horizons","date":"2020-02-09","arxiv_id":"2002.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-data-driven-choice-of-misfit-function-for","title":"A data-driven choice of misfit function for FWI using reinforcement learning","date":"2020-02-08","arxiv_id":"2002.03154","repositories_listed":0,"syntology":null},{"url":null,"slug":"brpo-batch-residual-policy-optimization","title":"BRPO: Batch Residual Policy Optimization","date":"2020-02-08","arxiv_id":"2002.05522","repositories_listed":0,"syntology":null},{"url":null,"slug":"conservative-exploration-in-reinforcement","title":"Conservative Exploration in Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03218","repositories_listed":0,"syntology":null},{"url":null,"slug":"description-based-text-classification-with","title":"Description Based Text Classification with Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03067","repositories_listed":0,"syntology":null},{"url":null,"slug":"inferential-induction-joint-bayesian","title":"Inferential Induction: A Novel Framework for Bayesian Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03098","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-reinforcement-learning-with-a","title":"Multi-task Reinforcement Learning with a Planning Quasi-Metric","date":"2020-02-08","arxiv_id":"2002.03240","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-duet-online-music-accompaniment-generation","title":"RL-Duet: Online Music Accompaniment Generation Using Deep Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03082","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-for","title":"Accelerating Reinforcement Learning for Reaching using Continuous Curriculum Learning","date":"2020-02-07","arxiv_id":"2002.02697","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-lane-change-strategy-using-proximal","title":"Automated Lane Change Strategy using Proximal Policy Optimization-based Deep Reinforcement Learning","date":"2020-02-07","arxiv_id":"2002.02667","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-residual-policy-optimization-1","title":"Bayesian Residual Policy Optimization: Scalable Bayesian Reinforcement Learning with Clairvoyant Experts","date":"2020-02-07","arxiv_id":"2002.03042","repositories_listed":0,"syntology":null},{"url":null,"slug":"causally-correct-partial-models-for-1","title":"Causally Correct Partial Models for Reinforcement Learning","date":"2020-02-07","arxiv_id":"2002.02836","repositories_listed":0,"syntology":null},{"url":null,"slug":"manipulating-reinforcement-learning-poisoning","title":"Manipulating Reinforcement Learning: Poisoning Attacks on Cost Signals","date":"2020-02-07","arxiv_id":"2002.03827","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-reconstruction-of-policy","title":"Representation of Reinforcement Learning Policies in Reproducing Kernel Hilbert Spaces","date":"2020-02-07","arxiv_id":"2002.02863","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-free-exploration-for-reinforcement","title":"Reward-Free Exploration for Reinforcement Learning","date":"2020-02-07","arxiv_id":"2002.02794","repositories_listed":0,"syntology":null},{"url":null,"slug":"studentteacher-advising-through-reward","title":"Student/Teacher Advising through Reward Augmentation","date":"2020-02-07","arxiv_id":"2002.02938","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-reinforcement-learning-in-3","title":"Reinforcement Learning in Factored MDPs: Oracle-Efficient Algorithms and Tighter Regret Bounds for the Non-Episodic Setting","date":"2020-02-06","arxiv_id":"2002.02302","repositories_listed":0,"syntology":null},{"url":null,"slug":"social-diversity-and-social-preferences-in","title":"Social diversity and social preferences in mixed-motive reinforcement learning","date":"2020-02-06","arxiv_id":"2002.02325","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-adaptive-hierarchical-reinforcement","title":"Temporal-adaptive Hierarchical Reinforcement Learning","date":"2020-02-06","arxiv_id":"2002.02080","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutual-information-based-state-control-for","title":"Mutual Information-based State-Control for Intrinsically Motivated Reinforcement Learning","date":"2020-02-05","arxiv_id":"2002.01963","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-task-driven-control-policies-via","title":"Learning Task-Driven Control Policies via Information Bottlenecks","date":"2020-02-04","arxiv_id":"2002.01428","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-algorithms-for-constructing-an","title":"Evolutionary algorithms for constructing an ensemble of decision trees","date":"2020-02-03","arxiv_id":"2002.00721","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-autonomous-2","title":"Deep Reinforcement Learning for Autonomous Driving: A Survey","date":"2020-02-02","arxiv_id":"2002.00444","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-1","title":"A Deep Reinforcement Learning Approach to Concurrent Bilateral Negotiation","date":"2020-01-31","arxiv_id":"2001.11785","repositories_listed":0,"syntology":null},{"url":null,"slug":"locally-private-distributed-reinforcement","title":"Locally Private Distributed Reinforcement Learning","date":"2020-01-31","arxiv_id":"2001.11718","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-goal-directed-attention-control","title":"Predicting Goal-directed Attention Control Using Inverse-Reinforcement Learning","date":"2020-01-31","arxiv_id":"2001.11921","repositories_listed":0,"syntology":null},{"url":null,"slug":"preventing-imitation-learning-with-1","title":"Preventing Imitation Learning with Adversarial Policy Ensembles","date":"2020-01-31","arxiv_id":"2002.01059","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-deep-reinforcement-learning-for","title":"Survey of Deep Reinforcement Learning for Motion Planning of Autonomous Vehicles","date":"2020-01-30","arxiv_id":"2001.11231","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotically-efficient-off-policy","title":"Asymptotically Efficient Off-Policy Evaluation for Tabular Reinforcement Learning","date":"2020-01-29","arxiv_id":"2001.10742","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-multimodal-image-registration-using","title":"Robust Multimodal Image Registration Using Deep Recurrent Reinforcement Learning","date":"2020-01-29","arxiv_id":"2002.03733","repositories_listed":0,"syntology":null},{"url":null,"slug":"distal-explanations-for-explainable","title":"Distal Explanations for Model-free Explainable Reinforcement Learning","date":"2020-01-28","arxiv_id":"2001.10284","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-sharing-in-coagent-networks","title":"Coagent Networks Revisited","date":"2020-01-28","arxiv_id":"2001.10474","repositories_listed":0,"syntology":null},{"url":null,"slug":"developing-multi-task-recommendations-with","title":"Developing Multi-Task Recommendations with Long-Term Rewards via Policy Distilled Reinforcement Learning","date":"2020-01-27","arxiv_id":"2001.09595","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-autoscaling-of","title":"Reinforcement Learning-based Application Autoscaling in the Cloud: A Survey","date":"2020-01-27","arxiv_id":"2001.09957","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-upper-confidence-reinforcement","title":"Constrained Upper Confidence Reinforcement Learning","date":"2020-01-26","arxiv_id":"2001.09377","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentiment-and-knowledge-based-algorithmic","title":"Sentiment and Knowledge Based Algorithmic Trading with Deep Reinforcement Learning","date":"2020-01-26","arxiv_id":"2001.09403","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-blind","title":"Deep Reinforcement Learning based Blind mmWave MIMO Beam Alignment","date":"2020-01-25","arxiv_id":"2001.09251","repositories_listed":0,"syntology":null},{"url":null,"slug":"egomap-projective-mapping-and-structured-1","title":"EgoMap: Projective mapping and structured egocentric memory for Deep RL","date":"2020-01-24","arxiv_id":"2002.02286","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-vision-based-adaptive-cruise","title":"End-to-End Vision-Based Adaptive Cruise Control (ACC) Using Deep Reinforcement Learning","date":"2020-01-24","arxiv_id":"2001.09181","repositories_listed":0,"syntology":null},{"url":null,"slug":"pricing-commodity-swing-options","title":"Pricing commodity swing options","date":"2020-01-24","arxiv_id":"2001.08906","repositories_listed":0,"syntology":null},{"url":null,"slug":"facial-feedback-for-reinforcement-learning-a","title":"Facial Feedback for Reinforcement Learning: A Case Study and Offline Analysis Using the TAMER Framework","date":"2020-01-23","arxiv_id":"2001.08703","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-a-transformer-based-language","title":"Reducing Non-Normative Text Generation from Language Models","date":"2020-01-23","arxiv_id":"2001.08764","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-policy-optimization-for-trajectory","title":"Local Policy Optimization for Trajectory-Centric Reinforcement Learning","date":"2020-01-22","arxiv_id":"2001.08092","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-solving-cooperative-marl-problems-with-a","title":"On Solving Cooperative MARL Problems with a Few Good Experiences","date":"2020-01-22","arxiv_id":"2001.07993","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-bandwidth-allocation-for-latency","title":"Intelligent Bandwidth Allocation for Latency Management in NG-EPON using Reinforcement Learning Methods","date":"2020-01-21","arxiv_id":"2001.07698","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyceum-an-efficient-and-scalable-ecosystem-1","title":"Lyceum: An efficient and scalable ecosystem for robot learning","date":"2020-01-21","arxiv_id":"2001.07343","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervisedly-learned-representations-should","title":"Unsupervisedly Learned Representations: Should the Quest be Over?","date":"2020-01-21","arxiv_id":"2001.07495","repositories_listed":0,"syntology":null},{"url":null,"slug":"memristor-hardware-friendly-reinforcement","title":"Memristor Hardware-Friendly Reinforcement Learning","date":"2020-01-20","arxiv_id":"2001.06930","repositories_listed":0,"syntology":null},{"url":null,"slug":"nested-wasserstein-self-imitation-learning","title":"Nested-Wasserstein Self-Imitation Learning for Sequence Generation","date":"2020-01-20","arxiv_id":"2001.06944","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-probabilistically-1","title":"Reinforcement Learning with Probabilistically Complete Exploration","date":"2020-01-20","arxiv_id":"2001.06940","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-reinforcement-learning-techniques","title":"A Survey of Reinforcement Learning Techniques: Strategies, Recent Development, and Future Directions","date":"2020-01-19","arxiv_id":"2001.06921","repositories_listed":0,"syntology":null},{"url":null,"slug":"fresh-interactive-reward-shaping-in-high","title":"FRESH: Interactive Reward Shaping in High-Dimensional State Spaces using Human Feedback","date":"2020-01-19","arxiv_id":"2001.06781","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-options-from-demonstration-using","title":"Learning Options from Demonstration using Skill Segmentation","date":"2020-01-19","arxiv_id":"2001.06793","repositories_listed":0,"syntology":null},{"url":null,"slug":"cube2net-efficient-query-specific-network","title":"cube2net: Efficient Query-Specific Network Construction with Data Cube Organization","date":"2020-01-18","arxiv_id":"2002.00841","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-neural-architecture-search-a-broad","title":"BNAS:An Efficient Neural Architecture Search Approach Using Broad Scalable Architecture","date":"2020-01-18","arxiv_id":"2001.06679","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithms-in-multi-agent-systems-a-holistic","title":"Algorithms in Multi-Agent Systems: A Holistic Perspective from Reinforcement Learning and Game Theory","date":"2020-01-17","arxiv_id":"2001.06487","repositories_listed":0,"syntology":null},{"url":null,"slug":"mime-mutual-information-minimisation","title":"MIME: Mutual Information Minimisation Exploration","date":"2020-01-16","arxiv_id":"2001.05636","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-shaping-for-reinforcement-learning","title":"Reward Shaping for Reinforcement Learning with Omega-Regular Objectives","date":"2020-01-16","arxiv_id":"2001.05977","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-multi-agent-reinforcement","title":"Model-based Multi-Agent Reinforcement Learning with Cooperative Prioritized Sweeping","date":"2020-01-15","arxiv_id":"2001.07527","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-grasp-manipulation-using-evolutionary","title":"Robotic Grasp Manipulation Using Evolutionary Computing and Deep Reinforcement Learning","date":"2020-01-15","arxiv_id":"2001.05443","repositories_listed":0,"syntology":null},{"url":null,"slug":"seerl-sample-efficient-ensemble-reinforcement-1","title":"SEERL: Sample Efficient Ensemble Reinforcement Learning","date":"2020-01-15","arxiv_id":"2001.05209","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-language-instructions-for","title":"Exploiting Language Instructions for Interpretable and Compositional Reinforcement Learning","date":"2020-01-13","arxiv_id":"2001.04418","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-robot-formation-control-using","title":"Multi-Robot Formation Control Using Reinforcement Learning","date":"2020-01-13","arxiv_id":"2001.04527","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-complex-1","title":"Deep Reinforcement Learning for Complex Manipulation Tasks with Sparse Feedback","date":"2020-01-12","arxiv_id":"2001.03877","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-video-summarization-by","title":"Weakly Supervised Video Summarization by Hierarchical Reinforcement Learning","date":"2020-01-12","arxiv_id":"2001.05864","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-sequential-resource-investment-planning","title":"A storage expansion planning framework using reinforcement learning and simulation-based optimization","date":"2020-01-10","arxiv_id":"2001.03507","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-interactive-reinforcement-learning-for","title":"Deep Interactive Reinforcement Learning for Path Following of Autonomous Underwater Vehicle","date":"2020-01-10","arxiv_id":"2001.03359","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-tracking-control-for","title":"Reinforcement Learning Tracking Control for Robotic Manipulator With Kernel-Based Dynamic Model","date":"2020-01-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"eeg-based-drowsiness-estimation-for-driving","title":"EEG-based Drowsiness Estimation for Driving Safety using Deep Q-Learning","date":"2020-01-08","arxiv_id":"2001.02399","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-for-4","title":"Multi-Agent Deep Reinforcement Learning for Cooperative Connected Vehicles","date":"2020-01-08","arxiv_id":"2001.02337","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-thompson-sampling-for-smoother-than","title":"On Thompson Sampling for Smoother-than-Lipschitz Bandits","date":"2020-01-08","arxiv_id":"2001.02323","repositories_listed":0,"syntology":null},{"url":null,"slug":"perception-and-decision-making-of-autonomous","title":"Perception and Navigation in Autonomous Systems in the Era of Learning: A Survey","date":"2020-01-08","arxiv_id":"2001.02319","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-based-distributional-policy-gradient","title":"Sample-based Distributional Policy Gradient","date":"2020-01-08","arxiv_id":"2001.02652","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-automotive-radar-spectrum","title":"Decentralized Automotive Radar Spectrum Allocation to Avoid Mutual Interference Using Reinforcement Learning","date":"2020-01-07","arxiv_id":"2001.02629","repositories_listed":0,"syntology":null},{"url":null,"slug":"experimental-analysis-of-reinforcement","title":"Experimental Analysis of Reinforcement Learning Techniques for Spectrum Sharing Radar","date":"2020-01-06","arxiv_id":"2001.01799","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-speed-autonomous-drifting-with-deep","title":"High-speed Autonomous Drifting with Deep Reinforcement Learning","date":"2020-01-06","arxiv_id":"2001.01377","repositories_listed":0,"syntology":null},{"url":null,"slug":"incentivizing-the-emergence-of-grounded","title":"Generalizing Emergent Communication","date":"2020-01-06","arxiv_id":"2001.01772","repositories_listed":0,"syntology":null}],"record_sha256":"5e73f6ef45fce4565585c62302ae21458f561b8635b052b3905ea4b622f830e3","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}