{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/97","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":97,"pages_in_order":132,"rows_per_page":100,"rows":[9601,9700],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/96","next":"/task/reinforcement-learning/papers/98","papers":[{"url":null,"slug":"acceleration-of-actor-critic-deep","title":"Acceleration of Actor-Critic Deep Reinforcement Learning for Visual Grasping in Clutter by State Representation Learning Based on Disentanglement of a Raw Input Image","date":"2020-02-27","arxiv_id":"2002.11903","repositories_listed":0,"syntology":null},{"url":null,"slug":"assembly-robots-with-optimized-control","title":"Assembly robots with optimized control stiffness through reinforcement learning","date":"2020-02-27","arxiv_id":"2002.12207","repositories_listed":0,"syntology":null},{"url":null,"slug":"cautious-reinforcement-learning-via","title":"Cautious Reinforcement Learning via Distributional Risk in the Dual Domain","date":"2020-02-27","arxiv_id":"2002.12475","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-in-markov-decision-processes-under","title":"Learning in Markov Decision Processes under Constraints","date":"2020-02-27","arxiv_id":"2002.12435","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-resolve-alliance-dilemmas-in-many","title":"Learning to Resolve Alliance Dilemmas in Many-Player Zero-Sum Games","date":"2020-02-27","arxiv_id":"2003.00799","repositories_listed":0,"syntology":null},{"url":null,"slug":"opportunities-of-a-machine-learning-based","title":"Opportunities of a Machine Learning-based Decision Support System for Stroke Rehabilitation Assessment","date":"2020-02-27","arxiv_id":"2002.12261","repositories_listed":0,"syntology":null},{"url":null,"slug":"review-analyze-and-design-a-comprehensive","title":"Review, Analysis and Design of a Comprehensive Deep Reinforcement Learning Framework","date":"2020-02-27","arxiv_id":"2002.11883","repositories_listed":0,"syntology":null},{"url":null,"slug":"sub-goal-trees-a-framework-for-goal-based","title":"Sub-Goal Trees -- a Framework for Goal-Based Reinforcement Learning","date":"2020-02-27","arxiv_id":"2002.12361","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-modular-algorithm-induction","title":"Towards Modular Algorithm Induction","date":"2020-02-27","arxiv_id":"2003.04227","repositories_listed":0,"syntology":null},{"url":null,"slug":"cautious-reinforcement-learning-with-logical","title":"Cautious Reinforcement Learning with Logical Constraints","date":"2020-02-26","arxiv_id":"2002.12156","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-hindsight-for-reinforcement","title":"Generalized Hindsight for Reinforcement Learning","date":"2020-02-26","arxiv_id":"2002.11708","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-navigation-costs-from-demonstration","title":"Learning Navigation Costs from Demonstration in Partially Observable Environments","date":"2020-02-26","arxiv_id":"2002.11637","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-ordinary-differential-equation-value","title":"Neural Ordinary Differential Equation Value Networks for Parametrized Action Spaces","date":"2020-02-26","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-evaluation-networks","title":"Policy Evaluation Networks","date":"2020-02-26","arxiv_id":"2002.11833","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-do-drivers-concentrate-attention-based","title":"When Do Drivers Concentrate? Attention-based Driver Behavior Modeling With Deep Reinforcement Learning","date":"2020-02-26","arxiv_id":"2002.11385","repositories_listed":0,"syntology":null},{"url":null,"slug":"g-learner-and-girl-goal-based-wealth","title":"G-Learner and GIRL: Goal Based Wealth Management with Reinforcement Learning","date":"2020-02-25","arxiv_id":"2002.10990","repositories_listed":0,"syntology":null},{"url":null,"slug":"metric-based-imitation-learning-between-two","title":"Metric-Based Imitation Learning Between Two Dissimilar Anthropomorphic Robotic Arms","date":"2020-02-25","arxiv_id":"2003.02638","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-2","title":"Model-Based Reinforcement Learning for Physical Systems Without Velocity and Acceleration Measurements","date":"2020-02-25","arxiv_id":"2002.10621","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-reinforcement-learning-for-turn-based-zero","title":"On Reinforcement Learning for Turn-based Zero-sum Markov Games","date":"2020-02-25","arxiv_id":"2002.10620","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-task-imitation-learning-with","title":"Scalable Multi-Task Imitation Learning with Autonomous Improvement","date":"2020-02-25","arxiv_id":"2003.02636","repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneously-evolving-deep-reinforcement","title":"Simultaneously Evolving Deep Reinforcement Learning Models using Multifactorial Optimization","date":"2020-02-25","arxiv_id":"2002.12133","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-double-q-learning-approach-for-navigation","title":"A Double Q-Learning Approach for Navigation of Aerial Vehicles with Connectivity Constraint","date":"2020-02-24","arxiv_id":"2002.10563","repositories_listed":0,"syntology":null},{"url":null,"slug":"backpropamine-training-self-modifying-neural-1","title":"Backpropamine: training self-modifying neural networks with differentiable neuromodulated plasticity","date":"2020-02-24","arxiv_id":"2002.10585","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-transferable-are-the-representations","title":"How Transferable are the Representations Learned by Deep Q Agents?","date":"2020-02-24","arxiv_id":"2002.10021","repositories_listed":0,"syntology":null},{"url":null,"slug":"millimeter-wave-communications-with-an","title":"Millimeter Wave Communications with an Intelligent Reflector: Performance Optimization and Distributional Reinforcement Learning","date":"2020-02-24","arxiv_id":"2002.10572","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-with-uniformly-bounded-variance","title":"Q-learning with Uniformly Bounded Variance: Large Discounting is Not a Barrier to Fast Learning","date":"2020-02-24","arxiv_id":"2002.10301","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-inverse-reinforcement","title":"Scalable Multi-Agent Inverse Reinforcement Learning via Actor-Attention-Critic","date":"2020-02-24","arxiv_id":"2002.10525","repositories_listed":0,"syntology":null},{"url":null,"slug":"computer-inspired-quantum-experiments","title":"Computer-inspired Quantum Experiments","date":"2020-02-23","arxiv_id":"2002.09970","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-linear","title":"Deep Reinforcement Learning with Linear Quadratic Regulator Regions","date":"2020-02-23","arxiv_id":"2002.09820","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-regret-bounds-for-stochastic","title":"Near-optimal Regret Bounds for Stochastic Shortest Path","date":"2020-02-23","arxiv_id":"2002.09869","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-traffic-lights-with-multi-agent","title":"Optimizing Traffic Lights with Multi-agent Deep Reinforcement Learning and V2X communication","date":"2020-02-23","arxiv_id":"2002.09853","repositories_listed":0,"syntology":null},{"url":null,"slug":"periodic-q-learning","title":"Periodic Q-Learning","date":"2020-02-23","arxiv_id":"2002.09795","repositories_listed":0,"syntology":null},{"url":null,"slug":"rapidly-personalizing-mobile-health-treatment","title":"Rapidly Personalizing Mobile Health Treatment Policies with Limited Data","date":"2020-02-23","arxiv_id":"2002.09971","repositories_listed":0,"syntology":null},{"url":null,"slug":"wireless-20-towards-an-intelligent-radio","title":"Wireless 2.0: Towards an Intelligent Radio Environment Empowered by Reconfigurable Meta-Surfaces and Artificial Intelligence","date":"2020-02-23","arxiv_id":"2002.11040","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-data-augmentation-via-deep","title":"Automatic Data Augmentation via Deep Reinforcement Learning for Effective Kidney Tumor Segmentation","date":"2020-02-22","arxiv_id":"2002.09703","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-for-ultra-reliable-and-low","title":"Deep Learning for Ultra-Reliable and Low-Latency Communications in 6G Networks","date":"2020-02-22","arxiv_id":"2002.11045","repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-constrained-policy-optimization-for","title":"Guided Constrained Policy Optimization for Dynamic Quadrupedal Robot Locomotion","date":"2020-02-22","arxiv_id":"2002.09676","repositories_listed":0,"syntology":null},{"url":null,"slug":"vehicle-tracking-in-wireless-sensor-networks","title":"Vehicle Tracking in Wireless Sensor Networks via Deep Reinforcement Learning","date":"2020-02-22","arxiv_id":"2002.09671","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-with-a","title":"Accelerating Reinforcement Learning with a Directional-Gaussian-Smoothing Evolution Strategy","date":"2020-02-21","arxiv_id":"2002.09077","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-freshness-and-energy-efficient-uav","title":"Data Freshness and Energy-Efficient UAV Navigation Optimization: A Deep Reinforcement Learning Approach","date":"2020-02-21","arxiv_id":"2003.04816","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-controllable-object-through","title":"Disentangling Controllable Object through Video Prediction Improves Visual Reinforcement Learning","date":"2020-02-21","arxiv_id":"2002.09136","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-off-policy-evaluation-with","title":"Minimax-Optimal Off-Policy Evaluation with Linear Function Approximation","date":"2020-02-21","arxiv_id":"2002.09516","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-search-for-feedback-in-reinforcement","title":"On the Search for Feedback in Reinforcement Learning","date":"2020-02-21","arxiv_id":"2002.09478","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-aware-energy-scheduling-for-edge","title":"Risk-Aware Energy Scheduling for Edge Computing with Microgrid: A Multi-Agent Deep Reinforcement Learning Approach","date":"2020-02-21","arxiv_id":"2003.02157","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-temporal-difference-learning-with","title":"Adaptive Temporal Difference Learning with Linear Function Approximation","date":"2020-02-20","arxiv_id":"2002.08537","repositories_listed":0,"syntology":null},{"url":"/paper/automatic-gesture-recognition-in-robot","slug":"automatic-gesture-recognition-in-robot","title":"Automatic Gesture Recognition in Robot-assisted Surgery with Reinforcement Learning and Tree Search","date":"2020-02-20","arxiv_id":"2002.08718","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-adversarial-strategically-timed","title":"Enhanced Adversarial Strategically-Timed Attacks against Deep Reinforcement Learning","date":"2020-02-20","arxiv_id":"2002.09027","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-meta-reinforcement-learning-for","title":"Multi-Agent Meta-Reinforcement Learning for Self-Powered and Sustainable Edge Computing Systems","date":"2020-02-20","arxiv_id":"2002.08567","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-as-a","title":"Multi-Agent Reinforcement Learning as a Computational Tool for Language Evolution Research: Historical Context and Future Challenges","date":"2020-02-20","arxiv_id":"2002.08878","repositories_listed":0,"syntology":null},{"url":null,"slug":"oirl-robust-adversarial-inverse-reinforcement","title":"oIRL: Robust Adversarial Inverse Reinforcement Learning with Temporally Extended Actions","date":"2020-02-20","arxiv_id":"2002.09043","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-counterfactual-reinforcement-learning","title":"Debiased Off-Policy Evaluation for Recommendation Systems","date":"2020-02-20","arxiv_id":"2002.08536","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-in-gradient-based-meta","title":"Curriculum in Gradient-Based Meta-Reinforcement Learning","date":"2020-02-19","arxiv_id":"2002.07956","repositories_listed":0,"syntology":null},{"url":null,"slug":"keep-doing-what-worked-behavioral-modelling","title":"Keep Doing What Worked: Behavioral Modelling Priors for Offline Reinforcement Learning","date":"2020-02-19","arxiv_id":"2002.08396","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-search-for-fault","title":"Neural Architecture Search For Fault Diagnosis","date":"2020-02-19","arxiv_id":"2002.07997","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-policy-optimization-with-bandit","title":"Optimistic Policy Optimization with Bandit Feedback","date":"2020-02-19","arxiv_id":"2002.08243","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-aided-search-and-rescue-operation-using","title":"UAV Aided Search and Rescue Operation Using Reinforcement Learning","date":"2020-02-19","arxiv_id":"2002.08415","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-ai-for-mitigating-the-impact-of-network","title":"Using AI for Mitigating the Impact of Network Delay in Cloud-based Intelligent Traffic Signal Control","date":"2020-02-19","arxiv_id":"2002.08303","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-driven-hindsight-modelling-1","title":"Value-driven Hindsight Modelling","date":"2020-02-19","arxiv_id":"2002.08329","repositories_listed":0,"syntology":null},{"url":null,"slug":"empirical-policy-evaluation-with-supergraphs","title":"Empirical Policy Evaluation with Supergraphs","date":"2020-02-18","arxiv_id":"2002.07905","repositories_listed":0,"syntology":null},{"url":null,"slug":"kogun-accelerating-deep-reinforcement","title":"KoGuN: Accelerating Deep Reinforcement Learning via Integrating Human Suboptimal Knowledge","date":"2020-02-18","arxiv_id":"2002.07418","repositories_listed":0,"syntology":null},{"url":null,"slug":"motiac-multi-objective-actor-critics-for-real","title":"MoTiAC: Multi-Objective Actor-Critics for Real-Time Bidding","date":"2020-02-18","arxiv_id":"2002.07408","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-issue-bargaining-with-deep","title":"Multi-Issue Bargaining With Deep Reinforcement Learning","date":"2020-02-18","arxiv_id":"2002.07788","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-experience-selection-for-policy","title":"Adaptive Experience Selection for Policy Gradient","date":"2020-02-17","arxiv_id":"2002.06946","repositories_listed":0,"syntology":null},{"url":null,"slug":"gacem-generalized-autoregressive-cross","title":"GACEM: Generalized Autoregressive Cross Entropy Method for Multi-Modal Black Box Constraint Satisfaction","date":"2020-02-17","arxiv_id":"2002.07236","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-zero-sum-simultaneous-move-markov","title":"Learning Zero-Sum Simultaneous-Move Markov Games Using Function Approximation and Correlated Equilibrium","date":"2020-02-17","arxiv_id":"2002.07066","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-the-manipulation","title":"Reinforcement learning for the privacy preservation and manipulation of eye tracking data","date":"2020-02-17","arxiv_id":"2002.06806","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-design-for-driver-repositioning-using","title":"Reward Design for Driver Repositioning Using Multi-Agent Reinforcement Learning","date":"2020-02-17","arxiv_id":"2002.06723","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-simple-object-representations","title":"Investigating Simple Object Representations in Model-Free Deep Reinforcement Learning","date":"2020-02-16","arxiv_id":"2002.06703","repositories_listed":0,"syntology":null},{"url":null,"slug":"temple-learning-template-of-transitions-for","title":"TempLe: Learning Template of Transitions for Sample Efficient Multi-task RL","date":"2020-02-16","arxiv_id":"2002.06659","repositories_listed":0,"syntology":null},{"url":null,"slug":"mrrc-multiple-role-representation-crossover","title":"MRRC: Multiple Role Representation Crossover Interpretation for Image Captioning With R-CNN Feature Distribution Composition (FDC)","date":"2020-02-15","arxiv_id":"2002.06436","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-asymptotic-convergence-of-adam-type","title":"Non-asymptotic Convergence of Adam-type Reinforcement Learning Algorithms under Markovian Sampling","date":"2020-02-15","arxiv_id":"2002.06286","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-archimedean-trap-why-traditional","title":"The Archimedean trap: Why traditional reinforcement learning will probably not yield AGI","date":"2020-02-15","arxiv_id":"2002.10221","repositories_listed":0,"syntology":null},{"url":null,"slug":"frequency-based-search-control-in-dyna-1","title":"Frequency-based Search-control in Dyna","date":"2020-02-14","arxiv_id":"2002.05822","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-functionally-decomposed-hierarchies-1","title":"Learning Functionally Decomposed Hierarchies for Continuous Control Tasks with Path Planning","date":"2020-02-14","arxiv_id":"2002.05954","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-management-in-wireless-networks-via","title":"Resource Management in Wireless Networks via Multi-Agent Deep Reinforcement Learning","date":"2020-02-14","arxiv_id":"2002.06215","repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-training-of-dnn-for-speech-enhancement","title":"Stable Training of DNN for Speech Enhancement based on Perceptually-Motivated Black-Box Cost Function","date":"2020-02-14","arxiv_id":"2002.05879","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-beam","title":"Deep Reinforcement Learning-Based Beam Tracking for Low-Latency Services in Vehicular Networks","date":"2020-02-13","arxiv_id":"2002.05564","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-reinforcement-learning-for-anti-jamming","title":"Fast Reinforcement Learning for Anti-jamming Communications","date":"2020-02-13","arxiv_id":"2002.05364","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-reinforcement","title":"Improving Generalization of Reinforcement Learning with Minimax Distributional Soft Actor-Critic","date":"2020-02-13","arxiv_id":"2002.05502","repositories_listed":0,"syntology":null},{"url":null,"slug":"modrld-am-multiobjective-deep-reinforcement","title":"MODRL/D-AM: Multiobjective Deep Reinforcement Learning Algorithm Using Decomposition and Attention Model for Multiobjective Optimization","date":"2020-02-13","arxiv_id":"2002.05484","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-vehicle-routing-problems-with-soft-time","title":"Multi-Vehicle Routing Problems with Soft Time Windows: A Multi-Agent Reinforcement Learning Approach","date":"2020-02-13","arxiv_id":"2002.05513","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-sensory-commutativity-of-action","title":"On the Sensory Commutativity of Action Sequences for Embodied Agents","date":"2020-02-13","arxiv_id":"2002.05630","repositories_listed":0,"syntology":null},{"url":null,"slug":"xcs-classifier-system-with-experience-replay","title":"XCS Classifier System with Experience Replay","date":"2020-02-13","arxiv_id":"2002.05628","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tensor-network-approach-to-finite-markov","title":"A Tensor Network Approach to Finite Markov Decision Processes","date":"2020-02-12","arxiv_id":"2002.05185","repositories_listed":0,"syntology":null},{"url":null,"slug":"connectivity-driven-communication-in-multi","title":"Learning Multi-Agent Coordination through Connectivity-driven Communication","date":"2020-02-12","arxiv_id":"2002.05233","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-training-for-reinforcement","title":"Data Efficient Training for Reinforcement Learning with Adaptive Behavior Policy Sharing","date":"2020-02-12","arxiv_id":"2002.05229","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsic-motivation-for-encouraging-1","title":"Intrinsic Motivation for Encouraging Synergistic Behavior","date":"2020-02-12","arxiv_id":"2002.05189","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bounds-for-discounted-mdps","title":"Regret Bounds for Discounted MDPs","date":"2020-02-12","arxiv_id":"2002.05138","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-online-filters-to-real-world-image","title":"AI Online Filters to Real World Image Recognition","date":"2020-02-11","arxiv_id":"2002.08242","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-of-both-worlds-automl-codesign-of-a-cnn","title":"Best of Both Worlds: AutoML Codesign of a CNN and its Hardware Accelerator","date":"2020-02-11","arxiv_id":"2002.05022","repositories_listed":0,"syntology":null},{"url":null,"slug":"confounding-robust-policy-evaluation-in","title":"Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.04518","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyper-meta-reinforcement-learning-with-sparse","title":"HMRL: Hyper-Meta Learning for Sparse Reward Reinforcement Learning Problem","date":"2020-02-11","arxiv_id":"2002.04238","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-structured-communication-for-multi-1","title":"Learning Structured Communication for Multi-agent Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.04235","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-switch-between-machines-and","title":"Learning to Switch Among Agents in a Team via 2-Layer Markov Decision Processes","date":"2020-02-11","arxiv_id":"2002.04258","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-approaches-for-motor","title":"Machine Learning Approaches For Motor Learning: A Short Review","date":"2020-02-11","arxiv_id":"2002.04317","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-pomdp-partitioned","title":"Reinforcement Learning for POMDP: Partitioned Rollout and Policy Iteration with Application to Autonomous Sequential Repair Problems","date":"2020-02-11","arxiv_id":"2002.04175","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-intelligent-pick-and-place-assembly","title":"Towards Intelligent Pick and Place Assembly of Individualized Products Using Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.08333","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-guarantees-of-policy-optimization","title":"Convergence Guarantees of Policy Optimization Methods for Markovian Jump Linear Systems","date":"2020-02-10","arxiv_id":"2002.04090","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-off-policy-evaluation-in","title":"Interpretable Off-Policy Evaluation in Reinforcement Learning by Highlighting Influential Transitions","date":"2020-02-10","arxiv_id":"2002.03478","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-reward-shaping-for-mobile-robot-navigation","title":"On Reward Shaping for Mobile Robot Navigation: A Reinforcement Learning and SLAM Based Approach","date":"2020-02-10","arxiv_id":"2002.04109","repositories_listed":0,"syntology":null}],"record_sha256":"c5186d477bd6d4e7cf163756869f2405d03995cc81370fe9484696738b66decc","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}