{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/86","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":86,"pages_in_order":132,"rows_per_page":100,"rows":[8501,8600],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/85","next":"/task/reinforcement-learning/papers/87","papers":[{"url":null,"slug":"causal-reinforcement-learning-an-instrumental","title":"Asymptotic Theory for IV-Based Reinforcement Learning with Potential Endogeneity","date":"2021-03-06","arxiv_id":"2103.04021","repositories_listed":0,"syntology":null},{"url":null,"slug":"passing-through-narrow-gaps-with-deep","title":"Passing Through Narrow Gaps with Deep Reinforcement Learning","date":"2021-03-06","arxiv_id":"2103.03991","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-bit-by-bit","title":"Reinforcement Learning, Bit by Bit","date":"2021-03-06","arxiv_id":"2103.04047","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-memory-architecture-for-reinforcement","title":"A Dual-Memory Architecture for Reinforcement Learning on Neuromorphic Platforms","date":"2021-03-05","arxiv_id":"2103.04780","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-medical","title":"Deep reinforcement learning in medical imaging: A literature review","date":"2021-03-05","arxiv_id":"2103.05115","repositories_listed":0,"syntology":null},{"url":null,"slug":"routing-algorithms-as-tools-for-integrating","title":"Routing algorithms as tools for integrating social distancing with emergency evacuation","date":"2021-03-05","arxiv_id":"2103.03413","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-with-explicit","title":"Inverse Reinforcement Learning with Explicit Policy Estimates","date":"2021-03-04","arxiv_id":"2103.02863","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuromechanics-based-deep-reinforcement","title":"Neuromechanics-based Deep Reinforcement Learning of Neurostimulation Control in FES cycling","date":"2021-03-04","arxiv_id":"2103.03057","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-uav-trajectory-planning-using","title":"Efficient UAV Trajectory-Planning using Economic Reinforcement Learning","date":"2021-03-03","arxiv_id":"2103.02676","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-external-1","title":"Reinforcement Learning with External Knowledge by using Logical Neural Networks","date":"2021-03-03","arxiv_id":"2103.02363","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with","title":"Offline Reinforcement Learning with Pseudometric Learning","date":"2021-03-02","arxiv_id":"2103.01948","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-monopoly-gameplay-a-hybrid-model","title":"Decision Making in Monopoly using a Hybrid Deep Reinforcement Learning Approach","date":"2021-03-01","arxiv_id":"2103.00683","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-adaptive-mesh","title":"Reinforcement Learning for Adaptive Mesh Refinement","date":"2021-03-01","arxiv_id":"2103.01342","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-and-incentives-in-reinforcement","title":"Exploration and Incentives in Reinforcement Learning","date":"2021-02-28","arxiv_id":"2103.00360","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-conservativeness-oriented-offline","title":"Reducing Conservativeness Oriented Offline Reinforcement Learning","date":"2021-02-27","arxiv_id":"2103.00098","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-peng-s-q-l-for-modern","title":"Revisiting Peng's Q($λ$) for Modern Reinforcement Learning","date":"2021-02-27","arxiv_id":"2103.00107","repositories_listed":0,"syntology":null},{"url":null,"slug":"potential-impacts-of-smart-homes-on-human","title":"Potential Impacts of Smart Homes on Human Behavior: A Reinforcement Learning Approach","date":"2021-02-26","arxiv_id":"2102.13307","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-distributional-reinforcement-learning","title":"Safe Distributional Reinforcement Learning","date":"2021-02-26","arxiv_id":"2102.13446","repositories_listed":0,"syntology":null},{"url":null,"slug":"bias-reduced-multi-step-hindsight-experience","title":"Bias-reduced Multi-step Hindsight Experience Replay for Efficient Multi-goal Reinforcement Learning","date":"2021-02-25","arxiv_id":"2102.12962","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-bounding-mdps-learning","title":"Iterative Bounding MDPs: Learning Interpretable Policies via Non-Interpretable Methods","date":"2021-02-25","arxiv_id":"2102.13045","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-reinforcement-learning-with-heavy","title":"No-Regret Reinforcement Learning with Heavy-Tailed Rewards","date":"2021-02-25","arxiv_id":"2102.12769","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effect-of-auxiliary-tasks-on","title":"On The Effect of Auxiliary Tasks on Representation Dynamics","date":"2021-02-25","arxiv_id":"2102.13089","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-approach-for-resource","title":"Reinforcement learning approach for resource allocation in humanitarian logistics","date":"2021-02-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-implicit-and","title":"Reinforcement Learning of Implicit and Explicit Control Flow in Instructions","date":"2021-02-25","arxiv_id":"2102.13195","repositories_listed":0,"syntology":null},{"url":null,"slug":"annotating-motion-primitives-for-simplifying","title":"Annotating Motion Primitives for Simplifying Action Search in Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12017","repositories_listed":0,"syntology":null},{"url":null,"slug":"coverage-as-a-principle-for-discovering-1","title":"Beyond Fine-Tuning: Transferring Behavior in Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.13515","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-emergent-discrete-message","title":"Learning Emergent Discrete Message Communication for Cooperative Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12550","repositories_listed":0,"syntology":null},{"url":null,"slug":"pfrl-pose-free-reinforcement-learning-for-6d-1","title":"PFRL: Pose-Free Reinforcement Learning for 6D Pose Estimation","date":"2021-02-24","arxiv_id":"2102.12096","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-safe-continuing-task-reinforcement","title":"Towards Safe Continuing Task Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12585","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-robotic-model-of-hippocampal-reverse-replay","title":"A Robotic Model of Hippocampal Reverse Replay for Reinforcement Learning","date":"2021-02-23","arxiv_id":"2102.11914","repositories_listed":0,"syntology":null},{"url":null,"slug":"greedy-multi-step-off-policy-reinforcement-1","title":"Greedy-Step Off-Policy Reinforcement Learning","date":"2021-02-23","arxiv_id":"2102.11717","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-augmented-constrained-reinforcement","title":"State Augmented Constrained Reinforcement Learning: Overcoming the Limitations of Learning with Rewards","date":"2021-02-23","arxiv_id":"2102.11941","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-redundancy-in-reinforcement-learning","title":"Action Redundancy in Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.11329","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-parallel","title":"Communication Efficient Parallel Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.10740","repositories_listed":0,"syntology":null},{"url":null,"slug":"gelato-geometrically-enriched-latent-model","title":"Uncertainty Estimation Using Riemannian Model~Dynamics for Offline Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.11327","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-the-prediction","title":"Reinforcement Learning of the Prediction Horizon in Model Predictive Control","date":"2021-02-22","arxiv_id":"2102.11122","repositories_listed":0,"syntology":null},{"url":null,"slug":"return-based-contrastive-representation-1","title":"Return-Based Contrastive Representation Learning for Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.10960","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentinel-taming-uncertainty-with-ensemble","title":"SENTINEL: Taming Uncertainty with Ensemble-based Distributional Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.11075","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-navigation-in-vortical","title":"Learning Efficient Navigation in Vortical Flow Fields","date":"2021-02-21","arxiv_id":"2102.10536","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-using-robust","title":"Safe Reinforcement Learning Using Robust Action Governor","date":"2021-02-21","arxiv_id":"2102.10643","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-age-of-1","title":"A Reinforcement Learning Approach to Age of Information in Multi-User Networks with HARQ","date":"2021-02-19","arxiv_id":"2102.09774","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-deterministic-multi-agent-1","title":"Decentralized Deterministic Multi-Agent Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09745","repositories_listed":0,"syntology":null},{"url":null,"slug":"instrumental-variable-value-iteration-for","title":"Instrumental Variable Value Iteration for Causal Offline Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09907","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-invariant-state-abstractions-for-model","title":"Model-Invariant State Abstractions for Model-Based Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09850","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-memory-dependent-continuous-control","title":"Learning Memory-Dependent Continuous Control from Demonstrations","date":"2021-02-18","arxiv_id":"2102.09208","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserving-teacher-student-deep","title":"Privacy-Preserving Kickstarting Deep Reinforcement Learning with Privacy-Aware Learners","date":"2021-02-18","arxiv_id":"2102.09599","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-datacenter","title":"Reinforcement Learning for Datacenter Congestion Control","date":"2021-02-18","arxiv_id":"2102.09337","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-feasibility-pump-reinforcement-learning","title":"Smart Feasibility Pump: Reinforcement Learning for (Mixed) Integer Programming","date":"2021-02-18","arxiv_id":"2102.09663","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategic-bidding-in-freight-transport-using","title":"Strategic bidding in freight transport using deep reinforcement learning","date":"2021-02-18","arxiv_id":"2102.09253","repositories_listed":0,"syntology":null},{"url":null,"slug":"separated-proportional-integral-lagrangian","title":"Separated Proportional-Integral Lagrangian for Chance Constrained Reinforcement Learning","date":"2021-02-17","arxiv_id":"2102.08539","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-matters-in-using-data-augmentation-for","title":"Efficient Scheduling of Data Augmentation for Deep Reinforcement Learning","date":"2021-02-17","arxiv_id":"2102.08581","repositories_listed":0,"syntology":null},{"url":null,"slug":"improper-learning-with-gradient-based-policy","title":"Improper Reinforcement Learning with Gradient-based Policy Optimization","date":"2021-02-16","arxiv_id":"2102.08201","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-meta-reinforcement-learning-using","title":"Model-based Meta Reinforcement Learning using Graph Structured Surrogate Models","date":"2021-02-16","arxiv_id":"2102.08291","repositories_listed":0,"syntology":null},{"url":null,"slug":"rmix-learning-risk-sensitive-policies-for","title":"RMIX: Learning Risk-Sensitive Policies for Cooperative Reinforcement Learning Agents","date":"2021-02-16","arxiv_id":"2102.08159","repositories_listed":0,"syntology":null},{"url":null,"slug":"trader-practical-deep-hierarchical","title":"TradeR: Practical Deep Hierarchical Reinforcement Learning for Trade Execution","date":"2021-02-16","arxiv_id":"2104.00620","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-larger-networks-for-deep","title":"Training Larger Networks for Deep Reinforcement Learning","date":"2021-02-16","arxiv_id":"2102.07920","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-domain-knowledge-with-an-adviser","title":"Transferring Domain Knowledge with an Adviser in Continuous Tasks","date":"2021-02-16","arxiv_id":"2102.08029","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperation-and-reputation-dynamics-with","title":"Cooperation and Reputation Dynamics with Reinforcement Learning","date":"2021-02-15","arxiv_id":"2102.07523","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-demonstrations-using-signal","title":"Learning from Demonstrations using Signal Temporal Logic","date":"2021-02-15","arxiv_id":"2102.07730","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-by-haptic-glance-reinforcement","title":"Seeing by haptic glance: reinforcement learning-based 3D object Recognition","date":"2021-02-15","arxiv_id":"2102.07599","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adversarial-reinforcement-learning","title":"Domain Adversarial Reinforcement Learning","date":"2021-02-14","arxiv_id":"2102.07097","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-iot-security-a","title":"Reinforcement Learning for IoT Security: A Comprehensive Survey","date":"2021-02-14","arxiv_id":"2102.07247","repositories_listed":0,"syntology":null},{"url":null,"slug":"reversible-action-design-for-combinatorial","title":"Reversible Action Design for Combinatorial Optimization with Reinforcement Learning","date":"2021-02-14","arxiv_id":"2102.07210","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-method-for-optical","title":"A Reinforcement learning method for Optical Thin-Film Design","date":"2021-02-13","arxiv_id":"2102.09398","repositories_listed":0,"syntology":null},{"url":null,"slug":"equilibrium-inverse-reinforcement-learning","title":"Equilibrium Inverse Reinforcement Learning for Ride-hailing Vehicle Network","date":"2021-02-13","arxiv_id":"2102.06854","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-corruption-robust-algorithms-for","title":"Improved Corruption Robust Algorithms for Episodic Reinforcement Learning","date":"2021-02-13","arxiv_id":"2102.06875","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-cooperation-in-network-games-with","title":"Modelling Cooperation in Network Games with Spatio-Temporal Complexity","date":"2021-02-13","arxiv_id":"2102.06911","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-backup","title":"Deep Reinforcement Learning for Backup Strategies against Adversaries","date":"2021-02-12","arxiv_id":"2102.06632","repositories_listed":0,"syntology":null},{"url":null,"slug":"disturbing-reinforcement-learning-agents-with","title":"Disturbing Reinforcement Learning Agents with Corrupted Rewards","date":"2021-02-12","arxiv_id":"2102.06587","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-data-poisoning-on","title":"Reinforcement Learning For Data Poisoning on Graph Neural Networks","date":"2021-02-12","arxiv_id":"2102.06800","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-combinatorial","title":"Deep Reinforcement Learning for Combinatorial Optimization: Covering Salesman Problems","date":"2021-02-11","arxiv_id":"2102.05875","repositories_listed":0,"syntology":null},{"url":null,"slug":"hedging-of-financial-derivative-contracts-via","title":"Hedging of Financial Derivative Contracts via Monte Carlo Tree Search","date":"2021-02-11","arxiv_id":"2102.06274","repositories_listed":0,"syntology":null},{"url":null,"slug":"defense-against-reward-poisoning-attacks-in","title":"Defense Against Reward Poisoning Attacks in Reinforcement Learning","date":"2021-02-10","arxiv_id":"2102.05776","repositories_listed":0,"syntology":null},{"url":null,"slug":"derivative-free-reinforcement-learning-a","title":"Derivative-Free Reinforcement Learning: A Review","date":"2021-02-10","arxiv_id":"2102.05710","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-reinforcement-learning-for","title":"Leveraging Reinforcement Learning for evaluating Robustness of KNN Search Algorithms","date":"2021-02-10","arxiv_id":"2102.06525","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalization-for-web-based-services-using","title":"Personalization for Web-based Services using Offline Reinforcement Learning","date":"2021-02-10","arxiv_id":"2102.05612","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-averse-bayes-adaptive-reinforcement","title":"Risk-Averse Bayes-Adaptive Reinforcement Learning","date":"2021-02-10","arxiv_id":"2102.05762","repositories_listed":0,"syntology":null},{"url":null,"slug":"simple-agent-complex-environment-efficient","title":"Simple Agent, Complex Environment: Efficient Reinforcement Learning with Agent States","date":"2021-02-10","arxiv_id":"2102.05261","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-progress-in-deep-reinforcement-1","title":"Measuring Progress in Deep Reinforcement Learning Sample Efficiency","date":"2021-02-09","arxiv_id":"2102.04881","repositories_listed":0,"syntology":null},{"url":null,"slug":"scheduling-the-nasa-deep-space-network-with","title":"Scheduling the NASA Deep Space Network with Deep Reinforcement Learning","date":"2021-02-09","arxiv_id":"2102.05167","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrasting-centralized-and-decentralized","title":"Contrasting Centralized and Decentralized Critics in Multi-Agent Reinforcement Learning","date":"2021-02-08","arxiv_id":"2102.04402","repositories_listed":0,"syntology":null},{"url":null,"slug":"generate-and-revise-reinforcement-learning-in","title":"Generate and Revise: Reinforcement Learning in Neural Poetry","date":"2021-02-08","arxiv_id":"2102.04114","repositories_listed":0,"syntology":null},{"url":null,"slug":"introduction-to-machine-learning-for-the","title":"Introduction to Machine Learning for the Sciences","date":"2021-02-08","arxiv_id":"2102.04883","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlocking-pixels-for-reinforcement-learning","title":"Unlocking Pixels for Reinforcement Learning via Implicit Attention","date":"2021-02-08","arxiv_id":"2102.04353","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-frame-skipping-in","title":"An Analysis of Frame-skipping in Reinforcement Learning","date":"2021-02-07","arxiv_id":"2102.03718","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-model-and-search-for-computer-go","title":"Improving Model and Search for Computer Go","date":"2021-02-06","arxiv_id":"2102.03467","repositories_listed":0,"syntology":null},{"url":null,"slug":"deceptive-reinforcement-learning-for-privacy","title":"Deceptive Reinforcement Learning for Privacy-Preserving Planning","date":"2021-02-05","arxiv_id":"2102.03022","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-based-heuristic-search-robust","title":"Experience-Based Heuristic Search: Robust Motion Planning with Deep Q-Learning","date":"2021-02-05","arxiv_id":"2102.03127","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-motion-planning-algorithms-for","title":"A review of motion planning algorithms for intelligent robotics","date":"2021-02-04","arxiv_id":"2102.02376","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-image-1","title":"Deep reinforcement learning-based image classification achieves perfect testing set accuracy for MRI brain tumors with a training set of only 30 images","date":"2021-02-04","arxiv_id":"2102.02895","repositories_listed":0,"syntology":null},{"url":null,"slug":"persistent-rule-based-interactive","title":"Persistent Rule-based Interactive Reinforcement Learning","date":"2021-02-04","arxiv_id":"2102.02441","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-compact-state-representation-for","title":"The Pitfall of More Powerful Autoencoders in Lidar-Based Navigation","date":"2021-02-03","arxiv_id":"2102.02127","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-uav-mobile-edge-computing-and-path","title":"Multi-UAV Mobile Edge Computing and Path Planning Platform based on Reinforcement Learning","date":"2021-02-03","arxiv_id":"2102.02078","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-recursive-belief-states-in-multi-agent","title":"Neural Recursive Belief States in Multi-Agent Reinforcement Learning","date":"2021-02-03","arxiv_id":"2102.02274","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-offline-reinforcement-learning","title":"Near-Optimal Offline Reinforcement Learning via Double Variance Reduction","date":"2021-02-02","arxiv_id":"2102.01748","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-reinforcement-learning-de-novo","title":"A step toward a reinforcement learning de novo genome assembler","date":"2021-02-02","arxiv_id":"2102.02649","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-multi-agent-reinforcement-learning","title":"Towards Multi-agent Reinforcement Learning for Wireless Network Protocol Synthesis","date":"2021-02-02","arxiv_id":"2102.01611","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-secure-learning-control-strategy-via","title":"A Secure Learning Control Strategy via Dynamic Camouflaging for Unknown Dynamical Systems under Attacks","date":"2021-02-01","arxiv_id":"2102.00573","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-information-driven-multi-agent","title":"Hybrid Information-driven Multi-agent Reinforcement Learning","date":"2021-02-01","arxiv_id":"2102.01004","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-reinforcement-learning-inspired","title":"Interpretable Reinforcement Learning Inspired by Piaget's Theory of Cognitive Development","date":"2021-02-01","arxiv_id":"2102.00572","repositories_listed":0,"syntology":null}],"record_sha256":"22fff6ce08096d9d53c7000fd6826e814d2bbe27df8ba9315477db1a31079b86","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}