{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/96","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":96,"pages_in_order":152,"rows_per_page":100,"rows":[9501,9600],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/95","next":"/task/reinforcement-learning-1/papers/97","papers":[{"url":null,"slug":"self-consistent-models-and-values","title":"Self-Consistent Models and Values","date":"2021-10-25","arxiv_id":"2110.12840","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-domain-adaptation-with-dynamics","title":"Unsupervised Domain Adaptation with Dynamics-Aware Rewards in Reinforcement Learning","date":"2021-10-25","arxiv_id":"2110.12997","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-simultaneous","title":"Deep Reinforcement Learning for Simultaneous Sensing and Channel Access in Cognitive Networks","date":"2021-10-24","arxiv_id":"2110.14541","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-thompson-sampling-for-partially","title":"Analysis of Thompson Sampling for Partially Observable Contextual Multi-Armed Bandits","date":"2021-10-23","arxiv_id":"2110.12175","repositories_listed":0,"syntology":null},{"url":null,"slug":"foresight-of-graph-reinforcement-learning","title":"Foresight of Graph Reinforcement Learning Latent Permutations Learnt by Gumbel Sinkhorn Network","date":"2021-10-23","arxiv_id":"2110.12144","repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-distributed-actor-critic-architecture","title":"Fully Distributed Actor-Critic Architecture for Multitask Deep Reinforcement Learning","date":"2021-10-23","arxiv_id":"2110.12306","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-search-using-dynamic-mirror-descent","title":"Policy Search using Dynamic Mirror Descent MPC for Model Free Off Policy RL","date":"2021-10-23","arxiv_id":"2110.12239","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-2","title":"A Reinforcement Learning Approach to Parameter Selection for Distributed Optimal Power Flow","date":"2021-10-22","arxiv_id":"2110.11991","repositories_listed":0,"syntology":null},{"url":null,"slug":"c-planning-an-automatic-curriculum-for-1","title":"C-Planning: An Automatic Curriculum for Learning Goal-Reaching Tasks","date":"2021-10-22","arxiv_id":"2110.12080","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-rates-of-average-reward-multi","title":"Convergence Rates of Average-Reward Multi-agent Reinforcement Learning via Randomized Linear Programming","date":"2021-10-22","arxiv_id":"2110.12929","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-reinforcement-learning-with-2","title":"Off-policy Reinforcement Learning with Optimistic Exploration and Distribution Correction","date":"2021-10-22","arxiv_id":"2110.12081","repositories_listed":0,"syntology":null},{"url":null,"slug":"patient-level-simulation-and-reinforcement","title":"Patient level simulation and reinforcement learning to discover novel strategies for treating ovarian cancer","date":"2021-10-22","arxiv_id":"2110.11872","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-process-control","title":"Reinforcement Learning for Process Control with Application in Semiconductor Manufacturing","date":"2021-10-22","arxiv_id":"2110.11572","repositories_listed":0,"syntology":null},{"url":null,"slug":"anti-concentrated-confidence-bonuses-for-1","title":"Anti-Concentrated Confidence Bonuses for Scalable Exploration","date":"2021-10-21","arxiv_id":"2110.11202","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-q-learning-solve-multi-armed-bantids","title":"Can Q-learning solve Multi Armed Bantids?","date":"2021-10-21","arxiv_id":"2110.10934","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-online-2","title":"Deep Reinforcement Learning for Online Control of Stochastic Partial Differential Equations","date":"2021-10-21","arxiv_id":"2110.11265","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-robotic-manipulation-through","title":"Efficient Robotic Manipulation Through Offline-to-Online Reinforcement Learning and Goal-Aware State Information","date":"2021-10-21","arxiv_id":"2110.10905","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-high-variance-unavoidable-in-rl-a-case-1","title":"Is High Variance Unavoidable in RL? A Case Study in Continuous Control","date":"2021-10-21","arxiv_id":"2110.11222","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-4","title":"Model-based Reinforcement Learning for Service Mesh Fault Resiliency in a Web Application-level","date":"2021-10-21","arxiv_id":"2110.13621","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-reinforcement-learning-with","title":"Neuro-Symbolic Reinforcement Learning with First-Order Logic","date":"2021-10-21","arxiv_id":"2110.10963","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-dynamics-inverse-reinforcement-learning","title":"Off-Dynamics Inverse Reinforcement Learning from Hetero-Domain","date":"2021-10-21","arxiv_id":"2110.11443","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-optimal-camera","title":"Reinforcement Learning Based Optimal Camera Placement for Depth Observation of Indoor Scenes","date":"2021-10-21","arxiv_id":"2110.11106","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-socialbot-learning-via-multi","title":"Socialbots on Fire: Modeling Adversarial Behaviors of Socialbots via Multi-Agent Hierarchical Reinforcement Learning","date":"2021-10-20","arxiv_id":"2110.10655","repositories_listed":0,"syntology":null},{"url":null,"slug":"computationally-efficient-safe-reinforcement","title":"Computationally Efficient Safe Reinforcement Learning for Power Systems","date":"2021-10-20","arxiv_id":"2110.10333","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-reinforcement-learning-for-3","title":"Distributed Reinforcement Learning for Privacy-Preserving Dynamic Edge Caching","date":"2021-10-20","arxiv_id":"2110.10349","repositories_listed":0,"syntology":null},{"url":null,"slug":"feedback-linearization-of-car-dynamics-for","title":"Feedback Linearization of Car Dynamics for Racing via Reinforcement Learning","date":"2021-10-20","arxiv_id":"2110.10441","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-efficient-exploration-with-symbolic","title":"More Efficient Exploration with Symbolic Priors on Action Sequence Equivalences","date":"2021-10-20","arxiv_id":"2110.10632","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-reinforcement-learning-for-dc-dc","title":"Transferring Reinforcement Learning for DC-DC Buck Converter Control via Duty Ratio Mapping: From Simulation to Implementation","date":"2021-10-20","arxiv_id":"2110.10490","repositories_listed":0,"syntology":null},{"url":null,"slug":"aesthetic-photo-collage-with-deep","title":"Aesthetic Photo Collage with Deep Reinforcement Learning","date":"2021-10-19","arxiv_id":"2110.09775","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-exact-gradients-convergence-of","title":"Beyond Exact Gradients: Convergence of Stochastic Soft-Max Policy Gradient Methods with Entropy Regularization","date":"2021-10-19","arxiv_id":"2110.10117","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-cooperation-by-balancing-exploration","title":"Improved cooperation by balancing exploration and exploitation in intertemporal social dilemma tasks","date":"2021-10-19","arxiv_id":"2111.09152","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robotic-manipulation-skills-using-an","title":"Learning Robotic Manipulation Skills Using an Adaptive Force-Impedance Action Space","date":"2021-10-19","arxiv_id":"2110.09904","repositories_listed":0,"syntology":null},{"url":null,"slug":"locally-differentially-private-reinforcement","title":"Locally Differentially Private Reinforcement Learning for Linear Mixture Markov Decision Processes","date":"2021-10-19","arxiv_id":"2110.10133","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-compatible-off-policy-natural","title":"Neural Network Compatible Off-Policy Natural Actor-Critic Algorithm","date":"2021-10-19","arxiv_id":"2110.10017","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-reward-free-rl-with-kernel-and-neural","title":"On Reward-Free RL with Kernel and Neural Function Approximations: Single-Agent MDP and Markov Game","date":"2021-10-19","arxiv_id":"2110.09771","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-based-episodic-memory-for-multi-agent","title":"State-based Episodic Memory for Multi-Agent Reinforcement Learning","date":"2021-10-19","arxiv_id":"2110.09817","repositories_listed":0,"syntology":null},{"url":null,"slug":"embracing-advanced-ai-ml-to-help-investors","title":"Embracing advanced AI/ML to help investors achieve success: Vanguard Reinforcement Learning for Financial Goal Planning","date":"2021-10-18","arxiv_id":"2110.12003","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-robustness-of-reinforcement","title":"Improving Robustness of Reinforcement Learning for Power System Control with Adversarial Training","date":"2021-10-18","arxiv_id":"2110.08956","repositories_listed":0,"syntology":null},{"url":null,"slug":"mdp-abstraction-with-successor-features","title":"Option Transfer and SMDP Abstraction with Successor Features","date":"2021-10-18","arxiv_id":"2110.09196","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-policy-optimization-is-provably-1","title":"Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs","date":"2021-10-18","arxiv_id":"2110.08984","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-hierarchy-based-meta-reinforcement-1","title":"Provable Hierarchy-Based Meta-Reinforcement Learning","date":"2021-10-18","arxiv_id":"2110.09507","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-coverage-path","title":"Reinforcement Learning-Based Coverage Path Planning with Implicit Cellular Decomposition","date":"2021-10-18","arxiv_id":"2110.09018","repositories_listed":0,"syntology":null},{"url":null,"slug":"sim-to-real-transfer-in-multi-agent","title":"Sim-to-Real Transfer in Multi-agent Reinforcement Networking for Federated Edge Computing","date":"2021-10-18","arxiv_id":"2110.08952","repositories_listed":0,"syntology":null},{"url":null,"slug":"damped-anderson-mixing-for-deep-reinforcement","title":"Damped Anderson Mixing for Deep Reinforcement Learning: Acceleration, Convergence, and Stabilization","date":"2021-10-17","arxiv_id":"2110.08896","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-rl-with-exogenous-distractors-via","title":"Provable RL with Exogenous Distractors via Multistep Inverse Dynamics","date":"2021-10-17","arxiv_id":"2110.08847","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-instance-optimal-offline","title":"Towards Instance-Optimal Offline Reinforcement Learning with Pessimism","date":"2021-10-17","arxiv_id":"2110.08695","repositories_listed":0,"syntology":null},{"url":null,"slug":"case-based-reasoning-for-better-1","title":"Case-based Reasoning for Better Generalization in Textual Reinforcement Learning","date":"2021-10-16","arxiv_id":"2110.08470","repositories_listed":0,"syntology":null},{"url":null,"slug":"emotion-style-transfer-with-a-specified","title":"Emotion Style Transfer with a Specified Intensity Using Deep Reinforcement Learning","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-imitation-learning-for-1","title":"Generative Adversarial Imitation Learning for End-to-End Autonomous Driving on Urban Environments","date":"2021-10-16","arxiv_id":"2110.08586","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallucinated-but-factual-inspecting-the","title":"Hallucinated but Factual! Inspecting the Factuality of Hallucinations in Abstractive Summarization","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lifting-the-veil-on-hyper-parameters-for","title":"Lifting the veil on hyper-parameters for value-based deep reinforcement learning","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"local-advantage-actor-critic-for-robust-multi","title":"Local Advantage Actor-Critic for Robust Multi-Agent Deep Reinforcement Learning","date":"2021-10-16","arxiv_id":"2110.08642","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-pruning-through-constrained","title":"Neural Network Pruning Through Constrained Reinforcement Learning","date":"2021-10-16","arxiv_id":"2110.08558","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-target-q-learning-with-reverse-1","title":"Online Target Q-learning with Reverse Experience Replay: Efficiently finding the Optimal Policy for Linear MDPs","date":"2021-10-16","arxiv_id":"2110.08440","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-modern-communication-from-semantic","title":"Rethinking Modern Communication from Semantic Coding to Semantic Communication","date":"2021-10-16","arxiv_id":"2110.08496","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-broad-persistent-advising-approach-for-deep","title":"A Broad-persistent Advising Approach for Deep Interactive Reinforcement Learning in Robotic Environments","date":"2021-10-15","arxiv_id":"2110.08003","repositories_listed":0,"syntology":null},{"url":null,"slug":"containerized-distributed-value-based-multi-1","title":"Containerized Distributed Value-Based Multi-Agent Reinforcement Learning","date":"2021-10-15","arxiv_id":"2110.08169","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-probabilistic-logic-models-for","title":"Dynamic probabilistic logic models for effective abstractions in RL","date":"2021-10-15","arxiv_id":"2110.08318","repositories_listed":0,"syntology":null},{"url":null,"slug":"effects-of-different-optimization","title":"Effects of Different Optimization Formulations in Evolutionary Reinforcement Learning on Diverse Behavior Generation","date":"2021-10-15","arxiv_id":"2110.08122","repositories_listed":0,"syntology":null},{"url":null,"slug":"growspace-learning-how-to-shape-plants","title":"GrowSpace: Learning How to Shape Plants","date":"2021-10-15","arxiv_id":"2110.08307","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-hyperparameter-optimization-by-1","title":"Improving Hyperparameter Optimization by Planning Ahead","date":"2021-10-15","arxiv_id":"2110.08028","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-model-errors-in-reinforcement-1","title":"On-Policy Model Errors in Reinforcement Learning","date":"2021-10-15","arxiv_id":"2110.07985","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-penalized-q-learning-for-recommender","title":"Value Penalized Q-Learning for Recommender Systems","date":"2021-10-15","arxiv_id":"2110.07923","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-unsupervised-reinforcement","title":"Wasserstein Unsupervised Reinforcement Learning","date":"2021-10-15","arxiv_id":"2110.07940","repositories_listed":0,"syntology":null},{"url":null,"slug":"haven-hierarchical-cooperative-multi-agent","title":"HAVEN: Hierarchical Cooperative Multi-Agent Reinforcement Learning with Dual Coordination Mechanism","date":"2021-10-14","arxiv_id":"2110.07246","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-soft","title":"Offline Reinforcement Learning with Soft Behavior Regularization","date":"2021-10-14","arxiv_id":"2110.07395","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-multi-agent-reinforcement","title":"Provably Efficient Multi-Agent Reinforcement Learning with Fully Decentralized Communication","date":"2021-10-14","arxiv_id":"2110.07392","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-aware-policy-optimisation-for-1","title":"Safe Autonomous Racing via Approximate Reachability on Ego-vision","date":"2021-10-14","arxiv_id":"2110.07699","repositories_listed":0,"syntology":null},{"url":null,"slug":"sign-and-relevance-learning","title":"Sign and Relevance Learning","date":"2021-10-14","arxiv_id":"2110.07292","repositories_listed":0,"syntology":null},{"url":null,"slug":"block-contextual-mdps-for-continual-learning-1","title":"Block Contextual MDPs for Continual Learning","date":"2021-10-13","arxiv_id":"2110.06972","repositories_listed":0,"syntology":null},{"url":null,"slug":"feudal-reinforcement-learning-by-reading-1","title":"Feudal Reinforcement Learning by Reading Manuals","date":"2021-10-13","arxiv_id":"2110.06477","repositories_listed":0,"syntology":null},{"url":null,"slug":"neurips-2021-competition-iglu-interactive","title":"NeurIPS 2021 Competition IGLU: Interactive Grounded Language Understanding in a Collaborative Environment","date":"2021-10-13","arxiv_id":"2110.06536","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-covariate-shift-of-latent-confounders-in-1","title":"On Covariate Shift of Latent Confounders in Imitation and Reinforcement Learning","date":"2021-10-13","arxiv_id":"2110.06539","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-standards-design","title":"Reinforcement Learning for Standards Design","date":"2021-10-13","arxiv_id":"2110.06909","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cooperative-multi-agent-1","title":"On Improving Model-Free Algorithms for Decentralized Multi-Agent Reinforcement Learning","date":"2021-10-12","arxiv_id":"2110.05707","repositories_listed":0,"syntology":null},{"url":null,"slug":"deciding-what-s-fair-challenges-of-applying","title":"Deciding What's Fair: Challenges of Applying Reinforcement Learning in Online Marketplaces","date":"2021-10-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dqn-based-beamforming-for-uplink-mmwave","title":"DQN-based Beamforming for Uplink mmWave Cellular-Connected UAVs","date":"2021-10-12","arxiv_id":"2110.06318","repositories_listed":0,"syntology":null},{"url":null,"slug":"gridlearn-multiagent-reinforcement-learning","title":"GridLearn: Multiagent Reinforcement Learning for Grid-Aware Building Energy Management","date":"2021-10-12","arxiv_id":"2110.06396","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-multi-agent-cooperative","title":"Learning Efficient Multi-Agent Cooperative Visual Exploration","date":"2021-10-12","arxiv_id":"2110.05734","repositories_listed":0,"syntology":null},{"url":null,"slug":"power-and-accountability-in-rl-driven","title":"Power and Accountability in RL-driven Environmental Policy","date":"2021-10-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-reinforcement-learning-in","title":"Provably Efficient Reinforcement Learning in Decentralized General-Sum Markov Games","date":"2021-10-12","arxiv_id":"2110.05682","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-free-model-based-reinforcement","title":"Reward-Free Model-Based Reinforcement Learning with Linear Function Approximation","date":"2021-10-12","arxiv_id":"2110.06394","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-abstraction-in-reinforcement","title":"Temporal Abstraction in Reinforcement Learning with the Successor Representation","date":"2021-10-12","arxiv_id":"2110.05740","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-automated-portfolio-trading-system-with","title":"An Automated Portfolio Trading System with Feature Preprocessing and Recurrent Reinforcement Learning","date":"2021-10-11","arxiv_id":"2110.05299","repositories_listed":0,"syntology":null},{"url":null,"slug":"bid-optimization-using-maximum-entropy","title":"Bid Optimization using Maximum Entropy Reinforcement Learning","date":"2021-10-11","arxiv_id":"2110.05032","repositories_listed":0,"syntology":null},{"url":null,"slug":"navigation-in-urban-environments-amongst","title":"Navigation In Urban Environments Amongst Pedestrians Using Multi-Objective Deep Reinforcement Learning","date":"2021-10-11","arxiv_id":"2110.05205","repositories_listed":0,"syntology":null},{"url":null,"slug":"rein-2-giving-birth-to-prepared-reinforcement","title":"REIN-2: Giving Birth to Prepared Reinforcement Learning Agents Using Reinforcement Learning Agents","date":"2021-10-11","arxiv_id":"2110.05128","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-traffic-signal-controls-using-fog","title":"Scalable Traffic Signal Controls using Fog-Cloud Based Multiagent Reinforcement Learning","date":"2021-10-11","arxiv_id":"2110.05564","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-augmented-reality-platform-for-introducing","title":"An Augmented Reality Platform for Introducing Reinforcement Learning to K-12 Students with Robots","date":"2021-10-10","arxiv_id":"2110.04697","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-in-depth-summary-of-recent-artificial","title":"An In-depth Summary of Recent Artificial Intelligence Applications in Drug Design","date":"2021-10-10","arxiv_id":"2110.05478","repositories_listed":0,"syntology":null},{"url":null,"slug":"braxlines-fast-and-interactive-toolkit-for-rl","title":"Braxlines: Fast and Interactive Toolkit for RL-driven Behavior Engineering beyond Reward Maximization","date":"2021-10-10","arxiv_id":"2110.04686","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-optimizing","title":"Deep Reinforcement Learning for Optimizing RIS-Assisted HD-FD Wireless Systems","date":"2021-10-10","arxiv_id":"2110.04859","repositories_listed":0,"syntology":null},{"url":null,"slug":"hard-instance-learning-for-quantum-adiabatic","title":"Hard instance learning for quantum adiabatic prime factorization","date":"2021-10-10","arxiv_id":"2110.04782","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-condition-multi-objective-optimization","title":"Multi-condition multi-objective optimization using deep reinforcement learning","date":"2021-10-10","arxiv_id":"2110.05945","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-systematic-fx","title":"Reinforcement Learning for Systematic FX Trading","date":"2021-10-10","arxiv_id":"2110.04745","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-independent-learning-algorithm-for-a-class","title":"Satisficing Paths and Independent Multi-Agent Reinforcement Learning in Stochastic Games","date":"2021-10-09","arxiv_id":"2110.04638","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-sample-complexity-barrier-to","title":"Breaking the Sample Complexity Barrier to Regret-Optimal Model-Free Reinforcement Learning","date":"2021-10-09","arxiv_id":"2110.04645","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-aware-robot-navigation-via","title":"Human-Aware Robot Navigation via Reinforcement Learning with Hindsight Experience Replay and Curriculum Learning","date":"2021-10-09","arxiv_id":"2110.04564","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-black-box-action-poisoning","title":"Provably Efficient Black-Box Action Poisoning Attacks Against Reinforcement Learning","date":"2021-10-09","arxiv_id":"2110.04471","repositories_listed":0,"syntology":null},{"url":null,"slug":"theoretically-principled-deep-rl-acceleration","title":"Theoretically Principled Deep RL Acceleration via Nearest Neighbor Function Approximation","date":"2021-10-09","arxiv_id":"2110.04422","repositories_listed":0,"syntology":null}],"record_sha256":"613e80eb0ad15c11bebfce1b75ca546d5bf4cc7029879373629bae30a9fb651b","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}