{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/89","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":89,"pages_in_order":135,"rows_per_page":100,"rows":[8801,8900],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/88","next":"/task/reinforcement-learning-2/papers/90","papers":[{"url":null,"slug":"generalization-in-deep-rl-for-tsp-problems","title":"Generalization in Deep RL for TSP Problems via Equivariance and Local Search","date":"2021-10-07","arxiv_id":"2110.03595","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-pessimism-for-robust-and-efficient","title":"Learning Pessimism for Robust and Efficient Off-Policy Reinforcement Learning","date":"2021-10-07","arxiv_id":"2110.03375","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-reward-mixing-mdps","title":"Reinforcement Learning in Reward-Mixing MDPs","date":"2021-10-07","arxiv_id":"2110.03743","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-lever-manipulation-using-hindsight","title":"Robotic Lever Manipulation using Hindsight Experience Replay and Shapley Additive Explanations","date":"2021-10-07","arxiv_id":"2110.03292","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-distributional","title":"The Benefits of Being Categorical Distributional: Uncertainty-aware Regularized Exploration in Reinforcement Learning","date":"2021-10-07","arxiv_id":"2110.03155","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-control-of-a-mechatronic-system","title":"Adaptive control of a mechatronic system using constrained residual reinforcement learning","date":"2021-10-06","arxiv_id":"2110.02566","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-attentions-for-solving-pickup","title":"Heterogeneous Attentions for Solving Pickup and Delivery Problem via Deep Reinforcement Learning","date":"2021-10-06","arxiv_id":"2110.02634","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-deep","title":"Improving Generalization of Deep Reinforcement Learning-based TSP Solvers","date":"2021-10-06","arxiv_id":"2110.02843","repositories_listed":0,"syntology":null},{"url":null,"slug":"nested-policy-reinforcement-learning","title":"Compositional Q-learning for electrolyte repletion with imbalanced patient sub-populations","date":"2021-10-06","arxiv_id":"2110.02879","repositories_listed":0,"syntology":null},{"url":null,"slug":"pretraining-reinforcement-learning-sharpening","title":"Pretraining & Reinforcement Learning: Sharpening the Axe Before Cutting the Tree","date":"2021-10-06","arxiv_id":"2110.02497","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-4","title":"A Deep Reinforcement Learning Framework for Contention-Based Spectrum Sharing","date":"2021-10-05","arxiv_id":"2110.02736","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-first-passage-time-minimization","title":"A study of first-passage time minimization via Q-learning in heated gridworlds","date":"2021-10-05","arxiv_id":"2110.02129","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-guidewire","title":"Deep reinforcement learning for guidewire navigation in coronary artery phantom","date":"2021-10-05","arxiv_id":"2110.01840","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepedge-a-deep-reinforcement-learning-based","title":"DeepEdge: A Deep Reinforcement Learning based Task Orchestrator for Edge Computing","date":"2021-10-05","arxiv_id":"2110.01863","repositories_listed":0,"syntology":null},{"url":null,"slug":"narle-natural-language-models-using","title":"NaRLE: Natural Language Models using Reinforcement Learning with Emotion Feedback","date":"2021-10-05","arxiv_id":"2110.02148","repositories_listed":0,"syntology":null},{"url":null,"slug":"ottr-off-road-trajectory-tracking-using","title":"OTTR: Off-Road Trajectory Tracking using Reinforcement Learning","date":"2021-10-05","arxiv_id":"2110.02332","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-modified-q-learning-algorithm-for-rate","title":"A Modified Q-Learning Algorithm for Rate-Profiling of Polarization Adjusted Convolutional (PAC) Codes","date":"2021-10-04","arxiv_id":"2110.01563","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-privilege-escalation-with-deep","title":"Automating Privilege Escalation with Deep Reinforcement Learning","date":"2021-10-04","arxiv_id":"2110.01362","repositories_listed":0,"syntology":null},{"url":null,"slug":"behaviour-conditioned-policies-for","title":"Behaviour-conditioned policies for cooperative reinforcement learning tasks","date":"2021-10-04","arxiv_id":"2110.01266","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-assist-agents-by-observing-them","title":"Learning to Assist Agents by Observing Them","date":"2021-10-04","arxiv_id":"2110.01311","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-path-planning-using-deep","title":"Multi-Agent Path Planning Using Deep Reinforcement Learning","date":"2021-10-04","arxiv_id":"2110.01460","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-admission-control-1","title":"Reinforcement Learning for Admission Control in Wireless Virtual Network Embedding","date":"2021-10-04","arxiv_id":"2110.01262","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-safe-reinforcement-learning-for","title":"Decentralized Safe Reinforcement Learning for Voltage Control","date":"2021-10-03","arxiv_id":"2110.01126","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-clusters-buffer-management-with","title":"DRL-Clusters: Buffer Management with Clustering based Deep Reinforcement Learning","date":"2021-10-03","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-actors-and-learners-a-framework-for","title":"Parallel Actors and Learners: A Framework for Generating Scalable RL Implementations","date":"2021-10-03","arxiv_id":"2110.01101","repositories_listed":0,"syntology":null},{"url":null,"slug":"feel-good-thompson-sampling-for-contextual","title":"Feel-Good Thompson Sampling for Contextual Bandits and Reinforcement Learning","date":"2021-10-02","arxiv_id":"2110.00871","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeking-visual-discomfort-curiosity-driven","title":"Seeking Visual Discomfort: Curiosity-driven Representations for Reinforcement Learning","date":"2021-10-02","arxiv_id":"2110.00784","repositories_listed":0,"syntology":null},{"url":null,"slug":"cellular-traffic-offloading-via-opportunistic","title":"Cellular traffic offloading via Opportunistic Networking with Reinforcement Learning","date":"2021-10-01","arxiv_id":"2110.00397","repositories_listed":0,"syntology":null},{"url":null,"slug":"divergence-regularized-multi-agent-actor","title":"Divergence-Regularized Multi-Agent Actor-Critic","date":"2021-10-01","arxiv_id":"2110.00304","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-planning-for-autonomous-vehicles-in","title":"Motion Planning for Autonomous Vehicles in the Presence of Uncertainty Using Reinforcement Learning","date":"2021-10-01","arxiv_id":"2110.00640","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-lane-cruising-using-hierarchical","title":"Multi-lane Cruising Using Hierarchical Planning and Reinforcement Learning","date":"2021-10-01","arxiv_id":"2110.00650","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-aware-model-based-reinforcement","title":"Safety aware model-based reinforcement learning for optimal control of a class of output-feedback nonlinear systems","date":"2021-10-01","arxiv_id":"2110.00271","repositories_listed":0,"syntology":null},{"url":null,"slug":"terminal-adaptive-guidance-for-autonomous","title":"Terminal Adaptive Guidance for Autonomous Hypersonic Strike Weapons via Reinforcement Learning","date":"2021-10-01","arxiv_id":"2110.00634","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-privacy-preserving-distributed-training","title":"A Privacy-preserving Distributed Training Framework for Cooperative Multi-agent Deep Reinforcement Learning","date":"2021-09-30","arxiv_id":"2109.14998","repositories_listed":0,"syntology":null},{"url":null,"slug":"bitcoin-transaction-strategy-construction","title":"Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning","date":"2021-09-30","arxiv_id":"2109.14789","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-reinforcement-learning-for","title":"Coordinated Reinforcement Learning for Optimizing Mobile Networks","date":"2021-09-30","arxiv_id":"2109.15175","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-graph-based-multi-agent","title":"Decentralized Graph-Based Multi-Agent Reinforcement Learning Using Reward Machines","date":"2021-09-30","arxiv_id":"2110.00096","repositories_listed":0,"syntology":null},{"url":null,"slug":"hlic-harmonizing-optimization-metrics-in","title":"HLIC: Harmonizing Optimization Metrics in Learned Image Compression by Reinforcement Learning","date":"2021-09-30","arxiv_id":"2109.14863","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-interactions-of-autonomous-vehicles","title":"Modeling Interactions of Autonomous Vehicles and Pedestrians with Deep Multi-Agent Reinforcement Learning for Collision Avoidance","date":"2021-09-30","arxiv_id":"2109.15266","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-classical-planning","title":"Reinforcement Learning for Classical Planning: Viewing Heuristics as Dense Reward Generators","date":"2021-09-30","arxiv_id":"2109.14830","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-information","title":"Reinforcement Learning with Information-Theoretic Actuation","date":"2021-09-30","arxiv_id":"2109.15147","repositories_listed":0,"syntology":null},{"url":null,"slug":"stability-constrained-reinforcement-learning","title":"Stability Constrained Reinforcement Learning for Real-Time Voltage Control","date":"2021-09-30","arxiv_id":"2109.14854","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-planning-with-deep-reinforcement","title":"Trajectory Planning with Deep Reinforcement Learning in High-Level Action Spaces","date":"2021-09-30","arxiv_id":"2110.00044","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-flexible-measurement-of-diversity-in","title":"A Flexible Measurement of Diversity in Datasets with Random Network Distillation","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-theory-of-relativity-in","title":"A General Theory of Relativity in Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-principled-permutation-invariant-approach","title":"A Principled Permutation Invariant Approach to Mean-Field Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"aarl-automated-auxiliary-loss-for","title":"AARL: Automated Auxiliary Loss for Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-q-learning-for-interaction-limited","title":"Adaptive Q-learning for Interaction-Limited Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-style-transfer-for-robust-policy","title":"Adversarial Style Transfer for Robust Policy Optimization in Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-attempt-to-model-human-trust-with","title":"An Attempt to Model Human Trust with Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-experimental-design-perspective-on-1","title":"An Experimental Design Perspective on Exploration in Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optics-controlling-environment-and","title":"An Optics Controlling Environment and Reinforcement Learning Benchmarks","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-deep-reinforcement-learning","title":"Assessing Deep Reinforcement Learning Policies via Natural Corruptions at the Edge of Imperceptibility","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-encoding-inverse-reinforcement-learning","title":"Auto-Encoding Inverse Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-exploration-for-lifelong","title":"Bayesian Exploration for Lifelong Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-sample-selection-strategies-for","title":"Benchmarking Sample Selection Strategies for Batch Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"better-state-exploration-using-action","title":"Better state exploration using action sequence equivalence","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-linear-value-networks-for-multi-goal","title":"Bi-linear Value Networks for Multi-goal Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"boosted-curriculum-reinforcement-learning","title":"Boosted Curriculum Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"causaldyna-improving-generalization-of-dyna","title":"CausalDyna: Improving Generalization of Dyna-style Reinforcement Learning via Counterfactual-Based Data Augmentation","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"closed-loop-control-of-additive-manufacturing","title":"Closed-Loop Control of Additive Manufacturing via Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-reinforcement-learning-based","title":"Combinatorial Reinforcement Learning Based Scheduling for DNN Execution on Edge","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"conditional-value-at-risk-for-quantitative","title":"Conditional Value-at-Risk for Quantitative Trading: A Direct Reinforcement Learning Approach","date":"2021-09-29","arxiv_id":"2109.14438","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-deep-q-learning-in-optimal-control","title":"Continuous Deep Q-Learning in Optimal Control Problems: Normalized Advantage Functions Analysis","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"convergent-and-efficient-deep-q-learning","title":"Convergent and Efficient Deep Q Learning Algorithm","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-attacks-against-federated","title":"Coordinated Attacks Against Federated Learning: A Multi-Agent Reinforcement Learning Approach","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cubetr-learning-to-solve-the-rubik-s-cube","title":"CubeTR: Learning to Solve the Rubik's Cube using Transformers","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-sharing-without-rewards-in-multi-task","title":"Data Sharing without Rewards in Multi-Task Offline Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cooperative-multi-agent","title":"Decentralized Cooperative Multi-Agent Reinforcement Learning with Exploration","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cross-entropy-method-for-model","title":"Decentralized Cross-Entropy Method for Model-Based Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-inverse-reinforcement-learning-via","title":"Deep Inverse Reinforcement Learning via Adversarial One-Class Classification","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-of-intrinsically-motivated","title":"Deep Learning of Intrinsically Motivated Options in the Arcade Learning Environment","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-worst-case-corruptions-via-loss","title":"Detecting Worst-case Corruptions via Loss Landscape Curvature in Deep Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-generalization-in-reinforcement","title":"Disentangling Generalization in Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/disentangling-sources-of-risk-for","slug":"disentangling-sources-of-risk-for","title":"Disentangling Sources of Risk for Distributional Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-perturbation-for-efficient","title":"Distributional Perturbation for Efficient Exploration in Distributional Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reinforcement-learning-with-5","title":"Distributional Reinforcement Learning with Monotonic Splines","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dsdf-coordinated-look-ahead-strategy-in","title":"DSDF: Coordinated look-ahead strategy in stochastic multi-agent reinforcement learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"eat-c-environment-adversarial-sub-task","title":"EAT-C: Environment-Adversarial sub-Task Curriculum for Efficient Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning","title":"Efficient Reinforcement Learning Experimentation in PyTorch","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"eqr-equivariant-representations-for-data","title":"EqR: Equivariant Representations for Data-Efficient Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-robustness-of-cooperative-marl","title":"Evaluating Robustness of Cooperative MARL","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evolution-strategies-as-an-alternate-learning","title":"Evolution Strategies as an Alternate Learning method for Hierarchical Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-diversity-optimization-with","title":"Evolutionary Diversity Optimization with Clustering-based Selection for Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-replay-more-when-it-s-a-key","title":"Experience Replay More When It's a Key Transition in Deep Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-robustness-of-distributional-1","title":"Exploring the Robustness of Distributional Reinforcement Learning against Noisy State Observations","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-reinforcement-learning-with-value","title":"Faster Reinforcement Learning with Value Target Lower Bounding","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-convergence-and-sample-complexity","title":"Finite-Time Convergence and Sample Complexity of Multi-Agent Actor-Critic Reinforcement Learning with Average Reward","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"formulation-and-validation-of-a-car-following","title":"Formulation and validation of a car-following model based on deep reinforcement learning","date":"2021-09-29","arxiv_id":"2109.14268","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalisation-in-lifelong-reinforcement","title":"Generalisation in Lifelong Reinforcement Learning through Logical Composition","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-maximum-entropy-reinforcement","title":"Generalized Maximum Entropy Reinforcement Learning via Reward Shaping","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-enhanced-exploration-for-goal-oriented","title":"Graph-Enhanced Exploration for Goal-oriented Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"greedy-based-value-representation-for","title":"Greedy-based Value Representation for Efficient Coordination in Multi-agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hypothesis-driven-coordinate-ascent-for","title":"Hypothesis Driven Coordinate Ascent for Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ia-marl-imputation-assisted-multi-agent","title":"IA-MARL: Imputation Assisted Multi-Agent Reinforcement Learning for Missing Training Data","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-safety-in-deep-reinforcement","title":"Improving Safety in Deep Reinforcement Learning using Unsupervised Action Planning","date":"2021-09-29","arxiv_id":"2109.14325","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-bottleneck-based-behavior","title":"Information-Bottleneck-Based Behavior Representation Learning for Multi-agent Reinforcement learning","date":"2021-09-29","arxiv_id":"2109.14188","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-self-supervised-learning-for-vision","title":"Joint Self-Supervised Learning for Vision-based Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-controllable-elements-oriented","title":"Learning Controllable Elements Oriented Representations for Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-invariant-reward-functions-through","title":"Learning Invariant Reward Functions through Trajectory Interventions","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"d5c754c3ee41bdbac9b57781f54ca868198e1089088e9471f062c1f1388167fb","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}