{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/72","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":72,"pages_in_order":135,"rows_per_page":100,"rows":[7101,7200],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/71","next":"/task/reinforcement-learning-2/papers/73","papers":[{"url":null,"slug":"temporal-difference-learning-with-compressed","title":"Temporal Difference Learning with Compressed Updates: Error-Feedback meets Reinforcement Learning","date":"2023-01-03","arxiv_id":"2301.00944","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-deployable-rl-what-s-broken-with-rl","title":"Towards Deployable RL - What's Broken with RL Research and a Potential Fix","date":"2023-01-03","arxiv_id":"2301.01320","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-asset-1","title":"Deep Reinforcement Learning for Asset Allocation: Reward Clipping","date":"2023-01-02","arxiv_id":"2301.05300","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-traffic-signal-control-by-a-nash","title":"Large-Scale Traffic Signal Control by a Nash Deep Q-network Approach","date":"2023-01-02","arxiv_id":"2301.00637","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-filtering-for-reinforcement-learning","title":"Safety Filtering for Reinforcement Learning-based Adaptive Cruise Control","date":"2023-01-02","arxiv_id":"2301.00884","repositories_listed":0,"syntology":null},{"url":null,"slug":"co-speech-gesture-synthesis-by-reinforcement","title":"Co-Speech Gesture Synthesis by Reinforcement Learning With Contrastive Pre-Trained Rewards","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"gait-generating-aesthetic-indoor-tours-with","title":"GAIT: Generating Aesthetic Indoor Tours with Deep Reinforcement Learning","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"local-guided-global-paired-similarity","title":"Local-Guided Global: Paired Similarity Representation for Visual Reinforcement Learning","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policycleanse-backdoor-detection-and","title":"PolicyCleanse: Backdoor Detection and Mitigation for Competitive Reinforcement Learning","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"regen-a-good-generative-zero-shot-video","title":"ReGen: A good Generative Zero-Shot Video Classifier Should be Rewarded","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"releaps-reinforcement-learning-based","title":"ReLeaPS : Reinforcement Learning-based Illumination Planning for Generalized Photometric Stereo","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/second-thoughts-are-best-learning-to-re-align","slug":"second-thoughts-are-best-learning-to-re-align","title":"Second Thoughts are Best: Learning to Re-Align With Human Values from Text Edits","date":"2023-01-01","arxiv_id":"2301.00355","repositories_listed":0,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/second-thoughts-are-best-learning-to-re-align#ran","syntology_url":"https://syntology.ai/paper/2301.00355","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2301.00355"}},"official":null}},{"url":null,"slug":"simoun-synergizing-interactive-motion","title":"Simoun: Synergizing Interactive Motion-appearance Understanding for Vision-based Reinforcement Learning","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-visual-reinforcement-learning-via","title":"Stabilizing Visual Reinforcement Learning via Asymmetric Interactive Cooperation","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"accuracy-guaranteed-collaborative-dnn","title":"Accuracy-Guaranteed Collaborative DNN Inference in Industrial IoT via Deep Reinforcement Learning","date":"2022-12-31","arxiv_id":"2301.00130","repositories_listed":0,"syntology":null},{"url":null,"slug":"new-challenges-in-reinforcement-learning-a","title":"New Challenges in Reinforcement Learning: A Survey of Security and Privacy","date":"2022-12-31","arxiv_id":"2301.00188","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-deep-reinforcement-learning-and","title":"Hybrid Deep Reinforcement Learning and Planning for Safe and Comfortable Automated Driving","date":"2022-12-30","arxiv_id":"2301.00650","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-experts-advice-aggregation-framework","title":"A Novel Experts Advice Aggregation Framework Using Deep Reinforcement Learning for Portfolio Management","date":"2022-12-29","arxiv_id":"2212.14477","repositories_listed":0,"syntology":null},{"url":null,"slug":"backward-curriculum-reinforcement-learning","title":"Backward Curriculum Reinforcement Learning","date":"2022-12-29","arxiv_id":"2212.14214","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-multi-agent-deep-reinforcement","title":"Federated Multi-Agent Deep Reinforcement Learning Approach via Physics-Informed Reward for Multi-Microgrid Energy Management","date":"2022-12-29","arxiv_id":"2301.00641","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-geometry-of-reinforcement-learning-in","title":"On the Geometry of Reinforcement Learning in Continuous State and Action Spaces","date":"2022-12-29","arxiv_id":"2301.00009","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-transforming-reinforcement-learning-by","title":"On Transforming Reinforcement Learning by Transformer: The Development Trajectory","date":"2022-12-29","arxiv_id":"2212.14164","repositories_listed":0,"syntology":null},{"url":null,"slug":"certifying-safety-in-reinforcement-learning","title":"Certifying Safety in Reinforcement Learning under Adversarial Perturbation Attacks","date":"2022-12-28","arxiv_id":"2212.14115","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-do-it-safer-reinforcement-learning-with","title":"Don't do it: Safer Reinforcement Learning With Rule-based Guidance","date":"2022-12-28","arxiv_id":"2212.13819","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-a-sequence-to-sequence-nlp-model","title":"Improving a sequence-to-sequence nlp model using a reinforcement learning policy algorithm","date":"2022-12-28","arxiv_id":"2212.14117","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-discounted-policy","title":"On the Convergence of Discounted Policy Gradient Methods","date":"2022-12-28","arxiv_id":"2212.14066","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automating-codenames-spymasters-with","title":"Towards automating Codenames spymasters with deep reinforcement learning","date":"2022-12-28","arxiv_id":"2212.14104","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-learning-abstractions-via","title":"Towards Learning Abstractions via Reinforcement Learning","date":"2022-12-28","arxiv_id":"2212.13980","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-control-of-covid-19-in-buildings","title":"Data-driven control of COVID-19 in buildings: a reinforcement-learning approach","date":"2022-12-27","arxiv_id":"2212.13559","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-with-2","title":"Model-Based Reinforcement Learning with Multinomial Logistic Function Approximation","date":"2022-12-27","arxiv_id":"2212.13540","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-scheduling-of-island-integrated","title":"Optimal scheduling of island integrated energy systems considering multi-uncertainties and hydrothermal simultaneous transmission: A deep reinforcement learning approach","date":"2022-12-27","arxiv_id":"2212.13472","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-reinforcement-learning-with-loss","title":"Off-Policy Reinforcement Learning with Loss Function Weighted by Temporal Difference Error","date":"2022-12-26","arxiv_id":"2212.13175","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-heat-pump","title":"Deep Reinforcement Learning for Heat Pump Control","date":"2022-12-24","arxiv_id":"2212.12716","repositories_listed":0,"syntology":null},{"url":null,"slug":"shiro-soft-hierarchical-reinforcement","title":"SHIRO: Soft Hierarchical Reinforcement Learning","date":"2022-12-24","arxiv_id":"2212.12786","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-traffic-flow-prediction-based-on","title":"Streaming Traffic Flow Prediction Based on Continuous Reinforcement Learning","date":"2022-12-24","arxiv_id":"2212.12767","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-multi-agent-reinforcement","title":"Coordinated Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Swarms in Autonomous Mobile Access Applications","date":"2022-12-23","arxiv_id":"2304.08493","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-reinforcement-learning-for","title":"Investigation of reinforcement learning for shape optimization of profile extrusion dies","date":"2022-12-23","arxiv_id":"2212.12207","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-human","title":"Offline Reinforcement Learning for Human-Guided Human-Machine Interaction with Private Information","date":"2022-12-23","arxiv_id":"2212.12167","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-learned-simulation-environment-to-model-1","title":"A Learned Simulation Environment to Model Student Engagement and Retention in Automated Online Courses","date":"2022-12-22","arxiv_id":"2212.14693","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-surface-codes-with-deep","title":"Decoding surface codes with deep reinforcement learning and probabilistic policy reuse","date":"2022-12-22","arxiv_id":"2212.11890","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-approaches-to","title":"Reinforcement Learning Based Approaches to Adaptive Context Caching in Distributed Context Management Systems","date":"2022-12-22","arxiv_id":"2212.11709","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-memetic-algorithm-with-reinforcement","title":"A Memetic Algorithm with Reinforcement Learning for Sociotechnical Production Scheduling","date":"2022-12-21","arxiv_id":"2212.10936","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-is-not-enough-robustifying","title":"Imitation Is Not Enough: Robustifying Imitation with Reinforcement Learning for Challenging Driving Scenarios","date":"2022-12-21","arxiv_id":"2212.11419","repositories_listed":0,"syntology":null},{"url":null,"slug":"neighboring-state-based-rl-exploration","title":"Neighboring state-based RL Exploration","date":"2022-12-21","arxiv_id":"2212.10712","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-path-selection-in-software-defined","title":"Robust Path Selection in Software-defined WANs using Deep Reinforcement Learning","date":"2022-12-21","arxiv_id":"2212.11155","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-the-exploration-rate-for-value-of","title":"Adapting the Exploration Rate for Value-of-Information-Based Reinforcement Learning","date":"2022-12-20","arxiv_id":"2212.11083","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversar-adversarial-search-and-rescue-via","title":"AdverSAR: Adversarial Search and Rescue via Multi-Agent Reinforcement Learning","date":"2022-12-20","arxiv_id":"2212.10064","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandit-approach-to-conflict-free-multi-agent","title":"Bandit approach to conflict-free multi-agent Q-learning in view of photonic implementation","date":"2022-12-20","arxiv_id":"2212.09926","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-quantum-soft-actor-critic-for","title":"Variational Quantum Soft Actor-Critic for Robotic Arm Control","date":"2022-12-20","arxiv_id":"2212.11681","repositories_listed":0,"syntology":null},{"url":null,"slug":"dexterous-manipulation-from-images-autonomous","title":"Dexterous Manipulation from Images: Autonomous Real-World RL via Substep Guidance","date":"2022-12-19","arxiv_id":"2212.09902","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-for-text","title":"Inverse Reinforcement Learning for Text Summarization","date":"2022-12-19","arxiv_id":"2212.09917","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-policy-identification-in-active","title":"Near-optimal Policy Identification in Active Reinforcement Learning","date":"2022-12-19","arxiv_id":"2212.09510","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-policy-gradient-algorithms","title":"Quantum policy gradient algorithms","date":"2022-12-19","arxiv_id":"2212.09328","repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-lagrangian-chaos-with-multi-objective","title":"Taming Lagrangian Chaos with Multi-Objective Reinforcement Learning","date":"2022-12-19","arxiv_id":"2212.09612","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-coreference-resolution-based-on","title":"Neural Coreference Resolution based on Reinforcement Learning","date":"2022-12-18","arxiv_id":"2212.09028","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-with","title":"Risk-Sensitive Reinforcement Learning with Exponential Criteria","date":"2022-12-18","arxiv_id":"2212.09010","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-cyber-resilience-of-networked","title":"Enhancing Cyber Resilience of Networked Microgrids using Vertical Federated Reinforcement Learning","date":"2022-12-17","arxiv_id":"2212.08973","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-variable-representation-for","title":"Latent Variable Representation for Reinforcement Learning","date":"2022-12-17","arxiv_id":"2212.08765","repositories_listed":0,"syntology":null},{"url":null,"slug":"level-k-meta-learning-for-pedestrian-aware","title":"Cognitive Level-$k$ Meta-Learning for Safe and Pedestrian-Aware Autonomous Driving","date":"2022-12-17","arxiv_id":"2212.08800","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-trained-image-encoder-for-generalizable","title":"Pre-Trained Image Encoder for Generalizable Visual Reinforcement Learning","date":"2022-12-17","arxiv_id":"2212.08860","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-patrolling-with-battery","title":"An Energy-aware and Fault-tolerant Deep Reinforcement Learning based approach for Multi-agent Patrolling Problems","date":"2022-12-16","arxiv_id":"2212.08230","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-robot-reinforcement-learning-with","title":"Offline Robot Reinforcement Learning with Uncertainty-Guided Human Expert Sampling","date":"2022-12-16","arxiv_id":"2212.08232","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-agile-active","title":"Reinforcement Learning for Agile Active Target Sensing with a UAV","date":"2022-12-16","arxiv_id":"2212.08214","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-gap-between-offline-and-online","title":"Bridging the Gap Between Offline and Online Reinforcement Learning Evaluation Methodologies","date":"2022-12-15","arxiv_id":"2212.08131","repositories_listed":0,"syntology":null},{"url":null,"slug":"driver-assistance-eco-driving-and","title":"Driver Assistance Eco-driving and Transmission Control with Deep Reinforcement Learning","date":"2022-12-15","arxiv_id":"2212.07594","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-4","title":"Multi-Agent Reinforcement Learning with Shared Resources for Inventory Management","date":"2022-12-15","arxiv_id":"2212.07684","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-hardware-specific-automatic","title":"Towards Hardware-Specific Automatic Compression of Neural Networks","date":"2022-12-15","arxiv_id":"2212.07818","repositories_listed":0,"syntology":null},{"url":null,"slug":"ungeneralizable-contextual-logistic-bandit-in","title":"Reinforcement Learning in Credit Scoring and Underwriting","date":"2022-12-15","arxiv_id":"2212.07632","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-in-resource-restricted","title":"Efficient Exploration in Resource-Restricted Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.06988","repositories_listed":0,"syntology":null},{"url":null,"slug":"explaining-agent-s-decision-making-in-a","title":"Explaining Agent's Decision-making in a Hierarchical Reinforcement Learning Scenario","date":"2022-12-14","arxiv_id":"2212.06967","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-strategies-for-cooperative-multi","title":"Hierarchical Strategies for Cooperative Multi-Agent Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.07397","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-control-based-on-deep-reinforcement","title":"Quantum Control based on Deep Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.07385","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-system","title":"Reinforcement Learning in System Identification","date":"2022-12-14","arxiv_id":"2212.07123","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-correction-from-baseline-towards-the","title":"Safety Correction from Baseline: Towards the Risk-aware Policy in Robotics via Dual-agent Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.06998","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-off-policy-evaluation-in","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","date":"2022-12-13","arxiv_id":"2212.06355","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-in-reinforcement-1","title":"Improving generalization in reinforcement learning through forked agents","date":"2022-12-13","arxiv_id":"2212.06451","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-approach-to-fair-solar-pv","title":"Model-Free Approach to Fair Solar PV Curtailment Using Reinforcement Learning","date":"2022-12-13","arxiv_id":"2212.06542","repositories_listed":0,"syntology":null},{"url":null,"slug":"ppo-ue-proximal-policy-optimization-via","title":"PPO-UE: Proximal Policy Optimization via Uncertainty-Aware Exploration","date":"2022-12-13","arxiv_id":"2212.06343","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-sample-efficient-distributed","title":"Scalable and Sample Efficient Distributed Policy Gradient Algorithms in Multi-Agent Networked Systems","date":"2022-12-13","arxiv_id":"2212.06357","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-cell-training-on-architecture-search","title":"Single Cell Training on Architecture Search for Image Denoising","date":"2022-12-13","arxiv_id":"2212.06368","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-reinforcement-learning-security","title":"A Survey on Reinforcement Learning Security with Application to Autonomous Driving","date":"2022-12-12","arxiv_id":"2212.06123","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-model-free-reinforcement-learning","title":"Evaluating Model-free Reinforcement Learning toward Safety-critical Tasks","date":"2022-12-12","arxiv_id":"2212.05727","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-minimax-optimal-reinforcement-learning-2","title":"Nearly Minimax Optimal Reinforcement Learning for Linear Markov Decision Processes","date":"2022-12-12","arxiv_id":"2212.06132","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduced-conservative-policy","title":"Variance-Reduced Conservative Policy Iteration","date":"2022-12-12","arxiv_id":"2212.06283","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-through-the-lens-of-learning","title":"Generalization Through the Lens of Learning Dynamics","date":"2022-12-11","arxiv_id":"2212.05377","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-deep-reinforcement-learning-for-1","title":"Hierarchical Deep Reinforcement Learning for VWAP Strategy Optimization","date":"2022-12-11","arxiv_id":"2212.14670","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-deep-reinforcement-learning-1","title":"Off-Policy Deep Reinforcement Learning Algorithms for Handling Various Robotic Manipulator Tasks","date":"2022-12-11","arxiv_id":"2212.05572","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-modality-specific-representations","title":"Leveraging Modality-specific Representations for Audio-visual Speech Recognition via Reinforcement Learning","date":"2022-12-10","arxiv_id":"2212.05301","repositories_listed":0,"syntology":null},{"url":null,"slug":"relate-to-predict-towards-task-independent","title":"Relate to Predict: Towards Task-Independent Knowledge Representations for Reinforcement Learning","date":"2022-12-10","arxiv_id":"2212.05298","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-differentially-private","title":"Near-Optimal Differentially Private Reinforcement Learning","date":"2022-12-09","arxiv_id":"2212.04680","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-predicting-traffic","title":"Reinforcement Learning for Predicting Traffic Accidents","date":"2022-12-09","arxiv_id":"2212.04677","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-stochastic-gradient-descent-algorithm","title":"A Novel Stochastic Gradient Descent Algorithm for Learning Principal Subspaces","date":"2022-12-08","arxiv_id":"2212.04025","repositories_listed":0,"syntology":null},{"url":null,"slug":"confidence-conditioned-value-functions-for","title":"Confidence-Conditioned Value Functions for Offline Reinforcement Learning","date":"2022-12-08","arxiv_id":"2212.04607","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-and-planning-of-flexible-mobile-micro","title":"Design and Planning of Flexible Mobile Micro-Grids Using Deep Reinforcement Learning","date":"2022-12-08","arxiv_id":"2212.04136","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-resilient-power","title":"Reinforcement Learning for Resilient Power Grids","date":"2022-12-08","arxiv_id":"2212.04069","repositories_listed":0,"syntology":null},{"url":null,"slug":"system-design-for-an-integrated-lifelong","title":"System Design for an Integrated Lifelong Reinforcement Learning Agent for Real-Time Strategy Games","date":"2022-12-08","arxiv_id":"2212.04603","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-self-imitation-learning-from","title":"Accelerating Self-Imitation Learning from Demonstrations via Policy Constraints and Q-Ensemble","date":"2022-12-07","arxiv_id":"2212.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-learned-simulation-environment-to-model","title":"A Learned Simulation Environment to Model Plant Growth in Indoor Farming","date":"2022-12-06","arxiv_id":"2212.03155","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-deep-reinforcement-learning-based-1","title":"A Novel Deep Reinforcement Learning Based Automated Stock Trading System Using Cascaded LSTM Networks","date":"2022-12-06","arxiv_id":"2212.02721","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-learning-of-voltage-control","title":"Efficient Learning of Voltage Control Strategies via Model-based Deep Reinforcement Learning","date":"2022-12-06","arxiv_id":"2212.02715","repositories_listed":0,"syntology":null}],"record_sha256":"72fff06175bfb1d96475447ee3e55bd32589e2c7e5ff8df3f55fcc6b45071542","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}