{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/83","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":83,"pages_in_order":135,"rows_per_page":100,"rows":[8201,8300],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/82","next":"/task/reinforcement-learning-2/papers/84","papers":[{"url":null,"slug":"deep-binary-reinforcement-learning-for","title":"Deep Binary Reinforcement Learning for Scalable Verification","date":"2022-03-11","arxiv_id":"2203.05704","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-networks-for-relational","title":"Graph Neural Networks for Relational Inductive Bias in Vision-based Deep Reinforcement Learning of Robot Control","date":"2022-03-11","arxiv_id":"2203.05985","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-offline-reinforcement-learning-2","title":"Near-optimal Offline Reinforcement Learning with Linear Representation: Leveraging Variance Information with Pessimism","date":"2022-03-11","arxiv_id":"2203.05804","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-linear-quadratic","title":"Reinforcement Learning for Linear Quadratic Control is Vulnerable Under Cost Manipulation","date":"2022-03-11","arxiv_id":"2203.05774","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-ensemble-reinforcement-learning-for","title":"Random Ensemble Reinforcement Learning for Traffic Signal Control","date":"2022-03-10","arxiv_id":"2203.05961","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-factorized-optical-flows-as","title":"Investigation of Factorized Optical Flows as Mid-Level Representations","date":"2022-03-09","arxiv_id":"2203.04927","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-robot-cooperative-pursuit-via-potential","title":"Multi-robot Cooperative Pursuit via Potential Field-Enhanced Reinforcement Learning","date":"2022-03-09","arxiv_id":"2203.04700","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-sharp-characterization-of-linear-estimators","title":"A Complete Characterization of Linear Estimators for Offline Policy Evaluation","date":"2022-03-08","arxiv_id":"2203.04236","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-control-using-reinforcement","title":"Distributed Control using Reinforcement Learning with Temporal-Logic-Based Reward Shaping","date":"2022-03-08","arxiv_id":"2203.04172","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-reinforcement-learning-for-predictive","title":"Designing Heterogeneous GNNs with Desired Permutation Properties for Wireless Resource Allocation","date":"2022-03-08","arxiv_id":"2203.03906","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-broad-reinforcement-learning-for","title":"Multi-Agent Broad Reinforcement Learning for Intelligent Traffic Light Control","date":"2022-03-08","arxiv_id":"2203.04310","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-based-bayesian-experimental-design-for","title":"Policy-Based Bayesian Experimental Design for Non-Differentiable Implicit Models","date":"2022-03-08","arxiv_id":"2203.04272","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-moocs-concept-recommendation-in","title":"Reinforced MOOCs Concept Recommendation in Heterogeneous Information Networks","date":"2022-03-08","arxiv_id":"2203.11011","repositories_listed":0,"syntology":null},{"url":null,"slug":"renyi-state-entropy-for-exploration","title":"Rényi State Entropy for Exploration Acceleration in Reinforcement Learning","date":"2022-03-08","arxiv_id":"2203.04297","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-reinforcement-learning-methods-in","title":"A Survey on Reinforcement Learning Methods in Character Animation","date":"2022-03-07","arxiv_id":"2203.04735","repositories_listed":0,"syntology":null},{"url":null,"slug":"cascaded-gaps-towards-gap-dependent-regret","title":"Cascaded Gaps: Towards Gap-Dependent Regret for Risk-Sensitive Reinforcement Learning","date":"2022-03-07","arxiv_id":"2203.03110","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-cooperation-strategy-generation-in","title":"Efficient Policy Generation in Multi-Agent Systems via Hypergraph Neural Network","date":"2022-03-07","arxiv_id":"2203.03265","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-and-data-efficient-reinforcement","title":"Fast and Data Efficient Reinforcement Learning from Pixels via Non-Parametric Value Approximation","date":"2022-03-07","arxiv_id":"2203.03078","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-networks-for-image","title":"Graph Neural Networks for Image Classification and Reinforcement Learning using Graph representations","date":"2022-03-07","arxiv_id":"2203.03457","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-in-deep-reinforcement","title":"Knowledge Transfer in Deep Reinforcement Learning for Slice-Aware Mobility Robustness Optimization","date":"2022-03-07","arxiv_id":"2203.03227","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-to-match-with-no-regret-reinforcement","title":"Learn to Match with No Regret: Reinforcement Learning in Markov Matching Markets","date":"2022-03-07","arxiv_id":"2203.03684","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-location-aware","title":"Reinforcement Learning for Location-Aware Scheduling","date":"2022-03-07","arxiv_id":"2203.03480","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-reinforcement-learning-1","title":"Scalable multi-agent reinforcement learning for distributed control of residential energy flexibility","date":"2022-03-07","arxiv_id":"2203.03417","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchically-structured-scheduling-and","title":"Hierarchically Structured Scheduling and Execution of Tasks in a Multi-Agent Environment","date":"2022-03-06","arxiv_id":"2203.03021","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-reward-gradients-for-reinforcement","title":"Leveraging Reward Gradients For Reinforcement Learning in Differentiable Physics Simulations","date":"2022-03-06","arxiv_id":"2203.02857","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-deep-reinforcement-learning-for","title":"Offline Deep Reinforcement Learning for Dynamic Pricing of Consumer Credit","date":"2022-03-06","arxiv_id":"2203.03003","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-reasoning-graph-for-multi-agent","title":"Recursive Reasoning Graph for Multi-Agent Reinforcement Learning","date":"2022-03-06","arxiv_id":"2203.02844","repositories_listed":0,"syntology":null},{"url":null,"slug":"watch-from-sky-machine-learning-based-multi","title":"Watch from sky: machine-learning-based multi-UAV network for predictive police surveillance","date":"2022-03-06","arxiv_id":"2203.02892","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-for-legged","title":"Safe Reinforcement Learning for Legged Locomotion","date":"2022-03-05","arxiv_id":"2203.02638","repositories_listed":0,"syntology":null},{"url":null,"slug":"target-network-and-truncation-overcome-the","title":"Target Network and Truncation Overcome The Deadly Triad in $Q$-Learning","date":"2022-03-05","arxiv_id":"2203.02628","repositories_listed":0,"syntology":null},{"url":null,"slug":"cloud-edge-training-architecture-for-sim-to","title":"Cloud-Edge Training Architecture for Sim-to-Real Deep Reinforcement Learning","date":"2022-03-04","arxiv_id":"2203.02230","repositories_listed":0,"syntology":null},{"url":null,"slug":"grasparl-dynamic-grasping-via-adversarial","title":"GraspARL: Dynamic Grasping via Adversarial Reinforcement Learning","date":"2022-03-04","arxiv_id":"2203.02119","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-modern","title":"Reinforcement Learning in Modern Biostatistics: Constructing Optimal Adaptive Interventions","date":"2022-03-04","arxiv_id":"2203.02605","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilateral-deep-reinforcement-learning","title":"Bilateral Deep Reinforcement Learning Approach for Better-than-human Car Following Model","date":"2022-03-03","arxiv_id":"2203.04749","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsically-motivated-reinforcement-1","title":"Intrinsically-Motivated Reinforcement Learning: A Brief Introduction","date":"2022-03-03","arxiv_id":"2203.02298","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-reinforcement-learning-via-policy","title":"Quantum Reinforcement Learning via Policy Iteration","date":"2022-03-03","arxiv_id":"2203.01889","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-best-of-both-worlds-reinforcement","title":"The Best of Both Worlds: Reinforcement Learning with Logarithmic Regret and Policy Switches","date":"2022-03-03","arxiv_id":"2203.01491","repositories_listed":0,"syntology":null},{"url":null,"slug":"follow-your-nose-using-general-value","title":"Follow your Nose: Using General Value Functions for Directed Exploration in Reinforcement Learning","date":"2022-03-02","arxiv_id":"2203.00874","repositories_listed":0,"syntology":null},{"url":null,"slug":"reliable-validation-of-reinforcement-learning","title":"Reliable validation of Reinforcement Learning Benchmarks","date":"2022-03-02","arxiv_id":"2203.01075","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-theory-of-abstraction-in-reinforcement","title":"A Theory of Abstraction in Reinforcement Learning","date":"2022-03-01","arxiv_id":"2203.00397","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximating-a-deep-reinforcement-learning","title":"Approximating a deep reinforcement learning docking agent using linear model trees","date":"2022-03-01","arxiv_id":"2203.00369","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reinforcement-learning-for-5","title":"Distributional Reinforcement Learning for Scheduling of Chemical Production Processes","date":"2022-03-01","arxiv_id":"2203.00636","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamingv2-reinforcement-learning-with","title":"DreamingV2: Reinforcement Learning with Discrete World Models without Reconstruction","date":"2022-03-01","arxiv_id":"2203.00494","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimistic-q-learning-for-offline","title":"Pessimistic Q-Learning for Offline Reinforcement Learning: Towards Optimal Sample Complexity","date":"2022-02-28","arxiv_id":"2202.13890","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-disentangled-representation","title":"Weakly Supervised Disentangled Representation for Goal-conditioned Reinforcement Learning","date":"2022-02-28","arxiv_id":"2202.13624","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-progressive-hedging-enforcing","title":"Neural-Progressive Hedging: Enforcing Constraints in Reinforcement Learning with Stochastic Programming","date":"2022-02-27","arxiv_id":"2202.13436","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scalable-graph-theoretic-distributed","title":"Distributed Multi-Agent Reinforcement Learning Based on Graph-Induced Local Value Functions","date":"2022-02-26","arxiv_id":"2202.13046","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-knowledge-based-automated-analog","title":"Domain Knowledge-Based Automated Analog Circuit Design with Deep Reinforcement Learning","date":"2022-02-26","arxiv_id":"2202.13185","repositories_listed":0,"syntology":null},{"url":null,"slug":"consolidated-adaptive-t-soft-update-for-deep","title":"Consolidated Adaptive T-soft Update for Deep Reinforcement Learning","date":"2022-02-25","arxiv_id":"2202.12504","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-hierarchy-inverse-reinforcement","title":"Context-Hierarchy Inverse Reinforcement Learning","date":"2022-02-25","arxiv_id":"2202.12597","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamic-mechanisms-in-unknown","title":"Learning Dynamic Mechanisms in Unknown Environments: A Reinforcement Learning Approach","date":"2022-02-25","arxiv_id":"2202.12797","repositories_listed":0,"syntology":null},{"url":null,"slug":"reachability-analysis-in-stochastic-directed","title":"Reachability analysis in stochastic directed graphs by reinforcement learning","date":"2022-02-25","arxiv_id":"2202.12546","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-to-learn-reinforcement-learning","title":"Evolving-to-Learn Reinforcement Learning Tasks with Spiking Neural Networks","date":"2022-02-24","arxiv_id":"2202.12322","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistent-dropout-for-policy-gradient","title":"Consistent Dropout for Policy Gradient Reinforcement Learning","date":"2022-02-23","arxiv_id":"2202.11818","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-opportunities-and","title":"Reinforcement Learning in Practice: Opportunities and Challenges","date":"2022-02-23","arxiv_id":"2202.11296","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-relative-return-policies-with-upside","title":"Learning Relative Return Policies With Upside-Down Reinforcement Learning","date":"2022-02-23","arxiv_id":"2202.12742","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-demonstrations-by","title":"Reinforcement Learning from Demonstrations by Novel Interactive Expert and Application to Automatic Berthing Control Systems for Unmanned Surface Vessel","date":"2022-02-23","arxiv_id":"2202.11325","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-characteristic-functions-with","title":"Training Characteristic Functions with Reinforcement Learning: XAI-methods play Connect Four","date":"2022-02-23","arxiv_id":"2202.11797","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-gradient-ascent-methods-for","title":"A policy gradient approach for optimization of smooth risk measures","date":"2022-02-22","arxiv_id":"2202.11046","repositories_listed":0,"syntology":null},{"url":null,"slug":"behaviour-diverse-automatic-penetration","title":"Behaviour-Diverse Automatic Penetration Testing: A Curiosity-Driven Multi-Objective Deep Reinforcement Learning Approach","date":"2022-02-22","arxiv_id":"2202.10630","repositories_listed":0,"syntology":null},{"url":null,"slug":"behaviour-neutral-smart-charging-of-plugin","title":"Behaviour-neutral Smart Charging of Plugin Electric Vehicles: Reinforcement learning approach","date":"2022-02-22","arxiv_id":"2202.10823","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-auxiliary-task-learning-1","title":"Continual Auxiliary Task Learning","date":"2022-02-22","arxiv_id":"2202.11133","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-fidelity-reinforcement-learning","title":"Multi-fidelity reinforcement learning framework for shape optimization","date":"2022-02-22","arxiv_id":"2202.11170","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-free-policy-space-compression-for-1","title":"Reward-Free Policy Space Compression for Reinforcement Learning","date":"2022-02-22","arxiv_id":"2202.11079","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-information-design-markov","title":"Sequential Information Design: Markov Persuasion Process and Its Efficient Reinforcement Learning","date":"2022-02-22","arxiv_id":"2202.10678","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-primal-dual-methods-for","title":"Accelerating Primal-dual Methods for Regularized Markov Decision Processes","date":"2022-02-21","arxiv_id":"2202.10506","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-warehouse-robot-using-deep-q","title":"Autonomous Warehouse Robot using Deep Q-Learning","date":"2022-02-21","arxiv_id":"2202.10019","repositories_listed":0,"syntology":null},{"url":null,"slug":"ccpt-automatic-gameplay-testing-and","title":"CCPT: Automatic Gameplay Testing and Validation with Curiosity-Conditioned Proximal Trajectories","date":"2022-02-21","arxiv_id":"2202.10057","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-learning-for-orchestrating-deep","title":"Hybrid Learning for Orchestrating Deep Learning Inference in Multi-user Edge-cloud Networks","date":"2022-02-21","arxiv_id":"2202.11098","repositories_listed":0,"syntology":null},{"url":null,"slug":"rule-mining-over-knowledge-graphs-via","title":"Rule Mining over Knowledge Graphs via Reinforcement Learning","date":"2022-02-21","arxiv_id":"2202.10381","repositories_listed":0,"syntology":null},{"url":null,"slug":"pool-pheromone-inspired-communication","title":"PooL: Pheromone-inspired Communication Framework forLarge Scale Multi-Agent Reinforcement Learning","date":"2022-02-20","arxiv_id":"2202.09722","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-credit-assignment","title":"Selective Credit Assignment","date":"2022-02-20","arxiv_id":"2202.09699","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-regularized-implicit-policy-for-offline","title":"A Behavior Regularized Implicit Policy for Offline Reinforcement Learning","date":"2022-02-19","arxiv_id":"2202.09673","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-safe-reinforcement-learning-for","title":"Multi-task Safe Reinforcement Learning for Navigating Intersections in Dense Traffic","date":"2022-02-19","arxiv_id":"2202.09644","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-as-a","title":"Robust Reinforcement Learning as a Stackelberg Game via Adaptively-Regularized Adversarial Training","date":"2022-02-19","arxiv_id":"2202.09514","repositories_listed":0,"syntology":null},{"url":"/paper/transdreamer-reinforcement-learning-with-1","slug":"transdreamer-reinforcement-learning-with-1","title":"TransDreamer: Reinforcement Learning with Transformer World Models","date":"2022-02-19","arxiv_id":"2202.09481","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/transdreamer-reinforcement-learning-with-1#ran","syntology_url":"https://syntology.ai/paper/2202.09481","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2202.09481"}},"official":null}},{"url":null,"slug":"transformation-coding-simple-objectives-for","title":"Transformation Coding: Simple Objectives for Equivariant Representations","date":"2022-02-19","arxiv_id":"2202.10930","repositories_listed":0,"syntology":null},{"url":null,"slug":"who-are-the-best-adopters-user-selection","title":"Who Are the Best Adopters? User Selection Model for Free Trial Item Promotion","date":"2022-02-19","arxiv_id":"2202.09508","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-interpretable-reinforcement-learning","title":"Can Interpretable Reinforcement Learning Manage Prosperity Your Way?","date":"2022-02-18","arxiv_id":"2202.09064","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-explainable-reinforcement","title":"A Survey of Explainable Reinforcement Learning","date":"2022-02-17","arxiv_id":"2202.08434","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-deep-reinforcement-learning-based","title":"A Survey on Deep Reinforcement Learning-based Approaches for Adaptation and Generalization","date":"2022-02-17","arxiv_id":"2202.08444","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-learning-of-safe-driving-policy-via-1","title":"Efficient Learning of Safe Driving Policy via Human-AI Copilot Optimization","date":"2022-02-17","arxiv_id":"2202.10341","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-augmented-reinforcement-learning-1","title":"Retrieval-Augmented Reinforcement Learning","date":"2022-02-17","arxiv_id":"2202.08417","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-via-genetic","title":"Robust Reinforcement Learning via Genetic Curriculum","date":"2022-02-17","arxiv_id":"2202.08393","repositories_listed":0,"syntology":null},{"url":null,"slug":"branching-reinforcement-learning","title":"Branching Reinforcement Learning","date":"2022-02-16","arxiv_id":"2202.07995","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptive-fake-news-detection-via","title":"Domain Adaptive Fake News Detection via Reinforcement Learning","date":"2022-02-16","arxiv_id":"2202.08159","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-a-variance-reduction-correction-of-the","title":"Temporal Difference Learning with Continuous Time and State in the Stochastic Setting","date":"2022-02-16","arxiv_id":"2202.07960","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-multi","title":"Deep Reinforcement Learning Based Multi-Access Edge Computing Schedule for Internet of Vehicle","date":"2022-02-15","arxiv_id":"2202.08972","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-reinforcement-learning-with-2","title":"Interpretable Reinforcement Learning with Multilevel Subgoal Discovery","date":"2022-02-15","arxiv_id":"2202.07414","repositories_listed":0,"syntology":null},{"url":null,"slug":"l2c2-locally-lipschitz-continuous-constraint","title":"L2C2: Locally Lipschitz Continuous Constraint towards Stable and Smooth Reinforcement Learning","date":"2022-02-15","arxiv_id":"2202.07152","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-mitigate-ai-collusion-on-economic","title":"Learning to Mitigate AI Collusion on Economic Platforms","date":"2022-02-15","arxiv_id":"2202.07106","repositories_listed":0,"syntology":null},{"url":null,"slug":"user-oriented-robust-reinforcement-learning","title":"User-Oriented Robust Reinforcement Learning","date":"2022-02-15","arxiv_id":"2202.07301","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-causal-model-based","title":"Provably Efficient Causal Model-Based Reinforcement Learning for Systematic Generalization","date":"2022-02-14","arxiv_id":"2202.06545","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-presence-of-1","title":"Reinforcement Learning in Presence of Discrete Markovian Context Evolution","date":"2022-02-14","arxiv_id":"2202.06557","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-bayesian-experimental-designs-via","title":"Sequential Bayesian experimental designs via reinforcement learning","date":"2022-02-14","arxiv_id":"2202.07472","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-inference-after-adaptive-sampling","title":"Statistical Inference After Adaptive Sampling for Longitudinal Data","date":"2022-02-14","arxiv_id":"2202.07098","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-deployment-efficient-reinforcement-1","title":"Towards Deployment-Efficient Reinforcement Learning: Lower Bound and Optimality","date":"2022-02-14","arxiv_id":"2202.06450","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-drone-swarm-navigation-and-multi","title":"Autonomous Drone Swarm Navigation and Multi-target Tracking in 3D Environments with Dynamic Obstacles","date":"2022-02-13","arxiv_id":"2202.06253","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-and-convex-mean","title":"Deep Reinforcement Learning and Convex Mean-Variance Optimisation for Portfolio Management","date":"2022-02-13","arxiv_id":"2203.11318","repositories_listed":0,"syntology":null},{"url":null,"slug":"individual-level-inverse-reinforcement","title":"Individual-Level Inverse Reinforcement Learning for Mean Field Games","date":"2022-02-13","arxiv_id":"2202.06401","repositories_listed":0,"syntology":null}],"record_sha256":"abab962fab8f99d8fca60c9e215d42a6123d2abb7c19254a140401698d126443","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}