{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/76","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":76,"pages_in_order":132,"rows_per_page":100,"rows":[7501,7600],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/75","next":"/task/reinforcement-learning/papers/77","papers":[{"url":null,"slug":"distributional-reinforcement-learning-for-5","title":"Distributional Reinforcement Learning for Scheduling of Chemical Production Processes","date":"2022-03-01","arxiv_id":"2203.00636","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamingv2-reinforcement-learning-with","title":"DreamingV2: Reinforcement Learning with Discrete World Models without Reconstruction","date":"2022-03-01","arxiv_id":"2203.00494","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-disentangled-representation","title":"Weakly Supervised Disentangled Representation for Goal-conditioned Reinforcement Learning","date":"2022-02-28","arxiv_id":"2202.13624","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scalable-graph-theoretic-distributed","title":"Distributed Multi-Agent Reinforcement Learning Based on Graph-Induced Local Value Functions","date":"2022-02-26","arxiv_id":"2202.13046","repositories_listed":0,"syntology":null},{"url":null,"slug":"consolidated-adaptive-t-soft-update-for-deep","title":"Consolidated Adaptive T-soft Update for Deep Reinforcement Learning","date":"2022-02-25","arxiv_id":"2202.12504","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-hierarchy-inverse-reinforcement","title":"Context-Hierarchy Inverse Reinforcement Learning","date":"2022-02-25","arxiv_id":"2202.12597","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamic-mechanisms-in-unknown","title":"Learning Dynamic Mechanisms in Unknown Environments: A Reinforcement Learning Approach","date":"2022-02-25","arxiv_id":"2202.12797","repositories_listed":0,"syntology":null},{"url":null,"slug":"reachability-analysis-in-stochastic-directed","title":"Reachability analysis in stochastic directed graphs by reinforcement learning","date":"2022-02-25","arxiv_id":"2202.12546","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-to-learn-reinforcement-learning","title":"Evolving-to-Learn Reinforcement Learning Tasks with Spiking Neural Networks","date":"2022-02-24","arxiv_id":"2202.12322","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistent-dropout-for-policy-gradient","title":"Consistent Dropout for Policy Gradient Reinforcement Learning","date":"2022-02-23","arxiv_id":"2202.11818","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-opportunities-and","title":"Reinforcement Learning in Practice: Opportunities and Challenges","date":"2022-02-23","arxiv_id":"2202.11296","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-relative-return-policies-with-upside","title":"Learning Relative Return Policies With Upside-Down Reinforcement Learning","date":"2022-02-23","arxiv_id":"2202.12742","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-demonstrations-by","title":"Reinforcement Learning from Demonstrations by Novel Interactive Expert and Application to Automatic Berthing Control Systems for Unmanned Surface Vessel","date":"2022-02-23","arxiv_id":"2202.11325","repositories_listed":0,"syntology":null},{"url":null,"slug":"behaviour-diverse-automatic-penetration","title":"Behaviour-Diverse Automatic Penetration Testing: A Curiosity-Driven Multi-Objective Deep Reinforcement Learning Approach","date":"2022-02-22","arxiv_id":"2202.10630","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-auxiliary-task-learning-1","title":"Continual Auxiliary Task Learning","date":"2022-02-22","arxiv_id":"2202.11133","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-fidelity-reinforcement-learning","title":"Multi-fidelity reinforcement learning framework for shape optimization","date":"2022-02-22","arxiv_id":"2202.11170","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-free-policy-space-compression-for-1","title":"Reward-Free Policy Space Compression for Reinforcement Learning","date":"2022-02-22","arxiv_id":"2202.11079","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-warehouse-robot-using-deep-q","title":"Autonomous Warehouse Robot using Deep Q-Learning","date":"2022-02-21","arxiv_id":"2202.10019","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-learning-for-orchestrating-deep","title":"Hybrid Learning for Orchestrating Deep Learning Inference in Multi-user Edge-cloud Networks","date":"2022-02-21","arxiv_id":"2202.11098","repositories_listed":0,"syntology":null},{"url":null,"slug":"rule-mining-over-knowledge-graphs-via","title":"Rule Mining over Knowledge Graphs via Reinforcement Learning","date":"2022-02-21","arxiv_id":"2202.10381","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-regularized-implicit-policy-for-offline","title":"A Behavior Regularized Implicit Policy for Offline Reinforcement Learning","date":"2022-02-19","arxiv_id":"2202.09673","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-safe-reinforcement-learning-for","title":"Multi-task Safe Reinforcement Learning for Navigating Intersections in Dense Traffic","date":"2022-02-19","arxiv_id":"2202.09644","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-as-a","title":"Robust Reinforcement Learning as a Stackelberg Game via Adaptively-Regularized Adversarial Training","date":"2022-02-19","arxiv_id":"2202.09514","repositories_listed":0,"syntology":null},{"url":"/paper/transdreamer-reinforcement-learning-with-1","slug":"transdreamer-reinforcement-learning-with-1","title":"TransDreamer: Reinforcement Learning with Transformer World Models","date":"2022-02-19","arxiv_id":"2202.09481","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/transdreamer-reinforcement-learning-with-1#ran","syntology_url":"https://syntology.ai/paper/2202.09481","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2202.09481"}},"official":null}},{"url":null,"slug":"who-are-the-best-adopters-user-selection","title":"Who Are the Best Adopters? User Selection Model for Free Trial Item Promotion","date":"2022-02-19","arxiv_id":"2202.09508","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-interpretable-reinforcement-learning","title":"Can Interpretable Reinforcement Learning Manage Prosperity Your Way?","date":"2022-02-18","arxiv_id":"2202.09064","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-explainable-reinforcement","title":"A Survey of Explainable Reinforcement Learning","date":"2022-02-17","arxiv_id":"2202.08434","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-learning-of-safe-driving-policy-via-1","title":"Efficient Learning of Safe Driving Policy via Human-AI Copilot Optimization","date":"2022-02-17","arxiv_id":"2202.10341","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-augmented-reinforcement-learning-1","title":"Retrieval-Augmented Reinforcement Learning","date":"2022-02-17","arxiv_id":"2202.08417","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-via-genetic","title":"Robust Reinforcement Learning via Genetic Curriculum","date":"2022-02-17","arxiv_id":"2202.08393","repositories_listed":0,"syntology":null},{"url":null,"slug":"branching-reinforcement-learning","title":"Branching Reinforcement Learning","date":"2022-02-16","arxiv_id":"2202.07995","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptive-fake-news-detection-via","title":"Domain Adaptive Fake News Detection via Reinforcement Learning","date":"2022-02-16","arxiv_id":"2202.08159","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-reinforcement-learning-with-2","title":"Interpretable Reinforcement Learning with Multilevel Subgoal Discovery","date":"2022-02-15","arxiv_id":"2202.07414","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-mitigate-ai-collusion-on-economic","title":"Learning to Mitigate AI Collusion on Economic Platforms","date":"2022-02-15","arxiv_id":"2202.07106","repositories_listed":0,"syntology":null},{"url":null,"slug":"user-oriented-robust-reinforcement-learning","title":"User-Oriented Robust Reinforcement Learning","date":"2022-02-15","arxiv_id":"2202.07301","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-causal-model-based","title":"Provably Efficient Causal Model-Based Reinforcement Learning for Systematic Generalization","date":"2022-02-14","arxiv_id":"2202.06545","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-presence-of-1","title":"Reinforcement Learning in Presence of Discrete Markovian Context Evolution","date":"2022-02-14","arxiv_id":"2202.06557","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-bayesian-experimental-designs-via","title":"Sequential Bayesian experimental designs via reinforcement learning","date":"2022-02-14","arxiv_id":"2202.07472","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-inference-after-adaptive-sampling","title":"Statistical Inference After Adaptive Sampling for Longitudinal Data","date":"2022-02-14","arxiv_id":"2202.07098","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-deployment-efficient-reinforcement-1","title":"Towards Deployment-Efficient Reinforcement Learning: Lower Bound and Optimality","date":"2022-02-14","arxiv_id":"2202.06450","repositories_listed":0,"syntology":null},{"url":null,"slug":"individual-level-inverse-reinforcement","title":"Individual-Level Inverse Reinforcement Learning for Mean Field Games","date":"2022-02-13","arxiv_id":"2202.06401","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-with-3","title":"Sample-Efficient Reinforcement Learning with loglog(T) Switching Cost","date":"2022-02-13","arxiv_id":"2202.06385","repositories_listed":0,"syntology":null},{"url":null,"slug":"computational-statistical-gaps-in","title":"Computational-Statistical Gaps in Reinforcement Learning","date":"2022-02-11","arxiv_id":"2202.05444","repositories_listed":0,"syntology":null},{"url":null,"slug":"rate-matching-the-regret-lower-bound-in-the","title":"Rate-matching the regret lower-bound in the linear quadratic regulator with unknown dynamics","date":"2022-02-11","arxiv_id":"2202.05799","repositories_listed":0,"syntology":null},{"url":null,"slug":"abstraction-for-deep-reinforcement-learning","title":"Abstraction for Deep Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.05839","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-based-robust-resource-allocation-in-end-to","title":"AI-based Robust Resource Allocation in End-to-End Network Slicing under Demand and CSI Uncertainties","date":"2022-02-10","arxiv_id":"2202.05131","repositories_listed":0,"syntology":null},{"url":null,"slug":"dda3c-cooperative-distributed-deep","title":"Group-Agent Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.05135","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-pipelines-with-evolutionarily","title":"Interpretable pipelines with evolutionarily optimized modules for RL tasks with visual inputs","date":"2022-02-10","arxiv_id":"2202.04943","repositories_listed":0,"syntology":null},{"url":null,"slug":"safer-data-efficient-and-safe-reinforcement-1","title":"SAFER: Data-Efficient and Safe Reinforcement Learning via Skill Acquisition","date":"2022-02-10","arxiv_id":"2202.04849","repositories_listed":0,"syntology":null},{"url":null,"slug":"settling-the-communication-complexity-for","title":"Settling the Communication Complexity for Distributed Offline Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.04862","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-2","title":"Offline Reinforcement Learning with Realizability and Single-policy Concentrability","date":"2022-02-09","arxiv_id":"2202.04634","repositories_listed":0,"syntology":null},{"url":null,"slug":"scenario-assisted-deep-reinforcement-learning","title":"Scenario-Assisted Deep Reinforcement Learning","date":"2022-02-09","arxiv_id":"2202.04337","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdoor-detection-in-reinforcement-learning","title":"PolicyCleanse: Backdoor Detection and Mitigation in Reinforcement Learning","date":"2022-02-08","arxiv_id":"2202.03609","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-explanations-for-reinforcement-learning","title":"Local Explanations for Reinforcement Learning","date":"2022-02-08","arxiv_id":"2202.03597","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-reinforcement-learning-with-a-short","title":"Provable Reinforcement Learning with a Short-Term Memory","date":"2022-02-08","arxiv_id":"2202.03983","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-offline-meta-reinforcement-1","title":"Model-Based Offline Meta-Reinforcement Learning with Regularization","date":"2022-02-07","arxiv_id":"2202.02929","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-for-stochastic-shortest","title":"Policy Optimization for Stochastic Shortest Path","date":"2022-02-07","arxiv_id":"2202.03334","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-respecting-subtasks-for-model-based","title":"Reward-Respecting Subtasks for Model-Based Reinforcement Learning","date":"2022-02-07","arxiv_id":"2202.03466","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-with-multi-sample-target-values","title":"Exploration with Multi-Sample Target Values for Distributional Reinforcement Learning","date":"2022-02-06","arxiv_id":"2202.02693","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-gradient-descent-with-dependent","title":"Stochastic Gradient Descent with Dependent Data for Offline Reinforcement Learning","date":"2022-02-06","arxiv_id":"2202.02850","repositories_listed":0,"syntology":null},{"url":null,"slug":"asha-assistive-teleoperation-via-human-in-the","title":"ASHA: Assistive Teleoperation via Human-in-the-Loop Reinforcement Learning","date":"2022-02-05","arxiv_id":"2202.02465","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-discourse-on-metods-meta-optimized","title":"Meta-Reinforcement Learning with Self-Modifying Networks","date":"2022-02-04","arxiv_id":"2202.02363","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-for-3","title":"Model-Free Reinforcement Learning for Symbolic Automata-encoded Objectives","date":"2022-02-04","arxiv_id":"2202.02404","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-mobile","title":"Offline Reinforcement Learning for Mobile Notifications","date":"2022-02-04","arxiv_id":"2202.03867","repositories_listed":0,"syntology":null},{"url":"/paper/video-violence-recognition-and-localization","slug":"video-violence-recognition-and-localization","title":"Video Violence Recognition and Localization Using a Semi-Supervised Hard Attention Model","date":"2022-02-04","arxiv_id":"2202.02212","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenging-common-assumptions-in-convex","title":"Challenging Common Assumptions in Convex Reinforcement Learning","date":"2022-02-03","arxiv_id":"2202.01511","repositories_listed":0,"syntology":null},{"url":null,"slug":"financial-vision-based-reinforcement-learning","title":"Financial Vision Based Reinforcement Learning Trading Strategy","date":"2022-02-03","arxiv_id":"2202.04115","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-leverage-unlabeled-data-in-offline","title":"How to Leverage Unlabeled Data in Offline Reinforcement Learning","date":"2022-02-03","arxiv_id":"2202.01741","repositories_listed":0,"syntology":null},{"url":null,"slug":"network-resource-allocation-strategy-based-on","title":"Network Resource Allocation Strategy Based on Deep Reinforcement Learning","date":"2022-02-03","arxiv_id":"2202.03193","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-discrete-communication-bottlenecks","title":"Adaptive Discrete Communication Bottlenecks with Dynamic Vector Quantization","date":"2022-02-02","arxiv_id":"2202.01334","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-reinforcement-learning-for","title":"Federated Reinforcement Learning for Collective Navigation of Robotic Swarms","date":"2022-02-02","arxiv_id":"2202.01141","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-in-reinforcement-learning-via-regret","title":"Transfer in Reinforcement Learning via Regret Bounds for Learning Agents","date":"2022-02-02","arxiv_id":"2202.01182","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-sample-efficiency-of-value-based","title":"Improving Sample Efficiency of Value Based Models Using Attention and Vision Transformers","date":"2022-02-01","arxiv_id":"2202.00710","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-optimal-active","title":"Reinforcement learning of optimal active particle navigation","date":"2022-02-01","arxiv_id":"2202.00812","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-fragment-based-3d-molecular-design","title":"Scalable Fragment-Based 3D Molecular Design with Reinforcement Learning","date":"2022-02-01","arxiv_id":"2202.00658","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-search-with-off-policy","title":"Sequential Search with Off-Policy Reinforcement Learning","date":"2022-02-01","arxiv_id":"2202.00245","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-multi-object-reinforcement","title":"Compositional Multi-Object Reinforcement Learning with Linear Relation Networks","date":"2022-01-31","arxiv_id":"2201.13388","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-solutions-of-the-distributional-bellman","title":"On solutions of the distributional Bellman equation","date":"2022-01-31","arxiv_id":"2202.00081","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-heterogeneous","title":"Reinforcement Learning with Heterogeneous Data: Estimation and Inference","date":"2022-01-31","arxiv_id":"2202.00088","repositories_listed":0,"syntology":null},{"url":null,"slug":"warmth-and-competence-in-human-agent","title":"Warmth and competence in human-agent cooperation","date":"2022-01-31","arxiv_id":"2201.13448","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-consensus-mechanism","title":"Communication-Efficient Consensus Mechanism for Federated Reinforcement Learning","date":"2022-01-30","arxiv_id":"2201.12718","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-frequency-control-through-safe","title":"Coordinated Frequency Control through Safe Reinforcement Learning","date":"2022-01-30","arxiv_id":"2202.00530","repositories_listed":0,"syntology":null},{"url":null,"slug":"apollorl-a-reinforcement-learning-platform","title":"ApolloRL: a Reinforcement Learning Platform for Autonomous Driving","date":"2022-01-29","arxiv_id":"2201.12609","repositories_listed":0,"syntology":null},{"url":null,"slug":"deeprng-towards-deep-reinforcement-learning","title":"DeepRNG: Towards Deep Reinforcement Learning-Assisted Generative Testing of Software","date":"2022-01-29","arxiv_id":"2201.12602","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-q-learning-method-for-optimizing","title":"A deep Q-learning method for optimizing visual search strategies in backgrounds of dynamic noise","date":"2022-01-28","arxiv_id":"2201.12385","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-exfiltration-paths-using","title":"Discovering Exfiltration Paths Using Reinforcement Learning with Attack Graphs","date":"2022-01-28","arxiv_id":"2201.12416","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-temporal-reconciliation-by","title":"Dynamic Temporal Reconciliation by Reinforcement learning","date":"2022-01-28","arxiv_id":"2201.11964","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-differentiable-optimization-and","title":"Joint Differentiable Optimization and Verification for Certified Reinforcement Learning","date":"2022-01-28","arxiv_id":"2201.12243","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-exploration-for","title":"Generative Adversarial Exploration for Reinforcement Learning","date":"2022-01-27","arxiv_id":"2201.11685","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantile-based-policy-optimization-for","title":"Quantile-Based Policy Optimization for Reinforcement Learning","date":"2022-01-27","arxiv_id":"2201.11463","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-empowered-mobile-edge","title":"Reinforcement Learning-Empowered Mobile Edge Computing for 6G Edge Intelligence","date":"2022-01-27","arxiv_id":"2201.11410","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-challenges-of-exploration-for-offline","title":"The Challenges of Exploration for Offline Reinforcement Learning","date":"2022-01-27","arxiv_id":"2201.11861","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperparameter-tuning-for-deep-reinforcement","title":"Hyperparameter Tuning for Deep Reinforcement Learning Applications","date":"2022-01-26","arxiv_id":"2201.11182","repositories_listed":0,"syntology":null},{"url":null,"slug":"moore-model-based-offline-to-online","title":"MOORe: Model-based Offline-to-Online Reinforcement Learning","date":"2022-01-25","arxiv_id":"2201.10070","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-query-vertex","title":"Reinforcement Learning Based Query Vertex Ordering Model for Subgraph Matching","date":"2022-01-25","arxiv_id":"2201.11251","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-for-zero","title":"Using Deep Reinforcement Learning for Zero Defect Smart Forging","date":"2022-01-25","arxiv_id":"2201.10268","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-intravascular-ultrasound-imaging","title":"Accelerated Intravascular Ultrasound Imaging using Deep Reinforcement Learning","date":"2022-01-24","arxiv_id":"2201.09522","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-reinforcement-learning-for-wireless","title":"Large-Scale Graph Reinforcement Learning in Wireless Control Systems","date":"2022-01-24","arxiv_id":"2201.09859","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-spiking-q","title":"Deep Reinforcement Learning with Spiking Q-learning","date":"2022-01-21","arxiv_id":"2201.09754","repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-dependent-confidence-and-early","title":"Instance-Dependent Confidence and Early Stopping for Reinforcement Learning","date":"2022-01-21","arxiv_id":"2201.08536","repositories_listed":0,"syntology":null}],"record_sha256":"c883acd52f1b6744fcc2b3c82d5a3b3a411fad8566364eab82c08887413215f2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}