{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/104","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":104,"pages_in_order":152,"rows_per_page":100,"rows":[10301,10400],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/103","next":"/task/reinforcement-learning-1/papers/105","papers":[{"url":null,"slug":"grounding-complex-navigational-instructions","title":"Grounding Complex Navigational Instructions Using Scene Graphs","date":"2021-06-03","arxiv_id":"2106.01607","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperbolically-discounted-reinforcement","title":"Hyperbolically-Discounted Reinforcement Learning on Reward-Punishment Framework","date":"2021-06-03","arxiv_id":"2106.01516","repositories_listed":0,"syntology":null},{"url":null,"slug":"limiirl-lightweight-multiple-intent-inverse","title":"LiMIIRL: Lightweight Multiple-Intent Inverse Reinforcement Learning","date":"2021-06-03","arxiv_id":"2106.01777","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-ran-control-a-symbolic-reinforcement","title":"Safe RAN control: A Symbolic Reinforcement Learning Approach","date":"2021-06-03","arxiv_id":"2106.01977","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-and-comparison-of-reward-functions-in","title":"Design and Comparison of Reward Functions in Reinforcement Learning for Energy Management of Sensor Nodes","date":"2021-06-02","arxiv_id":"2106.01114","repositories_listed":0,"syntology":null},{"url":null,"slug":"expected-scalarised-returns-dominance-a-new","title":"Expected Scalarised Returns Dominance: A New Solution Concept for Multi-Objective Decision Making","date":"2021-06-02","arxiv_id":"2106.01048","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-schedule-job-shop-problems","title":"Learning to schedule job-shop problems: Representation and policy learning using graph neural network and reinforcement learning","date":"2021-06-02","arxiv_id":"2106.01086","repositories_listed":0,"syntology":null},{"url":null,"slug":"robot-in-a-china-shop-using-reinforcement","title":"Robot in a China Shop: Using Reinforcement Learning for Location-Specific Navigation Behaviour","date":"2021-06-02","arxiv_id":"2106.01434","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-deeper-deep-reinforcement-learning","title":"Towards Deeper Deep Reinforcement Learning with Spectral Normalization","date":"2021-06-02","arxiv_id":"2106.01151","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-empowerment-as-representation","title":"Variational Empowerment as Representation Learning for Goal-Based Reinforcement Learning","date":"2021-06-02","arxiv_id":"2106.01404","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-coarse-to-fine-question-answering-system","title":"A Coarse to Fine Question Answering System based on Reinforcement Learning","date":"2021-06-01","arxiv_id":"2106.00257","repositories_listed":0,"syntology":null},{"url":null,"slug":"ad-headline-generation-using-self-critical","title":"Ad Headline Generation using Self-Critical Masked Language Model","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-entropy-regularization-free-mechanism-for","title":"An Entropy Regularization Free Mechanism for Policy-based Reinforcement Learning","date":"2021-06-01","arxiv_id":"2106.00707","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-long-term-metrics-in-recommendation","title":"Improving Long-Term Metrics in Recommendation Systems using Short-Horizon Reinforcement Learning","date":"2021-06-01","arxiv_id":"2106.00589","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantitative-day-trading-from-natural","title":"Quantitative Day Trading from Natural Language using Reinforcement Learning","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforce-security-a-model-free-approach","title":"Reinforce Security: A Model-Free Approach Towards Secure Wiretap Coding","date":"2021-06-01","arxiv_id":"2106.00343","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-is-enough-for-convex-mdps","title":"Reward is enough for convex MDPs","date":"2021-06-01","arxiv_id":"2106.00661","repositories_listed":0,"syntology":null},{"url":null,"slug":"search-from-history-and-reason-for-future-two","title":"Search from History and Reason for Future: Two-stage Reasoning on Temporal Knowledge Graphs","date":"2021-06-01","arxiv_id":"2106.00327","repositories_listed":0,"syntology":null},{"url":null,"slug":"shapley-counterfactual-credits-for-multi","title":"Shapley Counterfactual Credits for Multi-Agent Reinforcement Learning","date":"2021-06-01","arxiv_id":"2106.00285","repositories_listed":0,"syntology":null},{"url":null,"slug":"appbuddy-learning-to-accomplish-tasks-in","title":"AppBuddy: Learning to Accomplish Tasks in Mobile Apps via Reinforcement Learning","date":"2021-05-31","arxiv_id":"2106.00133","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-spibb-seldonian-offline","title":"Multi-Objective SPIBB: Seldonian Offline Policy Improvement with Safety Constraints in Finite MDPs","date":"2021-05-31","arxiv_id":"2106.00099","repositories_listed":0,"syntology":null},{"url":null,"slug":"procedural-content-generation-better","title":"Procedural Content Generation: Better Benchmarks for Transfer Reinforcement Learning","date":"2021-05-31","arxiv_id":"2105.14780","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-dynamic-service","title":"Reinforcement Learning-based Dynamic Service Placement in Vehicular Networks","date":"2021-05-31","arxiv_id":"2105.15022","repositories_listed":0,"syntology":null},{"url":null,"slug":"tesseract-tensorised-actors-for-multi-agent","title":"Tesseract: Tensorised Actors for Multi-Agent Reinforcement Learning","date":"2021-05-31","arxiv_id":"2106.00136","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-the-deployment-time-inference","title":"Reducing the Deployment-Time Inference Control Costs of Deep Reinforcement Learning Agents via an Asymmetric Architecture","date":"2021-05-30","arxiv_id":"2105.14471","repositories_listed":0,"syntology":null},{"url":null,"slug":"shaped-policy-search-for-evolutionary","title":"Shaped Policy Search for Evolutionary Strategies using Waypoints","date":"2021-05-30","arxiv_id":"2105.14639","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-deep-reinforcement-learning","title":"A Survey of Deep Reinforcement Learning Algorithms for Motion Planning and Control of Autonomous Vehicles","date":"2021-05-29","arxiv_id":"2105.14218","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-free-neural-network-training-via","title":"Gradient-Free Neural Network Training via Synaptic-Level Reinforcement Learning","date":"2021-05-29","arxiv_id":"2105.14383","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-theory-of-reinforcement-learning-with","title":"On the Theory of Reinforcement Learning with Once-per-Episode Feedback","date":"2021-05-29","arxiv_id":"2105.14363","repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-representation-learning-for","title":"Predictive Representation Learning for Language Modeling","date":"2021-05-29","arxiv_id":"2105.14214","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-reconfigurable-surface-assisted","title":"Reconfigurable Intelligent Surface-assisted Multi-UAV Networks: Efficient Resource Allocation with Deep Reinforcement Learning","date":"2021-05-28","arxiv_id":"2105.14142","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-optimization-of-multi-objective","title":"Joint Optimization of Multi-Objective Reinforcement Learning with Policy Gradient Based Algorithm","date":"2021-05-28","arxiv_id":"2105.14125","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-approximate-and-exact-numeral","title":"Learning Approximate and Exact Numeral Systems via Reinforcement Learning","date":"2021-05-28","arxiv_id":"2105.13857","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-on-line-sequence","title":"Reinforcement Learning for on-line Sequence Transformation","date":"2021-05-28","arxiv_id":"2105.14097","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-reveals-fundamental","title":"Reinforcement Learning reveals fundamental limits on the mixing of active particles","date":"2021-05-28","arxiv_id":"2105.14105","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-aware-transfer-in-reinforcement-learning","title":"Risk-Aware Transfer in Reinforcement Learning using Successor Features","date":"2021-05-28","arxiv_id":"2105.14127","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-for","title":"Sample-Efficient Reinforcement Learning for Linearly-Parameterized MDPs with a Generative Model","date":"2021-05-28","arxiv_id":"2105.14016","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-intervention-for-causal-inference","title":"Stochastic Intervention for Causal Inference via Reinforcement Learning","date":"2021-05-28","arxiv_id":"2105.13514","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-guided-inverse-reinforcement-learning","title":"Task-Guided Inverse Reinforcement Learning Under Partial Information","date":"2021-05-28","arxiv_id":"2105.14073","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferable-deep-reinforcement-learning","title":"Transferable Deep Reinforcement Learning Framework for Autonomous Vehicles with Joint Radar-Data Communications","date":"2021-05-28","arxiv_id":"2105.13670","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-modular-and-transferable-reinforcement","title":"A Modular and Transferable Reinforcement Learning Framework for the Fleet Rebalancing Problem","date":"2021-05-27","arxiv_id":"2105.13284","repositories_listed":0,"syntology":null},{"url":null,"slug":"branching-dueling-q-network-based-online","title":"Branching Dueling Q-Network Based Online Scheduling of a Microgrid With Distributed Energy Storage Systems","date":"2021-05-27","arxiv_id":"2105.13497","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-reinforcement-learning-by-forward","title":"Optimistic Reinforcement Learning by Forward Kullback-Leibler Divergence Optimization","date":"2021-05-27","arxiv_id":"2105.12991","repositories_listed":0,"syntology":null},{"url":null,"slug":"pattern-transfer-learning-for-reinforcement","title":"Pattern Transfer Learning for Reinforcement Learning in Order Dispatching","date":"2021-05-27","arxiv_id":"2105.13218","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-taxi-dispatching-at-city-scale","title":"Context-aware taxi dispatching at city-scale using deep reinforcement learning","date":"2021-05-26","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-generalised-inverse-reinforcement-learning","title":"A Generalised Inverse Reinforcement Learning Framework","date":"2021-05-25","arxiv_id":"2105.11812","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-nonparametric-reinforcement-learning","title":"Bayesian Nonparametric Reinforcement Learning in LTE and Wi-Fi Coexistence","date":"2021-05-25","arxiv_id":"2105.12249","repositories_listed":0,"syntology":null},{"url":null,"slug":"fnas-uncertainty-aware-fast-neural","title":"FNAS: Uncertainty-Aware Fast Neural Architecture Search","date":"2021-05-25","arxiv_id":"2105.11694","repositories_listed":0,"syntology":null},{"url":null,"slug":"igo-qnn-quantum-neural-network-architecture","title":"IGO-QNN: Quantum Neural Network Architecture for Inductive Grover Oracularization","date":"2021-05-25","arxiv_id":"2105.11603","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-uav-collision-avoidance-using","title":"Interpretable UAV Collision Avoidance using Deep Reinforcement Learning","date":"2021-05-25","arxiv_id":"2105.12254","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowsr-knowledge-sharing-among-homogeneous","title":"KnowSR: Knowledge Sharing among Homogeneous Agents in Multi-agent Reinforcement Learning","date":"2021-05-25","arxiv_id":"2105.11611","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-model-based-off-policy-reinforcement","title":"Safe Model-based Off-policy Reinforcement Learning for Eco-Driving in Connected and Automated Hybrid Electric Vehicles","date":"2021-05-25","arxiv_id":"2105.11640","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-modeling-via-random-utility","title":"Trajectory Modeling via Random Utility Inverse Reinforcement Learning","date":"2021-05-25","arxiv_id":"2105.12092","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-and-curriculum-learning-in","title":"Transfer Learning and Curriculum Learning in Sokoban","date":"2021-05-25","arxiv_id":"2105.11702","repositories_listed":0,"syntology":null},{"url":null,"slug":"unbiased-asymmetric-actor-critic-for","title":"Unbiased Asymmetric Reinforcement Learning under Partial Observability","date":"2021-05-25","arxiv_id":"2105.11674","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-mirror-descent-for-regularized","title":"Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence","date":"2021-05-24","arxiv_id":"2105.11066","repositories_listed":0,"syntology":null},{"url":null,"slug":"room-clearance-with-feudal-hierarchical","title":"Room Clearance with Feudal Hierarchical Reinforcement Learning","date":"2021-05-24","arxiv_id":"2105.11328","repositories_listed":0,"syntology":null},{"url":null,"slug":"verification-of-dissipativity-and-evaluation","title":"Verification of Dissipativity and Evaluation of Storage Function in Economic Nonlinear MPC using Q-Learning","date":"2021-05-24","arxiv_id":"2105.11313","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-based-reinforcement-learning-for","title":"Attention-based Reinforcement Learning for Real-Time UAV Semantic Communication","date":"2021-05-22","arxiv_id":"2105.10716","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-exponential-lower-bound-for-linearly-1","title":"An Exponential Lower Bound for Linearly Realizable MDP with Constant Suboptimality Gap","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"de-biased-modelling-of-search-click-behavior","title":"De-Biased Modelling of Search Click Behavior with Reinforcement Learning","date":"2021-05-21","arxiv_id":"2105.10072","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-mdps-from-features-predict-then-1","title":"Learning MDPs from Features: Predict-Then-Optimize for Sequential Decision Making by Reinforcement Learning","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-fast","title":"Meta Reinforcement Learning for Fast Adaptation of Hierarchical Policies","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-using","title":"Multi-Agent Deep Reinforcement Learning using Attentive Graph Neural Architectures for Real-Time Strategy Games","date":"2021-05-21","arxiv_id":"2105.10211","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-use-of-feature-maps-and-parameter","title":"On the use of feature-maps and parameter control for improved quality-diversity meta-evolution","date":"2021-05-21","arxiv_id":"2105.10317","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-disease-1","title":"Reinforcement Learning based Disease Progression Model for Alzheimer’s Disease","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-instance","title":"Reinforcement learning for instance segmentation with high-level priors","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-design-choices-in-offline-model-1","title":"Revisiting Design Choices in Offline Model Based Reinforcement Learning","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rlirank-learning-to-rank-with-reinforcement","title":"RLIRank: Learning to Rank with Reinforcement Learning for Dynamic Search","date":"2021-05-21","arxiv_id":"2105.10124","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-approximation-of-gaussian-free","title":"Stochastic Approximation of Gaussian Free Energy for Risk-Sensitive Reinforcement Learning","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"techniques-toward-optimizing-viewability-in","title":"Techniques Toward Optimizing Viewability in RTB Ad Campaigns Using Reinforcement Learning","date":"2021-05-21","arxiv_id":"2105.10587","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-stochastic-composite-augmented-lagrangian","title":"A Stochastic Composite Augmented Lagrangian Method For Reinforcement Learning","date":"2021-05-20","arxiv_id":"2105.09716","repositories_listed":0,"syntology":null},{"url":null,"slug":"objective-aware-traffic-simulation-via","title":"Objective-aware Traffic Simulation via Inverse Reinforcement Learning","date":"2021-05-20","arxiv_id":"2105.09560","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-sample-efficient-reinforcement","title":"Towards a Sample Efficient Reinforcement Learning Pipeline for Vision Based Robotics","date":"2021-05-20","arxiv_id":"2105.09719","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-conversational-recommendation-policy","title":"Unified Conversational Recommendation Policy Learning via Graph-based Reinforcement Learning","date":"2021-05-20","arxiv_id":"2105.09710","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-fine-grained-adaptive-loss-for-multiple","title":"Learn Fine-grained Adaptive Loss for Multiple Anatomical Landmark Detection in Medical Images","date":"2021-05-19","arxiv_id":"2105.09124","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-adaptive-optimal-control-algorithm","title":"Online Adaptive Optimal Control Algorithm Based on Synchronous Integral Reinforcement Learning With Explorations","date":"2021-05-19","arxiv_id":"2105.09006","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-assisted-oxygen","title":"Reinforcement Learning Assisted Oxygen Therapy for COVID-19 Patients Under Intensive Care","date":"2021-05-19","arxiv_id":"2105.08923","repositories_listed":0,"syntology":null},{"url":null,"slug":"robo-advising-enhancing-investment-with","title":"Robo-Advising: Enhancing Investment with Inverse Optimization and Deep Reinforcement Learning","date":"2021-05-19","arxiv_id":"2105.09264","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-abac-policy-learning-a-reinforcement","title":"Adaptive ABAC Policy Learning: A Reinforcement Learning Approach","date":"2021-05-18","arxiv_id":"2105.08587","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-deep-reinforcement-learning","title":"Application of deep reinforcement learning for Indian stock trading automation","date":"2021-05-18","arxiv_id":"2106.16088","repositories_listed":0,"syntology":null},{"url":null,"slug":"gym-anm-open-source-software-to-leverage","title":"Gym-ANM: Open-source software to leverage reinforcement learning for power system management in research and education","date":"2021-05-18","arxiv_id":"2105.08846","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-information-in-stochastic","title":"Learning and Information in Stochastic Networks and Queues","date":"2021-05-18","arxiv_id":"2105.08769","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-multimodal-transportation-planning","title":"Online Multimodal Transportation Planning using Deep Reinforcement Learning","date":"2021-05-18","arxiv_id":"2105.08374","repositories_listed":0,"syntology":null},{"url":null,"slug":"pobrl-optimizing-multi-document-summarization","title":"PoBRL: Optimizing Multi-Document Summarization by Blending Reinforcement Learning Policies","date":"2021-05-18","arxiv_id":"2105.08244","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-adaptive-video","title":"Reinforcement Learning for Adaptive Video Compressive Sensing","date":"2021-05-18","arxiv_id":"2105.08205","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparsity-prior-regularized-q-learning-for","title":"Reinforcement Learning With Sparse-Executing Actions via Sparsity Regularization","date":"2021-05-18","arxiv_id":"2105.08666","repositories_listed":0,"syntology":null},{"url":null,"slug":"sublinear-least-squares-value-iteration-via","title":"Sublinear Least-Squares Value Iteration via Locality Sensitive Hashing","date":"2021-05-18","arxiv_id":"2105.08285","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-games-flock-the-reinforcement","title":"Mean Field Games Flock! The Reinforcement Learning Way","date":"2021-05-17","arxiv_id":"2105.07933","repositories_listed":0,"syntology":null},{"url":null,"slug":"raider-reinforcement-aided-spear-phishing","title":"RAIDER: Reinforcement-aided Spear Phishing Detector","date":"2021-05-17","arxiv_id":"2105.07582","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-grit-reinforcement-learning-for-grammar","title":"RL-GRIT: Reinforcement Learning for Grammar Inference","date":"2021-05-17","arxiv_id":"2105.13114","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-is","title":"Sample-Efficient Reinforcement Learning Is Feasible for Linearly Realizable MDPs with Limited Revisiting","date":"2021-05-17","arxiv_id":"2105.08024","repositories_listed":0,"syntology":null},{"url":null,"slug":"dras-cqsim-a-reinforcement-learning-based","title":"DRAS-CQSim: A Reinforcement Learning based Framework for HPC Cluster Scheduling","date":"2021-05-16","arxiv_id":"2105.07526","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-heuristically-assisted-deep-reinforcement","title":"A Heuristically Assisted Deep Reinforcement Learning Approach for Network Slice Placement","date":"2021-05-14","arxiv_id":"2105.06741","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-pac-reinforcement-learning-in","title":"Efficient PAC Reinforcement Learning in Regular Decision Processes","date":"2021-05-14","arxiv_id":"2105.06784","repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-based-interpretable-reinforcement","title":"Feature-Based Interpretable Reinforcement Learning based on State-Transition Models","date":"2021-05-14","arxiv_id":"2105.07099","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-decreasing-quantile-function-network-with-1","title":"Non-decreasing Quantile Function Network with Efficient Exploration for Distributional Reinforcement Learning","date":"2021-05-14","arxiv_id":"2105.06696","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-warm-start-mcts-in-alphazero-like","title":"Adaptive Warm-Start MCTS in AlphaZero-like Deep Reinforcement Learning","date":"2021-05-13","arxiv_id":"2105.06136","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligence-and-unambitiousness-using","title":"Intelligence and Unambitiousness Using Algorithmic Information Theory","date":"2021-05-13","arxiv_id":"2105.06268","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-algorithms-and-policies-using-adaptive","title":"Online Algorithms and Policies Using Adaptive and Machine Learning Approaches","date":"2021-05-13","arxiv_id":"2105.06577","repositories_listed":0,"syntology":null}],"record_sha256":"786497d122a3e8033df03118bdfad8f7969cd1d9e59ffd2f81f21a9d46d03e05","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}