{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/sequential-decision-making/papers/7","list_of":"/task/sequential-decision-making","task":"Sequential Decision Making","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":7,"pages_in_order":13,"rows_per_page":100,"rows":[601,700],"of":1210,"counts":{"archive_papers_tagged":1210,"with_a_code_link":351,"where_syntology_ran_a_sample":107,"not_listed_spam_title":0,"listed":1210,"listed_where_code_ran":107,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":90,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":90,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/sequential-decision-making","prev":"/task/sequential-decision-making/papers/6","next":"/task/sequential-decision-making/papers/8","papers":[{"url":null,"slug":"online-restless-multi-armed-bandits-with-long","title":"Online Restless Multi-Armed Bandits with Long-Term Fairness Constraints","date":"2023-12-16","arxiv_id":"2312.10303","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-customizable-generator-for-comic-style","title":"A Customizable Generator for Comic-Style Visual Narrative","date":"2023-12-14","arxiv_id":"2401.02863","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-adaptive-planning-representations","title":"Learning adaptive planning representations with natural language guidance","date":"2023-12-13","arxiv_id":"2312.08566","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-cooperation-in-multi-agent","title":"A Review of Cooperation in Multi-agent Learning","date":"2023-12-08","arxiv_id":"2312.05162","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-optimization-via-kernelized-multi","title":"Distributed Optimization via Kernelized Multi-armed Bandits","date":"2023-12-07","arxiv_id":"2312.04719","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-encoders-for-data-efficient-imitation","title":"Visual Encoders for Data-Efficient Imitation Learning in Modern Video Games","date":"2023-12-04","arxiv_id":"2312.02312","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-in-pharma-for-personalized-sequential","title":"AI in Pharma for Personalized Sequential Decision-Making: Methods, Applications and Opportunities","date":"2023-11-30","arxiv_id":"2311.18725","repositories_listed":0,"syntology":null},{"url":null,"slug":"history-filtering-in-imperfect-information","title":"History Filtering in Imperfect Information Games: Algorithms and Complexity","date":"2023-11-24","arxiv_id":"2311.14651","repositories_listed":0,"syntology":null},{"url":null,"slug":"code-models-are-zero-shot-precondition","title":"Code Models are Zero-shot Precondition Reasoners","date":"2023-11-16","arxiv_id":"2311.09601","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-advantage-based-policy-transfer-algorithm","title":"An advantage based policy transfer algorithm for reinforcement learning with measures of transferability","date":"2023-11-12","arxiv_id":"2311.06731","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-expandable-machine-learning-optimization","title":"An Expandable Machine Learning-Optimization Framework to Sequential Decision-Making","date":"2023-11-12","arxiv_id":"2311.06972","repositories_listed":0,"syntology":null},{"url":null,"slug":"likelihood-ratio-confidence-sets-for","title":"Likelihood Ratio Confidence Sets for Sequential Decision Making","date":"2023-11-08","arxiv_id":"2311.04402","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-increasingly-large-extremal-graphs","title":"Finding Increasingly Large Extremal Graphs with AlphaZero and Tabu Search","date":"2023-11-06","arxiv_id":"2311.03583","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-sequential-optimization-for-switching","title":"Safe Sequential Optimization for Switching Environments","date":"2023-11-03","arxiv_id":"2311.02119","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-general-value-functions-to-learn-domain","title":"Using General Value Functions to Learn Domain-Backed Inventory Management Policies","date":"2023-11-03","arxiv_id":"2311.02125","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-decision-transformer-via","title":"Rethinking Decision Transformer via Hierarchical Reinforcement Learning","date":"2023-11-01","arxiv_id":"2311.00267","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-aware-causal-representation-for","title":"Safety-aware Causal Representation for Trustworthy Offline Reinforcement Learning in Autonomous Driving","date":"2023-10-31","arxiv_id":"2311.10747","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-minimization-algorithms-for-multi","title":"Regret-Minimization Algorithms for Multi-Agent Cooperative Learning Systems","date":"2023-10-30","arxiv_id":"2310.19468","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-dimensional-prediction-for-sequential","title":"High-Dimensional Prediction for Sequential Decision Making","date":"2023-10-26","arxiv_id":"2310.17651","repositories_listed":0,"syntology":null},{"url":null,"slug":"o3d-offline-data-driven-discovery-and","title":"O3D: Offline Data-driven Discovery and Distillation for Sequential Decision-Making with Large Language Models","date":"2023-10-22","arxiv_id":"2310.14403","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-visual-imitation-learning-with-inverse","title":"Robust Visual Imitation Learning with Inverse Dynamics Representations","date":"2023-10-22","arxiv_id":"2310.14274","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-benefits-of-multi-task-rl-under-non","title":"Provable Benefits of Multi-task RL under Non-Markovian Decision Making Processes","date":"2023-10-20","arxiv_id":"2310.13550","repositories_listed":0,"syntology":null},{"url":null,"slug":"auction-based-scheduling","title":"Auction-Based Scheduling","date":"2023-10-18","arxiv_id":"2310.11798","repositories_listed":0,"syntology":null},{"url":null,"slug":"keep-various-trajectories-promoting","title":"Keep Various Trajectories: Promoting Exploration of Ensemble Policies in Continuous Control","date":"2023-10-17","arxiv_id":"2310.11138","repositories_listed":0,"syntology":null},{"url":null,"slug":"partially-observable-stochastic-games-with","title":"Partially Observable Stochastic Games with Neural Perception Mechanisms","date":"2023-10-17","arxiv_id":"2310.11566","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-tree-search-ability-of-large","title":"Autonomous Tree-search Ability of Large Language Models","date":"2023-10-14","arxiv_id":"2310.10686","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-explanation-methods-for-vision-and","title":"Evaluating Explanation Methods for Vision-and-Language Navigation","date":"2023-10-10","arxiv_id":"2310.06654","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-policy-gradient-methods-4","title":"Global Convergence of Policy Gradient Methods in Reinforcement Learning, Games and Control","date":"2023-10-08","arxiv_id":"2310.05230","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-sequential-decision-making-in","title":"Optimal Sequential Decision-Making in Geosteering: A Reinforcement Learning Approach","date":"2023-10-07","arxiv_id":"2310.04772","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-stationarity-convergence-analysis-of","title":"Beyond Stationarity: Convergence Analysis of Stochastic Softmax Policy Gradient Methods","date":"2023-10-04","arxiv_id":"2310.02671","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-unified-framework-for-sequential","title":"Towards a Unified Framework for Sequential Decision Making","date":"2023-10-03","arxiv_id":"2310.02167","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-make-adherence-aware-advice","title":"Learning to Make Adherence-Aware Advice","date":"2023-10-01","arxiv_id":"2310.00817","repositories_listed":0,"syntology":null},{"url":null,"slug":"state2explanation-concept-based-explanations","title":"State2Explanation: Concept-Based Explanations to Benefit Agent Learning and User Understanding","date":"2023-09-21","arxiv_id":"2309.12482","repositories_listed":0,"syntology":null},{"url":null,"slug":"delays-in-reinforcement-learning","title":"Delays in Reinforcement Learning","date":"2023-09-20","arxiv_id":"2309.11096","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-pomdp-online-planning-via-shielding","title":"Safe POMDP Online Planning via Shielding","date":"2023-09-19","arxiv_id":"2309.10216","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-quantum-recurrent-reinforcement","title":"Efficient quantum recurrent reinforcement learning via quantum reservoir computing","date":"2023-09-13","arxiv_id":"2309.07339","repositories_listed":0,"syntology":null},{"url":null,"slug":"fidelity-induced-interpretable-policy","title":"Fidelity-Induced Interpretable Policy Extraction for Reinforcement Learning","date":"2023-09-12","arxiv_id":"2309.06097","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-adaptive-human-machine","title":"Bootstrapping Adaptive Human-Machine Interfaces with Offline Reinforcement Learning","date":"2023-09-07","arxiv_id":"2309.03839","repositories_listed":0,"syntology":null},{"url":null,"slug":"atms-algorithmic-trading-guided-market","title":"INTAGS: Interactive Agent-Guided Simulation","date":"2023-09-04","arxiv_id":"2309.01784","repositories_listed":0,"syntology":null},{"url":null,"slug":"pure-exploration-under-mediators-feedback","title":"Pure Exploration under Mediators' Feedback","date":"2023-08-29","arxiv_id":"2308.15552","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-exploration-networks","title":"Bayesian Exploration Networks","date":"2023-08-24","arxiv_id":"2308.13049","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-robust-policy-bootstrapping-algorithm-for","title":"A Robust Policy Bootstrapping Algorithm for Multi-objective Reinforcement Learning in Non-stationary Environments","date":"2023-08-18","arxiv_id":"2308.09734","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsically-motivated-hierarchical-policy","title":"Intrinsically Motivated Hierarchical Policy Learning in Multi-objective Markov Decision Processes","date":"2023-08-18","arxiv_id":"2308.09733","repositories_listed":0,"syntology":null},{"url":null,"slug":"imm-an-imitative-reinforcement-learning","title":"IMM: An Imitative Reinforcement Learning Approach with Predictive Representation Learning for Automatic Market Making","date":"2023-08-17","arxiv_id":"2308.08918","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-pretrained-models-for-sequential","title":"Multimodal Pretrained Models for Verifiable Sequential Decision-Making: Planning, Grounding, and Perception","date":"2023-08-10","arxiv_id":"2308.05295","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-inverse-transition-learning-for","title":"Bayesian Inverse Transition Learning for Offline Settings","date":"2023-08-09","arxiv_id":"2308.05075","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-robust-goal","title":"Deep Reinforcement Learning for Robust Goal-Based Wealth Management","date":"2023-07-25","arxiv_id":"2307.13501","repositories_listed":0,"syntology":null},{"url":null,"slug":"dip-rl-demonstration-inferred-preference","title":"DIP-RL: Demonstration-Inferred Preference Learning in Minecraft","date":"2023-07-22","arxiv_id":"2307.12158","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-expressivity-of-multidimensional","title":"On the Expressivity of Multidimensional Markov Reward","date":"2023-07-22","arxiv_id":"2307.12184","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-perception-optimizing-state","title":"Selective Perception: Optimizing State Descriptions with Reinforcement Learning for Language Model Actors","date":"2023-07-21","arxiv_id":"2307.11922","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-delayed-combinatorial-semi","title":"Non-stationary Delayed Combinatorial Semi-Bandit with Causally Related Rewards","date":"2023-07-18","arxiv_id":"2307.09093","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-player-zero-sum-markov-games-with","title":"Multi-Player Zero-Sum Markov Games with Networked Separable Interactions","date":"2023-07-13","arxiv_id":"2307.09470","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairo-fairness-aware-adaptation-in-sequential","title":"FAIRO: Fairness-aware Adaptation in Sequential-Decision Making for Human-in-the-Loop Systems","date":"2023-07-12","arxiv_id":"2307.05857","repositories_listed":0,"syntology":null},{"url":null,"slug":"bof-ucb-a-bayesian-optimistic-frequentist","title":"BOF-UCB: A Bayesian-Optimistic Frequentist Algorithm for Non-Stationary Contextual Bandits","date":"2023-07-07","arxiv_id":"2307.03587","repositories_listed":0,"syntology":null},{"url":null,"slug":"tgrl-an-algorithm-for-teacher-guided","title":"TGRL: An Algorithm for Teacher Guided Reinforcement Learning","date":"2023-07-06","arxiv_id":"2307.03186","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-flow-networks-a-markov-chain","title":"Generative Flow Networks: a Markov Chain Perspective","date":"2023-07-04","arxiv_id":"2307.01422","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-ucb-type-algorithms-for","title":"Provably Efficient UCB-type Algorithms For Learning Predictive State Representations","date":"2023-07-01","arxiv_id":"2307.00405","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-improved-exploration-in","title":"Thompson sampling for improved exploration in GFlowNets","date":"2023-06-30","arxiv_id":"2306.17693","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-framework-for-sequential-decision","title":"A General Framework for Sequential Decision-Making under Adaptivity Constraints","date":"2023-06-26","arxiv_id":"2306.14468","repositories_listed":0,"syntology":null},{"url":null,"slug":"proportional-aggregation-of-preferences-for","title":"Proportional Aggregation of Preferences for Sequential Decision Making","date":"2023-06-26","arxiv_id":"2306.14858","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-sequence-models-for-sequential-decision","title":"Large Sequence Models for Sequential Decision-Making: A Survey","date":"2023-06-24","arxiv_id":"2306.13945","repositories_listed":0,"syntology":null},{"url":null,"slug":"you-can-trade-your-experience-in-distributed","title":"You Can Trade Your Experience in Distributed Multi-Agent Multi-Armed Bandits","date":"2023-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"if2net-innately-forgetting-free-networks-for","title":"IF2Net: Innately Forgetting-Free Networks for Continual Learning","date":"2023-06-18","arxiv_id":"2306.10480","repositories_listed":0,"syntology":null},{"url":null,"slug":"langevin-thompson-sampling-with-logarithmic","title":"Langevin Thompson Sampling with Logarithmic Communication: Bandits and Reinforcement Learning","date":"2023-06-15","arxiv_id":"2306.08803","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-learning-nash-policies-in","title":"Provably Learning Nash Policies in Constrained Markov Potential Games","date":"2023-06-13","arxiv_id":"2306.07749","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-via-adversarial","title":"Bring Your Own (Non-Robust) Algorithm to Solve Robust MDPs by Estimating The Worst Kernel","date":"2023-06-09","arxiv_id":"2306.05859","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-linear-contextual-bandits-with-user","title":"Federated Linear Contextual Bandits with User-level Differential Privacy","date":"2023-06-08","arxiv_id":"2306.05275","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-digital-twin-for-identification-of","title":"AI-based Identification of Most Critical Cyberattacks in Industrial Systems","date":"2023-06-07","arxiv_id":"2306.04821","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-regret-balancing-for-online-model","title":"Data-Driven Online Model Selection With Regret Guarantees","date":"2023-06-05","arxiv_id":"2306.02869","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-on-online-learning-to","title":"Adversarial Attacks on Online Learning to Rank with Click Feedback","date":"2023-05-26","arxiv_id":"2305.17071","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-reinforcement-learning-that","title":"Self-Supervised Reinforcement Learning that Transfers using Random Features","date":"2023-05-26","arxiv_id":"2305.17250","repositories_listed":0,"syntology":null},{"url":null,"slug":"stability-penalty-adaptive-follow-the","title":"Stability-penalty-adaptive follow-the-regularized-leader: Sparsity, game-dependency, and best-of-both-worlds","date":"2023-05-26","arxiv_id":"2305.17301","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-mini-review-on-the-utilization-of","title":"A Mini Review on the utilization of Reinforcement Learning with OPC UA","date":"2023-05-24","arxiv_id":"2305.15113","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-dynamic-conditional-quantile","title":"Evaluating Dynamic Conditional Quantile Treatment Effects with Applications in Ridesharing","date":"2023-05-17","arxiv_id":"2305.10187","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-memory-mapping-using-deep","title":"Optimizing Memory Mapping Using Deep Reinforcement Learning","date":"2023-05-11","arxiv_id":"2305.07440","repositories_listed":0,"syntology":null},{"url":null,"slug":"replicating-complex-dialogue-policy-of-humans","title":"Replicating Complex Dialogue Policy of Humans via Offline Imitation Learning with Supervised Regularization","date":"2023-05-06","arxiv_id":"2305.03987","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-from-teachers-to-learners","title":"Knowledge Transfer from Teachers to Learners in Growing-Batch Reinforcement Learning","date":"2023-05-05","arxiv_id":"2305.03870","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-symbolic-subsymbolic-and-hybrid","title":"A Review of Symbolic, Subsymbolic and Hybrid Methods for Sequential Decision Making","date":"2023-04-20","arxiv_id":"2304.10590","repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-stackelberg-equilibrium-through","title":"Inducing Stackelberg Equilibrium through Spatio-Temporal Sequential Decision-Making in Multi-Agent Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10351","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-6","title":"Model Based Reinforcement Learning for Personalized Heparin Dosing","date":"2023-04-19","arxiv_id":"2304.10000","repositories_listed":0,"syntology":null},{"url":null,"slug":"aoi-delay-tradeoff-in-mobile-edge-caching-a","title":"AoI-Delay Tradeoff in Mobile Edge Caching: A Mixed-Order Drift-Plus-Penalty Algorithm","date":"2023-04-18","arxiv_id":"2304.08781","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthetically-generating-human-like-data-for","title":"Synthetically Generating Human-like Data for Sequential Decision Making Tasks via Reward-Shaped Imitation Learning","date":"2023-04-14","arxiv_id":"2304.07280","repositories_listed":0,"syntology":null},{"url":null,"slug":"experimentation-platforms-meet-reinforcement","title":"Experimentation Platforms Meet Reinforcement Learning: Bayesian Sequential Decision-Making for Continuous Monitoring","date":"2023-04-02","arxiv_id":"2304.00420","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-and-robust-model-based","title":"Risk-Sensitive and Robust Model-Based Reinforcement Learning and Planning","date":"2023-04-02","arxiv_id":"2304.00573","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-exploration-and-representation","title":"Accelerating exploration and representation learning with offline pre-training","date":"2023-03-31","arxiv_id":"2304.00046","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-reinforcement-learning-and-planning","title":"Boosting Reinforcement Learning and Planning with Demonstrations: A Survey","date":"2023-03-23","arxiv_id":"2303.13489","repositories_listed":0,"syntology":null},{"url":null,"slug":"welfare-maximization-algorithm-for-solving","title":"Welfare Maximization Algorithm for Solving Budget-Constrained Multi-Component POMDPs","date":"2023-03-18","arxiv_id":"2303.10302","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-omega-regular","title":"Reinforcement Learning for Omega-Regular Specifications on Continuous-Time MDP","date":"2023-03-16","arxiv_id":"2303.09528","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-conditioned-policy-gradient-for-multi","title":"Latent-Conditioned Policy Gradient for Multi-Objective Deep Reinforcement Learning","date":"2023-03-15","arxiv_id":"2303.08909","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-adversarial-imitation-1","title":"Sample-efficient Adversarial Imitation Learning","date":"2023-03-14","arxiv_id":"2303.07846","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-aware-robust-reinforcement-learning","title":"Variance-aware robust reinforcement learning with linear function approximation under heavy-tailed rewards","date":"2023-03-09","arxiv_id":"2303.05606","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-cyber-defence-a-review","title":"Automated Cyber Defence: A Review","date":"2023-03-08","arxiv_id":"2303.04926","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaparl-adaptive-privacy-aware-reinforcement","title":"adaPARL: Adaptive Privacy-Aware Reinforcement Learning for Sequential-Decision Making Human-in-the-Loop Systems","date":"2023-03-07","arxiv_id":"2303.04257","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-via-epistemic-value-estimation","title":"Exploration via Epistemic Value Estimation","date":"2023-03-07","arxiv_id":"2303.04012","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-offline-reinforcement-learning-for-real","title":"Deep Offline Reinforcement Learning for Real-world Treatment Optimization Applications","date":"2023-02-15","arxiv_id":"2302.07549","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-dimension-in-bandit-problems-under","title":"Effective Dimension in Bandit Problems under Censorship","date":"2023-02-14","arxiv_id":"2302.06916","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-ucb-statistical-complexity-and-optimal","title":"Statistical Complexity and Optimal Algorithms for Non-linear Ridge Bandits","date":"2023-02-12","arxiv_id":"2302.06025","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-causal-reinforcement-learning","title":"A Survey on Causal Reinforcement Learning","date":"2023-02-10","arxiv_id":"2302.05209","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-representation-learning-for-pure","title":"Multi-task Representation Learning for Pure Exploration in Linear Bandits","date":"2023-02-09","arxiv_id":"2302.04441","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scale-independent-multi-objective","title":"A Scale-Independent Multi-Objective Reinforcement Learning with Convergence Analysis","date":"2023-02-08","arxiv_id":"2302.04179","repositories_listed":0,"syntology":null}],"record_sha256":"6b0dbc8b2f1a197f644dbf929dec64b3d58231dcbc00f8034d90716c29e4100c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}