{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/sequential-decision-making/papers/9","list_of":"/task/sequential-decision-making","task":"Sequential Decision Making","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":9,"pages_in_order":13,"rows_per_page":100,"rows":[801,900],"of":1210,"counts":{"archive_papers_tagged":1210,"with_a_code_link":351,"where_syntology_ran_a_sample":107,"not_listed_spam_title":0,"listed":1210,"listed_where_code_ran":107,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":90,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":90,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/sequential-decision-making","prev":"/task/sequential-decision-making/papers/8","next":"/task/sequential-decision-making/papers/10","papers":[{"url":null,"slug":"hierarchical-constrained-stochastic-shortest","title":"Hierarchical Constrained Stochastic Shortest Path Planning via Cost Budget Allocation","date":"2022-05-11","arxiv_id":"2205.05228","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-multi-armed-bandits-under-byzantine","title":"Federated Multi-Armed Bandits Under Byzantine Attacks","date":"2022-05-09","arxiv_id":"2205.04134","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-flexible-inference-in-sequential","title":"Towards Flexible Inference in Sequential Decision Problems via Bidirectional Transformers","date":"2022-04-28","arxiv_id":"2204.13326","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-reward-maximization-and","title":"Integrating Reward Maximization and Population Estimation: Sequential Decision-Making for Internal Revenue Service Audit Selection","date":"2022-04-25","arxiv_id":"2204.11910","repositories_listed":0,"syntology":null},{"url":null,"slug":"gfcl-a-gru-based-federated-continual-learning","title":"GFCL: A GRU-based Federated Continual Learning Framework against Data Poisoning Attacks in IoV","date":"2022-04-23","arxiv_id":"2204.11010","repositories_listed":0,"syntology":null},{"url":null,"slug":"saac-safe-reinforcement-learning-as-an","title":"SAAC: Safe Reinforcement Learning as an Adversarial Game of Actor-Critics","date":"2022-04-20","arxiv_id":"2204.09424","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-and-evaluation-of-deep-policies","title":"Training and Evaluation of Deep Policies using Reinforcement Learning and Generative Models","date":"2022-04-18","arxiv_id":"2204.08573","repositories_listed":0,"syntology":null},{"url":null,"slug":"worst-case-performance-of-greedy-policies-in","title":"Worst-case Performance of Greedy Policies in Bandits with Imperfect Context Observations","date":"2022-04-10","arxiv_id":"2204.04773","repositories_listed":0,"syntology":null},{"url":null,"slug":"actual-causality-and-responsibility","title":"Actual Causality and Responsibility Attribution in Decentralized Partially Observable Markov Decision Processes","date":"2022-04-01","arxiv_id":"2204.00302","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-online-approach-to-solve-the-dynamic","title":"An Online Approach to Solve the Dynamic Vehicle Routing Problem with Stochastic Trip Requests for Paratransit Services","date":"2022-03-28","arxiv_id":"2203.15127","repositories_listed":0,"syntology":null},{"url":null,"slug":"novgrid-a-flexible-grid-world-for-evaluating","title":"NovGrid: A Flexible Grid World for Evaluating Agent Response to Novelty","date":"2022-03-23","arxiv_id":"2203.12117","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-multi-agent-reinforcement-2","title":"Model-based Multi-agent Reinforcement Learning: Recent Progress and Prospects","date":"2022-03-20","arxiv_id":"2203.10603","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-price-of-unfairness-in-linear-bandits","title":"The price of unfairness in linear bandits with biased feedback","date":"2022-03-18","arxiv_id":"2203.09784","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-offline-reinforcement-learning-2","title":"Near-optimal Offline Reinforcement Learning with Linear Representation: Leveraging Variance Information with Pessimism","date":"2022-03-11","arxiv_id":"2203.05804","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-delay-consistent-and-smooth-trainable","title":"A Trainable Approach to Zero-delay Smoothing Spline Interpolation","date":"2022-03-07","arxiv_id":"2203.03776","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-modern","title":"Reinforcement Learning in Modern Biostatistics: Constructing Optimal Adaptive Interventions","date":"2022-03-04","arxiv_id":"2203.02605","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-stochastic-bandits-over-a-bit","title":"Linear Stochastic Bandits over a Bit-Constrained Channel","date":"2022-03-02","arxiv_id":"2203.01198","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulating-network-paths-with-recurrent","title":"Simulating Network Paths with Recurrent Buffering Units","date":"2022-02-23","arxiv_id":"2202.13870","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-explainable-reinforcement","title":"A Survey of Explainable Reinforcement Learning","date":"2022-02-17","arxiv_id":"2202.08434","repositories_listed":0,"syntology":null},{"url":null,"slug":"muzero-with-self-competition-for-rate-control","title":"MuZero with Self-competition for Rate Control in VP9 Video Compression","date":"2022-02-14","arxiv_id":"2202.06626","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-causal-model-based","title":"Provably Efficient Causal Model-Based Reinforcement Learning for Systematic Generalization","date":"2022-02-14","arxiv_id":"2202.06545","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-bayesian-experimental-designs-via","title":"Sequential Bayesian experimental designs via reinforcement learning","date":"2022-02-14","arxiv_id":"2202.07472","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-reinforcement-learning-with-a-short","title":"Provable Reinforcement Learning with a Short-Term Memory","date":"2022-02-08","arxiv_id":"2202.03983","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-regret-for-differentially-private","title":"Improved Regret for Differentially Private Exploration in Linear MDP","date":"2022-02-02","arxiv_id":"2202.01292","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-hypothesis-spaces-for","title":"Meta-Learning Hypothesis Spaces for Sequential Decision-making","date":"2022-02-01","arxiv_id":"2202.00602","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-off-policy-evaluation-from-a","title":"Generalizing Off-Policy Evaluation From a Causal Perspective For Sequential Decision-Making","date":"2022-01-20","arxiv_id":"2201.08262","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-based-multistage-sequential","title":"Active Learning-Based Multistage Sequential Decision-Making Model with Application on Common Bile Duct Stone Evaluation","date":"2022-01-13","arxiv_id":"2201.04807","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-reinforcement-learning-an-overview","title":"Automated Reinforcement Learning: An Overview","date":"2022-01-13","arxiv_id":"2201.05000","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-echelon-supply-chains-with-uncertain","title":"Multi-echelon Supply Chains with Uncertain Seasonal Demands and Lead Times Using Deep Reinforcement Learning","date":"2022-01-12","arxiv_id":"2201.04651","repositories_listed":0,"syntology":null},{"url":null,"slug":"subgoal-based-explanations-for-unreliable","title":"Subgoal-Based Explanations for Unreliable Intelligent Decision Support Systems","date":"2022-01-11","arxiv_id":"2201.04204","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-of-the-art-of-user-simulation","title":"State of the Art of User Simulation approaches for conversational information retrieval","date":"2022-01-10","arxiv_id":"2201.03435","repositories_listed":0,"syntology":null},{"url":null,"slug":"monitoring-and-anomaly-detection-actor-critic","title":"Temporal Detection of Anomalies via Actor-Critic Based Controlled Sensing","date":"2022-01-03","arxiv_id":"2201.00879","repositories_listed":0,"syntology":null},{"url":null,"slug":"socially-optimal-mechanism-design-for","title":"Socially-Optimal Mechanism Design for Incentivized Online Learning","date":"2021-12-29","arxiv_id":"2112.14338","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-planning-complexity-of-general","title":"Reducing Planning Complexity of General Reinforcement Learning with Non-Markovian Abstractions","date":"2021-12-26","arxiv_id":"2112.13386","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-interpretable-reinforcement","title":"A Survey on Interpretable Reinforcement Learning","date":"2021-12-24","arxiv_id":"2112.13112","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-algorithms-for-poker-require-modelling","title":"Revisiting Game Representations: The Hidden Costs of Efficiency in Sequential Decision-making Algorithms","date":"2021-12-20","arxiv_id":"2112.10890","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-deep-reinforcement-learning-to","title":"Application of Deep Reinforcement Learning to Payment Fraud","date":"2021-12-08","arxiv_id":"2112.04236","repositories_listed":0,"syntology":null},{"url":null,"slug":"first-order-regret-in-reinforcement-learning","title":"First-Order Regret in Reinforcement Learning with Linear Function Approximation: A Robust Estimation Approach","date":"2021-12-07","arxiv_id":"2112.03432","repositories_listed":0,"syntology":null},{"url":null,"slug":"mdpfuzzer-finding-crash-triggering-state","title":"MDPFuzz: Testing Models Solving Markov Decision Processes","date":"2021-12-06","arxiv_id":"2112.02807","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-spatial-causal-interpretations-for","title":"Temporal-Spatial Causal Interpretations for Vision-Based Reinforcement Learning","date":"2021-12-06","arxiv_id":"2112.03020","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-zero-shot-generalization-in-offline-1","title":"Improving Zero-shot Generalization in Offline Reinforcement Learning using Generalized Similarity Functions","date":"2021-11-29","arxiv_id":"2111.14629","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimistic-model-selection-for-offline-deep-1","title":"Pessimistic Model Selection for Offline Deep Reinforcement Learning","date":"2021-11-29","arxiv_id":"2111.14346","repositories_listed":0,"syntology":null},{"url":null,"slug":"identification-of-subgroups-with-similar","title":"Identification of Subgroups With Similar Benefits in Off-Policy Policy Evaluation","date":"2021-11-28","arxiv_id":"2111.14272","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-and-optimal-algorithms-for","title":"Efficient and Optimal Algorithms for Contextual Dueling Bandits under Realizability","date":"2021-11-24","arxiv_id":"2111.12306","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-column-generation-for-capacitated","title":"Neural Column Generation for Capacitated Vehicle Routing","date":"2021-11-24","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-deep-learning-for-online-resource","title":"Adversarial Deep Learning for Online Resource Allocation","date":"2021-11-19","arxiv_id":"2111.10285","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-entity","title":"Deep Reinforcement Learning for Entity Alignment","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"route-optimization-via-environment-aware-deep","title":"Route Optimization via Environment-Aware Deep Network and Reinforcement Learning","date":"2021-11-16","arxiv_id":"2111.09124","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-goal-generation-using-dynamical","title":"Automatic Goal Generation using Dynamical Distance Learning","date":"2021-11-07","arxiv_id":"2111.04120","repositories_listed":0,"syntology":null},{"url":null,"slug":"regular-decision-processes-for-grid-worlds","title":"Regular Decision Processes for Grid Worlds","date":"2021-11-05","arxiv_id":"2111.03647","repositories_listed":0,"syntology":null},{"url":null,"slug":"partial-adaptive-submodular-maximization","title":"Partial-Adaptive Submodular Maximization","date":"2021-11-01","arxiv_id":"2111.00986","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-law-of-iterated-logarithm-for-multi-agent","title":"A Law of Iterated Logarithm for Multi-Agent Reinforcement Learning","date":"2021-10-27","arxiv_id":"2110.15092","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-value-of-information-when-deciding-what","title":"The Value of Information When Deciding What to Learn","date":"2021-10-26","arxiv_id":"2110.13973","repositories_listed":0,"syntology":null},{"url":null,"slug":"hsvi-fo-zs-posgs-using-concavity-convexity","title":"HSVI for zs-POSGs using Concavity, Convexity and Lipschitz Properties","date":"2021-10-25","arxiv_id":"2110.14529","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-thompson-sampling-for-partially","title":"Analysis of Thompson Sampling for Partially Observable Contextual Multi-Armed Bandits","date":"2021-10-23","arxiv_id":"2110.12175","repositories_listed":0,"syntology":null},{"url":null,"slug":"anti-concentrated-confidence-bonuses-for-1","title":"Anti-Concentrated Confidence Bonuses for Scalable Exploration","date":"2021-10-21","arxiv_id":"2110.11202","repositories_listed":0,"syntology":null},{"url":null,"slug":"ss-mail-self-supervised-multi-agent-imitation-1","title":"SS-MAIL: Self-Supervised Multi-Agent Imitation Learning","date":"2021-10-18","arxiv_id":"2110.08963","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-cooperation-and-online-planning","title":"Learning Cooperation and Online Planning Through Simulation and Graph Convolutional Network","date":"2021-10-16","arxiv_id":"2110.08480","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-aware-robot-navigation-via","title":"Human-Aware Robot Navigation via Reinforcement Learning with Hindsight Experience Replay and Curriculum Learning","date":"2021-10-09","arxiv_id":"2110.04564","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-to-call-your-neighbor-strategic","title":"When to Call Your Neighbor? Strategic Communication in Cooperative Stochastic Bandits","date":"2021-10-08","arxiv_id":"2110.04396","repositories_listed":0,"syntology":null},{"url":null,"slug":"nested-policy-reinforcement-learning","title":"Compositional Q-learning for electrolyte repletion with imbalanced patient sub-populations","date":"2021-10-06","arxiv_id":"2110.02879","repositories_listed":0,"syntology":null},{"url":null,"slug":"gambits-theory-and-evidence","title":"Gambits: Theory and Evidence","date":"2021-10-05","arxiv_id":"2110.02755","repositories_listed":0,"syntology":null},{"url":null,"slug":"partner-aware-algorithms-in-decentralized","title":"Partner-Aware Algorithms in Decentralized Cooperative Bandit Teams","date":"2021-10-02","arxiv_id":"2110.00751","repositories_listed":0,"syntology":null},{"url":null,"slug":"crowdplay-crowdsourcing-human-demonstration","title":"CrowdPlay: Crowdsourcing human demonstration data for offline learning in Atari games","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cross-entropy-method-for-model","title":"Decentralized Cross-Entropy Method for Model-Based Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-successor-features-to-continuous","title":"Generalizing Successor Features to continuous domains for Multi-task Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-randomization-for-playing-text-based","title":"Goal Randomization for Playing Text-based Games without a Reward Function","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-ensemble-diversity-in-deep","title":"Maximizing Ensemble Diversity in Deep Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-bootstrapping-attention-for-neural","title":"Neural Bootstrapping Attention for Neural Processes","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pdqn-a-deep-reinforcement-learning-method-for","title":"PDQN - A Deep Reinforcement Learning Method for Planning with Long Delays: Optimization of Manufacturing Dispatching","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-versus-evolution","title":"Deep Reinforcement Learning Versus Evolution Strategies: A Comparative Survey","date":"2021-09-28","arxiv_id":"2110.01411","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-quantitative","title":"Reinforcement Learning for Quantitative Trading","date":"2021-09-28","arxiv_id":"2109.13851","repositories_listed":0,"syntology":null},{"url":null,"slug":"combing-policy-evaluation-and-policy","title":"The $f$-Divergence Reinforcement Learning Framework","date":"2021-09-24","arxiv_id":"2109.11867","repositories_listed":0,"syntology":null},{"url":null,"slug":"dimension-free-rates-for-natural-policy","title":"Dimension-Free Rates for Natural Policy Gradient in Multi-Agent Reinforcement Learning","date":"2021-09-23","arxiv_id":"2109.11692","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-optimal-robustness-to-adversarial","title":"On Optimal Robustness to Adversarial Corruption in Online Decision Problems","date":"2021-09-22","arxiv_id":"2109.10963","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-bayesian-estimation-for-dynamic","title":"Deep Bayesian Estimation for Dynamic Treatment Regimes with a Long Follow-up Time","date":"2021-09-20","arxiv_id":"2109.11929","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-offline-reinforcement-learning","title":"Accelerating Offline Reinforcement Learning Application in Real-Time Bidding and Recommendation: Potential Use of Simulation","date":"2021-09-17","arxiv_id":"2109.08331","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-emptive-learning-to-defer-for-sequential","title":"Learning-to-defer for sequential medical decision-making under uncertainty","date":"2021-09-13","arxiv_id":"2109.06312","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-ensemble-model-based-reinforcement","title":"Federated Ensemble Model-based Reinforcement Learning in Edge Computing","date":"2021-09-12","arxiv_id":"2109.05549","repositories_listed":0,"syntology":null},{"url":null,"slug":"gpu-accelerated-optimal-path-planning-in","title":"Optimal Path Planning of Autonomous Marine Vehicles in Stochastic Dynamic Ocean Flows using a GPU-Accelerated Algorithm","date":"2021-09-02","arxiv_id":"2109.00857","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-dba-no-regret-multi-armed-bandits-for","title":"No DBA? No regret! Multi-armed bandits for index tuning of analytical and HTAP workloads with provable guarantees","date":"2021-08-23","arxiv_id":"2108.10130","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-stochastic-optimization-in","title":"Sequential Stochastic Optimization in Separable Learning Environments","date":"2021-08-21","arxiv_id":"2108.09585","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-reinforcement-learning-for-broad","title":"Explainable Reinforcement Learning for Broad-XAI: A Conceptual Framework and Survey","date":"2021-08-20","arxiv_id":"2108.09003","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-human-decision-making-with-machine","title":"Improving Human Sequential Decision-Making with Reinforcement Learning","date":"2021-08-19","arxiv_id":"2108.08454","repositories_listed":0,"syntology":null},{"url":null,"slug":"tdm-trustworthy-decision-making-via","title":"TDM: Trustworthy Decision-Making via Interpretability Enhancement","date":"2021-08-13","arxiv_id":"2108.06080","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-ap-probing-and-scheduling-a-contextual","title":"Joint AP Probing and Scheduling: A Contextual Bandit Approach","date":"2021-08-06","arxiv_id":"2108.03297","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyapunov-based-uncertainty-aware-safe","title":"Lyapunov-based uncertainty-aware safe reinforcement learning","date":"2021-07-29","arxiv_id":"2107.13944","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-blame-attribution-for-accountable-multi","title":"On Blame Attribution for Accountable Multi-Agent Sequential Decision Making","date":"2021-07-26","arxiv_id":"2107.11927","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-adaptive-submodular-maximization","title":"Robust Adaptive Submodular Maximization","date":"2021-07-23","arxiv_id":"2107.11333","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-agent-training-with","title":"Reinforcement Learning Agent Training with Goals for Real World Tasks","date":"2021-07-21","arxiv_id":"2107.10390","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-accuracy-model-based-reinforcement","title":"High-Accuracy Model-Based Reinforcement Learning, a Survey","date":"2021-07-17","arxiv_id":"2107.08241","repositories_listed":0,"syntology":null},{"url":null,"slug":"recent-advances-in-leveraging-human-guidance","title":"Recent Advances in Leveraging Human Guidance for Sequential Decision-Making Tasks","date":"2021-07-13","arxiv_id":"2107.05825","repositories_listed":0,"syntology":null},{"url":null,"slug":"metalearning-linear-bandits-by-prior-update","title":"Metalearning Linear Bandits by Prior Update","date":"2021-07-12","arxiv_id":"2107.05320","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-decision-making-under-misspecified","title":"Bayesian decision-making under misspecified priors with applications to meta-learning","date":"2021-07-03","arxiv_id":"2107.01509","repositories_listed":0,"syntology":null},{"url":null,"slug":"markov-decision-process-modeled-with-bandits","title":"Markov Decision Process modeled with Bandits for Sequential Decision Making in Linear-flow","date":"2021-07-01","arxiv_id":"2107.00204","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-making-with-dynamic-probabilistic","title":"Decision making with dynamic probabilistic forecasts","date":"2021-06-30","arxiv_id":"2106.16047","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-set-based-policy-optimization-for-safe","title":"Action Set Based Policy Optimization for Safe Power Grid Management","date":"2021-06-29","arxiv_id":"2106.15200","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-assisted-online-machine-learning-over","title":"UAV-assisted Online Machine Learning over Multi-Tiered Networks: A Hierarchical Nested Personalized Federated Learning Approach","date":"2021-06-29","arxiv_id":"2106.15734","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-4","title":"A Reinforcement Learning Approach for Sequential Spatial Transformer Networks","date":"2021-06-27","arxiv_id":"2106.14295","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-intelligent-autonomous-navigation","title":"Building Intelligent Autonomous Navigation Agents","date":"2021-06-25","arxiv_id":"2106.13415","repositories_listed":0,"syntology":null}],"record_sha256":"961b99e944073062705663e76e29f0c9c593819ea0c698fa46493f15d3319b13","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}