{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/sequential-decision-making/papers/8","list_of":"/task/sequential-decision-making","task":"Sequential Decision Making","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":8,"pages_in_order":13,"rows_per_page":100,"rows":[701,800],"of":1210,"counts":{"archive_papers_tagged":1210,"with_a_code_link":351,"where_syntology_ran_a_sample":107,"not_listed_spam_title":0,"listed":1210,"listed_where_code_ran":107,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":90,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":90,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/sequential-decision-making","prev":"/task/sequential-decision-making/papers/7","next":"/task/sequential-decision-making/papers/9","papers":[{"url":null,"slug":"linear-partial-monitoring-for-sequential","title":"Linear Partial Monitoring for Sequential Decision-Making: Algorithms, Regret Bounds and Applications","date":"2023-02-07","arxiv_id":"2302.03683","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-strong-baseline-for-batch-imitation","title":"A Strong Baseline for Batch Imitation Learning","date":"2023-02-06","arxiv_id":"2302.02788","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reduction-based-framework-for-sequential","title":"A Reduction-based Framework for Sequential Decision Making with Delayed Feedback","date":"2023-02-03","arxiv_id":"2302.01477","repositories_listed":0,"syntology":null},{"url":"/paper/learning-universal-policies-via-text-guided","slug":"learning-universal-policies-via-text-guided","title":"Learning Universal Policies via Text-Guided Video Generation","date":"2023-01-31","arxiv_id":"2302.00111","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-posterior-sampling-for-constrained-mdps","title":"Safe Posterior Sampling for Constrained MDPs with Bounded Constraint Violation","date":"2023-01-27","arxiv_id":"2301.11547","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-global-convergence-of-risk-averse","title":"On the Global Convergence of Risk-Averse Policy Gradient Methods with Expected Conditional Risk Measures","date":"2023-01-26","arxiv_id":"2301.10932","repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-point-allocation-for-sparse-gaussian","title":"Inducing Point Allocation for Sparse Gaussian Processes in High-Throughput Bayesian Optimisation","date":"2023-01-24","arxiv_id":"2301.10123","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-self-supervised-multi-task-pretraining","title":"SMART: Self-supervised Multi-task pretrAining with contRol Transformers","date":"2023-01-24","arxiv_id":"2301.09816","repositories_listed":0,"syntology":null},{"url":null,"slug":"gbose-generalized-bandit-orthogonalized","title":"GBOSE: Generalized Bandit Orthogonalized Semiparametric Estimation","date":"2023-01-20","arxiv_id":"2301.08781","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-focused-evaluation-analyzing","title":"Decision-Focused Evaluation: Analyzing Performance of Deployed Restless Multi-Arm Bandits","date":"2023-01-19","arxiv_id":"2301.07835","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-world-models-for-adapting-to","title":"Neuro-Symbolic World Models for Adapting to Open World Novelty","date":"2023-01-16","arxiv_id":"2301.06294","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-meta-reinforcement-learning","title":"Neuro-symbolic Meta Reinforcement Learning for Trading","date":"2023-01-15","arxiv_id":"2302.08996","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-and-sequential-decision-making","title":"Fairness and Sequential Decision Making: Limits, Lessons, and Opportunities","date":"2023-01-13","arxiv_id":"2301.05753","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-training-of-quantum","title":"Asynchronous training of quantum reinforcement learning","date":"2023-01-12","arxiv_id":"2301.05096","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-fair-resource-allocation-under-a","title":"Sequential Fair Resource Allocation under a Markov Decision Process Framework","date":"2023-01-10","arxiv_id":"2301.03758","repositories_listed":0,"syntology":null},{"url":"/paper/rlas-biabc-a-reinforcement-learning-based","slug":"rlas-biabc-a-reinforcement-learning-based","title":"RLAS-BIABC: A Reinforcement Learning-Based Answer Selection Using the BERT Model Boosted by an Improved ABC Algorithm","date":"2023-01-07","arxiv_id":"2301.02807","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-enhancement-of-reinforcement-learning","title":"Value Enhancement of Reinforcement Learning via Efficient and Robust Trust Region Optimization","date":"2023-01-05","arxiv_id":"2301.02220","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-differential-privacy-for-sequential","title":"Local Differential Privacy for Sequential Decision Making in a Changing Environment","date":"2023-01-02","arxiv_id":"2301.00561","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-statistical-inference-for-contextual","title":"Online Statistical Inference for Contextual Bandits via Stochastic Gradient Descent","date":"2022-12-30","arxiv_id":"2212.14883","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantile-off-policy-evaluation-via-deep","title":"Quantile Off-Policy Evaluation via Deep Conditional Generative Learning","date":"2022-12-29","arxiv_id":"2212.14466","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-the-linear-programming-framework","title":"Offline Reinforcement Learning via Linear-Programming with Error-Bound Induced Constraints","date":"2022-12-28","arxiv_id":"2212.13861","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-combinatorial-semi-bandit-with","title":"Linear Combinatorial Semi-Bandit with Causally Related Rewards","date":"2022-12-25","arxiv_id":"2212.12923","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-statistical-inference-for-matrix","title":"Online Statistical Inference in Decision-Making with Matrix Context","date":"2022-12-21","arxiv_id":"2212.11385","repositories_listed":0,"syntology":null},{"url":null,"slug":"invariant-lipschitz-bandits-a-side","title":"Invariant Lipschitz Bandits: A Side Observation Approach","date":"2022-12-14","arxiv_id":"2212.07524","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-approximate-exploratory-data","title":"Reinforced Approximate Exploratory Data Analysis","date":"2022-12-12","arxiv_id":"2212.06225","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-trajectory-stitching-for-improved-1","title":"Model-based trajectory stitching for improved behavioural cloning and its applications","date":"2022-12-08","arxiv_id":"2212.04280","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-automata-based-task-knowledge","title":"Automaton-Based Representations of Task Knowledge from Generative Language Models","date":"2022-12-04","arxiv_id":"2212.01944","repositories_listed":0,"syntology":null},{"url":null,"slug":"winning-the-citylearn-challenge-adaptive","title":"Winning the CityLearn Challenge: Adaptive Optimization with Evolutionary Search under Trajectory-based Guidance","date":"2022-12-04","arxiv_id":"2212.01939","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-reinforcement-learning-a","title":"Distributed Deep Reinforcement Learning: A Survey and A Multi-Player Multi-Agent Learning Toolbox","date":"2022-12-01","arxiv_id":"2212.00253","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-episodic-control","title":"Continuous Episodic Control","date":"2022-11-28","arxiv_id":"2211.15183","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-conditional-generative-modeling-all-you","title":"Is Conditional Generative Modeling all you need for Decision-Making?","date":"2022-11-28","arxiv_id":"2211.15657","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-environment-pretraining-enables","title":"Multi-Environment Pretraining Enables Transfer to Action Limited Datasets","date":"2022-11-23","arxiv_id":"2211.13337","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-5","title":"A Deep Reinforcement Learning Approach to Rare Event Estimation","date":"2022-11-22","arxiv_id":"2211.12470","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-watch-me-a-spatio-temporal-trojan","title":"Don't Watch Me: A Spatio-Temporal Trojan Attack on Deep-Reinforcement-Learning-Augment Autonomous Driving","date":"2022-11-22","arxiv_id":"2211.14440","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-reinforcement-learning-in","title":"A Survey on Reinforcement Learning in Aviation Applications","date":"2022-11-03","arxiv_id":"2211.02147","repositories_listed":0,"syntology":null},{"url":null,"slug":"teacher-student-curriculum-learning-for","title":"Teacher-student curriculum learning for reinforcement learning","date":"2022-10-31","arxiv_id":"2210.17368","repositories_listed":0,"syntology":null},{"url":null,"slug":"hsvi-can-solve-zero-sum-partially-observable","title":"HSVI can solve zero-sum Partially Observable Stochastic Games","date":"2022-10-26","arxiv_id":"2210.14640","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-deep-recurrent-reinforcement-learning","title":"Quantum deep recurrent reinforcement learning","date":"2022-10-26","arxiv_id":"2210.14876","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-decision-making-on-unmatched-data","title":"Sequential Decision Making on Unmatched Data using Bayesian Kernel Embeddings","date":"2022-10-25","arxiv_id":"2210.13692","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-policy-summaries-with-reward","title":"Integrating Policy Summaries with Reward Decomposition for Explaining Reinforcement Learning Agents","date":"2022-10-21","arxiv_id":"2210.11825","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-session-recommendations-in-e","title":"Fine-Grained Session Recommendations in E-commerce using Deep Reinforcement Learning","date":"2022-10-20","arxiv_id":"2210.15451","repositories_listed":0,"syntology":null},{"url":null,"slug":"movement-penalized-bayesian-optimization-with","title":"Movement Penalized Bayesian Optimization with Application to Wind Energy Systems","date":"2022-10-14","arxiv_id":"2210.08087","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-on-the-edge-online-learning-with","title":"Learning on the Edge: Online Learning with Stochastic Feedback Graphs","date":"2022-10-09","arxiv_id":"2210.04229","repositories_listed":0,"syntology":null},{"url":null,"slug":"advice-conformance-verification-by","title":"Advice Conformance Verification by Reinforcement Learning agents for Human-in-the-Loop","date":"2022-10-07","arxiv_id":"2210.03455","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-approach-for-multi","title":"Reinforcement Learning Approach for Multi-Agent Flexible Scheduling Problems","date":"2022-10-07","arxiv_id":"2210.03674","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-bayesian-optimization-with","title":"Generalizing Bayesian Optimization with Decision-theoretic Entropies","date":"2022-10-04","arxiv_id":"2210.01383","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperbolic-deep-reinforcement-learning","title":"Hyperbolic Deep Reinforcement Learning","date":"2022-10-04","arxiv_id":"2210.01542","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-5","title":"Offline Reinforcement Learning with Differentiable Function Approximation is Provably Efficient","date":"2022-10-03","arxiv_id":"2210.00750","repositories_listed":0,"syntology":null},{"url":null,"slug":"blessing-from-experts-super-reinforcement","title":"Blessing from Human-AI Interaction: Super Reinforcement Learning in Confounded Environments","date":"2022-09-29","arxiv_id":"2209.15448","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-driver-s-evasive-behavior-during","title":"Modeling driver's evasive behavior during safety-critical lane changes:Two-dimensional time-to-collision and deep reinforcement learning","date":"2022-09-29","arxiv_id":"2209.15133","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-mle-a-generic-model-based","title":"Optimistic MLE -- A Generic Model-based Algorithm for Partially Observable Sequential Decision Making","date":"2022-09-29","arxiv_id":"2209.14997","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-non-exponential","title":"Reinforcement Learning with Non-Exponential Discounting","date":"2022-09-27","arxiv_id":"2209.13413","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-efficient-online-imitation-learning-via","title":"On Efficient Online Imitation Learning via Classification","date":"2022-09-26","arxiv_id":"2209.12868","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-adaptive-mesh","title":"Deep Reinforcement Learning for Adaptive Mesh Refinement","date":"2022-09-25","arxiv_id":"2209.12351","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-networks-for-multi-robot-active","title":"Graph Neural Networks for Multi-Robot Active Information Acquisition","date":"2022-09-24","arxiv_id":"2209.12091","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-with-virtual-helping-agents","title":"Thompson Sampling with Virtual Helping Agents","date":"2022-09-16","arxiv_id":"2209.08197","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-large-population-systems-and","title":"A Survey on Large-Population Systems and Scalable Multi-Agent Reinforcement Learning","date":"2022-09-08","arxiv_id":"2209.03859","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-information-design-learning-to","title":"Sequential Information Design: Learning to Persuade in the Dark","date":"2022-09-08","arxiv_id":"2209.03927","repositories_listed":0,"syntology":null},{"url":null,"slug":"metatrader-an-reinforcement-learning-approach","title":"MetaTrader: An Reinforcement Learning Approach Integrating Diverse Policies for Portfolio Optimization","date":"2022-09-01","arxiv_id":"2210.01774","repositories_listed":0,"syntology":null},{"url":null,"slug":"jarvis-a-neuro-symbolic-commonsense-reasoning","title":"JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents","date":"2022-08-28","arxiv_id":"2208.13266","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-regularization-for-population","title":"Entropy Regularization for Population Estimation","date":"2022-08-24","arxiv_id":"2208.11747","repositories_listed":0,"syntology":null},{"url":null,"slug":"sampling-through-the-lens-of-sequential","title":"Sampling Through the Lens of Sequential Decision Making","date":"2022-08-17","arxiv_id":"2208.08056","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-adaptive-submodular-maximization","title":"Streaming Adaptive Submodular Maximization","date":"2022-08-17","arxiv_id":"2208.08021","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-stochastic-dynamics-of","title":"Understanding the stochastic dynamics of sequential decision-making processes: A path-integral analysis of multi-armed bandits","date":"2022-08-11","arxiv_id":"2208.06245","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-vulman-a-deep-reinforcement-learning","title":"Deep VULMAN: A Deep Reinforcement Learning-Enabled Cyber Vulnerability Management Framework","date":"2022-08-03","arxiv_id":"2208.02369","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bayesian-approach-to-learning-bandit","title":"A Bayesian Approach to Learning Bandit Structure in Markov Decision Processes","date":"2022-07-30","arxiv_id":"2208.00250","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-safe-learning-for-online","title":"Sample-efficient Safe Learning for Online Nonlinear Control with Control Barrier Functions","date":"2022-07-29","arxiv_id":"2207.14419","repositories_listed":0,"syntology":null},{"url":null,"slug":"branch-ranking-for-efficient-mixed-integer","title":"Branch Ranking for Efficient Mixed-Integer Programming via Offline Ranking-based Policy Learning","date":"2022-07-26","arxiv_id":"2207.13701","repositories_listed":0,"syntology":null},{"url":null,"slug":"partial-monotone-adaptive-submodular","title":"Partial-Monotone Adaptive Submodular Maximization","date":"2022-07-26","arxiv_id":"2207.12840","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-neural-ordinary-differential-equations","title":"Adaptive Asynchronous Control Using Meta-learned Neural Ordinary Differential Equations","date":"2022-07-25","arxiv_id":"2207.12062","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-dimensional-stochastic-linear-contextual","title":"High dimensional stochastic linear contextual bandit with missing covariates","date":"2022-07-22","arxiv_id":"2207.11165","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-continuously-act-discretely-hybrid","title":"Learn Continuously, Act Discretely: Hybrid Action-Space Reinforcement Learning For Optimal Execution","date":"2022-07-22","arxiv_id":"2207.11152","repositories_listed":0,"syntology":null},{"url":null,"slug":"delayed-feedback-in-generalised-linear","title":"Delayed Feedback in Generalised Linear Bandits Revisited","date":"2022-07-21","arxiv_id":"2207.10786","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategising-template-guided-needle-placement","title":"Strategising template-guided needle placement for MR-targeted prostate biopsy","date":"2022-07-21","arxiv_id":"2207.10784","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-learning-with-off-policy-feedback","title":"Online Learning with Off-Policy Feedback","date":"2022-07-18","arxiv_id":"2207.08956","repositories_listed":0,"syntology":null},{"url":null,"slug":"guaranteed-discovery-of-controllable-latent","title":"Guaranteed Discovery of Control-Endogenous Latent States with Multi-Step Inverse Models","date":"2022-07-17","arxiv_id":"2207.08229","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-up-ml-based-black-box-planning-with","title":"Scaling up ML-based Black-box Planning with Partial STRIPS Models","date":"2022-07-10","arxiv_id":"2207.04479","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-saliency-models-predictions-of-the","title":"Improving saliency models' predictions of the next fixation with humans' intrinsic cost of gaze shifts","date":"2022-07-09","arxiv_id":"2207.04250","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-optimal-solutions-via-an-lstm","title":"Learning Optimal Solutions via an LSTM-Optimization Framework","date":"2022-07-06","arxiv_id":"2207.02937","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-approaches-for-the","title":"Reinforcement Learning Approaches for the Orienteering Problem with Stochastic and Dynamic Release Dates","date":"2022-07-02","arxiv_id":"2207.00885","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-dynamic-model-1","title":"Reinforcement Learning Based Dynamic Model Combination for Time Series Forecasting","date":"2022-06-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"utility-theory-for-sequential-decision-making","title":"Utility Theory for Sequential Decision Making","date":"2022-06-27","arxiv_id":"2206.13637","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-link-flows-in-road-networks-with","title":"Estimating Link Flows in Road Networks with Synthetic Trajectory Data Generation: Reinforcement Learning-based Approaches","date":"2022-06-26","arxiv_id":"2206.12873","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-model-based-reinforcement","title":"A Survey on Model-based Reinforcement Learning","date":"2022-06-19","arxiv_id":"2206.09328","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-federated-learning-via-predictive","title":"Federated Learning with Uncertainty via Distilled Predictive Distributions","date":"2022-06-15","arxiv_id":"2206.07562","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-rollout-length-for-model-based-rl","title":"Adaptive Rollout Length for Model-Based RL Using Model-Free Deep RL","date":"2022-06-06","arxiv_id":"2206.02380","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-and-sample-complexity-of-natural","title":"Convergence and sample complexity of natural policy gradient primal-dual methods for constrained MDPs","date":"2022-06-06","arxiv_id":"2206.02346","repositories_listed":0,"syntology":null},{"url":null,"slug":"between-rate-distortion-theory-value","title":"Between Rate-Distortion Theory & Value Equivalence in Model-Based Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.02025","repositories_listed":0,"syntology":null},{"url":null,"slug":"deciding-what-to-model-value-equivalent","title":"Deciding What to Model: Value-Equivalent Sampling for Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.02072","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpolating-between-softmax-policy-gradient","title":"Interpolating Between Softmax Policy Gradient and Neural Replicator Dynamics with Capped Implicit Exploration","date":"2022-06-04","arxiv_id":"2206.02036","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-6","title":"A Deep Reinforcement Learning Framework For Column Generation","date":"2022-06-03","arxiv_id":"2206.02568","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-robust-online-portfolio-selection","title":"Adaptive Robust Online Portfolio Selection","date":"2022-06-02","arxiv_id":"2206.01064","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-near-optimal-best-of-both-worlds-algorithm","title":"A Near-Optimal Best-of-Both-Worlds Algorithm for Online Learning with Feedback Graphs","date":"2022-06-01","arxiv_id":"2206.00557","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-learning-of-numerical-methods-for","title":"Multi-Agent Learning of Numerical Methods for Hyperbolic PDEs with Factored Dec-MDP","date":"2022-05-31","arxiv_id":"2205.15716","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unifying-framework-for-causal-explanation","title":"Causal Explanations for Sequential Decision Making Under Uncertainty","date":"2022-05-30","arxiv_id":"2205.15462","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-learning-for-discovery","title":"Adaptive Sampling for Discovery","date":"2022-05-30","arxiv_id":"2205.14829","repositories_listed":0,"syntology":null},{"url":null,"slug":"flow-based-recurrent-belief-state-learning-1","title":"Flow-based Recurrent Belief State Learning for POMDPs","date":"2022-05-23","arxiv_id":"2205.11051","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-on-fair-reinforcement-learning-theory","title":"Survey on Fair Reinforcement Learning: Theory and Practice","date":"2022-05-20","arxiv_id":"2205.10032","repositories_listed":0,"syntology":null},{"url":null,"slug":"marginal-and-joint-cross-entropies","title":"Marginal and Joint Cross-Entropies & Predictives for Online Bayesian Inference, Active Learning, and Active Sampling","date":"2022-05-18","arxiv_id":"2205.08766","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-for-context-dependent","title":"Representation Learning for Context-Dependent Decision-Making","date":"2022-05-12","arxiv_id":"2205.05820","repositories_listed":0,"syntology":null}],"record_sha256":"6d9689739aa0dd9fabb6c4e4dc5d92d17af97b5c87086c501f449f72cf2f658b","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}