{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/134","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":134,"pages_in_order":135,"rows_per_page":100,"rows":[13301,13400],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/133","next":"/task/reinforcement-learning-2/papers/135","papers":[{"url":null,"slug":"practical-kernel-based-reinforcement-learning","title":"Practical Kernel-Based Reinforcement Learning","date":"2014-07-21","arxiv_id":"1407.5358","repositories_listed":0,"syntology":null},{"url":null,"slug":"extreme-state-aggregation-beyond-mdps","title":"Extreme State Aggregation Beyond MDPs","date":"2014-07-12","arxiv_id":"1407.3341","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-algorithm-for","title":"Reinforcement Learning Based Algorithm for the Maximization of EV Charging Station Revenue","date":"2014-07-04","arxiv_id":"1407.1291","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-learning-parameterized","title":"Thompson Sampling for Learning Parameterized Markov Decision Processes","date":"2014-06-29","arxiv_id":"1406.7498","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-and-imitation-learning-via","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","date":"2014-06-23","arxiv_id":"1406.5979","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-medical-treatments-using-novel","title":"Personalized Medical Treatments Using Novel Reinforcement Learning Algorithms","date":"2014-06-16","arxiv_id":"1406.3922","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-reinforcement-learning-with","title":"Multi-objective Reinforcement Learning with Continuous Pareto Frontier Approximation Supplementary Material","date":"2014-06-13","arxiv_id":"1406.3497","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-and-the","title":"Model-based Reinforcement Learning and the Eluder Dimension","date":"2014-06-07","arxiv_id":"1406.1853","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-multi-label-classification-with","title":"Comparing Multi-label Classification with Reinforcement Learning for Summarisation of Time-series Data","date":"2014-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-reinforcement-learning-a-new-theory","title":"Proximal Reinforcement Learning: A New Theory of Sequential Decision Making in Primal-Dual Spaces","date":"2014-05-26","arxiv_id":"1405.6757","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-shaping-ensembles-in-reinforcement","title":"Off-Policy Shaping Ensembles in Reinforcement Learning","date":"2014-05-21","arxiv_id":"1405.5358","repositories_listed":0,"syntology":null},{"url":null,"slug":"projective-simulation-applied-to-the-grid","title":"Projective simulation applied to the grid-world and the mountain-car problem","date":"2014-05-21","arxiv_id":"1405.5459","repositories_listed":0,"syntology":null},{"url":null,"slug":"selecting-near-optimal-approximate-state","title":"Selecting Near-Optimal Approximate State Representations in Reinforcement Learning","date":"2014-05-12","arxiv_id":"1405.2652","repositories_listed":0,"syntology":null},{"url":null,"slug":"structural-return-maximization-for","title":"Structural Return Maximization for Reinforcement Learning","date":"2014-05-12","arxiv_id":"1405.2606","repositories_listed":0,"syntology":null},{"url":null,"slug":"dinasti-dialogues-with-a-negotiating","title":"DINASTI: Dialogues with a Negotiating Appointment Setting Interface","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"undirected-machine-translation-with","title":"Undirected Machine Translation with Discriminative Reinforcement Learning","date":"2014-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"comparison-of-multi-agent-and-single-agent","title":"Comparison of Multi-agent and Single-agent Inverse Learning on a Simulated Soccer Example","date":"2014-03-26","arxiv_id":"1403.6822","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-inverse-reinforcement-learning","title":"Multi-agent Inverse Reinforcement Learning for Two-person Zero-sum Games","date":"2014-03-25","arxiv_id":"1403.6508","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-reinforcement-learning-in","title":"Near-optimal Reinforcement Learning in Factored MDPs","date":"2014-03-15","arxiv_id":"1403.3741","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-exploration-of-state-and-action-spaces","title":"Safe Exploration of State and Action Spaces in Reinforcement Learning","date":"2014-02-04","arxiv_id":"1402.0560","repositories_listed":0,"syntology":null},{"url":null,"slug":"kalman-temporal-differences","title":"Kalman Temporal Differences","date":"2014-01-16","arxiv_id":"1406.3270","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-deterministic-policies-in-markovian","title":"Non-Deterministic Policies in Markovian Decision Processes","date":"2014-01-16","arxiv_id":"1401.3871","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multiagent-reinforcement-learning-algorithm","title":"A Multiagent Reinforcement Learning Algorithm with Non-linear Dynamics","date":"2014-01-15","arxiv_id":"1401.3454","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-partially-observable-deterministic","title":"Learning Partially Observable Deterministic Action Models","date":"2014-01-15","arxiv_id":"1401.3437","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-generalisation-symmetries-in","title":"Exploiting generalisation symmetries in accuracy-based learning classifier systems: An initial study","date":"2014-01-10","arxiv_id":"1401.2949","repositories_listed":0,"syntology":null},{"url":null,"slug":"dj-mc-a-reinforcement-learning-agent-for","title":"DJ-MC: A Reinforcement-Learning Agent for Music Playlist Recommendation","date":"2014-01-09","arxiv_id":"1401.1880","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-demand-response-using-device-based","title":"Optimal Demand Response Using Device Based Reinforcement Learning","date":"2014-01-08","arxiv_id":"1401.1549","repositories_listed":0,"syntology":null},{"url":null,"slug":"bellman-error-based-feature-generation-using","title":"Bellman Error Based Feature Generation using Random Projections on Sparse Spaces","date":"2013-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-and-value-function","title":"Efficient Exploration and Value Function Generalization in Deterministic Systems","date":"2013-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-shaping-integrating-human-feedback","title":"Policy Shaping: Integrating Human Feedback with Reinforcement Learning","date":"2013-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"projected-natural-actor-critic","title":"Projected Natural Actor-Critic","date":"2013-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-robust-markov","title":"Reinforcement Learning in Robust Markov Decision Processes","date":"2013-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-reinforcement-learning-for-h_infty","title":"Off-policy reinforcement learning for $ H_\\infty $ control design","date":"2013-11-24","arxiv_id":"1311.6107","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning","title":"Risk-sensitive Reinforcement Learning","date":"2013-11-08","arxiv_id":"1311.2097","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-interactive-personalized-music","title":"Exploration in Interactive Personalized Music Recommendation: A Reinforcement Learning Approach","date":"2013-11-06","arxiv_id":"1311.6355","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-matrix","title":"Reinforcement Learning for Matrix Computations: PageRank as an Example","date":"2013-11-01","arxiv_id":"1311.2889","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-framework-for","title":"Reinforcement Learning Framework for Opportunistic Routing in WSNs","date":"2013-10-31","arxiv_id":"1310.8467","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-reinforcement-learning-via-gossip","title":"Distributed Reinforcement Learning via Gossip","date":"2013-10-28","arxiv_id":"1310.7610","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-multi-task-reinforcement","title":"Sample Complexity of Multi-task Reinforcement Learning","date":"2013-09-26","arxiv_id":"1309.6821","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-sample-complexity-of-general","title":"The Sample-Complexity of General Reinforcement Learning","date":"2013-08-22","arxiv_id":"1308.4828","repositories_listed":0,"syntology":null},{"url":null,"slug":"coevolutionary-networks-of-reinforcement","title":"Coevolutionary networks of reinforcement-learning agents","date":"2013-08-05","arxiv_id":"1308.1049","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-student-feedback-from-time-series","title":"Generating Student Feedback from Time-Series Data Using Reinforcement Learning","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-two-issue","title":"Reinforcement Learning of Two-Issue Negotiation Dialogue Policies","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-transfer-in-multi-armed-bandit","title":"Sequential Transfer in Multi-armed Bandit with Finite Set of Models","date":"2013-07-25","arxiv_id":"1307.6887","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-in","title":"Efficient Reinforcement Learning in Deterministic Systems with Value Function Generalization","date":"2013-07-18","arxiv_id":"1307.4847","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-inverse-reinforcement-learning-1","title":"Probabilistic inverse reinforcement learning in unknown environments","date":"2013-07-14","arxiv_id":"1307.3785","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-policy-search","title":"Multi-Task Policy Search","date":"2013-07-02","arxiv_id":"1307.0813","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-up-robust-mdps-by-reinforcement","title":"Scaling Up Robust MDPs by Reinforcement Learning","date":"2013-06-26","arxiv_id":"1306.6189","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-restrictions-on","title":"Reinforcement learning with restrictions on the action set","date":"2013-06-12","arxiv_id":"1306.2918","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-association-problem-in-wireless-networks","title":"The association problem in wireless networks: a Policy Gradient Reinforcement Learning approach","date":"2013-06-11","arxiv_id":"1306.2554","repositories_listed":0,"syntology":null},{"url":null,"slug":"direct-uncertainty-estimation-in","title":"Direct Uncertainty Estimation in Reinforcement Learning","date":"2013-06-06","arxiv_id":"1306.1553","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-efficient-reinforcement-learning-via","title":"(More) Efficient Reinforcement Learning via Posterior Sampling","date":"2013-06-04","arxiv_id":"1306.0940","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-the-soccer","title":"Reinforcement Learning for the Soccer Dribbling Task","date":"2013-05-28","arxiv_id":"1305.6568","repositories_listed":0,"syntology":null},{"url":null,"slug":"cover-tree-bayesian-reinforcement-learning","title":"Cover Tree Bayesian Reinforcement Learning","date":"2013-05-08","arxiv_id":"1305.1809","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bounds-for-reinforcement-learning-with","title":"Regret Bounds for Reinforcement Learning with Policy Advice","date":"2013-05-05","arxiv_id":"1305.1027","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-deterministic-logic-programs","title":"Non Deterministic Logic Programs","date":"2013-04-26","arxiv_id":"1304.7168","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-framework-for-interacting-bayes","title":"A General Framework for Interacting Bayes-Optimally with Self-Interested Agents using Arbitrary Parametric Model and Model Prior","date":"2013-04-07","arxiv_id":"1304.2024","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-bayesian-reinforcement-learning","title":"Model-based Bayesian Reinforcement Learning for Dialogue Management","date":"2013-04-05","arxiv_id":"1304.1819","repositories_listed":0,"syntology":null},{"url":null,"slug":"abc-reinforcement-learning","title":"ABC Reinforcement Learning","date":"2013-03-27","arxiv_id":"1303.6977","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-for-high","title":"Efficient Reinforcement Learning for High Dimensional Linear Quadratic Systems","date":"2013-03-24","arxiv_id":"1303.5984","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-greedy-approximation-of-bayesian","title":"A Greedy Approximation of Bayesian Reinforcement Learning with Probably Optimistic Transition Model","date":"2013-03-13","arxiv_id":"1303.3163","repositories_listed":0,"syntology":null},{"url":null,"slug":"toggling-a-genetic-switch-using-reinforcement","title":"Toggling a Genetic Switch Using Reinforcement Learning","date":"2013-03-12","arxiv_id":"1303.3183","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-regret-bounds-for-undiscounted","title":"Online Regret Bounds for Undiscounted Continuous Reinforcement Learning","date":"2013-02-11","arxiv_id":"1302.2550","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-optimal-reward-baseline-for-gradient","title":"The Optimal Reward Baseline for Gradient-Based Reinforcement Learning","date":"2013-01-10","arxiv_id":"1301.2315","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-port-hamiltonian","title":"Reinforcement learning for port-Hamiltonian systems","date":"2012-12-21","arxiv_id":"1212.5524","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithms-for-learning-markov-field-policies","title":"Algorithms for Learning Markov Field Policies","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-hierarchical-reinforcement-learning","title":"Bayesian Hierarchical Reinforcement Learning","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cost-sensitive-exploration-in-bayesian","title":"Cost-Sensitive Exploration in Bayesian Reinforcement Learning","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-model-based-reinforcement","title":"Exploration in Model-based Reinforcement Learning by Empirically Estimating Learning Progress","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-through","title":"Inverse Reinforcement Learning through Structured Classification","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neurally-plausible-reinforcement-learning-of","title":"Neurally Plausible Reinforcement Learning of Working Memory Tasks","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"nonparametric-bayesian-inverse-reinforcement","title":"Nonparametric Bayesian Inverse Reinforcement Learning for Multiple Reward Functions","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-line-reinforcement-learning-using","title":"On-line Reinforcement Learning Using Incremental Kernel-Based Stochastic Factorization","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sketch-based-linear-value-function","title":"Sketch-Based Linear Value Function Approximation","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-expectations-in-model-based","title":"Transferring Expectations in Model-based Reinforcement Learning","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-likelihood-policy-search-with-model","title":"Weighted Likelihood Policy Search with Model Selection","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tact-a-transfer-actor-critic-learning","title":"TACT: A Transfer Actor-Critic Learning Framework for Energy Saving in Cellular Radio Access Networks","date":"2012-11-28","arxiv_id":"1211.6616","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-reinforcement-of-behavioral","title":"Autonomous Reinforcement of Behavioral Sequences in Neural Dynamics","date":"2012-10-12","arxiv_id":"1210.3569","repositories_listed":0,"syntology":null},{"url":null,"slug":"april-active-preference-learning-based","title":"APRIL: Active Preference-learning based Reinforcement Learning","date":"2012-08-05","arxiv_id":"1208.0984","repositories_listed":0,"syntology":null},{"url":null,"slug":"framework-of-automatic-text-summarization","title":"Framework of Automatic Text Summarization Using Reinforcement Learning","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-question-answering","title":"Reinforcement Learning of Question-Answering Dialogue Policies for Virtual Museum Guides","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"12066449","title":"Monte Carlo Bayesian Reinforcement Learning","date":"2012-06-27","arxiv_id":"1206.6449","repositories_listed":0,"syntology":null},{"url":null,"slug":"apprenticeship-learning-using-inverse","title":"Apprenticeship Learning using Inverse Reinforcement Learning and Gradient Methods","date":"2012-06-20","arxiv_id":"1206.5264","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-bayes-adaptive-reinforcement","title":"Efficient Bayes-Adaptive Reinforcement Learning using Sample-Based Search","date":"2012-05-14","arxiv_id":"1205.3109","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-of-reinforcement-learning","title":"A Comparative Study of Reinforcement Learning Techniques on Dialogue Management","date":"2012-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pac-bayesian-policy-evaluation-for","title":"PAC-Bayesian Policy Evaluation for Reinforcement Learning","date":"2012-02-14","arxiv_id":"1202.3717","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-timescale-nexting-in-a-reinforcement","title":"Multi-timescale Nexting in a Reinforcement Learning Robot","date":"2011-12-06","arxiv_id":"1112.1133","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-theory-for","title":"A Reinforcement Learning Theory for Homeostatic Regulation","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"action-gap-phenomenon-in-reinforcement","title":"Action-Gap Phenomenon in Reinforcement Learning","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-and-improvement-of-policy-gradient","title":"Analysis and Improvement of Policy Gradient Estimation","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"blending-autonomous-exploration-and","title":"Blending Autonomous Exploration and Apprenticeship Learning","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"map-inference-for-bayesian-inverse","title":"MAP Inference for Bayesian Inverse Reinforcement Learning","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-reinforcement-learning-for-gaussian","title":"Optimal Reinforcement Learning for Gaussian Systems","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-coagent-networks","title":"Policy Gradient Coagent Networks","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-using-kernel-based","title":"Reinforcement Learning using Kernel-Based Stochastic Factorization","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"selecting-the-state-representation-in","title":"Selecting the State-Representation in Reinforcement Learning","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-from-multiple-mdps","title":"Transfer from Multiple MDPs","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-applied","title":"Risk-Sensitive Reinforcement Learning Applied to Control under Constraints","date":"2011-09-09","arxiv_id":"1109.2147","repositories_listed":0,"syntology":null},{"url":null,"slug":"constructing-skill-trees-for-reinforcement","title":"Constructing Skill Trees for Reinforcement Learning Agents from Demonstration Trajectories","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/double-q-learning","slug":"double-q-learning","title":"Double Q-learning","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"fd13250e41613d22f61a22282243ee032dea9578346ee4bfa47a87595d2b8af2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}