{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/132","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":132,"pages_in_order":132,"rows_per_page":100,"rows":[13101,13178],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/131","next":null,"papers":[{"url":null,"slug":"on-line-reinforcement-learning-using","title":"On-line Reinforcement Learning Using Incremental Kernel-Based Stochastic Factorization","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sketch-based-linear-value-function","title":"Sketch-Based Linear Value Function Approximation","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"timely-object-recognition","title":"Timely Object Recognition","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-expectations-in-model-based","title":"Transferring Expectations in Model-based Reinforcement Learning","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"value-pursuit-iteration","title":"Value Pursuit Iteration","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-likelihood-policy-search-with-model","title":"Weighted Likelihood Policy Search with Model Selection","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tact-a-transfer-actor-critic-learning","title":"TACT: A Transfer Actor-Critic Learning Framework for Energy Saving in Cellular Radio Access Networks","date":"2012-11-28","arxiv_id":"1211.6616","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-reinforcement-of-behavioral","title":"Autonomous Reinforcement of Behavioral Sequences in Neural Dynamics","date":"2012-10-12","arxiv_id":"1210.3569","repositories_listed":0,"syntology":null},{"url":null,"slug":"april-active-preference-learning-based","title":"APRIL: Active Preference-learning based Reinforcement Learning","date":"2012-08-05","arxiv_id":"1208.0984","repositories_listed":0,"syntology":null},{"url":null,"slug":"framework-of-automatic-text-summarization","title":"Framework of Automatic Text Summarization Using Reinforcement Learning","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-question-answering","title":"Reinforcement Learning of Question-Answering Dialogue Policies for Virtual Museum Guides","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"12066449","title":"Monte Carlo Bayesian Reinforcement Learning","date":"2012-06-27","arxiv_id":"1206.6449","repositories_listed":0,"syntology":null},{"url":null,"slug":"apprenticeship-learning-using-inverse","title":"Apprenticeship Learning using Inverse Reinforcement Learning and Gradient Methods","date":"2012-06-20","arxiv_id":"1206.5264","repositories_listed":0,"syntology":null},{"url":null,"slug":"path-integral-policy-improvement-with","title":"Path Integral Policy Improvement with Covariance Matrix Adaptation","date":"2012-06-18","arxiv_id":"1206.4621","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-bayes-adaptive-reinforcement","title":"Efficient Bayes-Adaptive Reinforcement Learning using Sample-Based Search","date":"2012-05-14","arxiv_id":"1205.3109","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-of-reinforcement-learning","title":"A Comparative Study of Reinforcement Learning Techniques on Dialogue Management","date":"2012-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pac-bayesian-policy-evaluation-for","title":"PAC-Bayesian Policy Evaluation for Reinforcement Learning","date":"2012-02-14","arxiv_id":"1202.3717","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-timescale-nexting-in-a-reinforcement","title":"Multi-timescale Nexting in a Reinforcement Learning Robot","date":"2011-12-06","arxiv_id":"1112.1133","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-theory-for","title":"A Reinforcement Learning Theory for Homeostatic Regulation","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinterpretation-of-the-policy-oscillation","title":"A reinterpretation of the policy oscillation phenomenon in approximate policy iteration","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"action-gap-phenomenon-in-reinforcement","title":"Action-Gap Phenomenon in Reinforcement Learning","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-and-improvement-of-policy-gradient","title":"Analysis and Improvement of Policy Gradient Estimation","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"blending-autonomous-exploration-and","title":"Blending Autonomous Exploration and Apprenticeship Learning","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"clustering-via-dirichlet-process-mixture","title":"Clustering via Dirichlet Process Mixture Models for Portable Skill Discovery","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-agglomerate-superpixel","title":"Learning to Agglomerate Superpixel Hierarchies","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"map-inference-for-bayesian-inverse","title":"MAP Inference for Bayesian Inverse Reinforcement Learning","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-reinforcement-learning-for-gaussian","title":"Optimal Reinforcement Learning for Gaussian Systems","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-coagent-networks","title":"Policy Gradient Coagent Networks","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-using-kernel-based","title":"Reinforcement Learning using Kernel-Based Stochastic Factorization","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"selecting-the-state-representation-in","title":"Selecting the State-Representation in Reinforcement Learning","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-fixed-points-of-off-policy-td","title":"The Fixed Points of Off-Policy TD","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-from-multiple-mdps","title":"Transfer from Multiple MDPs","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-applied","title":"Risk-Sensitive Reinforcement Learning Applied to Control under Constraints","date":"2011-09-09","arxiv_id":"1109.2147","repositories_listed":0,"syntology":null},{"url":null,"slug":"infinite-horizon-policy-gradient-estimation","title":"Infinite-Horizon Policy-Gradient Estimation","date":"2011-06-03","arxiv_id":"1106.0665","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reduction-from-apprenticeship-learning-to","title":"A Reduction from Apprenticeship Learning to Classification","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-apprenticeship-learning","title":"Bootstrapping Apprenticeship Learning","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"constructing-skill-trees-for-reinforcement","title":"Constructing Skill Trees for Reinforcement Learning Agents from Demonstration Trajectories","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/double-q-learning","slug":"double-q-learning","title":"Double Q-learning","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-construction-for-inverse","title":"Feature Construction for Inverse Reinforcement Learning","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interval-estimation-for-reinforcement","title":"Interval Estimation for Reinforcement-Learning Algorithms in Continuous-State Domains","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-complementarity-for-regularized-policy","title":"Linear Complementarity for Regularized Policy Evaluation and Improvement","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lstd-with-random-projections","title":"LSTD with Random Projections","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"nonparametric-bayesian-policy-priors-for","title":"Nonparametric Bayesian Policy Priors for Reinforcement Learning","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-a-connection-between-importance-sampling","title":"On a Connection between Importance Sampling and the Likelihood Ratio Policy Gradient","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pac-bayesian-model-selection-for","title":"PAC-Bayesian Model Selection for Reinforcement Learning","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-state-temporal-difference-learning","title":"Predictive State Temporal Difference Learning","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-reinforcement-learning-for-energy","title":"Fast Reinforcement Learning for Energy-Efficient Wireless Communications","date":"2010-09-29","arxiv_id":"1009.5773","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-via-aixi-approximation","title":"Reinforcement Learning via AIXI Approximation","date":"2010-07-13","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"computational-model-of-music-sight-reading-a","title":"Computational Model of Music Sight Reading: A Reinforcement Learning Approach","date":"2010-07-04","arxiv_id":"1007.0546","repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-selection-as-a-one-player-game","title":"Feature Selection as a One-Player Game","date":"2010-05-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-generalized-natural-actor-critic-algorithm","title":"A Generalized Natural Actor-Critic Algorithm","date":"2009-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"code-specific-policy-gradient-rules-for","title":"Code-specific policy gradient rules for spiking neurons","date":"2009-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-mdl-predicts-in-total-variation","title":"Discrete MDL Predicts in Total Variation","date":"2009-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-explore-and-exploit-in-pomdps","title":"Learning to Explore and Exploit in POMDPs","date":"2009-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"manifold-embeddings-for-model-based","title":"Manifold Embeddings for Model-Based Reinforcement Learning under Partial Observability","date":"2009-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"skill-discovery-in-continuous-reinforcement","title":"Skill Discovery in Continuous Reinforcement Learning Domains using Skill Chaining","date":"2009-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-stochastic-games","title":"Solving Stochastic Games","date":"2009-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-infinite-partially-observable-markov","title":"The Infinite Partially Observable Markov Decision Process","date":"2009-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"training-factor-graphs-with-reinforcement","title":"Training Factor Graphs with Reinforcement Learning for Efficient MAP Inference","date":"2009-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-computational-model-of-hippocampal-function","title":"A computational model of hippocampal function in trace conditioning","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-kernel-shaping-for-learning-control","title":"Bayesian Kernel Shaping for Learning Control","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hebbian-learning-of-bayes-optimal-decisions","title":"Hebbian Learning of Bayes Optimal Decisions","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-resolution-exploration-in-continuous","title":"Multi-resolution Exploration in Continuous Spaces","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-regret-bounds-for-reinforcement","title":"Near-optimal Regret Bounds for Reinforcement Learning","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-on-a-budget-a-reinforcement","title":"Optimization on a Budget: A Reinforcement Learning Approach","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-search-for-motor-primitives-in","title":"Policy Search for Motor Primitives in Robotics","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-policy-iteration","title":"Regularized Policy Iteration","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"signal-to-noise-ratio-analysis-of-policy","title":"Signal-to-Noise Ratio Analysis of Policy Gradient Algorithms","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-learning-in-human-sequential","title":"Structure Learning in Human Sequential Decision-Making","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-difference-based-actor-critic","title":"Temporal Difference Based Actor Critic Learning - Convergence and Neural Implementation","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-dynamics-of-cognitive-control","title":"Temporal Dynamics of Cognitive Control","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fitted-q-iteration-in-continuous-action-space","title":"Fitted Q-iteration in continuous action-space MDPs","date":"2007-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"online-linear-regression-and-its-application","title":"Online Linear Regression and Its Application to Model-Based Reinforcement Learning","date":"2007-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"receding-horizon-differential-dynamic","title":"Receding Horizon Differential Dynamic Programming","date":"2007-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"scan-strategies-for-meteorological-radars","title":"Scan Strategies for Meteorological Radars","date":"2007-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-a-survey","title":"Reinforcement Learning: A Survey","date":"1996-05-01","arxiv_id":"cs/9605103","repositories_listed":0,"syntology":null},{"url":null,"slug":"accidental-exploration-through-value","title":"Accidental exploration through value predictors","date":null,"arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"from-deep-learning-to-deep-deducing","title":"FROM DEEP LEARNING TO DEEP DEDUCING: AUTOMATICALLY TRACKING DOWN NASH EQUILIBRIUM THROUGH AUTONOMOUS NEURAL AGENT, A POSSIBLE MISSING STEP TOWARD GENERAL A.I.","date":null,"arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"ec5b4f78361224582d452f4d8961850c1ab9bf5185d229d89527540d3455517a","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}