{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/continuous-control/papers/12","list_of":"/task/continuous-control","task":"Continuous Control","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":12,"pages_in_order":12,"rows_per_page":100,"rows":[1101,1161],"of":1161,"counts":{"archive_papers_tagged":1161,"with_a_code_link":494,"where_syntology_ran_a_sample":193,"not_listed_spam_title":0,"listed":1161,"listed_where_code_ran":193,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":161,"every_run_a_failure_of_syntologys_instrument":32,"listed_with_a_run_with_no_instrument_failure":161,"listed_every_run_a_failure_of_syntologys_instrument":32,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/continuous-control","prev":"/task/continuous-control/papers/11","next":null,"papers":[{"url":null,"slug":"a-bayesian-approach-to-generative-adversarial","title":"A Bayesian Approach to Generative Adversarial Imitation Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-traversing-the-continuous-spectrum-of","title":"Traversing the Continuous Spectrum of Image Retrieval with Deep Dynamic Models","date":"2018-12-01","arxiv_id":"1812.00202","repositories_listed":0,"syntology":null},{"url":null,"slug":"intra-class-variation-isolation-in","title":"Taking Control of Intra-class Variation in Conditional GANs Under Weak Supervision","date":"2018-11-27","arxiv_id":"1811.11296","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-with-distributed-deep-reinforcement","title":"PNS: Population-Guided Novelty Search for Reinforcement Learning in Hard Exploration Environments","date":"2018-11-26","arxiv_id":"1811.10264","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-for-multi-objective","title":"Meta-Learning for Multi-objective Reinforcement Learning","date":"2018-11-08","arxiv_id":"1811.03376","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-intrinsically-motivated-continuous-actor","title":"Deep Intrinsically Motivated Continuous Actor-Critic for Efficient Robotic Visuomotor Skill Learning","date":"2018-10-26","arxiv_id":"1810.11388","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-for-the","title":"Using Deep Reinforcement Learning for the Continuous Control of Robotic Arms","date":"2018-10-15","arxiv_id":"1810.06746","repositories_listed":0,"syntology":null},{"url":null,"slug":"emi-exploration-with-mutual-information-1","title":"EMI: Exploration with Mutual Information Maximizing State and Action Embeddings","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generative-adversarial-imitation","title":"Improving Generative Adversarial Imitation Learning with Non-expert Demonstrations","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"shrinkage-based-bias-variance-trade-off-for","title":"Shrinkage-based Bias-Variance Trade-off for Deep Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"success-at-any-cost-value-constrained-model","title":"Success at any cost: value constrained model-free continuous control","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-value-or-policy-a-value-centric","title":"Transfer Value or Policy? A Value-centric Framework Towards Transferrable Continuous Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"where-off-policy-deep-reinforcement-learning","title":"Where Off-Policy Deep Reinforcement Learning Fails","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-neural-network-dynamics-for-model","title":"Structured Neural Network Dynamics for Model-based Control","date":"2018-08-03","arxiv_id":"1808.01184","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-actionable-representations-from","title":"Learning Actionable Representations from Visual Observations","date":"2018-08-02","arxiv_id":"1808.00928","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-stabilizable-dynamical-systems-via","title":"Learning Stabilizable Dynamical Systems via Control Contraction Metrics","date":"2018-07-31","arxiv_id":"1808.00113","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubly-stochastic-adversarial-autoencoder","title":"Doubly Stochastic Adversarial Autoencoder","date":"2018-07-19","arxiv_id":"1807.07603","repositories_listed":0,"syntology":null},{"url":null,"slug":"general-value-function-networks","title":"General Value Function Networks","date":"2018-07-18","arxiv_id":"1807.06763","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-policy-gradients-with-general","title":"Deterministic Policy Gradients With General State Transitions","date":"2018-07-10","arxiv_id":"1807.03708","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-explore-via-meta-policy-gradient","title":"Learning to Explore via Meta-Policy Gradient","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-policy-representations-in-multiagent","title":"Learning Policy Representations in Multiagent Systems","date":"2018-06-17","arxiv_id":"1806.06464","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-inverse-control-with-events-a","title":"Variational Inverse Control with Events: A General Framework for Data-Driven Reward Definition","date":"2018-05-29","arxiv_id":"1805.11686","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-policy-iteration","title":"Dual Policy Iteration","date":"2018-05-28","arxiv_id":"1805.10755","repositories_listed":0,"syntology":null},{"url":null,"slug":"fingerprint-policy-optimisation-for-robust","title":"Fingerprint Policy Optimisation for Robust Reinforcement Learning","date":"2018-05-27","arxiv_id":"1805.10662","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-self-imitating-diverse-policies","title":"Learning Self-Imitating Diverse Policies","date":"2018-05-25","arxiv_id":"1805.10309","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-linear-quadratic-control-via","title":"Model-Free Linear Quadratic Control via Reduction to Expert Prediction","date":"2018-04-17","arxiv_id":"1804.06021","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-maximizing-exploration-with-a","title":"Information Maximizing Exploration with a Latent Dynamics Model","date":"2018-04-04","arxiv_id":"1804.01238","repositories_listed":0,"syntology":null},{"url":null,"slug":"smoothed-action-value-functions-for-learning","title":"Smoothed Action Value Functions for Learning Gaussian Policies","date":"2018-03-06","arxiv_id":"1803.02348","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-value-estimation-for-efficient","title":"Model-Based Value Estimation for Efficient Model-Free Reinforcement Learning","date":"2018-02-28","arxiv_id":"1803.00101","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-difference-models-model-free-deep-rl","title":"Temporal Difference Models: Model-Free Deep RL for Model-Based Control","date":"2018-02-25","arxiv_id":"1802.09081","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robust-and-adaptive-real-world","title":"Learning Robust and Adaptive Real-World Continuous Control Using Simulation and Transfer Learning","date":"2018-02-13","arxiv_id":"1802.04520","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-reinforcement-learning-with","title":"Progressive Reinforcement Learning with Distillation for Multi-Skilled Motion Control","date":"2018-02-13","arxiv_id":"1802.04765","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-learning-for-continuous-control","title":"Multi-task Learning for Continuous Control","date":"2018-02-03","arxiv_id":"1802.01034","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-driven-networking-a-deep","title":"Experience-driven Networking: A Deep Reinforcement Learning based Approach","date":"2018-01-17","arxiv_id":"1801.05757","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-policy-gradient-methods","title":"Global Convergence of Policy Gradient Methods for the Linear Quadratic Regulator","date":"2018-01-15","arxiv_id":"1801.05039","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-model-based-and-model-free-rl-via","title":"Combining Model-based and Model-free RL via Multi-step Control Variates","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-policy-imitation-gradient","title":"Deterministic Policy Imitation Gradient Algorithm","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-policy-gradient-methods-1","title":"Global Convergence of Policy Gradient Methods for Linearized Control Problems","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-gaussian-policies-from-smoothed","title":"Learning Gaussian Policies from Smoothed Action Value Functions","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-multiple-actions-for-stochastic","title":"Predicting Multiple Actions for Stochastic Continuous Control","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"simple-nearest-neighbor-policy-method-for","title":"Simple Nearest Neighbor Policy Method for Continuous Control Tasks","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"least-squares-temporal-difference-learning","title":"Least-Squares Temporal Difference Learning for the Linear Quadratic Regulator","date":"2017-12-22","arxiv_id":"1712.08642","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-deep-reinforcement-learning-and","title":"Comparing Deep Reinforcement Learning and Evolutionary Methods in Continuous Control","date":"2017-11-30","arxiv_id":"1712.00006","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-variance-reduction-for-policy","title":"Stochastic Variance Reduction for Policy Gradient Estimation","date":"2017-10-17","arxiv_id":"1710.06034","repositories_listed":0,"syntology":null},{"url":null,"slug":"amber-adaptive-multi-batch-experience-replay","title":"AMBER: Adaptive Multi-Batch Experience Replay for Continuous Action Control","date":"2017-10-12","arxiv_id":"1710.04423","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-continuous-control-of-flippers-for-a","title":"Towards continuous control of flippers for a multi-terrain robot using deep reinforcement learning","date":"2017-09-25","arxiv_id":"1709.08430","repositories_listed":0,"syntology":null},{"url":null,"slug":"shared-learning-enhancing-reinforcement-in-q","title":"Shared Learning : Enhancing Reinforcement in $Q$-Ensembles","date":"2017-09-14","arxiv_id":"1709.04909","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-surrogate","title":"Deep Reinforcement Learning with Surrogate Agent-Environment Interface","date":"2017-09-12","arxiv_id":"1709.03942","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-stochastic-policy-gradients-in","title":"Improving Stochastic Policy Gradients in Continuous Control with Deep Reinforcement Learning using the Beta Distribution","date":"2017-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-intentional-unintentional-agent-learning","title":"The Intentional Unintentional Agent: Learning to Solve Many Continuous Control Tasks Simultaneously","date":"2017-07-11","arxiv_id":"1707.03300","repositories_listed":0,"syntology":null},{"url":null,"slug":"opeb-open-physical-environment-benchmark-for","title":"OPEB: Open Physical Environment Benchmark for Artificial Intelligence","date":"2017-07-04","arxiv_id":"1707.00790","repositories_listed":0,"syntology":null},{"url":null,"slug":"path-integral-networks-end-to-end","title":"Path Integral Networks: End-to-End Differentiable Optimal Control","date":"2017-06-29","arxiv_id":"1706.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpolated-policy-gradient-merging-on","title":"Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning","date":"2017-06-01","arxiv_id":"1706.00387","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-sequential-prediction-of-continuous","title":"Discrete Sequential Prediction of Continuous Actions for Deep RL","date":"2017-05-14","arxiv_id":"1705.05035","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-deep-reinforcement-learning","title":"Data-efficient Deep Reinforcement Learning for Dexterous Manipulation","date":"2017-04-10","arxiv_id":"1704.03073","repositories_listed":0,"syntology":null},{"url":null,"slug":"stein-variational-policy-gradient","title":"Stein Variational Policy Gradient","date":"2017-04-07","arxiv_id":"1704.02399","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-unified-control-policy-for-safe","title":"Learning a Unified Control Policy for Safe Falling","date":"2017-03-08","arxiv_id":"1703.02905","repositories_listed":0,"syntology":null},{"url":null,"slug":"surprise-based-intrinsic-motivation-for-deep","title":"Surprise-Based Intrinsic Motivation for Deep Reinforcement Learning","date":"2017-03-06","arxiv_id":"1703.01732","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-interactive-sequence-generation-and","title":"Real-time interactive sequence generation and control with Recurrent Neural Network ensembles","date":"2016-12-14","arxiv_id":"1612.04687","repositories_listed":0,"syntology":null},{"url":null,"slug":"facedirector-continuous-control-of-facial","title":"FaceDirector: Continuous Control of Facial Performance in Video","date":"2015-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-deep-neural-network-policies-with","title":"Learning Deep Neural Network Policies with Continuous Memory States","date":"2015-07-05","arxiv_id":"1507.01273","repositories_listed":0,"syntology":null}],"record_sha256":"db4dc75adfd2a01c0c2f4d44d2e54bf4c415a413d8607ae97c70ac260313e048","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}