{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/continuous-control/papers/4","list_of":"/task/continuous-control","task":"Continuous Control","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":12,"rows_per_page":100,"rows":[301,400],"of":1161,"counts":{"archive_papers_tagged":1161,"with_a_code_link":494,"where_syntology_ran_a_sample":193,"not_listed_spam_title":0,"listed":1161,"listed_where_code_ran":193,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":161,"every_run_a_failure_of_syntologys_instrument":32,"listed_with_a_run_with_no_instrument_failure":161,"listed_every_run_a_failure_of_syntologys_instrument":32,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/continuous-control","prev":"/task/continuous-control/papers/3","next":"/task/continuous-control/papers/5","papers":[{"url":"/paper/direct-behavior-specification-via-constrained","slug":"direct-behavior-specification-via-constrained","title":"Direct Behavior Specification via Constrained Reinforcement Learning","date":"2021-12-22","arxiv_id":"2112.12228","repositories_listed":1,"syntology":null},{"url":"/paper/value-activation-for-bias-alleviation","slug":"value-activation-for-bias-alleviation","title":"Value Activation for Bias Alleviation: Generalized-activated Deep Double Deterministic Policy Gradients","date":"2021-12-21","arxiv_id":"2112.11216","repositories_listed":1,"syntology":null},{"url":"/paper/variational-quantum-soft-actor-critic","slug":"variational-quantum-soft-actor-critic","title":"Variational Quantum Soft Actor-Critic","date":"2021-12-20","arxiv_id":"2112.11921","repositories_listed":1,"syntology":null},{"url":"/paper/cem-gd-cross-entropy-method-with-gradient","slug":"cem-gd-cross-entropy-method-with-gradient","title":"CEM-GD: Cross-Entropy Method with Gradient Descent Planner for Model-Based Reinforcement Learning","date":"2021-12-14","arxiv_id":"2112.07746","repositories_listed":1,"syntology":null},{"url":"/paper/stochastic-actor-executor-critic-for-image-to","slug":"stochastic-actor-executor-critic-for-image-to","title":"Stochastic Actor-Executor-Critic for Image-to-Image Translation","date":"2021-12-14","arxiv_id":"2112.07403","repositories_listed":1,"syntology":null},{"url":"/paper/calvin-a-benchmark-for-language-conditioned","slug":"calvin-a-benchmark-for-language-conditioned","title":"CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks","date":"2021-12-06","arxiv_id":"2112.03227","repositories_listed":1,"syntology":{"n":10,"n_ran":6,"n_constructed":0,"n_ran_checked":6,"n_instrument":0,"n_unverified":4,"n_honours":0,"n_violates":0,"n_no_contract":6,"n_pointer_only":0,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/calvin-a-benchmark-for-language-conditioned#ran","syntology_url":"https://syntology.ai/paper/2112.03227","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2112.03227"}},"official":{"repos":["mees/calvin"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":4,"ran_from_kinds":["official"]}}},{"url":"/paper/ed2-an-environment-dynamics-decomposition-1","slug":"ed2-an-environment-dynamics-decomposition-1","title":"ED2: Environment Dynamics Decomposition World Models for Continuous Control","date":"2021-12-06","arxiv_id":"2112.02817","repositories_listed":1,"syntology":null},{"url":"/paper/co-pilot-collaborative-planning-and","slug":"co-pilot-collaborative-planning-and","title":"CO-PILOT: COllaborative Planning and reInforcement Learning On sub-Task curriculum","date":"2021-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/continuous-control-with-ensemble-deep-1","slug":"continuous-control-with-ensemble-deep-1","title":"Continuous Control With Ensemble Deep Deterministic Policy Gradients","date":"2021-11-30","arxiv_id":"2111.15382","repositories_listed":1,"syntology":null},{"url":"/paper/adaptively-calibrated-critic-estimates-for","slug":"adaptively-calibrated-critic-estimates-for","title":"Adaptively Calibrated Critic Estimates for Deep Reinforcement Learning","date":"2021-11-24","arxiv_id":"2111.12673","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/adaptively-calibrated-critic-estimates-for#ran","syntology_url":"https://syntology.ai/paper/2111.12673","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2111.12673"}},"official":{"repos":["nicolinho/acc"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/learning-state-representations-via-retracing-1","slug":"learning-state-representations-via-retracing-1","title":"Learning State Representations via Retracing in Reinforcement Learning","date":"2021-11-24","arxiv_id":"2111.12600","repositories_listed":1,"syntology":null},{"url":"/paper/plan-better-amid-conservatism-offline-multi-1","slug":"plan-better-amid-conservatism-offline-multi-1","title":"Plan Better Amid Conservatism: Offline Multi-Agent Reinforcement Learning with Actor Rectification","date":"2021-11-22","arxiv_id":"2111.11188","repositories_listed":1,"syntology":null},{"url":"/paper/generalized-decision-transformer-for-offline","slug":"generalized-decision-transformer-for-offline","title":"Generalized Decision Transformer for Offline Hindsight Information Matching","date":"2021-11-19","arxiv_id":"2111.10364","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/generalized-decision-transformer-for-offline#ran","syntology_url":"https://syntology.ai/paper/2111.10364","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2111.10364"}},"official":{"repos":["frt03/generalized_dt"],"state":"official: no sample here; runs from other or unrecorded repositories","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["unlocated"]}}},{"url":"/paper/on-effective-scheduling-of-model-based","slug":"on-effective-scheduling-of-model-based","title":"On Effective Scheduling of Model-based Reinforcement Learning","date":"2021-11-16","arxiv_id":"2111.08550","repositories_listed":1,"syntology":null},{"url":"/paper/curriculum-offline-imitation-learning","slug":"curriculum-offline-imitation-learning","title":"Curriculum Offline Imitation Learning","date":"2021-11-03","arxiv_id":"2111.02056","repositories_listed":1,"syntology":{"n":4,"n_ran":2,"n_constructed":1,"n_ran_checked":2,"n_instrument":0,"n_unverified":2,"n_honours":1,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"2 ran (of which 1 constructed an object rather than computing a result; 2 with no instrument failure: 1 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/curriculum-offline-imitation-learning#ran","syntology_url":"https://syntology.ai/paper/2111.02056","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2111.02056"}},"official":{"repos":["apexrl/coil"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":1,"n_ran_no_instrument_failure":2,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/urlb-unsupervised-reinforcement-learning","slug":"urlb-unsupervised-reinforcement-learning","title":"URLB: Unsupervised Reinforcement Learning Benchmark","date":"2021-10-28","arxiv_id":"2110.15191","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/urlb-unsupervised-reinforcement-learning#ran","syntology_url":"https://syntology.ai/paper/2110.15191","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2110.15191"}},"official":{"repos":["rll-research/url_benchmark"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/towards-robust-bisimulation-metric-learning","slug":"towards-robust-bisimulation-metric-learning","title":"Towards Robust Bisimulation Metric Learning","date":"2021-10-27","arxiv_id":"2110.14096","repositories_listed":1,"syntology":null},{"url":"/paper/recurrent-off-policy-baselines-for-memory","slug":"recurrent-off-policy-baselines-for-memory","title":"Recurrent Off-policy Baselines for Memory-based Continuous Control","date":"2021-10-25","arxiv_id":"2110.12628","repositories_listed":1,"syntology":null},{"url":"/paper/which-model-to-trust-assessing-the-influence-1","slug":"which-model-to-trust-assessing-the-influence-1","title":"Which Model to Trust: Assessing the Influence of Models on the Performance of Reinforcement Learning Algorithms for Continuous Control Tasks","date":"2021-10-25","arxiv_id":"2110.13079","repositories_listed":1,"syntology":null},{"url":"/paper/hierarchical-skills-for-efficient-exploration","slug":"hierarchical-skills-for-efficient-exploration","title":"Hierarchical Skills for Efficient Exploration","date":"2021-10-20","arxiv_id":"2110.10809","repositories_listed":1,"syntology":{"n":7,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":7,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/hierarchical-skills-for-efficient-exploration#ran","syntology_url":"https://syntology.ai/paper/2110.10809","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2110.10809"}},"official":{"repos":["facebookresearch/hsd3"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":3,"ran_from_kinds":["official"]}}},{"url":"/paper/balancing-value-underestimation-and","slug":"balancing-value-underestimation-and","title":"Balancing Value Underestimation and Overestimation with Realistic Actor-Critic","date":"2021-10-19","arxiv_id":"2110.09712","repositories_listed":1,"syntology":null},{"url":"/paper/continuous-control-with-action-quantization-1","slug":"continuous-control-with-action-quantization-1","title":"Continuous Control with Action Quantization from Demonstrations","date":"2021-10-19","arxiv_id":"2110.10149","repositories_listed":1,"syntology":null},{"url":"/paper/cross-domain-imitation-learning-via-optimal","slug":"cross-domain-imitation-learning-via-optimal","title":"Cross-Domain Imitation Learning via Optimal Transport","date":"2021-10-07","arxiv_id":"2110.03684","repositories_listed":1,"syntology":null},{"url":"/paper/continuous-time-fitted-value-iteration-for","slug":"continuous-time-fitted-value-iteration-for","title":"Continuous-Time Fitted Value Iteration for Robust Policies","date":"2021-10-05","arxiv_id":"2110.01954","repositories_listed":1,"syntology":{"n":7,"n_ran":6,"n_constructed":0,"n_ran_checked":6,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":6,"n_pointer_only":0,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/continuous-time-fitted-value-iteration-for#ran","syntology_url":"https://syntology.ai/paper/2110.01954","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2110.01954"}},"official":null}},{"url":"/paper/parameter-free-deterministic-reduction-of-the","slug":"parameter-free-deterministic-reduction-of-the","title":"Parameter-free Reduction of the Estimation Bias in Deep Reinforcement Learning for Deterministic Policy Gradients","date":"2021-09-24","arxiv_id":"2109.11788","repositories_listed":1,"syntology":null},{"url":"/paper/estimation-error-correction-in-deep","slug":"estimation-error-correction-in-deep","title":"Estimation Error Correction in Deep Reinforcement Learning for Deterministic Actor-Critic Methods","date":"2021-09-22","arxiv_id":"2109.10736","repositories_listed":1,"syntology":null},{"url":"/paper/error-controlled-actor-critic","slug":"error-controlled-actor-critic","title":"Error Controlled Actor-Critic","date":"2021-09-06","arxiv_id":"2109.02517","repositories_listed":1,"syntology":null},{"url":"/paper/imitation-learning-by-reinforcement-learning","slug":"imitation-learning-by-reinforcement-learning","title":"Imitation Learning by Reinforcement Learning","date":"2021-08-10","arxiv_id":"2108.04763","repositories_listed":1,"syntology":{"n":8,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":0,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/imitation-learning-by-reinforcement-learning#ran","syntology_url":"https://syntology.ai/paper/2108.04763","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2108.04763"}},"official":{"repos":["spotify-research/il-by-rl"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/shortest-path-constrained-reinforcement-1","slug":"shortest-path-constrained-reinforcement-1","title":"Shortest-Path Constrained Reinforcement Learning for Sparse Reward Tasks","date":"2021-07-13","arxiv_id":"2107.06405","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":2,"n_instrument":1,"n_unverified":0,"n_honours":1,"n_violates":1,"n_no_contract":0,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 1 honoured, 1 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/shortest-path-constrained-reinforcement-1#ran","syntology_url":"https://syntology.ai/paper/2107.06405","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2107.06405"}},"official":{"repos":["srsohn/shortest-path-rl"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/towards-better-laplacian-representation-in","slug":"towards-better-laplacian-representation-in","title":"Towards Better Laplacian Representation in Reinforcement Learning with Generalized Graph Drawing","date":"2021-07-12","arxiv_id":"2107.05545","repositories_listed":1,"syntology":null},{"url":"/paper/sample-efficient-reinforcement-learning-via-2","slug":"sample-efficient-reinforcement-learning-via-2","title":"Sample Efficient Reinforcement Learning via Model-Ensemble Exploration and Exploitation","date":"2021-07-05","arxiv_id":"2107.01825","repositories_listed":1,"syntology":null},{"url":"/paper/model-advantage-optimization-for-model-based","slug":"model-advantage-optimization-for-model-based","title":"Model-Advantage and Value-Aware Models for Model-Based Reinforcement Learning: Bridging the Gap in Theory and Practice","date":"2021-06-26","arxiv_id":"2106.14080","repositories_listed":1,"syntology":null},{"url":"/paper/coarse-to-fine-q-attention-efficient-learning","slug":"coarse-to-fine-q-attention-efficient-learning","title":"Coarse-to-Fine Q-attention: Efficient Learning for Visual Robotic Manipulation via Discretisation","date":"2021-06-23","arxiv_id":"2106.12534","repositories_listed":1,"syntology":null},{"url":"/paper/towards-safe-reinforcement-learning-via-1","slug":"towards-safe-reinforcement-learning-via-1","title":"Towards Safe Reinforcement Learning via Constraining Conditional Value at Risk","date":"2021-06-18","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/solving-continuous-control-with-episodic","slug":"solving-continuous-control-with-episodic","title":"Solving Continuous Control with Episodic Memory","date":"2021-06-16","arxiv_id":"2106.08832","repositories_listed":1,"syntology":null},{"url":"/paper/towards-automatic-actor-critic-solutions-to","slug":"towards-automatic-actor-critic-solutions-to","title":"Towards Automatic Actor-Critic Solutions to Continuous Control","date":"2021-06-16","arxiv_id":"2106.08918","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/towards-automatic-actor-critic-solutions-to#ran","syntology_url":"https://syntology.ai/paper/2106.08918","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2106.08918"}},"official":{"repos":["jakegrigsby/deep_control"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/dynamic-sparse-training-for-deep","slug":"dynamic-sparse-training-for-deep","title":"Dynamic Sparse Training for Deep Reinforcement Learning","date":"2021-06-08","arxiv_id":"2106.04217","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":2,"n_pointer_only":1,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 1 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/dynamic-sparse-training-for-deep#ran","syntology_url":"https://syntology.ai/paper/2106.04217","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2106.04217"}},"official":{"repos":["GhadaSokar/Dynamic-Sparse-Training-for-Deep-Reinforcement-Learning"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/learning-markov-state-abstractions-for-deep","slug":"learning-markov-state-abstractions-for-deep","title":"Learning Markov State Abstractions for Deep Reinforcement Learning","date":"2021-06-08","arxiv_id":"2106.04379","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/learning-markov-state-abstractions-for-deep#ran","syntology_url":"https://syntology.ai/paper/2106.04379","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2106.04379"}},"official":{"repos":["camall3n/markov-state-abstractions"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/efficient-continuous-control-with-double","slug":"efficient-continuous-control-with-double","title":"Efficient Continuous Control with Double Actors and Regularized Critics","date":"2021-06-06","arxiv_id":"2106.03050","repositories_listed":1,"syntology":null},{"url":"/paper/mitigating-covariate-shift-in-imitation","slug":"mitigating-covariate-shift-in-imitation","title":"Mitigating Covariate Shift in Imitation Learning via Offline Data Without Great Coverage","date":"2021-06-06","arxiv_id":"2106.03207","repositories_listed":1,"syntology":null},{"url":"/paper/what-matters-for-adversarial-imitation","slug":"what-matters-for-adversarial-imitation","title":"What Matters for Adversarial Imitation Learning?","date":"2021-06-01","arxiv_id":"2106.00672","repositories_listed":1,"syntology":null},{"url":"/paper/efficient-hierarchical-exploration-with","slug":"efficient-hierarchical-exploration-with","title":"Active Hierarchical Exploration with Stable Subgoal Representation Learning","date":"2021-05-31","arxiv_id":"2105.14750","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/efficient-hierarchical-exploration-with#ran","syntology_url":"https://syntology.ai/paper/2105.14750","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2105.14750"}},"official":{"repos":["siyuanlee/hess"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/robust-value-iteration-for-continuous-control","slug":"robust-value-iteration-for-continuous-control","title":"Robust Value Iteration for Continuous Control Tasks","date":"2021-05-25","arxiv_id":"2105.12189","repositories_listed":1,"syntology":null},{"url":"/paper/mitigating-covariate-shift-in-imitation-1","slug":"mitigating-covariate-shift-in-imitation-1","title":"Mitigating Covariate Shift in Imitation Learning via Offline Data With Partial Coverage","date":"2021-05-21","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/generative-actor-critic-an-off-policy","slug":"generative-actor-critic-an-off-policy","title":"Generative Actor-Critic: An Off-policy Algorithm Using the Push-forward Model","date":"2021-05-08","arxiv_id":"2105.03733","repositories_listed":1,"syntology":null},{"url":"/paper/context-based-soft-actor-critic-for","slug":"context-based-soft-actor-critic-for","title":"Context-Based Soft Actor Critic for Environments with Non-stationary Dynamics","date":"2021-05-07","arxiv_id":"2105.03310","repositories_listed":1,"syntology":null},{"url":"/paper/safe-continuous-control-with-constrained","slug":"safe-continuous-control-with-constrained","title":"Safe Continuous Control with Constrained Model-Based Policy Optimization","date":"2021-04-14","arxiv_id":"2104.06922","repositories_listed":1,"syntology":{"n":5,"n_ran":5,"n_constructed":0,"n_ran_checked":5,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":1,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/safe-continuous-control-with-constrained#ran","syntology_url":"https://syntology.ai/paper/2104.06922","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2104.06922"}},"official":null}},{"url":"/paper/learning-and-planning-in-complex-action","slug":"learning-and-planning-in-complex-action","title":"Learning and Planning in Complex Action Spaces","date":"2021-04-13","arxiv_id":"2104.06303","repositories_listed":1,"syntology":null},{"url":"/paper/character-controllers-using-motion-vaes","slug":"character-controllers-using-motion-vaes","title":"Character Controllers Using Motion VAEs","date":"2021-03-26","arxiv_id":"2103.14274","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_constructed":0,"n_ran_checked":2,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":1,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/character-controllers-using-motion-vaes#ran","syntology_url":"https://syntology.ai/paper/2103.14274","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2103.14274"}},"official":{"repos":["electronicarts/character-motion-vaes"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/policy-information-capacity-information","slug":"policy-information-capacity-information","title":"Policy Information Capacity: Information-Theoretic Measure for Task Complexity in Deep Reinforcement Learning","date":"2021-03-23","arxiv_id":"2103.12726","repositories_listed":1,"syntology":null},{"url":"/paper/solving-compositional-reinforcement-learning-1","slug":"solving-compositional-reinforcement-learning-1","title":"Solving Compositional Reinforcement Learning Problems via Task Reduction","date":"2021-03-13","arxiv_id":"2103.07607","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":1,"n_instrument":2,"n_unverified":0,"n_honours":0,"n_violates":1,"n_no_contract":0,"n_pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 1 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/solving-compositional-reinforcement-learning-1#ran","syntology_url":"https://syntology.ai/paper/2103.07607","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2103.07607"}},"official":{"repos":["IrisLi17/self-imitation-via-reduction"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/a-quadratic-actor-network-for-model-free","slug":"a-quadratic-actor-network-for-model-free","title":"A Quadratic Actor Network for Model-Free Reinforcement Learning","date":"2021-03-11","arxiv_id":"2103.06617","repositories_listed":1,"syntology":null},{"url":"/paper/generalizable-episodic-memory-for-deep","slug":"generalizable-episodic-memory-for-deep","title":"Generalizable Episodic Memory for Deep Reinforcement Learning","date":"2021-03-11","arxiv_id":"2103.06469","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/generalizable-episodic-memory-for-deep#ran","syntology_url":"https://syntology.ai/paper/2103.06469","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2103.06469"}},"official":{"repos":["MouseHu/GEM"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/model-free-policy-learning-with-reward","slug":"model-free-policy-learning-with-reward","title":"Model-free Policy Learning with Reward Gradients","date":"2021-03-09","arxiv_id":"2103.05147","repositories_listed":1,"syntology":null},{"url":"/paper/reinforcement-learning-with-prototypical-1","slug":"reinforcement-learning-with-prototypical-1","title":"Reinforcement Learning with Prototypical Representations","date":"2021-03-09","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/model-based-versus-model-free-deep","slug":"model-based-versus-model-free-deep","title":"Latent Imagination Facilitates Zero-Shot Transfer in Autonomous Racing","date":"2021-03-08","arxiv_id":"2103.04909","repositories_listed":1,"syntology":null},{"url":"/paper/multimodal-vae-active-inference-controller","slug":"multimodal-vae-active-inference-controller","title":"Multimodal VAE Active Inference Controller","date":"2021-03-07","arxiv_id":"2103.04412","repositories_listed":1,"syntology":null},{"url":"/paper/analysis-and-assessment-of-controllability-of","slug":"analysis-and-assessment-of-controllability-of","title":"Analysis and Assessment of Controllability of an Expressive Deep Learning-based TTS system","date":"2021-03-06","arxiv_id":"2103.04097","repositories_listed":1,"syntology":null},{"url":"/paper/filter-based-abstractions-with-correctness","slug":"filter-based-abstractions-with-correctness","title":"Correct-by-construction reach-avoid control of partially observable linear stochastic systems","date":"2021-03-03","arxiv_id":"2103.02398","repositories_listed":1,"syntology":null},{"url":"/paper/foresee-then-evaluate-decomposing-value","slug":"foresee-then-evaluate-decomposing-value","title":"Foresee then Evaluate: Decomposing Value Estimation with Latent Future Prediction","date":"2021-03-03","arxiv_id":"2103.02225","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/foresee-then-evaluate-decomposing-value#ran","syntology_url":"https://syntology.ai/paper/2103.02225","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2103.02225"}},"official":{"repos":["bluecontra/AAAI2021-VDFP"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/snowflake-scaling-gnns-to-high-dimensional","slug":"snowflake-scaling-gnns-to-high-dimensional","title":"Snowflake: Scaling GNNs to High-Dimensional Continuous Control via Parameter Freezing","date":"2021-03-01","arxiv_id":"2103.01009","repositories_listed":1,"syntology":{"n":2,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"0 ran · 2 unverified","sample_list":"/paper/snowflake-scaling-gnns-to-high-dimensional#ran","syntology_url":"https://syntology.ai/paper/2103.01009","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2103.01009"}},"official":{"repos":["thecharlieblake/snowflake"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":2,"ran_from_kinds":[]}}},{"url":"/paper/gaze-informed-multi-objective-imitation","slug":"gaze-informed-multi-objective-imitation","title":"Imitation Learning with Human Eye Gaze via Multi-Objective Prediction","date":"2021-02-25","arxiv_id":"2102.13008","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/gaze-informed-multi-objective-imitation#ran","syntology_url":"https://syntology.ai/paper/2102.13008","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2102.13008"}},"official":{"repos":["ravikt/gril"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/reinforcement-learning-with-prototypical","slug":"reinforcement-learning-with-prototypical","title":"Reinforcement Learning with Prototypical Representations","date":"2021-02-22","arxiv_id":"2102.11271","repositories_listed":1,"syntology":null},{"url":"/paper/q-value-weighted-regression-reinforcement-1","slug":"q-value-weighted-regression-reinforcement-1","title":"Q-Value Weighted Regression: Reinforcement Learning with Limited Data","date":"2021-02-12","arxiv_id":"2102.06782","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 1 unverified","sample_list":"/paper/q-value-weighted-regression-reinforcement-1#ran","syntology_url":"https://syntology.ai/paper/2102.06782","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2102.06782"}},"official":null}},{"url":"/paper/robust-policy-gradient-against-strong-data","slug":"robust-policy-gradient-against-strong-data","title":"Robust Policy Gradient against Strong Data Corruption","date":"2021-02-11","arxiv_id":"2102.05800","repositories_listed":1,"syntology":null},{"url":"/paper/offcon-3-what-is-state-of-the-art-anyway","slug":"offcon-3-what-is-state-of-the-art-anyway","title":"OffCon$^3$: What is state of the art anyway?","date":"2021-01-27","arxiv_id":"2101.11331","repositories_listed":1,"syntology":null},{"url":"/paper/regularization-matters-in-policy-optimization","slug":"regularization-matters-in-policy-optimization","title":"Regularization Matters in Policy Optimization - An Empirical Study on Continuous Control","date":"2021-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/teac-intergrating-trust-region-and-max","slug":"teac-intergrating-trust-region-and-max","title":"TEAC: Intergrating Trust Region and Max Entropy Actor Critic for Continuous Control","date":"2021-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/unsupervised-task-clustering-for-multi-task","slug":"unsupervised-task-clustering-for-multi-task","title":"Unsupervised Task Clustering for Multi-Task Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/locally-persistent-exploration-in-continuous","slug":"locally-persistent-exploration-in-continuous","title":"Locally Persistent Exploration in Continuous Control Tasks with Sparse Rewards","date":"2020-12-26","arxiv_id":"2012.13658","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":1,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":1,"phrase":"1 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified; the one sample that ran constructed an object rather than computing a result","sample_list":"/paper/locally-persistent-exploration-in-continuous#ran","syntology_url":"https://syntology.ai/paper/2012.13658","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2012.13658"}},"official":{"repos":["h-aboutalebi/SparseBaseline"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":1,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/an-efficient-asynchronous-method-for-1","slug":"an-efficient-asynchronous-method-for-1","title":"An Efficient Asynchronous Method for Integrating Evolutionary and Gradient-based Policy Search","date":"2020-12-10","arxiv_id":"2012.05417","repositories_listed":1,"syntology":null},{"url":"/paper/continuous-transition-improving-sample","slug":"continuous-transition-improving-sample","title":"Continuous Transition: Improving Sample Efficiency for Continuous Control Problems via MixUp","date":"2020-11-30","arxiv_id":"2011.14487","repositories_listed":1,"syntology":null},{"url":"/paper/episodic-self-imitation-learning-with","slug":"episodic-self-imitation-learning-with","title":"Episodic Self-Imitation Learning with Hindsight","date":"2020-11-26","arxiv_id":"2011.13467","repositories_listed":1,"syntology":null},{"url":"/paper/world-model-as-a-graph-learning-latent","slug":"world-model-as-a-graph-learning-latent","title":"World Model as a Graph: Learning Latent Landmarks for Planning","date":"2020-11-25","arxiv_id":"2011.12491","repositories_listed":1,"syntology":null},{"url":"/paper/c-learning-horizon-aware-cumulative-1","slug":"c-learning-horizon-aware-cumulative-1","title":"C-Learning: Horizon-Aware Cumulative Accessibility Estimation","date":"2020-11-24","arxiv_id":"2011.12363","repositories_listed":1,"syntology":{"n":7,"n_ran":5,"n_constructed":3,"n_ran_checked":4,"n_instrument":1,"n_unverified":2,"n_honours":0,"n_violates":1,"n_no_contract":3,"n_pointer_only":7,"phrase":"5 ran (of which 3 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 1 violated, 3 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/c-learning-horizon-aware-cumulative-1#ran","syntology_url":"https://syntology.ai/paper/2011.12363","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2011.12363"}},"official":{"repos":["layer6ai-labs/CAE"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":3,"n_ran_no_instrument_failure":4,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/efficient-exploration-for-model-based-1","slug":"efficient-exploration-for-model-based-1","title":"Model-based Reinforcement Learning for Continuous Control with Posterior Sampling","date":"2020-11-20","arxiv_id":"2012.09613","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":1,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":1,"phrase":"1 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified; the one sample that ran constructed an object rather than computing a result","sample_list":"/paper/efficient-exploration-for-model-based-1#ran","syntology_url":"https://syntology.ai/paper/2012.09613","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2012.09613"}},"official":{"repos":["yingfan-bot/mbpsrl"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":1,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/tonic-a-deep-reinforcement-learning-library","slug":"tonic-a-deep-reinforcement-learning-library","title":"Tonic: A Deep Reinforcement Learning Library for Fast Prototyping and Benchmarking","date":"2020-11-15","arxiv_id":"2011.07537","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_constructed":0,"n_ran_checked":0,"n_instrument":3,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/tonic-a-deep-reinforcement-learning-library#ran","syntology_url":"https://syntology.ai/paper/2011.07537","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2011.07537"}},"official":{"repos":["fabiopardo/tonic"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/few-shot-object-grounding-and-mapping-for","slug":"few-shot-object-grounding-and-mapping-for","title":"Few-shot Object Grounding and Mapping for Natural Language Robot Instruction Following","date":"2020-11-14","arxiv_id":"2011.07384","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_constructed":0,"n_ran_checked":0,"n_instrument":3,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":4,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/few-shot-object-grounding-and-mapping-for#ran","syntology_url":"https://syntology.ai/paper/2011.07384","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2011.07384"}},"official":{"repos":["lil-lab/drif"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/diversity-enriched-option-critic","slug":"diversity-enriched-option-critic","title":"Diversity-Enriched Option-Critic","date":"2020-11-04","arxiv_id":"2011.02565","repositories_listed":1,"syntology":null},{"url":"/paper/learning-to-represent-action-values-as-a-1","slug":"learning-to-represent-action-values-as-a-1","title":"Learning to Represent Action Values as a Hypergraph on the Action Vertices","date":"2020-10-28","arxiv_id":"2010.14680","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/learning-to-represent-action-values-as-a-1#ran","syntology_url":"https://syntology.ai/paper/2010.14680","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.14680"}},"official":{"repos":["atavakol/action-hypergraph-networks"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/hamilton-jacobi-deep-q-learning-for","slug":"hamilton-jacobi-deep-q-learning-for","title":"Hamilton-Jacobi Deep Q-Learning for Deterministic Continuous-Time Systems with Lipschitz Continuous Controls","date":"2020-10-27","arxiv_id":"2010.14087","repositories_listed":1,"syntology":null},{"url":"/paper/iterative-amortized-policy-optimization-1","slug":"iterative-amortized-policy-optimization-1","title":"Iterative Amortized Policy Optimization","date":"2020-10-20","arxiv_id":"2010.10670","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 1 unverified","sample_list":"/paper/iterative-amortized-policy-optimization-1#ran","syntology_url":"https://syntology.ai/paper/2010.10670","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.10670"}},"official":{"repos":["joelouismarino/variational_rl"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/robust-imitation-learning-from-noisy","slug":"robust-imitation-learning-from-noisy","title":"Robust Imitation Learning from Noisy Demonstrations","date":"2020-10-20","arxiv_id":"2010.10181","repositories_listed":1,"syntology":null},{"url":"/paper/deep-reinforcement-learning-with-population","slug":"deep-reinforcement-learning-with-population","title":"Deep Reinforcement Learning with Population-Coded Spiking Neural Network for Continuous Control","date":"2020-10-19","arxiv_id":"2010.09635","repositories_listed":1,"syntology":{"n":9,"n_ran":7,"n_constructed":0,"n_ran_checked":5,"n_instrument":2,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":3,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 2 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/deep-reinforcement-learning-with-population#ran","syntology_url":"https://syntology.ai/paper/2010.09635","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.09635"}},"official":{"repos":["combra-lab/pop-spiking-deep-rl"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/dream-and-search-to-control-latent-space-1","slug":"dream-and-search-to-control-latent-space-1","title":"Dream and Search to Control: Latent Space Planning for Continuous Control","date":"2020-10-19","arxiv_id":"2010.09832","repositories_listed":1,"syntology":null},{"url":"/paper/model-based-policy-optimization-with","slug":"model-based-policy-optimization-with","title":"Model-based Policy Optimization with Unsupervised Model Adaptation","date":"2020-10-19","arxiv_id":"2010.09546","repositories_listed":1,"syntology":{"n":8,"n_ran":5,"n_constructed":0,"n_ran_checked":3,"n_instrument":2,"n_unverified":3,"n_honours":2,"n_violates":0,"n_no_contract":1,"n_pointer_only":2,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 2 honoured, 0 violated, 1 with no contract checked; 2 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/model-based-policy-optimization-with#ran","syntology_url":"https://syntology.ai/paper/2010.09546","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.09546"}},"official":{"repos":["RockySJ/ampo"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":3,"ran_from_kinds":["official"]}}},{"url":"/paper/what-about-taking-policy-as-input-of-value-1","slug":"what-about-taking-policy-as-input-of-value-1","title":"What About Inputing Policy in Value Function: Policy Representation and Policy-extended Value Function Approximator","date":"2020-10-19","arxiv_id":"2010.09536","repositories_listed":1,"syntology":null},{"url":"/paper/multi-task-deep-reinforcement-learning-with-1","slug":"multi-task-deep-reinforcement-learning-with-1","title":"Knowledge Transfer in Multi-Task Deep Reinforcement Learning for Continuous Control","date":"2020-10-15","arxiv_id":"2010.07494","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/multi-task-deep-reinforcement-learning-with-1#ran","syntology_url":"https://syntology.ai/paper/2010.07494","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.07494"}},"official":null}},{"url":"/paper/diverse-exploration-via-infomax-options-1","slug":"diverse-exploration-via-infomax-options-1","title":"Learning Diverse Options via InfoMax Termination Critic","date":"2020-10-06","arxiv_id":"2010.02756","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/diverse-exploration-via-infomax-options-1#ran","syntology_url":"https://syntology.ai/paper/2010.02756","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.02756"}},"official":{"repos":["kngwyu/infomax-option-critic"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/my-body-is-a-cage-the-role-of-morphology-in-1","slug":"my-body-is-a-cage-the-role-of-morphology-in-1","title":"My Body is a Cage: the Role of Morphology in Graph-Based Incompatible Control","date":"2020-10-05","arxiv_id":"2010.01856","repositories_listed":1,"syntology":null},{"url":"/paper/dynode-neural-ordinary-differential-equations","slug":"dynode-neural-ordinary-differential-equations","title":"DyNODE: Neural Ordinary Differential Equations for Dynamics Modeling in Continuous Control","date":"2020-09-09","arxiv_id":"2009.04278","repositories_listed":1,"syntology":{"n":5,"n_ran":5,"n_constructed":0,"n_ran_checked":3,"n_instrument":2,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":1,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/dynode-neural-ordinary-differential-equations#ran","syntology_url":"https://syntology.ai/paper/2009.04278","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2009.04278"}},"official":{"repos":["vmartinezalvarez/DyNODE"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/on-the-model-based-stochastic-value-gradient","slug":"on-the-model-based-stochastic-value-gradient","title":"On the model-based stochastic value gradient for continuous reinforcement learning","date":"2020-08-28","arxiv_id":"2008.12775","repositories_listed":1,"syntology":null},{"url":"/paper/learning-off-policy-with-online-planning","slug":"learning-off-policy-with-online-planning","title":"Learning Off-Policy with Online Planning","date":"2020-08-23","arxiv_id":"2008.10066","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/learning-off-policy-with-online-planning#ran","syntology_url":"https://syntology.ai/paper/2008.10066","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2008.10066"}},"official":null}},{"url":"/paper/contrastive-variational-model-based","slug":"contrastive-variational-model-based","title":"Contrastive Variational Reinforcement Learning for Complex Observations","date":"2020-08-06","arxiv_id":"2008.02430","repositories_listed":1,"syntology":null},{"url":"/paper/clipup-a-simple-and-powerful-optimizer-for","slug":"clipup-a-simple-and-powerful-optimizer-for","title":"ClipUp: A Simple and Powerful Optimizer for Distribution-based Policy Evolution","date":"2020-08-05","arxiv_id":"2008.02387","repositories_listed":1,"syntology":null},{"url":"/paper/predictive-information-accelerates-learning","slug":"predictive-information-accelerates-learning","title":"Predictive Information Accelerates Learning in RL","date":"2020-07-24","arxiv_id":"2007.12401","repositories_listed":1,"syntology":{"n":5,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/predictive-information-accelerates-learning#ran","syntology_url":"https://syntology.ai/paper/2007.12401","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2007.12401"}},"official":{"repos":["google-research/pisac"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/a-policy-gradient-method-for-task-agnostic","slug":"a-policy-gradient-method-for-task-agnostic","title":"Task-Agnostic Exploration via Policy Gradient of a Non-Parametric State Entropy Estimate","date":"2020-07-09","arxiv_id":"2007.04640","repositories_listed":1,"syntology":null},{"url":"/paper/deep-bayesian-quadrature-policy-optimization","slug":"deep-bayesian-quadrature-policy-optimization","title":"Deep Bayesian Quadrature Policy Optimization","date":"2020-06-28","arxiv_id":"2006.15637","repositories_listed":1,"syntology":null},{"url":"/paper/lipschitzness-is-all-you-need-to-tame-off","slug":"lipschitzness-is-all-you-need-to-tame-off","title":"Lipschitzness Is All You Need To Tame Off-policy Generative Adversarial Imitation Learning","date":"2020-06-28","arxiv_id":"2006.16785","repositories_listed":1,"syntology":null},{"url":"/paper/dm-control-software-and-tasks-for-continuous","slug":"dm-control-software-and-tasks-for-continuous","title":"dm_control: Software and Tasks for Continuous Control","date":"2020-06-22","arxiv_id":"2006.12983","repositories_listed":1,"syntology":null}],"record_sha256":"94c18f909539a88483f2277c30dec6d5d0f28b3f0093994bf6fd96de9757c879","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}