{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/entropy-regularization/papers/7","list_of":"/method/entropy-regularization","method":"Entropy Regularization","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":7,"pages_in_order":12,"rows_per_page":100,"rows":[601,700],"of":1128,"counts":{"archive_papers_tagged":1128,"with_a_code_link":451,"where_syntology_ran_a_sample":156,"not_listed_spam_title":0,"listed":1128,"listed_where_code_ran":156,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":129,"every_run_a_failure_of_syntologys_instrument":27,"listed_with_a_run_with_no_instrument_failure":129,"listed_every_run_a_failure_of_syntologys_instrument":27,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/entropy-regularization","prev":"/method/entropy-regularization/papers/6","next":"/method/entropy-regularization/papers/8","papers":[{"paper":null,"slug":"pmr-prototypical-modal-rebalance-for","title":"PMR: Prototypical Modal Rebalance for Multimodal Learning","date":"2022-11-14","arxiv_id":"2211.07089","n_code_links":0,"syntology":null},{"paper":null,"slug":"tier-a-denoising-learning-framework-for","title":"TIER-A: Denoising Learning Framework for Information Extraction","date":"2022-11-13","arxiv_id":"2211.11527","n_code_links":0,"syntology":null},{"paper":null,"slug":"empirical-risk-minimization-with-generalized","title":"Empirical Risk Minimization with Relative Entropy Regularization","date":"2022-11-12","arxiv_id":"2211.06617","n_code_links":0,"syntology":null},{"paper":"/paper/efficient-deep-reinforcement-learning-with-1","slug":"efficient-deep-reinforcement-learning-with-1","title":"Efficient Deep Reinforcement Learning with Predictive Processing Proximal Policy Optimization","date":"2022-11-11","arxiv_id":"2211.06236","n_code_links":1,"syntology":null},{"paper":null,"slug":"estimation-of-appearance-and-occupancy","title":"Estimation of Appearance and Occupancy Information in Birds Eye View from Surround Monocular Images","date":"2022-11-08","arxiv_id":"2211.04557","n_code_links":0,"syntology":null},{"paper":null,"slug":"decentralized-policy-optimization","title":"Decentralized Policy Optimization","date":"2022-11-06","arxiv_id":"2211.03032","n_code_links":0,"syntology":null},{"paper":"/paper/design-process-is-a-reinforcement-learning","slug":"design-process-is-a-reinforcement-learning","title":"Design Process is a Reinforcement Learning Problem","date":"2022-11-06","arxiv_id":"2211.03136","n_code_links":1,"syntology":null},{"paper":"/paper/defix-detecting-and-fixing-failure-scenarios","slug":"defix-detecting-and-fixing-failure-scenarios","title":"DeFIX: Detecting and Fixing Failure Scenarios with Reinforcement Learning in Imitation Learning Based Autonomous Driving","date":"2022-10-29","arxiv_id":"2210.16567","n_code_links":2,"syntology":null},{"paper":"/paper/self-improving-safety-performance-of","slug":"self-improving-safety-performance-of","title":"Self-Improving Safety Performance of Reinforcement Learning Based Driving with Black-Box Verification Algorithms","date":"2022-10-29","arxiv_id":"2210.16575","n_code_links":2,"syntology":null},{"paper":null,"slug":"many-objective-reinforcement-learning-for","title":"Many-Objective Reinforcement Learning for Online Testing of DNN-Enabled Systems","date":"2022-10-27","arxiv_id":"2210.15432","n_code_links":0,"syntology":null},{"paper":"/paper/plant-explainable-planning-transformers-via","slug":"plant-explainable-planning-transformers-via","title":"PlanT: Explainable Planning Transformers via Object-Level Representations","date":"2022-10-25","arxiv_id":"2210.14222","n_code_links":2,"syntology":{"ran":2,"of":2,"n_ran_checked":1,"n_instrument":1,"unverified":0,"pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["autonomousvision/plant"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/non-iterative-scribble-supervised-learning","slug":"non-iterative-scribble-supervised-learning","title":"Non-Iterative Scribble-Supervised Learning with Pacing Pseudo-Masks for Medical Image Segmentation","date":"2022-10-20","arxiv_id":"2210.10956","n_code_links":1,"syntology":null},{"paper":null,"slug":"out-of-distribution-reasoning-by-weakly","title":"Out of Distribution Reasoning by Weakly-Supervised Disentangled Logic Variational Autoencoder","date":"2022-10-18","arxiv_id":"2210.09959","n_code_links":0,"syntology":null},{"paper":"/paper/a-multilevel-reinforcement-learning-framework","slug":"a-multilevel-reinforcement-learning-framework","title":"A Multilevel Reinforcement Learning Framework for PDE-based Control","date":"2022-10-15","arxiv_id":"2210.08400","n_code_links":2,"syntology":null},{"paper":"/paper/model-based-imitation-learning-for-urban","slug":"model-based-imitation-learning-for-urban","title":"Model-Based Imitation Learning for Urban Driving","date":"2022-10-14","arxiv_id":"2210.07729","n_code_links":1,"syntology":{"ran":21,"of":23,"n_ran_checked":13,"n_instrument":8,"unverified":2,"pointer_only":0,"phrase":"21 ran (of which 13 constructed an object rather than computing a result; 13 with no instrument failure: 0 honoured, 0 violated, 13 with no contract checked; 8 where Syntology's instrument failed) · 2 unverified","official":{"repos":["wayveai/mile"],"state":"official (archive's flag): 21 ran","n_ran":21,"n_constructed":13,"n_ran_no_instrument_failure":13,"n_unverified":2,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"learning-driving-policies-for-end-to-end","title":"Exploring Contextual Representation and Multi-Modality for End-to-End Autonomous Driving","date":"2022-10-13","arxiv_id":"2210.06758","n_code_links":0,"syntology":null},{"paper":null,"slug":"point-cloud-scene-completion-with-joint-color","title":"Point Cloud Scene Completion with Joint Color and Semantic Estimation from Single RGB-D Image","date":"2022-10-12","arxiv_id":"2210.05891","n_code_links":0,"syntology":null},{"paper":"/paper/discovered-policy-optimisation","slug":"discovered-policy-optimisation","title":"Discovered Policy Optimisation","date":"2022-10-11","arxiv_id":"2210.05639","n_code_links":1,"syntology":null},{"paper":null,"slug":"enhance-sample-efficiency-and-robustness-of","title":"Enhance Sample Efficiency and Robustness of End-to-end Urban Autonomous Driving via Semantic Masked World Model","date":"2022-10-08","arxiv_id":"2210.04017","n_code_links":0,"syntology":null},{"paper":"/paper/real-time-reinforcement-learning-for-vision","slug":"real-time-reinforcement-learning-for-vision","title":"Real-Time Reinforcement Learning for Vision-Based Robotics Utilizing Local and Remote Computers","date":"2022-10-05","arxiv_id":"2210.02317","n_code_links":2,"syntology":{"ran":4,"of":4,"n_ran_checked":2,"n_instrument":2,"unverified":0,"pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","official":{"repos":["rlai-lab/relod","rlai-lab/remote-onboard-agent"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"spatial-temporal-aware-safe-multi-agent","title":"Spatial-Temporal-Aware Safe Multi-Agent Reinforcement Learning of Connected Autonomous Vehicles in Challenging Scenarios","date":"2022-10-05","arxiv_id":"2210.02300","n_code_links":0,"syntology":null},{"paper":"/paper/is-reinforcement-learning-not-for-natural","slug":"is-reinforcement-learning-not-for-natural","title":"Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization","date":"2022-10-03","arxiv_id":"2210.01241","n_code_links":3,"syntology":null},{"paper":null,"slug":"multi-agent-chance-constrained-stochastic","title":"Multi-Agent Chance-Constrained Stochastic Shortest Path with Application to Risk-Aware Intelligent Intersection","date":"2022-10-03","arxiv_id":"2210.01766","n_code_links":0,"syntology":null},{"paper":null,"slug":"obstacle-avoidance-for-robotic-manipulator-in","title":"IPPO: Obstacle Avoidance for Robotic Manipulators in Joint Space via Improved Proximal Policy Optimization","date":"2022-10-03","arxiv_id":"2210.00803","n_code_links":0,"syntology":null},{"paper":null,"slug":"softtreemax-policy-gradient-with-tree-search","title":"SoftTreeMax: Policy Gradient with Tree Search","date":"2022-09-28","arxiv_id":"2209.13966","n_code_links":0,"syntology":null},{"paper":null,"slug":"lamarckian-platform-pushing-the-boundaries-of","title":"Lamarckian Platform: Pushing the Boundaries of Evolutionary Reinforcement Learning towards Asynchronous Commercial Games","date":"2022-09-21","arxiv_id":"2209.10055","n_code_links":0,"syntology":null},{"paper":null,"slug":"model-free-reinforcement-learning-for-asset","title":"Model-Free Reinforcement Learning for Asset Allocation","date":"2022-09-21","arxiv_id":"2209.10458","n_code_links":0,"syntology":null},{"paper":"/paper/partial-observability-during-drl-for-robot","slug":"partial-observability-during-drl-for-robot","title":"Experimental Study on The Effect of Multi-step Deep Reinforcement Learning in POMDPs","date":"2022-09-12","arxiv_id":"2209.04999","n_code_links":1,"syntology":null},{"paper":null,"slug":"normality-guided-distributional-reinforcement","title":"Normality-Guided Distributional Reinforcement Learning for Continuous Control","date":"2022-08-28","arxiv_id":"2208.13125","n_code_links":0,"syntology":null},{"paper":null,"slug":"entropy-regularization-for-population","title":"Entropy Regularization for Population Estimation","date":"2022-08-24","arxiv_id":"2208.11747","n_code_links":0,"syntology":null},{"paper":null,"slug":"entropy-augmented-reinforcement-learning","title":"Entropy Augmented Reinforcement Learning","date":"2022-08-19","arxiv_id":"2208.09322","n_code_links":0,"syntology":null},{"paper":null,"slug":"path-planning-of-cleaning-robot-with","title":"Path Planning of Cleaning Robot with Reinforcement Learning","date":"2022-08-17","arxiv_id":"2208.08211","n_code_links":0,"syntology":null},{"paper":"/paper/bsac-bayesian-strategy-network-based-soft","slug":"bsac-bayesian-strategy-network-based-soft","title":"Bayesian Soft Actor-Critic: A Directed Acyclic Strategy Graph Based Deep Reinforcement Learning","date":"2022-08-11","arxiv_id":"2208.06033","n_code_links":2,"syntology":null},{"paper":"/paper/aerial-monocular-3d-object-detection","slug":"aerial-monocular-3d-object-detection","title":"Aerial Monocular 3D Object Detection","date":"2022-08-08","arxiv_id":"2208.03974","n_code_links":1,"syntology":null},{"paper":"/paper/learning-to-generalize-with-object-centric","slug":"learning-to-generalize-with-object-centric","title":"Learning to Generalize with Object-centric Agents in the Open World Survival Game Crafter","date":"2022-08-05","arxiv_id":"2208.03374","n_code_links":1,"syntology":{"ran":4,"of":4,"n_ran_checked":3,"n_instrument":1,"unverified":0,"pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["astanic/crafter-ood"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/performance-comparison-of-deep-rl-algorithms","slug":"performance-comparison-of-deep-rl-algorithms","title":"Performance Comparison of Deep RL Algorithms for Energy Systems Optimal Scheduling","date":"2022-08-01","arxiv_id":"2208.00728","n_code_links":1,"syntology":null},{"paper":null,"slug":"adaptive-feature-fusion-for-cooperative","title":"Adaptive Feature Fusion for Cooperative Perception using LiDAR Point Clouds","date":"2022-07-30","arxiv_id":"2208.00116","n_code_links":0,"syntology":null},{"paper":null,"slug":"solving-the-vehicle-routing-problem-with-deep","title":"Solving the vehicle routing problem with deep reinforcement learning","date":"2022-07-30","arxiv_id":"2208.00202","n_code_links":0,"syntology":null},{"paper":"/paper/safety-enhanced-autonomous-driving-using-1","slug":"safety-enhanced-autonomous-driving-using-1","title":"Safety-Enhanced Autonomous Driving Using Interpretable Sensor Fusion Transformer","date":"2022-07-28","arxiv_id":"2207.14024","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":0,"n_instrument":1,"unverified":0,"pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["opendilab/InterFuser"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"adaptive-decision-making-at-the-intersection","title":"Adaptive Decision Making at the Intersection for Autonomous Vehicles Based on Skill Discovery","date":"2022-07-24","arxiv_id":"2207.11724","n_code_links":0,"syntology":null},{"paper":"/paper/few-shot-class-incremental-learning-via-1","slug":"few-shot-class-incremental-learning-via-1","title":"Few-Shot Class-Incremental Learning via Entropy-Regularized Data-Free Replay","date":"2022-07-22","arxiv_id":"2207.11213","n_code_links":1,"syntology":{"ran":1,"of":2,"n_ran_checked":1,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["liuh127/FSCIL-via-Entropy-regularized-DF-Replay"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/synthetic-dataset-generation-for-adversarial","slug":"synthetic-dataset-generation-for-adversarial","title":"Synthetic Dataset Generation for Adversarial Machine Learning Research","date":"2022-07-21","arxiv_id":"2207.10719","n_code_links":1,"syntology":null},{"paper":null,"slug":"resolving-copycat-problems-in-visual","title":"Resolving Copycat Problems in Visual Imitation Learning via Residual Action Prediction","date":"2022-07-20","arxiv_id":"2207.09705","n_code_links":0,"syntology":null},{"paper":"/paper/anti-carla-an-adversarial-testing-framework","slug":"anti-carla-an-adversarial-testing-framework","title":"ANTI-CARLA: An Adversarial Testing Framework for Autonomous Vehicles in CARLA","date":"2022-07-19","arxiv_id":"2208.06309","n_code_links":1,"syntology":null},{"paper":"/paper/st-p3-end-to-end-vision-based-autonomous","slug":"st-p3-end-to-end-vision-based-autonomous","title":"ST-P3: End-to-end Vision-based Autonomous Driving via Spatial-Temporal Feature Learning","date":"2022-07-15","arxiv_id":"2207.07601","n_code_links":1,"syntology":{"ran":5,"of":5,"n_ran_checked":4,"n_instrument":1,"unverified":0,"pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":null}},{"paper":"/paper/automated-detection-of-label-errors-in","slug":"automated-detection-of-label-errors-in","title":"Automated Detection of Label Errors in Semantic Segmentation Datasets via Deep Learning and Uncertainty Quantification","date":"2022-07-13","arxiv_id":"2207.06104","n_code_links":1,"syntology":{"ran":2,"of":3,"n_ran_checked":2,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["mrcoee/automatic-label-error-detection"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"towards-global-optimality-in-cooperative-marl","title":"Towards Global Optimality in Cooperative MARL with the Transformation And Distillation Framework","date":"2022-07-12","arxiv_id":"2207.11143","n_code_links":0,"syntology":null},{"paper":"/paper/keep-your-distance-determining-sampling-and","slug":"keep-your-distance-determining-sampling-and","title":"Keep your Distance: Determining Sampling and Distance Thresholds in Machine Learning Monitoring","date":"2022-07-11","arxiv_id":"2207.05078","n_code_links":1,"syntology":null},{"paper":null,"slug":"asynchronous-curriculum-experience-replay-a","title":"Asynchronous Curriculum Experience Replay: A Deep Reinforcement Learning Approach for UAV Autonomous Motion Control in Unknown Dynamic Environments","date":"2022-07-04","arxiv_id":"2207.01251","n_code_links":0,"syntology":null},{"paper":null,"slug":"game-state-learning-via-game-scene","title":"Game State Learning via Game Scene Augmentation","date":"2022-07-04","arxiv_id":"2207.01289","n_code_links":0,"syntology":null},{"paper":null,"slug":"data-generation-using-simulation-technology","title":"Data generation using simulation technology to improve perception mechanism of autonomous vehicles","date":"2022-07-01","arxiv_id":"2207.00191","n_code_links":0,"syntology":null},{"paper":"/paper/learning-mixture-of-domain-specific-experts","slug":"learning-mixture-of-domain-specific-experts","title":"Learning mixture of domain-specific experts via disentangled factors for autonomous driving","date":"2022-06-28","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/ibiscape-a-simulated-benchmark-for-multi","slug":"ibiscape-a-simulated-benchmark-for-multi","title":"IBISCape: A Simulated Benchmark for multi-modal SLAM Systems Evaluation in Large-scale Dynamic Environments","date":"2022-06-27","arxiv_id":"2206.13455","n_code_links":1,"syntology":null},{"paper":null,"slug":"fighting-fire-with-fire-avoiding-dnn","title":"Fighting Fire with Fire: Avoiding DNN Shortcuts through Priming","date":"2022-06-22","arxiv_id":"2206.10816","n_code_links":0,"syntology":null},{"paper":"/paper/multi-agent-car-parking-using-reinforcement","slug":"multi-agent-car-parking-using-reinforcement","title":"Multi-Agent Car Parking using Reinforcement Learning","date":"2022-06-22","arxiv_id":"2206.13338","n_code_links":1,"syntology":null},{"paper":"/paper/envpool-a-highly-parallel-reinforcement","slug":"envpool-a-highly-parallel-reinforcement","title":"EnvPool: A Highly Parallel Reinforcement Learning Environment Execution Engine","date":"2022-06-21","arxiv_id":"2206.10558","n_code_links":3,"syntology":{"ran":5,"of":5,"n_ran_checked":4,"n_instrument":1,"unverified":0,"pointer_only":1,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["sail-sg/envpool"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["named_in_paper","official"]}}},{"paper":null,"slug":"imitate-then-transcend-multi-agent-optimal","title":"Imitate then Transcend: Multi-Agent Optimal Execution with Dual-Window Denoise PPO","date":"2022-06-21","arxiv_id":"2206.10736","n_code_links":0,"syntology":null},{"paper":null,"slug":"incorporating-voice-instructions-in-model","title":"Incorporating Voice Instructions in Model-Based Reinforcement Learning for Self-Driving Cars","date":"2022-06-21","arxiv_id":"2206.10249","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-parametric-class-of-approximate-gradient","title":"A Parametric Class of Approximate Gradient Updates for Policy Optimization","date":"2022-06-17","arxiv_id":"2206.08499","n_code_links":0,"syntology":null},{"paper":"/paper/towards-human-level-bimanual-dexterous","slug":"towards-human-level-bimanual-dexterous","title":"Towards Human-Level Bimanual Dexterous Manipulation with Reinforcement Learning","date":"2022-06-17","arxiv_id":"2206.08686","n_code_links":1,"syntology":null},{"paper":null,"slug":"level-2-autonomous-driving-on-a-single-device","title":"Level 2 Autonomous Driving on a Single Device: Diving into the Devils of Openpilot","date":"2022-06-16","arxiv_id":"2206.08176","n_code_links":0,"syntology":null},{"paper":"/paper/trajectory-guided-control-prediction-for-end","slug":"trajectory-guided-control-prediction-for-end","title":"Trajectory-guided Control Prediction for End-to-end Autonomous Driving: A Simple yet Strong Baseline","date":"2022-06-16","arxiv_id":"2206.08129","n_code_links":1,"syntology":null},{"paper":null,"slug":"learning-task-independent-game-state","title":"Learning Task-Independent Game State Representations from Unlabeled Images","date":"2022-06-13","arxiv_id":"2206.06490","n_code_links":0,"syntology":null},{"paper":"/paper/a-unified-approach-to-reinforcement-learning","slug":"a-unified-approach-to-reinforcement-learning","title":"A Unified Approach to Reinforcement Learning, Quantal Response Equilibria, and Two-Player Zero-Sum Games","date":"2022-06-12","arxiv_id":"2206.05825","n_code_links":3,"syntology":{"ran":5,"of":5,"n_ran_checked":4,"n_instrument":1,"unverified":0,"pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 1 honoured, 3 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["deepmind/open_spiel"],"state":"official: no sample here; runs from other or unrecorded repositories","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["named_in_paper"]}}},{"paper":"/paper/carla-gear-a-dataset-generator-for-a","slug":"carla-gear-a-dataset-generator-for-a","title":"CARLA-GeAR: a Dataset Generator for a Systematic Evaluation of Adversarial Robustness of Vision Models","date":"2022-06-09","arxiv_id":"2206.04365","n_code_links":1,"syntology":null},{"paper":"/paper/generalized-data-distribution-iteration","slug":"generalized-data-distribution-iteration","title":"Generalized Data Distribution Iteration","date":"2022-06-07","arxiv_id":"2206.03192","n_code_links":0,"syntology":null},{"paper":"/paper/gink-graph-based-interaction-aware","slug":"gink-graph-based-interaction-aware","title":"GIN: Graph-based Interaction-aware Constraint Policy Optimization for Autonomous Driving","date":"2022-06-03","arxiv_id":"2206.01488","n_code_links":1,"syntology":null},{"paper":null,"slug":"finite-time-analysis-of-entropy-regularized","title":"Finite-Time Analysis of Entropy-Regularized Neural Natural Actor-Critic Algorithm","date":"2022-06-02","arxiv_id":"2206.00833","n_code_links":0,"syntology":null},{"paper":null,"slug":"on-the-choice-of-data-for-efficient-training","title":"On the Choice of Data for Efficient Training and Validation of End-to-End Driving Models","date":"2022-06-01","arxiv_id":"2206.00608","n_code_links":0,"syntology":null},{"paper":"/paper/transfuser-imitation-with-transformer-based","slug":"transfuser-imitation-with-transformer-based","title":"TransFuser: Imitation with Transformer-Based Sensor Fusion for Autonomous Driving","date":"2022-05-31","arxiv_id":"2205.15997","n_code_links":3,"syntology":{"ran":5,"of":5,"n_ran_checked":5,"n_instrument":0,"unverified":0,"pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 1 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["autonomousvision/transfuser"],"state":"community repositories only","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["listed"]}}},{"paper":"/paper/efficient-reward-poisoning-attacks-on-online","slug":"efficient-reward-poisoning-attacks-on-online","title":"Efficient Reward Poisoning Attacks on Online Deep Reinforcement Learning","date":"2022-05-30","arxiv_id":"2205.14842","n_code_links":1,"syntology":{"ran":3,"of":3,"n_ran_checked":0,"n_instrument":3,"unverified":0,"pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","official":{"repos":["yinglunxu/reward_poisoning_attack_drl"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"risk-of-stochastic-systems-for-temporal-logic","title":"Risk of Stochastic Systems for Temporal Logic Specifications","date":"2022-05-28","arxiv_id":"2205.14523","n_code_links":0,"syntology":null},{"paper":null,"slug":"kl-entropy-regularized-rl-with-a-generative","title":"KL-Entropy-Regularized RL with a Generative Model is Minimax Optimal","date":"2022-05-27","arxiv_id":"2205.14211","n_code_links":0,"syntology":null},{"paper":"/paper/quark-controllable-text-generation-with","slug":"quark-controllable-text-generation-with","title":"Quark: Controllable Text Generation with Reinforced Unlearning","date":"2022-05-26","arxiv_id":"2205.13636","n_code_links":1,"syntology":{"ran":2,"of":2,"n_ran_checked":1,"n_instrument":1,"unverified":0,"pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["gximinglu/quark"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/accuracy-on-in-domain-samples-matters-when","slug":"accuracy-on-in-domain-samples-matters-when","title":"Accuracy on In-Domain Samples Matters When Building Out-of-Domain detectors: A Reply to Marek et al. (2021)","date":"2022-05-24","arxiv_id":"2205.11887","n_code_links":1,"syntology":null},{"paper":null,"slug":"learning-to-drive-using-sparse-imitation","title":"Learning to Drive Using Sparse Imitation Reinforcement Learning","date":"2022-05-24","arxiv_id":"2205.12128","n_code_links":0,"syntology":null},{"paper":"/paper/an-evaluation-study-of-intrinsic-motivation","slug":"an-evaluation-study-of-intrinsic-motivation","title":"An Evaluation Study of Intrinsic Motivation Techniques applied to Reinforcement Learning over Hard Exploration Environments","date":"2022-05-23","arxiv_id":"2205.11184","n_code_links":1,"syntology":{"ran":5,"of":5,"n_ran_checked":4,"n_instrument":1,"unverified":0,"pointer_only":2,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["aklein1995/intrinsic_motivation_techniques_study"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/flexible-diffusion-modeling-of-long-videos","slug":"flexible-diffusion-modeling-of-long-videos","title":"Flexible Diffusion Modeling of Long Videos","date":"2022-05-23","arxiv_id":"2205.11495","n_code_links":1,"syntology":null},{"paper":null,"slug":"generalization-mayhems-and-limits-in","title":"Generalization, Mayhems and Limits in Recurrent Proximal Policy Optimization","date":"2022-05-23","arxiv_id":"2205.11104","n_code_links":0,"syntology":null},{"paper":"/paper/sigmoidally-preconditioned-off-policy","slug":"sigmoidally-preconditioned-off-policy","title":"The Sufficiency of Off-Policyness and Soft Clipping: PPO is still Insufficient according to an Off-Policy Measure","date":"2022-05-20","arxiv_id":"2205.10047","n_code_links":1,"syntology":null},{"paper":"/paper/a2c-is-a-special-case-of-ppo","slug":"a2c-is-a-special-case-of-ppo","title":"A2C is a special case of PPO","date":"2022-05-18","arxiv_id":"2205.09123","n_code_links":1,"syntology":null},{"paper":null,"slug":"constraining-the-attack-space-of-machine","title":"Defending Object Detectors against Patch Attacks with Out-of-Distribution Smoothing","date":"2022-05-18","arxiv_id":"2205.08989","n_code_links":0,"syntology":null},{"paper":null,"slug":"policy-distillation-with-selective-input","title":"Policy Distillation with Selective Input Gradient Regularization for Efficient Interpretability","date":"2022-05-18","arxiv_id":"2205.08685","n_code_links":0,"syntology":null},{"paper":null,"slug":"qualitative-differences-between-evolutionary","title":"Qualitative Differences Between Evolutionary Strategies and Reinforcement Learning Methods for Control of Autonomous Agents","date":"2022-05-16","arxiv_id":"2205.07592","n_code_links":0,"syntology":null},{"paper":"/paper/cliff-diving-exploring-reward-surfaces-in","slug":"cliff-diving-exploring-reward-surfaces-in","title":"Cliff Diving: Exploring Reward Surfaces in Reinforcement Learning Environments","date":"2022-05-14","arxiv_id":"2205.07015","n_code_links":0,"syntology":{"ran":2,"of":4,"n_ran_checked":1,"n_instrument":1,"unverified":2,"pointer_only":1,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","official":null}},{"paper":null,"slug":"nmr-neural-manifold-representation-for","title":"NMR: Neural Manifold Representation for Autonomous Driving","date":"2022-05-11","arxiv_id":"2205.05551","n_code_links":0,"syntology":null},{"paper":null,"slug":"unrealnas-can-we-search-neural-architectures","title":"UnrealNAS: Can We Search Neural Architectures with Unreal Data?","date":"2022-05-04","arxiv_id":"2205.02162","n_code_links":0,"syntology":null},{"paper":null,"slug":"processing-network-controls-via-deep","title":"Processing Network Controls via Deep Reinforcement Learning","date":"2022-05-01","arxiv_id":"2205.02119","n_code_links":0,"syntology":null},{"paper":"/paper/loss-function-entropy-regularization-for","slug":"loss-function-entropy-regularization-for","title":"Loss Function Entropy Regularization for Diverse Decision Boundaries","date":"2022-04-30","arxiv_id":"2205.00224","n_code_links":0,"syntology":null},{"paper":null,"slug":"control-aware-prediction-objectives-for","title":"Control-Aware Prediction Objectives for Autonomous Driving","date":"2022-04-28","arxiv_id":"2204.13319","n_code_links":0,"syntology":null},{"paper":"/paper/king-generating-safety-critical-driving","slug":"king-generating-safety-critical-driving","title":"KING: Generating Safety-Critical Driving Scenarios for Robust Imitation via Kinematics Gradients","date":"2022-04-28","arxiv_id":"2204.13683","n_code_links":1,"syntology":{"ran":5,"of":6,"n_ran_checked":5,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 1 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","official":{"repos":["autonomousvision/king"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"task-induced-representation-learning-1","title":"Task-Induced Representation Learning","date":"2022-04-25","arxiv_id":"2204.11827","n_code_links":0,"syntology":null},{"paper":null,"slug":"selfd-self-learning-large-scale-driving","title":"SelfD: Self-Learning Large-Scale Driving Policies From the Web","date":"2022-04-21","arxiv_id":"2204.10320","n_code_links":0,"syntology":null},{"paper":"/paper/deep-reinforcement-learning-for-a-two-echelon","slug":"deep-reinforcement-learning-for-a-two-echelon","title":"Comparing Deep Reinforcement Learning Algorithms in Two-Echelon Supply Chains","date":"2022-04-20","arxiv_id":"2204.09603","n_code_links":1,"syntology":null},{"paper":null,"slug":"selma-semantic-large-scale-multimodal","title":"SELMA: SEmantic Large-scale Multimodal Acquisitions in Variable Weather, Daytime and Viewpoints","date":"2022-04-20","arxiv_id":"2204.09788","n_code_links":0,"syntology":null},{"paper":"/paper/fully-end-to-end-autonomous-driving-with","slug":"fully-end-to-end-autonomous-driving-with","title":"End-to-end Autonomous Driving with Semantic Depth Cloud Mapping and Multi-agent","date":"2022-04-12","arxiv_id":"2204.05513","n_code_links":1,"syntology":null},{"paper":null,"slug":"proximal-policy-optimization-learning-based","title":"Proximal Policy Optimization Learning based Control of Congested Freeway Traffic","date":"2022-04-12","arxiv_id":"2204.05627","n_code_links":0,"syntology":null},{"paper":null,"slug":"rl-coseg-a-novel-image-co-segmentation","title":"RL-CoSeg : A Novel Image Co-Segmentation Algorithm with Deep Reinforcement Learning","date":"2022-04-12","arxiv_id":"2204.05951","n_code_links":0,"syntology":null},{"paper":null,"slug":"scale-invariant-semantic-segmentation-with","title":"Scale Invariant Semantic Segmentation with RGB-D Fusion","date":"2022-04-10","arxiv_id":"2204.04679","n_code_links":0,"syntology":null},{"paper":null,"slug":"semantic-exploration-from-language","title":"Semantic Exploration from Language Abstractions and Pretrained Representations","date":"2022-04-08","arxiv_id":"2204.05080","n_code_links":0,"syntology":null}],"record_sha256":"c06f86b8b7d3da2a83426139391766ab8256d948f5e75233a09d7529572ee738","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}