{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/temporally-layered-architecture-for-efficient","title":"Optimizing Attention and Cognitive Control Costs Using Temporally-Layered Architectures","arxiv_id":"2305.18701","date":"2023-05-30","proceeding":null,"authors":["Devdhar Patel","Terrence Sejnowski","Hava Siegelmann"],"abstract":"The current reinforcement learning framework focuses exclusively on performance, often at the expense of efficiency. In contrast, biological control achieves remarkable performance while also optimizing computational energy expenditure and decision frequency. We propose a Decision Bounded Markov Decision Process (DB-MDP), that constrains the number of decisions and computational energy available to agents in reinforcement learning environments. Our experiments demonstrate that existing reinforcement learning algorithms struggle within this framework, leading to either failure or suboptimal performance. To address this, we introduce a biologically-inspired, Temporally Layered Architecture (TLA), enabling agents to manage computational costs through two layers with distinct time scales and energy requirements. TLA achieves optimal performance in decision-bounded environments and in continuous control environments, it matches state-of-the-art performance while utilizing a fraction of the compute cost. Compared to current reinforcement learning algorithms that solely prioritize performance, our approach significantly lowers computational energy expenditure while maintaining performance. These findings establish a benchmark and pave the way for future research on energy and time-aware control.","url_abs":"https://arxiv.org/abs/2305.18701v3","url_pdf":"https://arxiv.org/pdf/2305.18701v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"temporally-layered-architecture-for-efficient","repo_url":"https://github.com/dee0512/Temporally-Layered-Architecture","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"continuous-control","task_name":"Continuous Control"},{"task_slug":"openai-gym","task_name":"OpenAI Gym"},{"task_slug":null,"task_name":"Pendulum-v1"},{"task_slug":"reinforcement-learning","task_name":"Reinforcement Learning"},{"task_slug":"continuous-control","task_name":"continuous-control"},{"task_slug":"reinforcement-learning-2","task_name":"reinforcement-learning"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"clipped-double-q-learning","method_name":"Clipped Double Q-learning"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"experience-replay","method_name":"Experience Replay"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"td3","method_name":"TD3"},{"method_slug":"tla","method_name":"TLA"},{"method_slug":"target-policy-smoothing","method_name":"Target Policy Smoothing"}],"datasets_introduced":[],"methods_introduced":[{"slug":"tla","name":"TLA","full_name":"Temporally Layered Architecture"}],"results":[{"leaderboard":"/sota/openai-gym-on-ant-v2","task":"OpenAI Gym","dataset":"Ant-v2","model":"TLA","rank_in_archive_order":1,"of":2,"metrics":{"Action Repetition":".1268","Average Decisions":"860.21","Mean Reward":"5163.54"},"uses_additional_data":false},{"leaderboard":"/sota/openai-gym-on-halfcheetah-v2","task":"OpenAI Gym","dataset":"HalfCheetah-v2","model":"TLA","rank_in_archive_order":1,"of":2,"metrics":{"Action Repetition":".1805","Average Decisions":"831.42","Mean Reward":"9571.99"},"uses_additional_data":false},{"leaderboard":"/sota/openai-gym-on-hopper-v2","task":"OpenAI Gym","dataset":"Hopper-v2","model":"TLA","rank_in_archive_order":1,"of":2,"metrics":{"Action Repetition":".5722","Average Decisions":"423.91","Mean Reward":"3458.22"},"uses_additional_data":false},{"leaderboard":"/sota/openai-gym-on-inverteddoublependulum-v2","task":"OpenAI Gym","dataset":"InvertedDoublePendulum-v2","model":"TLA","rank_in_archive_order":1,"of":1,"metrics":{"Action Repetition":".7522","Average Decisions":"247.76","Mean Reward":"9356.67"},"uses_additional_data":false},{"leaderboard":"/sota/openai-gym-on-invertedpendulum-v2","task":"OpenAI Gym","dataset":"InvertedPendulum-v2","model":"TLA","rank_in_archive_order":1,"of":1,"metrics":{"Action Repetition":".8882","Average Decisions":"111.79","Mean Reward":"1000"},"uses_additional_data":false},{"leaderboard":"/sota/openai-gym-on-mountaincarcontinuous-v0","task":"OpenAI Gym","dataset":"MountainCarContinuous-v0","model":"TLA","rank_in_archive_order":1,"of":1,"metrics":{"Action Repetition":".914","Average Decisions":"10.6","Mean Reward":"93.88"},"uses_additional_data":false},{"leaderboard":"/sota/openai-gym-on-pendulum-v1","task":"OpenAI Gym","dataset":"Pendulum-v1","model":"TLA","rank_in_archive_order":2,"of":2,"metrics":{"Action Repetition":".7032","Average Decisions":"62.31","Mean Reward":"-154.92"},"uses_additional_data":false},{"leaderboard":"/sota/openai-gym-on-walker2d-v2","task":"OpenAI Gym","dataset":"Walker2d-v2","model":"TLA","rank_in_archive_order":2,"of":2,"metrics":{"Action Repetition":".4745","Average Decisions":"513.12","Mean Reward":"3878.41"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2305.18701","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}