{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/shakti-a-2-5-billion-parameter-small-language","title":"SHAKTI: A 2.5 Billion Parameter Small Language Model Optimized for Edge AI and Low-Resource Environments","arxiv_id":"2410.11331","date":"2024-10-15","proceeding":null,"authors":["Syed Abdul Gaffar Shakhadri","Kruthika KR","Rakshit Aralimatti"],"abstract":"We introduce Shakti, a 2.5 billion parameter language model specifically optimized for resource-constrained environments such as edge devices, including smartphones, wearables, and IoT systems. Shakti combines high-performance NLP with optimized efficiency and precision, making it ideal for real-time AI applications where computational resources and memory are limited. With support for vernacular languages and domain-specific tasks, Shakti excels in industries such as healthcare, finance, and customer service. Benchmark evaluations demonstrate that Shakti performs competitively against larger models while maintaining low latency and on-device efficiency, positioning it as a leading solution for edge AI.","url_abs":"https://arxiv.org/abs/2410.11331v1","url_pdf":"https://arxiv.org/pdf/2410.11331v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"small-language-model","task_name":"Small Language Model"}],"methods":[{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":null,"method_name":null},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/question-answering-on-bbh","task":"Question Answering","dataset":"BBH","model":"Shakti-LLM (2.5B)","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"58.2"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-boolq","task":"Question Answering","dataset":"BoolQ","model":"Shakti-LLM (2.5B)","rank_in_archive_order":54,"of":65,"metrics":{"Accuracy":"61.1"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-hellaswag","task":"Question Answering","dataset":"HellaSwag","model":"Shakti-LLM (2.5B)","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"52.4"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-mmlu","task":"Question Answering","dataset":"MML","model":"qwen-LLM 7B","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"71.8"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-medqa-usmle","task":"Question Answering","dataset":"MedQA","model":"Shakti-LLM (2.5B)","rank_in_archive_order":12,"of":27,"metrics":{"Accuracy":"60.3"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-piqa","task":"Question Answering","dataset":"PIQA","model":"Shakti-LLM (2.5B)","rank_in_archive_order":8,"of":67,"metrics":{"Accuracy":"86.2"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-triviaqa","task":"Question Answering","dataset":"TriviaQA","model":"Shakti-LLM (2.5B)","rank_in_archive_order":39,"of":56,"metrics":{"EM":"58.2"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-truthfulqa","task":"Question Answering","dataset":"TruthfulQA","model":"Shakti-LLM (2.5B)","rank_in_archive_order":33,"of":33,"metrics":{"Accuracy":"68.4"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2410.11331","atlas_url":"https://app.syntology.ai/?focus=2410.11331","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}