{"url":"/sota/time-series-forecasting-on-etth1-336-1","task":{"name":"Time Series Forecasting","url":"/task/time-series-forecasting","note":null},"dataset":{"name":"ETTh1 (336) Multivariate","url":"/dataset/ett"},"category":"Time Series","categories":["Time Series"],"category_note":null,"description":"**Time Series Forecasting** is the task of fitting a model to historical, time-stamped data in order to predict future values. Traditional approaches include moving average, exponential smoothing, and ARIMA, though models as various as RNNs, Transformers, or XGBoost can also be applied. The most popular benchmark is the ETTh1 dataset. Models are typically evaluated using the Mean Square Error (MSE) or Root Mean Square Error (RMSE). \r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [ThaiBinh Nguyen](https://github.com/tn16jv/Stock-Price-Prediction) )</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["MSE","MAE"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"MSE":"lower","MAE":"lower"}},"counts":{"rows":72,"rows_with_code":61,"rows_with_paper_page":72,"rows_dated":72,"rows_using_additional_data":0},"rows":[{"rank_in_archive_order":1,"model":"D-PAD","metrics":{"MAE":"0.406","MSE":"0.374"},"uses_additional_data":false,"paper_date":"2024-03-26","paper":"/paper/d-pad-deep-shallow-multi-frequency-patterns","paper_url":"https://arxiv.org/abs/2403.17814v1","paper_title":"D-PAD: Deep-Shallow Multi-Frequency Patterns Disentangling for Time Series Forecasting","code":"https://github.com/xybbo5/d-pad","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"xPatch","metrics":{"MAE":"0.415","MSE":"0.391"},"uses_additional_data":false,"paper_date":"2024-12-23","paper":"/paper/xpatch-dual-stream-time-series-forecasting","paper_url":"https://arxiv.org/abs/2412.17323v2","paper_title":"xPatch: Dual-Stream Time Series Forecasting with Exponential Seasonal-Trend Decomposition","code":"https://github.com/stitsyuk/xpatch","n_code_links":1,"syntology":null},{"rank_in_archive_order":3,"model":"PatchMixer","metrics":{"MAE":"0.414","MSE":"0.392"},"uses_additional_data":false,"paper_date":"2023-10-01","paper":"/paper/patchmixer-a-patch-mixing-architecture-for","paper_url":"https://arxiv.org/abs/2310.00655v2","paper_title":"PatchMixer: A Patch-Mixing Architecture for Long-Term Time Series Forecasting","code":"https://github.com/Zeying-Gong/PatchMixer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"Fredformer","metrics":{"MAE":"0.403","MSE":"0.395"},"uses_additional_data":false,"paper_date":"2024-06-13","paper":"/paper/fredformer-frequency-debiased-transformer-for","paper_url":"https://arxiv.org/abs/2406.09009v4","paper_title":"Fredformer: Frequency Debiased Transformer for Time Series Forecasting","code":"https://github.com/chenzrg/fredformer","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":5,"model":"UniTime","metrics":{"MAE":"0.407","MSE":"0.398"},"uses_additional_data":false,"paper_date":"2023-10-15","paper":"/paper/unitime-a-language-empowered-unified-model","paper_url":"https://arxiv.org/abs/2310.09751v3","paper_title":"UniTime: A Language-Empowered Unified Model for Cross-Domain Time Series Forecasting","code":"https://github.com/liuxu77/unitime","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"AutoTimes","metrics":{"MAE":"0.429","MSE":"0.401"},"uses_additional_data":false,"paper_date":"2024-02-04","paper":"/paper/autotimes-autoregressive-time-series","paper_url":"https://arxiv.org/abs/2402.02370v4","paper_title":"AutoTimes: Autoregressive Time Series Forecasters via Large Language Models","code":"https://github.com/thuml/AutoTimes","n_code_links":1,"syntology":null},{"rank_in_archive_order":7,"model":"SegRNN","metrics":{"MAE":"0.417","MSE":"0.401"},"uses_additional_data":false,"paper_date":"2023-08-22","paper":"/paper/segrnn-segment-recurrent-neural-network-for","paper_url":"https://arxiv.org/abs/2308.11200v1","paper_title":"SegRNN: Segment Recurrent Neural Network for Long-Term Time Series Forecasting","code":"https://github.com/thuml/Time-Series-Library","n_code_links":4,"syntology":null},{"rank_in_archive_order":8,"model":"TimeCMA","metrics":{"MAE":"0.405","MSE":"0.403"},"uses_additional_data":false,"paper_date":"2024-06-03","paper":"/paper/timecma-towards-llm-empowered-time-series","paper_url":"https://arxiv.org/abs/2406.01638v5","paper_title":"TimeCMA: Towards LLM-Empowered Multivariate Time Series Forecasting via Cross-Modality Alignment","code":"https://github.com/ChenxiLiu-HNU/ST-LLM","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":9,"model":"UniTS-ST","metrics":{"MAE":"0.422","MSE":"0.405"},"uses_additional_data":false,"paper_date":"2024-02-29","paper":"/paper/units-building-a-unified-time-series-model","paper_url":"https://arxiv.org/abs/2403.00131v3","paper_title":"UniTS: A Unified Multi-Task Time Series Model","code":"https://github.com/mims-harvard/UniTS","n_code_links":1,"syntology":{"n_ran":19,"n_unverified":9,"n_samples":28,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"ConvTimeNet","metrics":{"MAE":"0.420","MSE":"0.405"},"uses_additional_data":false,"paper_date":"2024-03-03","paper":"/paper/convtimenet-a-deep-hierarchical-fully","paper_url":"https://arxiv.org/abs/2403.01493v2","paper_title":"ConvTimeNet: A Deep Hierarchical Fully Convolutional Model for Multivariate Time Series Analysis","code":"https://github.com/mingyue-cheng/timemae","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":11,"model":"ROSE","metrics":{"MAE":"0.422","MSE":"0.406"},"uses_additional_data":false,"paper_date":"2024-05-24","paper":"/paper/rose-register-assisted-general-time-series","paper_url":"https://arxiv.org/abs/2405.17478v2","paper_title":"ROSE: Register Assisted General Time Series Forecasting with Decomposed Frequency Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":12,"model":"TEMPO","metrics":{"MAE":"0.425","MSE":"0.408"},"uses_additional_data":false,"paper_date":"2023-10-08","paper":"/paper/tempo-prompt-based-generative-pre-trained","paper_url":"https://arxiv.org/abs/2310.04948v3","paper_title":"TEMPO: Prompt-based Generative Pre-trained Transformer for Time Series Forecasting","code":"https://github.com/dc-research/tempo","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":8,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"MOIRAISmall","metrics":{"MAE":"0.429","MSE":"0.412"},"uses_additional_data":false,"paper_date":"2024-02-04","paper":"/paper/unified-training-of-universal-time-series","paper_url":"https://arxiv.org/abs/2402.02592v2","paper_title":"Unified Training of Universal Time Series Forecasting Transformers","code":"https://github.com/SalesforceAIResearch/uni2ts","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"AMD","metrics":{"MAE":"0.427","MSE":"0.418"},"uses_additional_data":false,"paper_date":"2024-06-06","paper":"/paper/adaptive-multi-scale-decomposition-framework","paper_url":"https://arxiv.org/abs/2406.03751v1","paper_title":"Adaptive Multi-Scale Decomposition Framework for Time Series Forecasting","code":"https://github.com/troubadour000/amd","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"WinNet","metrics":{"MAE":"0.426","MSE":"0.419"},"uses_additional_data":false,"paper_date":"2023-11-01","paper":"/paper/winnet-time-series-forecasting-with-a-window","paper_url":"https://arxiv.org/abs/2311.00214v2","paper_title":"WinNet: Make Only One Convolutional Layer Effective for Time Series Forecasting","code":"https://github.com/ouwen18/WinNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"RLinear","metrics":{"MAE":"0.423","MSE":"0.42"},"uses_additional_data":false,"paper_date":"2023-05-18","paper":"/paper/revisiting-long-term-time-series-forecasting","paper_url":"https://arxiv.org/abs/2305.10721v1","paper_title":"Revisiting Long-term Time Series Forecasting: An Investigation on Linear Mapping","code":"https://github.com/plumprc/rtsf","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":17,"model":"TSMixer","metrics":{"MAE":"0.436","MSE":"0.421"},"uses_additional_data":false,"paper_date":"2023-06-14","paper":"/paper/tsmixer-lightweight-mlp-mixer-model-for","paper_url":"https://arxiv.org/abs/2306.09364v4","paper_title":"TSMixer: Lightweight MLP-Mixer Model for Multivariate Time Series Forecasting","code":"https://github.com/ibm/tsfm","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":18,"model":"PatchTST/64","metrics":{"MAE":"0.44","MSE":"0.422"},"uses_additional_data":false,"paper_date":"2022-11-27","paper":"/paper/a-time-series-is-worth-64-words-long-term","paper_url":"https://arxiv.org/abs/2211.14730v2","paper_title":"A Time Series is Worth 64 Words: Long-term Forecasting with Transformers","code":"https://github.com/timeseriesAI/tsai","n_code_links":8,"syntology":{"n_ran":17,"n_unverified":13,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"HiMTM","metrics":{"MAE":"0.430","MSE":"0.422"},"uses_additional_data":false,"paper_date":"2024-01-10","paper":"/paper/himtm-hierarchical-multi-scale-masked-time","paper_url":"https://arxiv.org/abs/2401.05012v1","paper_title":"HiMTM: Hierarchical Multi-Scale Masked Time Series Modeling for Long-Term Forecasting","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":20,"model":"CATS","metrics":{"MAE":"0.437","MSE":"0.423"},"uses_additional_data":false,"paper_date":"2024-03-04","paper":"/paper/cats-enhancing-multivariate-time-series","paper_url":"https://arxiv.org/abs/2403.01673v1","paper_title":"CATS: Enhancing Multivariate Time Series Forecasting by Constructing Auxiliary Time Series as Exogenous Variables","code":"https://github.com/LJC-FVNR/CATS","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"SAMformer","metrics":{"MAE":"0.425","MSE":"0.423"},"uses_additional_data":false,"paper_date":"2024-02-15","paper":"/paper/unlocking-the-potential-of-transformers-in","paper_url":"https://arxiv.org/abs/2402.10198v3","paper_title":"SAMformer: Unlocking the Potential of Transformers in Time Series Forecasting with Sharpness-Aware Minimization and Channel-Wise Attention","code":"https://github.com/romilbert/samformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":22,"model":"LTBoost (drop_last=false)","metrics":{"MAE":"0.423","MSE":"0.424"},"uses_additional_data":false,"paper_date":"2024-10-21","paper":"/paper/ltboost-boosted-hybrids-of-ensemble-linear","paper_url":"https://dl.acm.org/doi/10.1145/3627673.3679527","paper_title":"LTBoost: Boosted Hybrids of Ensemble Linear and Gradient Algorithms for the Long-term Time Series Forecasting","code":"https://github.com/hubtru/LTBoost","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"GTT-Large","metrics":{"MAE":"0.419","MSE":"0.424"},"uses_additional_data":false,"paper_date":"2024-02-12","paper":"/paper/only-the-curve-shape-matters-training","paper_url":"https://arxiv.org/abs/2402.07570v2","paper_title":"Only the Curve Shape Matters: Training Foundation Models for Zero-Shot Multivariate Time Series Forecasting through Next Curve Shape Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":24,"model":"DiPE-Linear","metrics":{"MSE":"0.424"},"uses_additional_data":false,"paper_date":"2024-11-26","paper":"/paper/disentangled-interpretable-representation-for","paper_url":"https://arxiv.org/abs/2411.17257v1","paper_title":"Disentangled Interpretable Representation for Efficient Long-term Time Series Forecasting","code":"https://github.com/wintertee/dipe-linear","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"FITS","metrics":{"MSE":"0.427"},"uses_additional_data":false,"paper_date":"2023-07-06","paper":"/paper/fits-modeling-time-series-with-10k-parameters","paper_url":"https://arxiv.org/abs/2307.03756v3","paper_title":"FITS: Modeling Time Series with $10k$ Parameters","code":"https://github.com/WenjieDu/PyPOTS","n_code_links":2,"syntology":null},{"rank_in_archive_order":26,"model":"PRformer","metrics":{"MSE":"0.427"},"uses_additional_data":false,"paper_date":"2024-08-20","paper":"/paper/prformer-pyramidal-recurrent-transformer-for","paper_url":"https://arxiv.org/abs/2408.10483v1","paper_title":"PRformer: Pyramidal Recurrent Transformer for Multivariate Time Series Forecasting","code":"https://github.com/usualheart/prformer","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"NLinear","metrics":{"MAE":"0.427","MSE":"0.429"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/are-transformers-effective-for-time-series","paper_url":"https://arxiv.org/abs/2205.13504v3","paper_title":"Are Transformers Effective for Time Series Forecasting?","code":"https://github.com/cure-lab/DLinear","n_code_links":10,"syntology":{"n_ran":13,"n_unverified":6,"n_samples":19,"n_pointer_only_licence":13}},{"rank_in_archive_order":28,"model":"TimeMachine","metrics":{"MAE":"0.421","MSE":"0.429"},"uses_additional_data":false,"paper_date":"2024-03-14","paper":"/paper/timemachine-a-time-series-is-worth-4-mambas","paper_url":"https://arxiv.org/abs/2403.09898v2","paper_title":"TimeMachine: A Time Series is Worth 4 Mambas for Long-term Forecasting","code":"https://github.com/atik-ahamed/timemachine","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"GPHT","metrics":{"MAE":"0.423","MSE":"0.430"},"uses_additional_data":false,"paper_date":"2024-02-26","paper":"/paper/generative-pretrained-hierarchical","paper_url":"https://arxiv.org/abs/2402.16516v2","paper_title":"Generative Pretrained Hierarchical Transformer for Time Series Forecasting","code":"https://github.com/icantnamemyself/gpht","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":30,"model":"MoLE-RLinear","metrics":{"MSE":"0.43"},"uses_additional_data":false,"paper_date":"2023-12-11","paper":"/paper/mixture-of-linear-experts-for-long-term-time","paper_url":"https://arxiv.org/abs/2312.06786v3","paper_title":"Mixture-of-Linear-Experts for Long-term Time Series Forecasting","code":"https://github.com/rogerni/mole","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":31,"model":"PatchTST + LIFT","metrics":{"MAE":"0.435","MSE":"0.433"},"uses_additional_data":false,"paper_date":"2024-01-31","paper":"/paper/rethinking-channel-dependence-for","paper_url":"https://arxiv.org/abs/2401.17548v6","paper_title":"Rethinking Channel Dependence for Multivariate Time Series Forecasting: Learning from Leading Indicators","code":"https://github.com/sjtu-dmtai/lift","n_code_links":2,"syntology":{"n_ran":8,"n_unverified":3,"n_samples":11,"n_pointer_only_licence":11}},{"rank_in_archive_order":32,"model":"GTT-Large(Fine-tune)","metrics":{"MAE":"0.418","MSE":"0.433"},"uses_additional_data":false,"paper_date":"2024-02-12","paper":"/paper/only-the-curve-shape-matters-training","paper_url":"https://arxiv.org/abs/2402.07570v2","paper_title":"Only the Curve Shape Matters: Training Foundation Models for Zero-Shot Multivariate Time Series Forecasting through Next Curve Shape Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":33,"model":"SparseTSF","metrics":{"MSE":"0.434"},"uses_additional_data":false,"paper_date":"2024-05-02","paper":"/paper/sparsetsf-modeling-long-term-time-series","paper_url":"https://arxiv.org/abs/2405.00946v2","paper_title":"SparseTSF: Modeling Long-term Time Series Forecasting with 1k Parameters","code":"https://github.com/lss-1138/SparseTSF","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"TiDE","metrics":{"MAE":"0.433","MSE":"0.435"},"uses_additional_data":false,"paper_date":"2023-04-17","paper":"/paper/long-term-forecasting-with-tide-time-series","paper_url":"https://arxiv.org/abs/2304.08424v5","paper_title":"Long-term Forecasting with TiDE: Time-series Dense Encoder","code":"https://github.com/google-research/google-research/tree/master/tide","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":35,"model":"GridTST","metrics":{"MAE":"0.440","MSE":"0.436"},"uses_additional_data":false,"paper_date":"2024-05-22","paper":"/paper/leveraging-2d-information-for-long-term-time","paper_url":"https://arxiv.org/abs/2405.13810v1","paper_title":"Leveraging 2D Information for Long-term Time Series Forecasting with Vanilla Transformers","code":"https://github.com/Hannibal046/GridTST","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"DLinear","metrics":{"MAE":"0.443","MSE":"0.439"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/are-transformers-effective-for-time-series","paper_url":"https://arxiv.org/abs/2205.13504v3","paper_title":"Are Transformers Effective for Time Series Forecasting?","code":"https://github.com/cure-lab/DLinear","n_code_links":10,"syntology":{"n_ran":13,"n_unverified":6,"n_samples":19,"n_pointer_only_licence":13}},{"rank_in_archive_order":37,"model":"FiLM","metrics":{"MAE":"0.445","MSE":"0.442"},"uses_additional_data":false,"paper_date":"2022-05-18","paper":"/paper/film-frequency-improved-legendre-memory-model","paper_url":"https://arxiv.org/abs/2205.08897v4","paper_title":"FiLM: Frequency improved Legendre Memory Model for Long-term Time Series Forecasting","code":"https://github.com/WenjieDu/PyPOTS","n_code_links":3,"syntology":{"n_ran":17,"n_unverified":1,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"OLS","metrics":{"MSE":"0.448"},"uses_additional_data":false,"paper_date":"2024-03-21","paper":"/paper/an-analysis-of-linear-time-series-forecasting","paper_url":"https://arxiv.org/abs/2403.14587v2","paper_title":"An Analysis of Linear Time Series Forecasting Models","code":"https://github.com/levi-ackman/lino","n_code_links":3,"syntology":null},{"rank_in_archive_order":39,"model":"DLinear + LIFT","metrics":{"MAE":"0.453","MSE":"0.453"},"uses_additional_data":false,"paper_date":"2024-01-31","paper":"/paper/rethinking-channel-dependence-for","paper_url":"https://arxiv.org/abs/2401.17548v6","paper_title":"Rethinking Channel Dependence for Multivariate Time Series Forecasting: Learning from Leading Indicators","code":"https://github.com/sjtu-dmtai/lift","n_code_links":2,"syntology":{"n_ran":8,"n_unverified":3,"n_samples":11,"n_pointer_only_licence":11}},{"rank_in_archive_order":40,"model":"Pathformer","metrics":{"MAE":"0.432","MSE":"0.454"},"uses_additional_data":false,"paper_date":"2024-02-04","paper":"/paper/pathformer-multi-scale-transformers-with","paper_url":"https://arxiv.org/abs/2402.05956v5","paper_title":"Pathformer: Multi-scale Transformers with Adaptive Pathways for Time Series Forecasting","code":"https://github.com/decisionintelligence/pathformer","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":11}},{"rank_in_archive_order":41,"model":"Bi-Mamba4TS","metrics":{"MAE":"0.445","MSE":"0.455"},"uses_additional_data":false,"paper_date":"2024-04-24","paper":"/paper/bi-mamba4ts-bidirectional-mamba-for-time","paper_url":"https://arxiv.org/abs/2404.15772v3","paper_title":"Bi-Mamba+: Bidirectional Mamba for Time Series Forecasting","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":42,"model":"MOIRAIBase","metrics":{"MAE":"0.450","MSE":"0.456"},"uses_additional_data":false,"paper_date":"2024-02-04","paper":"/paper/unified-training-of-universal-time-series","paper_url":"https://arxiv.org/abs/2402.02592v2","paper_title":"Unified Training of Universal Time Series Forecasting Transformers","code":"https://github.com/SalesforceAIResearch/uni2ts","n_code_links":1,"syntology":null},{"rank_in_archive_order":43,"model":"LLaTA","metrics":{"MAE":"0.436","MSE":"0.456"},"uses_additional_data":false,"paper_date":"2021-08-01","paper":"/paper/taming-pre-trained-language-models-with-n","paper_url":"https://aclanthology.org/2021.acl-long.259","paper_title":"Taming Pre-trained Language Models with N-gram Representations for Low-Resource Domain Adaptation","code":"https://github.com/shizhediao/t-dna","n_code_links":1,"syntology":null},{"rank_in_archive_order":44,"model":"CALF","metrics":{"MAE":"0.436","MSE":"0.456"},"uses_additional_data":false,"paper_date":"2024-03-12","paper":"/paper/taming-pre-trained-llms-for-generalised-time","paper_url":"https://arxiv.org/abs/2403.07300v2","paper_title":"CALF: Aligning LLMs for Time Series Forecasting via Cross-modal Fine-Tuning","code":"https://github.com/hank0626/llata","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":45,"model":"GPHT*","metrics":{"MAE":"0.432","MSE":"0.456"},"uses_additional_data":false,"paper_date":"2024-02-26","paper":"/paper/generative-pretrained-hierarchical","paper_url":"https://arxiv.org/abs/2402.16516v2","paper_title":"Generative Pretrained Hierarchical Transformer for Time Series Forecasting","code":"https://github.com/icantnamemyself/gpht","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":46,"model":"GTT-Smal","metrics":{"MAE":"0.427","MSE":"0.459"},"uses_additional_data":false,"paper_date":"2024-02-12","paper":"/paper/only-the-curve-shape-matters-training","paper_url":"https://arxiv.org/abs/2402.07570v2","paper_title":"Only the Curve Shape Matters: Training Foundation Models for Zero-Shot Multivariate Time Series Forecasting through Next Curve Shape Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":47,"model":"Minusformer-96","metrics":{"MAE":"0.446","MSE":"0.465"},"uses_additional_data":false,"paper_date":"2024-02-04","paper":"/paper/minusformer-improving-time-series-forecasting","paper_url":"https://arxiv.org/abs/2402.02332v3","paper_title":"Minusformer: Improving Time Series Forecasting by Progressively Learning Residuals","code":"https://github.com/anoise/minusformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":48,"model":"GTT-Tiny","metrics":{"MAE":"0.436","MSE":"0.466"},"uses_additional_data":false,"paper_date":"2024-02-12","paper":"/paper/only-the-curve-shape-matters-training","paper_url":"https://arxiv.org/abs/2402.07570v2","paper_title":"Only the Curve Shape Matters: Training Foundation Models for Zero-Shot Multivariate Time Series Forecasting through Next Curve Shape Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":49,"model":"GTT-Large(100M traing samples)","metrics":{"MAE":"0.432","MSE":"0.468"},"uses_additional_data":false,"paper_date":"2024-02-12","paper":"/paper/only-the-curve-shape-matters-training","paper_url":"https://arxiv.org/abs/2402.07570v2","paper_title":"Only the Curve Shape Matters: Training Foundation Models for Zero-Shot Multivariate Time Series Forecasting through Next Curve Shape Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":50,"model":"MoLE-DLinear","metrics":{"MSE":"0.469"},"uses_additional_data":false,"paper_date":"2023-12-11","paper":"/paper/mixture-of-linear-experts-for-long-term-time","paper_url":"https://arxiv.org/abs/2312.06786v3","paper_title":"Mixture-of-Linear-Experts for Long-term Time Series Forecasting","code":"https://github.com/rogerni/mole","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":51,"model":"ForecastGrapher","metrics":{"MAE":"0.448","MSE":"0.472"},"uses_additional_data":false,"paper_date":"2024-05-28","paper":"/paper/forecastgrapher-redefining-multivariate-time","paper_url":"https://arxiv.org/abs/2405.18036v1","paper_title":"ForecastGrapher: Redefining Multivariate Time Series Forecasting with Graph Neural Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":52,"model":"Basisformer","metrics":{"MAE":"0.451","MSE":"0.473"},"uses_additional_data":false,"paper_date":"2023-10-31","paper":"/paper/basisformer-attention-based-time-series-1","paper_url":"https://arxiv.org/abs/2310.20496v2","paper_title":"BasisFormer: Attention-based Time Series Forecasting with Learnable and Interpretable Basis","code":"https://github.com/nzl5116190/basisformer","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":6,"n_samples":12,"n_pointer_only_licence":12}},{"rank_in_archive_order":53,"model":"VCformer","metrics":{"MAE":"0.449","MSE":"0.473"},"uses_additional_data":false,"paper_date":"2024-05-19","paper":"/paper/vcformer-variable-correlation-transformer","paper_url":"https://arxiv.org/abs/2405.11470v1","paper_title":"VCformer: Variable Correlation Transformer with Inherent Lagged Correlation for Multivariate Time Series Forecasting","code":"https://github.com/csyyn/vcformer","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":54,"model":"Simba","metrics":{"MAE":"0.443","MSE":"0.473"},"uses_additional_data":false,"paper_date":"2024-04-24","paper":"/paper/mamba-360-survey-of-state-space-models-as","paper_url":"https://arxiv.org/abs/2404.16112v1","paper_title":"Mamba-360: Survey of State Space Models as Transformer Alternative for Long Sequence Modelling: Methods, Applications, and Challenges","code":"https://github.com/badripatro/mamba360","n_code_links":1,"syntology":null},{"rank_in_archive_order":55,"model":"GTT-Large(50M traing samples)","metrics":{"MAE":"0.444","MSE":"0.475"},"uses_additional_data":false,"paper_date":"2024-02-12","paper":"/paper/only-the-curve-shape-matters-training","paper_url":"https://arxiv.org/abs/2402.07570v2","paper_title":"Only the Curve Shape Matters: Training Foundation Models for Zero-Shot Multivariate Time Series Forecasting through Next Curve Shape Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":56,"model":"TEFN","metrics":{"MAE":"0.441","MSE":"0.475"},"uses_additional_data":false,"paper_date":"2024-05-10","paper":"/paper/time-evidence-fusion-network-multi-source","paper_url":"https://arxiv.org/abs/2405.06419v3","paper_title":"Time Evidence Fusion Network: Multi-source View in Long-Term Time Series Forecasting","code":"https://github.com/WenjieDu/PyPOTS","n_code_links":2,"syntology":null},{"rank_in_archive_order":57,"model":"CPNet","metrics":{"MAE":"0.450","MSE":"0.479"},"uses_additional_data":false,"paper_date":"2024-05-06","paper":"/paper/boosting-mlps-with-a-coarsening-strategy-for","paper_url":"https://arxiv.org/abs/2405.03199v2","paper_title":"Boosting MLPs with a Coarsening Strategy for Long-Term Time Series Forecasting","code":"https://github.com/nannanbian/cpnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":58,"model":"SOFTS","metrics":{"MAE":"0.452","MSE":"0.480"},"uses_additional_data":false,"paper_date":"2024-04-22","paper":"/paper/softs-efficient-multivariate-time-series","paper_url":"https://arxiv.org/abs/2404.14197v3","paper_title":"SOFTS: Efficient Multivariate Time Series Forecasting with Series-Core Fusion","code":"https://github.com/secilia-cxy/softs","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":59,"model":"iTransformer","metrics":{"MAE":"0.458","MSE":"0.487"},"uses_additional_data":false,"paper_date":"2023-10-10","paper":"/paper/itransformer-inverted-transformers-are","paper_url":"https://arxiv.org/abs/2310.06625v4","paper_title":"iTransformer: Inverted Transformers Are Effective for Time Series Forecasting","code":"https://github.com/thuml/Time-Series-Library","n_code_links":11,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"S-Mamba","metrics":{"MAE":"0.468","MSE":"0.489"},"uses_additional_data":false,"paper_date":"2024-03-17","paper":"/paper/is-mamba-effective-for-time-series","paper_url":"https://arxiv.org/abs/2403.11144v3","paper_title":"Is Mamba Effective for Time Series Forecasting?","code":"https://github.com/wzhwzhwzh0921/s-d-mamba","n_code_links":1,"syntology":null},{"rank_in_archive_order":61,"model":"SCINet","metrics":{"MAE":"0.495","MSE":"0.504"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/time-series-is-a-special-sequence-forecasting","paper_url":"https://arxiv.org/abs/2106.09305v3","paper_title":"SCINet: Time Series Modeling and Forecasting with Sample Convolution and Interaction","code":"https://github.com/WenjieDu/PyPOTS","n_code_links":6,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":62,"model":"Autoformer","metrics":{"MAE":"0.484","MSE":"0.505"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/autoformer-decomposition-transformers-with","paper_url":"https://arxiv.org/abs/2106.13008v5","paper_title":"Autoformer: Decomposition Transformers with Auto-Correlation for Long-Term Series Forecasting","code":"https://github.com/thuml/autoformer","n_code_links":3,"syntology":{"n_ran":13,"n_unverified":3,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":63,"model":"ATFNet","metrics":{"MAE":"0.521","MSE":"0.514"},"uses_additional_data":false,"paper_date":"2024-04-08","paper":"/paper/atfnet-adaptive-time-frequency-ensembled","paper_url":"https://arxiv.org/abs/2404.05192v1","paper_title":"ATFNet: Adaptive Time-Frequency Ensembled Network for Long-term Time Series Forecasting","code":"https://github.com/yhyhyhyhyhy/atfnet","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":0,"n_samples":7,"n_pointer_only_licence":7}},{"rank_in_archive_order":64,"model":"MOIRAILarge","metrics":{"MAE":"0.474","MSE":"0.514"},"uses_additional_data":false,"paper_date":"2024-02-04","paper":"/paper/unified-training-of-universal-time-series","paper_url":"https://arxiv.org/abs/2402.02592v2","paper_title":"Unified Training of Universal Time Series Forecasting Transformers","code":"https://github.com/SalesforceAIResearch/uni2ts","n_code_links":1,"syntology":null},{"rank_in_archive_order":65,"model":"RPMixer","metrics":{"MAE":"0.498","MSE":"0.521"},"uses_additional_data":false,"paper_date":"2024-02-16","paper":"/paper/random-projection-layers-for-multidimensional","paper_url":"https://arxiv.org/abs/2402.10487v4","paper_title":"RPMixer: Shaking Up Time Series Forecasting with Random Projections for Large Spatial-Temporal Data","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":66,"model":"Aaren","metrics":{"MAE":"0.55","MSE":"0.65"},"uses_additional_data":false,"paper_date":"2024-05-22","paper":"/paper/attention-as-an-rnn","paper_url":"https://arxiv.org/abs/2405.13956v2","paper_title":"Attention as an RNN","code":"https://github.com/claCase/Attention-as-RNN","n_code_links":1,"syntology":null},{"rank_in_archive_order":67,"model":"Transformer","metrics":{"MAE":"0.7041","MSE":"0.8321"},"uses_additional_data":false,"paper_date":"2021-07-19","paper":"/paper/long-term-series-forecasting-with-query","paper_url":"https://arxiv.org/abs/2107.08687v2","paper_title":"Long-term series forecasting with Query Selector -- efficient model of sparse attention","code":"https://github.com/moraieu/query-selector","n_code_links":2,"syntology":null},{"rank_in_archive_order":68,"model":"QuerySelector","metrics":{"MAE":"0.7039","MSE":"0.8503"},"uses_additional_data":false,"paper_date":"2021-07-19","paper":"/paper/long-term-series-forecasting-with-query","paper_url":"https://arxiv.org/abs/2107.08687v2","paper_title":"Long-term series forecasting with Query Selector -- efficient model of sparse attention","code":"https://github.com/moraieu/query-selector","n_code_links":2,"syntology":null},{"rank_in_archive_order":69,"model":"Informer","metrics":{"MAE":"0.753","MSE":"0.884"},"uses_additional_data":false,"paper_date":"2020-12-14","paper":"/paper/informer-beyond-efficient-transformer-for","paper_url":"https://arxiv.org/abs/2012.07436v3","paper_title":"Informer: Beyond Efficient Transformer for Long Sequence Time-Series Forecasting","code":"https://github.com/zhouhaoyi/Informer2020","n_code_links":14,"syntology":{"n_ran":62,"n_unverified":14,"n_samples":76,"n_pointer_only_licence":13}},{"rank_in_archive_order":70,"model":"TimesFM","metrics":{"MAE":"0.436"},"uses_additional_data":false,"paper_date":"2023-10-14","paper":"/paper/a-decoder-only-foundation-model-for-time","paper_url":"https://arxiv.org/abs/2310.10688v4","paper_title":"A decoder-only foundation model for time-series forecasting","code":"https://github.com/google-research/timesfm","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":71,"model":"TSMixer","metrics":{"MAE":"0.431"},"uses_additional_data":false,"paper_date":"2023-03-10","paper":"/paper/tsmixer-an-all-mlp-architecture-for-time","paper_url":"https://arxiv.org/abs/2303.06053v5","paper_title":"TSMixer: An All-MLP Architecture for Time Series Forecasting","code":"https://github.com/google-research/google-research","n_code_links":5,"syntology":null},{"rank_in_archive_order":72,"model":"DeformTime","metrics":{"MAE":"0.2158"},"uses_additional_data":false,"paper_date":"2024-06-11","paper":"/paper/deformtime-capturing-variable-dependencies","paper_url":"https://arxiv.org/abs/2406.07438v2","paper_title":"DeformTime: Capturing Variable Dependencies with Deformable Attention for Time Series Forecasting","code":"https://github.com/ClaudiaShu/DeformTime","n_code_links":1,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,885 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6885,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":33,"rows_with_any_sample_ran":27,"distinct_papers_with_graph_line":29,"distinct_papers_with_any_sample_ran":24,"samples_over_distinct_papers":{"n_ran":213,"n_unverified":110,"n_samples":323,"n_pointer_only_licence":82,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":239,"n_unverified":122,"n_samples":361,"n_pointer_only_licence":107,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}