{"url":"/task/stochastic-optimization","name":"Stochastic Optimization","slug":"stochastic-optimization","description_markdown":"**Stochastic Optimization** is the task of optimizing certain objective functional by generating and using stochastic random variables. Usually the Stochastic Optimization is an iterative process of generating random variables that progressively finds out the minima or the maxima of the objective functional. Stochastic Optimization is usually applied in the non-convex functional spaces where the usual deterministic optimization such as linear or quadratic programming or their variants cannot be used.\n\n\n<span class=\"description-source\">Source: [ASOC: An Adaptive Parameter-free Stochastic Optimization Techinique for Continuous Variables ](https://arxiv.org/abs/1506.08004)</span>","categories":[{"name":"Methodology","url":"/area/methodology"},{"name":"Miscellaneous","url":"/area/miscellaneous"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":1387,"papers_with_code":337,"benchmarks":12,"benchmark_tables_in_archive":12,"benchmark_tables_shown":12,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":11,"subtasks":2,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/stochastic-optimization-on-cifar-10-wrn-28-10","slug":"stochastic-optimization-on-cifar-10-wrn-28-10","dataset":"CIFAR-10 WRN-28-10 - 200 Epochs","dataset_url":"/dataset/cifar-10","rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Adam (eps-adjusted)","paper_title":"Domain-independent Dominance of Adaptive Methods","paper_url":"/paper/domain-independent-dominance-of-adaptive-1","paper_date":"2019-12-04","arxiv_id":"1912.01823","code_links":[{"title":"lolemacs/avagrad","url":"https://github.com/lolemacs/avagrad"}],"syntology":null}},{"leaderboard":"/sota/stochastic-optimization-on-cifar-100-wrn-28","slug":"stochastic-optimization-on-cifar-100-wrn-28","dataset":"CIFAR-100 WRN-28-10 - 200 Epochs","dataset_url":null,"rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"AvaGrad","paper_title":"Domain-independent Dominance of Adaptive Methods","paper_url":"/paper/domain-independent-dominance-of-adaptive-1","paper_date":"2019-12-04","arxiv_id":"1912.01823","code_links":[{"title":"lolemacs/avagrad","url":"https://github.com/lolemacs/avagrad"}],"syntology":null}},{"leaderboard":"/sota/stochastic-optimization-on-cifar-10-resnet-18","slug":"stochastic-optimization-on-cifar-10-resnet-18","dataset":"CIFAR-10 ResNet-18 - 200 Epochs","dataset_url":"/dataset/cifar-10","rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"SGD - cosine LR schedule","paper_title":"Benchopt: Reproducible, efficient and collaborative optimization benchmarks","paper_url":"/paper/benchopt-reproducible-efficient-and","paper_date":"2022-06-27","arxiv_id":"2206.13424","code_links":[{"title":"deepmind/optax","url":"https://github.com/deepmind/optax"},{"title":"google-deepmind/optax","url":"https://github.com/google-deepmind/optax"},{"title":"benchopt/benchopt","url":"https://github.com/benchopt/benchopt"}],"syntology":{"n":10,"n_ran":0,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/stochastic-optimization-on-imagenet-resnet-50-2","slug":"stochastic-optimization-on-imagenet-resnet-50-2","dataset":"ImageNet ResNet-50 - 90 Epochs","dataset_url":null,"rows_in_archive":4,"metrics":["Top 1 Accuracy"],"first_row_in_archive_order":{"model":"AvaGrad","paper_title":"Domain-independent Dominance of Adaptive Methods","paper_url":"/paper/domain-independent-dominance-of-adaptive-1","paper_date":"2019-12-04","arxiv_id":"1912.01823","code_links":[{"title":"lolemacs/avagrad","url":"https://github.com/lolemacs/avagrad"}],"syntology":null}},{"leaderboard":"/sota/stochastic-optimization-on-penn-treebank","slug":"stochastic-optimization-on-penn-treebank","dataset":"Penn Treebank (Character Level) 3x1000 LSTM - 500 Epochs","dataset_url":"/dataset/penn-treebank","rows_in_archive":4,"metrics":["Bit per Character (BPC)"],"first_row_in_archive_order":{"model":"AvaGrad","paper_title":"Domain-independent Dominance of Adaptive Methods","paper_url":"/paper/domain-independent-dominance-of-adaptive-1","paper_date":"2019-12-04","arxiv_id":"1912.01823","code_links":[{"title":"lolemacs/avagrad","url":"https://github.com/lolemacs/avagrad"}],"syntology":null}},{"leaderboard":"/sota/stochastic-optimization-on-cifar-10","slug":"stochastic-optimization-on-cifar-10","dataset":"CIFAR-10","dataset_url":"/dataset/cifar-10","rows_in_archive":2,"metrics":["Accuracy (max)","Accuracy (mean)"],"first_row_in_archive_order":{"model":"Resnet18","paper_title":"Mixing ADAM and SGD: a Combined Optimization Method","paper_url":"/paper/mixing-adam-and-sgd-a-combined-optimization","paper_date":"2020-11-16","arxiv_id":"2011.08042","code_links":[{"title":"nicolalandro/multi_optimizer","url":"https://gitlab.com/nicolalandro/multi_optimizer"}],"syntology":null}},{"leaderboard":"/sota/stochastic-optimization-on-cifar-100","slug":"stochastic-optimization-on-cifar-100","dataset":"CIFAR-100","dataset_url":"/dataset/cifar-100","rows_in_archive":2,"metrics":["Accuracy (max)","Accuracy (mean)"],"first_row_in_archive_order":{"model":"Resnet18","paper_title":"Mixing ADAM and SGD: a Combined Optimization Method","paper_url":"/paper/mixing-adam-and-sgd-a-combined-optimization","paper_date":"2020-11-16","arxiv_id":"2011.08042","code_links":[{"title":"nicolalandro/multi_optimizer","url":"https://gitlab.com/nicolalandro/multi_optimizer"}],"syntology":null}},{"leaderboard":"/sota/stochastic-optimization-on-imagenet-resnet-50","slug":"stochastic-optimization-on-imagenet-resnet-50","dataset":"ImageNet ResNet-50 - 50 Epochs","dataset_url":null,"rows_in_archive":2,"metrics":["Top 1 Accuracy","Top 5 Accuracy"],"first_row_in_archive_order":{"model":"Lookahead","paper_title":"Lookahead Optimizer: k steps forward, 1 step back","paper_url":"/paper/lookahead-optimizer-k-steps-forward-1-step","paper_date":"2019-07-19","arxiv_id":"1907.08610","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"alphadl/lookahead.pytorch","url":"https://github.com/alphadl/lookahead.pytorch"},{"title":"HamadYA/GhostFaceNets","url":"https://github.com/HamadYA/GhostFaceNets"},{"title":"michaelrzhang/lookahead","url":"https://github.com/michaelrzhang/lookahead"},{"title":"bojone/keras_lookahead","url":"https://github.com/bojone/keras_lookahead"},{"title":"201419/Optimizer-PyTorch","url":"https://github.com/201419/Optimizer-PyTorch"},{"title":"chizhu/BDC2019","url":"https://github.com/chizhu/BDC2019"},{"title":"wkcn/LookaheadOptimizer-mx","url":"https://github.com/wkcn/LookaheadOptimizer-mx"},{"title":"kpe/params-flow","url":"https://github.com/kpe/params-flow"},{"title":"nachiket273/lookahead_pytorch","url":"https://github.com/nachiket273/lookahead_pytorch"},{"title":"SdahlSean/RangerOptimizerTensorflow","url":"https://github.com/SdahlSean/RangerOptimizerTensorflow"},{"title":"allen108108/Model-Optimizer_Implementation","url":"https://github.com/allen108108/Model-Optimizer_Implementation"},{"title":"nsarang/lookahead_keras","url":"https://github.com/nsarang/lookahead_keras"},{"title":"DreamInvoker/LookaheadOptimizer-mx-implementation","url":"https://github.com/DreamInvoker/LookaheadOptimizer-mx-implementation"},{"title":"dseuss/pytorch-lookahead-optimizer","url":"https://github.com/dseuss/pytorch-lookahead-optimizer"},{"title":"mnikitin/LookaheadOptimizer-mx","url":"https://github.com/mnikitin/LookaheadOptimizer-mx"},{"title":"Abhimanyu08/Lookahead_Optimizer","url":"https://github.com/Abhimanyu08/Lookahead_Optimizer"},{"title":"zhangtj1996/lookahead-sgd-adam-rmsprop-","url":"https://github.com/zhangtj1996/lookahead-sgd-adam-rmsprop-"},{"title":"COMP6248-Reproducability-Challenge/LookaheadOptimizer","url":"https://github.com/COMP6248-Reproducability-Challenge/LookaheadOptimizer"}],"syntology":null}},{"leaderboard":"/sota/stochastic-optimization-on-imagenet-resnet-50-1","slug":"stochastic-optimization-on-imagenet-resnet-50-1","dataset":"ImageNet ResNet-50 - 60 Epochs","dataset_url":null,"rows_in_archive":2,"metrics":["Top 1 Accuracy","Top 5 Accuracy"],"first_row_in_archive_order":{"model":"Lookahead","paper_title":"Lookahead Optimizer: k steps forward, 1 step back","paper_url":"/paper/lookahead-optimizer-k-steps-forward-1-step","paper_date":"2019-07-19","arxiv_id":"1907.08610","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"alphadl/lookahead.pytorch","url":"https://github.com/alphadl/lookahead.pytorch"},{"title":"HamadYA/GhostFaceNets","url":"https://github.com/HamadYA/GhostFaceNets"},{"title":"michaelrzhang/lookahead","url":"https://github.com/michaelrzhang/lookahead"},{"title":"bojone/keras_lookahead","url":"https://github.com/bojone/keras_lookahead"},{"title":"201419/Optimizer-PyTorch","url":"https://github.com/201419/Optimizer-PyTorch"},{"title":"chizhu/BDC2019","url":"https://github.com/chizhu/BDC2019"},{"title":"wkcn/LookaheadOptimizer-mx","url":"https://github.com/wkcn/LookaheadOptimizer-mx"},{"title":"kpe/params-flow","url":"https://github.com/kpe/params-flow"},{"title":"nachiket273/lookahead_pytorch","url":"https://github.com/nachiket273/lookahead_pytorch"},{"title":"SdahlSean/RangerOptimizerTensorflow","url":"https://github.com/SdahlSean/RangerOptimizerTensorflow"},{"title":"allen108108/Model-Optimizer_Implementation","url":"https://github.com/allen108108/Model-Optimizer_Implementation"},{"title":"nsarang/lookahead_keras","url":"https://github.com/nsarang/lookahead_keras"},{"title":"DreamInvoker/LookaheadOptimizer-mx-implementation","url":"https://github.com/DreamInvoker/LookaheadOptimizer-mx-implementation"},{"title":"dseuss/pytorch-lookahead-optimizer","url":"https://github.com/dseuss/pytorch-lookahead-optimizer"},{"title":"mnikitin/LookaheadOptimizer-mx","url":"https://github.com/mnikitin/LookaheadOptimizer-mx"},{"title":"Abhimanyu08/Lookahead_Optimizer","url":"https://github.com/Abhimanyu08/Lookahead_Optimizer"},{"title":"zhangtj1996/lookahead-sgd-adam-rmsprop-","url":"https://github.com/zhangtj1996/lookahead-sgd-adam-rmsprop-"},{"title":"COMP6248-Reproducability-Challenge/LookaheadOptimizer","url":"https://github.com/COMP6248-Reproducability-Challenge/LookaheadOptimizer"}],"syntology":null}},{"leaderboard":"/sota/stochastic-optimization-on-ag-news","slug":"stochastic-optimization-on-ag-news","dataset":"AG News","dataset_url":"/dataset/ag-news","rows_in_archive":1,"metrics":["Accuracy (max)","Accuracy (mean)"],"first_row_in_archive_order":{"model":"Bert","paper_title":"Mixing ADAM and SGD: a Combined Optimization Method","paper_url":"/paper/mixing-adam-and-sgd-a-combined-optimization","paper_date":"2020-11-16","arxiv_id":"2011.08042","code_links":[{"title":"nicolalandro/multi_optimizer","url":"https://gitlab.com/nicolalandro/multi_optimizer"}],"syntology":null}},{"leaderboard":"/sota/stochastic-optimization-on-cola","slug":"stochastic-optimization-on-cola","dataset":"CoLA","dataset_url":"/dataset/cola","rows_in_archive":1,"metrics":["Accuracy (max)","Accuracy (mean)"],"first_row_in_archive_order":{"model":"Bert","paper_title":"Mixing ADAM and SGD: a Combined Optimization Method","paper_url":"/paper/mixing-adam-and-sgd-a-combined-optimization","paper_date":"2020-11-16","arxiv_id":"2011.08042","code_links":[{"title":"nicolalandro/multi_optimizer","url":"https://gitlab.com/nicolalandro/multi_optimizer"}],"syntology":null}},{"leaderboard":"/sota/stochastic-optimization-on-mnist","slug":"stochastic-optimization-on-mnist","dataset":"MNIST","dataset_url":"/dataset/mnist","rows_in_archive":1,"metrics":["NLL"],"first_row_in_archive_order":{"model":"MLP","paper_title":"Training Deep Networks without Learning Rates Through Coin Betting","paper_url":"/paper/training-deep-networks-without-learning-rates","paper_date":"2017-05-22","arxiv_id":"1705.07795","code_links":[{"title":"tensorflow/addons","url":"https://github.com/tensorflow/addons/blob/master/tensorflow_addons/optimizers/cocob.py"},{"title":"bremen79/parameterfree","url":"https://github.com/bremen79/parameterfree"},{"title":"bremen79/cocob","url":"https://github.com/bremen79/cocob"},{"title":"anandsaha/nips.cocob.pytorch","url":"https://github.com/anandsaha/nips.cocob.pytorch"},{"title":"nocotan/cocob_backprop","url":"https://github.com/nocotan/cocob_backprop"},{"title":"brendanxwhitaker/spred","url":"https://github.com/brendanxwhitaker/spred"}],"syntology":null}}],"datasets":[{"url":"/dataset/cifar-10","name":"CIFAR-10","full_name":"CIFAR-10","num_papers_in_archive":16145},{"url":"/dataset/cifar-100","name":"CIFAR-100","full_name":"","num_papers_in_archive":9045},{"url":"/dataset/mnist","name":"MNIST","full_name":"","num_papers_in_archive":7651},{"url":"/dataset/glue","name":"GLUE","full_name":"General Language Understanding Evaluation benchmark","num_papers_in_archive":3197},{"url":"/dataset/penn-treebank","name":"Penn Treebank","full_name":"","num_papers_in_archive":1006},{"url":"/dataset/ag-news","name":"AG News","full_name":"AG’s News Corpus","num_papers_in_archive":969},{"url":"/dataset/cola","name":"CoLA","full_name":"Corpus of Linguistic Acceptability","num_papers_in_archive":710},{"url":"/dataset/amazon-product-data","name":"Amazon Product Data","full_name":"rithik","num_papers_in_archive":41},{"url":"/dataset/mnist-8m","name":"MNIST-8M","full_name":"Infinite MNIST","num_papers_in_archive":26},{"url":"/dataset/msra-hand","name":"MSRA Hand","full_name":"MSRA Hand","num_papers_in_archive":15},{"url":"/dataset/opereid","name":"OpeReid","full_name":"OpeReid","num_papers_in_archive":3}],"subtasks":[{"url":"/task/distributed-optimization","name":"Distributed Optimization"},{"url":"/task/evolutionary-algorithms","name":"Evolutionary Algorithms"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":337,"tagged_in_all":1387,"items":[{"url":"/paper/adam-a-method-for-stochastic-optimization","title":"Adam: A Method for Stochastic Optimization","date":"2014-12-22","arxiv_id":"1412.6980","repositories_listed":87,"syntology":{"n":37,"n_ran":18,"n_unverified":19,"n_pointer_only":8}},{"url":"/paper/accurate-large-minibatch-sgd-training","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","date":"2017-06-08","arxiv_id":"1706.02677","repositories_listed":73,"syntology":{"n":7,"n_ran":3,"n_unverified":4,"n_pointer_only":7}},{"url":"/paper/reducing-bert-pre-training-time-from-3-days","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","date":"2019-04-01","arxiv_id":"1904.00962","repositories_listed":32,"syntology":{"n":11,"n_ran":1,"n_unverified":10,"n_pointer_only":9}},{"url":"/paper/sgdr-stochastic-gradient-descent-with-warm","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","date":"2016-08-13","arxiv_id":"1608.03983","repositories_listed":24,"syntology":{"n":17,"n_ran":10,"n_unverified":7,"n_pointer_only":7}},{"url":"/paper/on-the-variance-of-the-adaptive-learning-rate","title":"On the Variance of the Adaptive Learning Rate and Beyond","date":"2019-08-08","arxiv_id":"1908.03265","repositories_listed":21,"syntology":{"n":13,"n_ran":4,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/lookahead-optimizer-k-steps-forward-1-step","title":"Lookahead Optimizer: k steps forward, 1 step back","date":"2019-07-19","arxiv_id":"1907.08610","repositories_listed":19,"syntology":null},{"url":"/paper/optimizing-neural-networks-with-kronecker","title":"Optimizing Neural Networks with Kronecker-factored Approximate Curvature","date":"2015-03-19","arxiv_id":"1503.05671","repositories_listed":19,"syntology":{"n":82,"n_ran":41,"n_unverified":41,"n_pointer_only":7}},{"url":"/paper/averaging-weights-leads-to-wider-optima-and","title":"Averaging Weights Leads to Wider Optima and Better Generalization","date":"2018-03-14","arxiv_id":"1803.05407","repositories_listed":17,"syntology":{"n":9,"n_ran":5,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/deep-learning-with-elastic-averaging-sgd","title":"Deep learning with Elastic Averaging SGD","date":"2014-12-20","arxiv_id":"1412.6651","repositories_listed":10,"syntology":{"n":12,"n_ran":0,"n_unverified":12,"n_pointer_only":0}},{"url":"/paper/distributionally-robust-neural-networks-for","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","date":"2019-11-20","arxiv_id":"1911.08731","repositories_listed":8,"syntology":{"n":10,"n_ran":9,"n_unverified":1,"n_pointer_only":2}},{"url":"/paper/sophia-a-scalable-stochastic-second-order","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","date":"2023-05-23","arxiv_id":"2305.14342","repositories_listed":7,"syntology":{"n":19,"n_ran":6,"n_unverified":13,"n_pointer_only":0}},{"url":"/paper/agnostic-federated-learning","title":"Agnostic Federated Learning","date":"2019-02-01","arxiv_id":"1902.00146","repositories_listed":7,"syntology":{"n":10,"n_ran":3,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/training-deep-networks-without-learning-rates","title":"Training Deep Networks without Learning Rates Through Coin Betting","date":"2017-05-22","arxiv_id":"1705.07795","repositories_listed":6,"syntology":null},{"url":"/paper/variational-inference-a-review-for","title":"Variational Inference: A Review for Statisticians","date":"2016-01-04","arxiv_id":"1601.00670","repositories_listed":6,"syntology":null},{"url":"/paper/adaptivity-without-compromise-a-momentumized","title":"Adaptivity without Compromise: A Momentumized, Adaptive, Dual Averaged Gradient Method for Stochastic Optimization","date":"2021-01-26","arxiv_id":"2101.11075","repositories_listed":5,"syntology":null},{"url":"/paper/learning-concise-representations-for","title":"Learning concise representations for regression by evolving networks of trees","date":"2018-07-03","arxiv_id":"1807.00981","repositories_listed":5,"syntology":null},{"url":"/paper/adafactor-adaptive-learning-rates-with","title":"Adafactor: Adaptive Learning Rates with Sublinear Memory Cost","date":"2018-04-11","arxiv_id":"1804.04235","repositories_listed":5,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/eve-a-gradient-based-optimization-method-with","title":"Eve: A Gradient Based Optimization Method with Locally and Globally Adaptive Learning Rates","date":"2016-11-04","arxiv_id":"1611.01505","repositories_listed":5,"syntology":null},{"url":"/paper/robust-deep-auc-maximization-a-new-surrogate","title":"Large-scale Robust Deep AUC Maximization: A New Surrogate Loss and Empirical Studies on Medical Image Classification","date":"2020-12-06","arxiv_id":"2012.03173","repositories_listed":4,"syntology":null},{"url":"/paper/personalized-federated-learning-with-moreau","title":"Personalized Federated Learning with Moreau Envelopes","date":"2020-06-16","arxiv_id":"2006.08848","repositories_listed":4,"syntology":null},{"url":"/paper/adahessian-an-adaptive-second-order-optimizer","title":"ADAHESSIAN: An Adaptive Second Order Optimizer for Machine Learning","date":"2020-06-01","arxiv_id":"2006.00719","repositories_listed":4,"syntology":{"n":11,"n_ran":1,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/federated-learning-over-wireless-networks","title":"Federated Learning over Wireless Networks: Convergence Analysis and Resource Allocation","date":"2019-10-29","arxiv_id":"1910.13067","repositories_listed":4,"syntology":null},{"url":"/paper/kronecker-determinantal-point-processes","title":"Kronecker Determinantal Point Processes","date":"2016-05-26","arxiv_id":"1605.08374","repositories_listed":4,"syntology":null},{"url":"/paper/revisiting-distributed-synchronous-sgd","title":"Revisiting Distributed Synchronous SGD","date":"2016-04-04","arxiv_id":"1604.00981","repositories_listed":4,"syntology":null},{"url":"/paper/second-order-stochastic-optimization-for","title":"Second-Order Stochastic Optimization for Machine Learning in Linear Time","date":"2016-02-12","arxiv_id":"1602.03943","repositories_listed":4,"syntology":null},{"url":"/paper/a-kronecker-factored-approximate-fisher","title":"A Kronecker-factored approximate Fisher matrix for convolution layers","date":"2016-02-03","arxiv_id":"1602.01407","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/a-distributed-data-parallel-pytorch","title":"A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale","date":"2023-09-12","arxiv_id":"2309.06497","repositories_listed":3,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":2}},{"url":"/paper/benchopt-reproducible-efficient-and","title":"Benchopt: Reproducible, efficient and collaborative optimization benchmarks","date":"2022-06-27","arxiv_id":"2206.13424","repositories_listed":3,"syntology":{"n":10,"n_ran":0,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/differentiable-quality-diversity","title":"Differentiable Quality Diversity","date":"2021-06-07","arxiv_id":"2106.03894","repositories_listed":3,"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":5}},{"url":"/paper/apollo-an-adaptive-parameter-wise-diagonal","title":"Apollo: An Adaptive Parameter-wise Diagonal Quasi-Newton Method for Nonconvex Stochastic Optimization","date":"2020-09-28","arxiv_id":"2009.13586","repositories_listed":3,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}],"syntology_records":18,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}