{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/sgd/papers/20","list_of":"/method/sgd","method":"SGD","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":20,"pages_in_order":21,"rows_per_page":100,"rows":[1901,2000],"of":2021,"counts":{"archive_papers_tagged":2021,"with_a_code_link":591,"where_syntology_ran_a_sample":192,"not_listed_spam_title":0,"listed":2021,"listed_where_code_ran":192,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":161,"every_run_a_failure_of_syntologys_instrument":31,"listed_with_a_run_with_no_instrument_failure":161,"listed_every_run_a_failure_of_syntologys_instrument":31,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/sgd","prev":"/method/sgd/papers/19","next":"/method/sgd/papers/21","papers":[{"paper":"/paper/yellowfin-and-the-art-of-momentum-tuning","slug":"yellowfin-and-the-art-of-momentum-tuning","title":"YellowFin and the Art of Momentum Tuning","date":"2017-06-12","arxiv_id":"1706.03471","n_code_links":2,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"0 ran · 1 unverified","official":null}},{"paper":"/paper/accurate-large-minibatch-sgd-training","slug":"accurate-large-minibatch-sgd-training","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","date":"2017-06-08","arxiv_id":"1706.02677","n_code_links":73,"syntology":{"ran":3,"of":7,"n_ran_checked":0,"n_instrument":3,"unverified":4,"pointer_only":7,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 4 unverified","official":null}},{"paper":null,"slug":"caterpillar-coarse-grain-reconfigurable","title":"CATERPILLAR: Coarse Grain Reconfigurable Architecture for Accelerating the Training of Deep Neural Networks","date":"2017-06-01","arxiv_id":"1706.00517","n_code_links":0,"syntology":null},{"paper":null,"slug":"reinforcement-learning-for-learning-rate","title":"Reinforcement Learning for Learning Rate Control","date":"2017-05-31","arxiv_id":"1705.11159","n_code_links":0,"syntology":null},{"paper":null,"slug":"online-to-offline-conversions-universality","title":"Online to Offline Conversions, Universality and Adaptive Minibatch Sizes","date":"2017-05-30","arxiv_id":"1705.10499","n_code_links":0,"syntology":null},{"paper":null,"slug":"convergence-analysis-of-two-layer-neural","title":"Convergence Analysis of Two-layer Neural Networks with ReLU Activation","date":"2017-05-28","arxiv_id":"1705.09886","n_code_links":0,"syntology":null},{"paper":"/paper/the-marginal-value-of-adaptive-gradient","slug":"the-marginal-value-of-adaptive-gradient","title":"The Marginal Value of Adaptive Gradient Methods in Machine Learning","date":"2017-05-23","arxiv_id":"1705.08292","n_code_links":3,"syntology":null},{"paper":"/paper/dissecting-adam-the-sign-magnitude-and","slug":"dissecting-adam-the-sign-magnitude-and","title":"Dissecting Adam: The Sign, Magnitude and Variance of Stochastic Gradients","date":"2017-05-22","arxiv_id":"1705.07774","n_code_links":2,"syntology":null},{"paper":null,"slug":"on-the-diffusion-approximation-of-nonconvex","title":"On the diffusion approximation of nonconvex stochastic gradient descent","date":"2017-05-22","arxiv_id":"1705.07562","n_code_links":0,"syntology":null},{"paper":null,"slug":"parallel-stochastic-gradient-descent-with","title":"Parallel Stochastic Gradient Descent with Sound Combiners","date":"2017-05-22","arxiv_id":"1705.08030","n_code_links":0,"syntology":null},{"paper":null,"slug":"statistical-inference-using-sgd","title":"Statistical inference using SGD","date":"2017-05-21","arxiv_id":"1705.07477","n_code_links":0,"syntology":null},{"paper":null,"slug":"determinantal-point-processes-for-mini-batch","title":"Determinantal Point Processes for Mini-Batch Diversification","date":"2017-05-01","arxiv_id":"1705.00607","n_code_links":0,"syntology":null},{"paper":"/paper/parseval-networks-improving-robustness-to","slug":"parseval-networks-improving-robustness-to","title":"Parseval Networks: Improving Robustness to Adversarial Examples","date":"2017-04-28","arxiv_id":"1704.08847","n_code_links":1,"syntology":null},{"paper":null,"slug":"linear-convergence-of-accelerated-stochastic","title":"Linear Convergence of Accelerated Stochastic Gradient Descent for Nonconvex Nonsmooth Optimization","date":"2017-04-26","arxiv_id":"1704.07953","n_code_links":0,"syntology":null},{"paper":"/paper/active-bias-training-more-accurate-neural","slug":"active-bias-training-more-accurate-neural","title":"Active Bias: Training More Accurate Neural Networks by Emphasizing High Variance Samples","date":"2017-04-24","arxiv_id":"1704.07433","n_code_links":1,"syntology":null},{"paper":"/paper/stochastic-gradient-descent-as-approximate","slug":"stochastic-gradient-descent-as-approximate","title":"Stochastic Gradient Descent as Approximate Bayesian Inference","date":"2017-04-13","arxiv_id":"1704.04289","n_code_links":1,"syntology":null},{"paper":"/paper/computing-nonvacuous-generalization-bounds","slug":"computing-nonvacuous-generalization-bounds","title":"Computing Nonvacuous Generalization Bounds for Deep (Stochastic) Neural Networks with Many More Parameters than Training Data","date":"2017-03-31","arxiv_id":"1703.11008","n_code_links":3,"syntology":{"ran":2,"of":3,"n_ran_checked":0,"n_instrument":2,"unverified":1,"pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","official":null}},{"paper":null,"slug":"theory-ii-landscape-of-the-empirical-risk-in","title":"Theory II: Landscape of the Empirical Risk in Deep Learning","date":"2017-03-28","arxiv_id":"1703.09833","n_code_links":0,"syntology":null},{"paper":null,"slug":"empirical-evaluation-of-parallel-training","title":"Empirical Evaluation of Parallel Training Algorithms on Acoustic Modeling","date":"2017-03-17","arxiv_id":"1703.05880","n_code_links":0,"syntology":null},{"paper":null,"slug":"separation-of-time-scales-and-direct","title":"Separation of time scales and direct computation of weights in deep neural networks","date":"2017-03-14","arxiv_id":"1703.04757","n_code_links":0,"syntology":null},{"paper":null,"slug":"data-dependent-stability-of-stochastic","title":"Data-Dependent Stability of Stochastic Gradient Descent","date":"2017-03-05","arxiv_id":"1703.01678","n_code_links":0,"syntology":null},{"paper":"/paper/a-robust-adaptive-stochastic-gradient-method","slug":"a-robust-adaptive-stochastic-gradient-method","title":"A Robust Adaptive Stochastic Gradient Method for Deep Learning","date":"2017-03-02","arxiv_id":"1703.00788","n_code_links":1,"syntology":null},{"paper":null,"slug":"sarah-a-novel-method-for-machine-learning","title":"SARAH: A Novel Method for Machine Learning Problems Using Stochastic Recursive Gradient","date":"2017-03-01","arxiv_id":"1703.00102","n_code_links":0,"syntology":null},{"paper":null,"slug":"learning-what-data-to-learn","title":"Learning What Data to Learn","date":"2017-02-28","arxiv_id":"1702.08635","n_code_links":0,"syntology":null},{"paper":"/paper/mckernel-a-library-for-approximate-kernel","slug":"mckernel-a-library-for-approximate-kernel","title":"McKernel: A Library for Approximate Kernel Expansions in Log-linear Time","date":"2017-02-27","arxiv_id":"1702.08159","n_code_links":1,"syntology":null},{"paper":null,"slug":"sgd-learns-the-conjugate-kernel-class-of-the","title":"SGD Learns the Conjugate Kernel Class of the Network","date":"2017-02-27","arxiv_id":"1702.08503","n_code_links":0,"syntology":null},{"paper":null,"slug":"on-sgds-failure-in-practice-characterizing","title":"On SGD's Failure in Practice: Characterizing and Overcoming Stalling","date":"2017-02-01","arxiv_id":"1702.00317","n_code_links":0,"syntology":null},{"paper":null,"slug":"reinforced-stochastic-gradient-descent-for","title":"Reinforced stochastic gradient descent for deep neural network learning","date":"2017-01-27","arxiv_id":"1701.07974","n_code_links":0,"syntology":null},{"paper":null,"slug":"optimization-on-product-submanifolds-of","title":"Optimization on Product Submanifolds of Convolution Kernels","date":"2017-01-22","arxiv_id":"1701.06123","n_code_links":0,"syntology":null},{"paper":null,"slug":"efficient-distributed-semi-supervised","title":"Efficient Distributed Semi-Supervised Learning using Stochastic Regularization over Affinity Graphs","date":"2016-12-15","arxiv_id":"1612.04898","n_code_links":0,"syntology":null},{"paper":null,"slug":"tuning-the-scheduling-of-distributed","title":"Tuning the Scheduling of Distributed Stochastic Gradient Descent with Bayesian Optimization","date":"2016-12-01","arxiv_id":"1612.00383","n_code_links":0,"syntology":null},{"paper":null,"slug":"spatial-contrasting-for-deep-unsupervised","title":"Spatial contrasting for deep unsupervised learning","date":"2016-11-21","arxiv_id":"1611.06996","n_code_links":0,"syntology":null},{"paper":null,"slug":"how-to-scale-distributed-deep-learning","title":"How to scale distributed deep learning?","date":"2016-11-14","arxiv_id":"1611.04581","n_code_links":0,"syntology":null},{"paper":"/paper/entropy-sgd-biasing-gradient-descent-into","slug":"entropy-sgd-biasing-gradient-descent-into","title":"Entropy-SGD: Biasing Gradient Descent Into Wide Valleys","date":"2016-11-06","arxiv_id":"1611.01838","n_code_links":2,"syntology":null},{"paper":"/paper/quasi-recurrent-neural-networks","slug":"quasi-recurrent-neural-networks","title":"Quasi-Recurrent Neural Networks","date":"2016-11-05","arxiv_id":"1611.01576","n_code_links":7,"syntology":{"ran":1,"of":1,"n_ran_checked":1,"n_instrument":0,"unverified":0,"pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":null}},{"paper":null,"slug":"statistical-inference-for-model-parameters-in","title":"Statistical Inference for Model Parameters in Stochastic Gradient Descent","date":"2016-10-27","arxiv_id":"1610.08637","n_code_links":0,"syntology":null},{"paper":null,"slug":"optimization-on-submanifolds-of-convolution","title":"Optimization on Submanifolds of Convolution Kernels in CNNs","date":"2016-10-22","arxiv_id":"1610.07008","n_code_links":0,"syntology":null},{"paper":null,"slug":"an-efficient-minibatch-acceptance-test-for","title":"An Efficient Minibatch Acceptance Test for Metropolis-Hastings","date":"2016-10-19","arxiv_id":"1610.06848","n_code_links":0,"syntology":null},{"paper":"/paper/cumf_sgd-fast-and-scalable-matrix","slug":"cumf_sgd-fast-and-scalable-matrix","title":"CuMF_SGD: Fast and Scalable Matrix Factorization","date":"2016-10-19","arxiv_id":"1610.05838","n_code_links":2,"syntology":null},{"paper":null,"slug":"big-batch-sgd-automated-inference-using","title":"Big Batch SGD: Automated Inference using Adaptive Batch Sizes","date":"2016-10-18","arxiv_id":"1610.05792","n_code_links":0,"syntology":null},{"paper":"/paper/parallelizing-stochastic-gradient-descent-for","slug":"parallelizing-stochastic-gradient-descent-for","title":"Parallelizing Stochastic Gradient Descent for Least Squares Regression: mini-batching, averaging, and model misspecification","date":"2016-10-12","arxiv_id":"1610.03774","n_code_links":4,"syntology":null},{"paper":"/paper/qsgd-communication-efficient-sgd-via-gradient","slug":"qsgd-communication-efficient-sgd-via-gradient","title":"QSGD: Communication-Efficient SGD via Gradient Quantization and Encoding","date":"2016-10-07","arxiv_id":"1610.02132","n_code_links":2,"syntology":{"ran":0,"of":3,"n_ran_checked":0,"n_instrument":0,"unverified":3,"pointer_only":3,"phrase":"0 ran · 3 unverified","official":null}},{"paper":null,"slug":"near-data-processing-for-differentiable","title":"Near-Data Processing for Differentiable Machine Learning Models","date":"2016-10-06","arxiv_id":"1610.02273","n_code_links":0,"syntology":null},{"paper":"/paper/stochastic-optimization-with-variance","slug":"stochastic-optimization-with-variance","title":"Stochastic Optimization with Variance Reduction for Infinite Datasets with Finite-Sum Structure","date":"2016-10-04","arxiv_id":"1610.00970","n_code_links":1,"syntology":null},{"paper":null,"slug":"deep-unsupervised-learning-through-spatial","title":"Deep unsupervised learning through spatial contrasting","date":"2016-10-02","arxiv_id":"1610.00243","n_code_links":0,"syntology":null},{"paper":null,"slug":"asynchronous-stochastic-gradient-descent-with-1","title":"Asynchronous Stochastic Gradient Descent with Delay Compensation","date":"2016-09-27","arxiv_id":"1609.08326","n_code_links":0,"syntology":null},{"paper":null,"slug":"generalization-error-bounds-for-optimization","title":"Generalization Error Bounds for Optimization Algorithms via Stability","date":"2016-09-27","arxiv_id":"1609.08397","n_code_links":0,"syntology":null},{"paper":null,"slug":"data-dependent-convergence-for-distributed","title":"Data Dependent Convergence for Distributed Stochastic Optimization","date":"2016-08-30","arxiv_id":"1608.08337","n_code_links":0,"syntology":null},{"paper":"/paper/lets-keep-it-simple-using-simple","slug":"lets-keep-it-simple-using-simple","title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","date":"2016-08-22","arxiv_id":"1608.06037","n_code_links":9,"syntology":{"ran":11,"of":11,"n_ran_checked":8,"n_instrument":3,"unverified":0,"pointer_only":0,"phrase":"11 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 0 violated, 8 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","official":{"repos":["Coderx7/SimpleNet"],"state":"community repositories only","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["listed"]}}},{"paper":null,"slug":"uniform-generalization-concentration-and","title":"Uniform Generalization, Concentration, and Adaptive Learning","date":"2016-08-22","arxiv_id":"1608.06072","n_code_links":0,"syntology":null},{"paper":null,"slug":"parallel-sgd-when-does-averaging-help","title":"Parallel SGD: When does averaging help?","date":"2016-06-23","arxiv_id":"1606.07365","n_code_links":0,"syntology":null},{"paper":"/paper/bolt-on-differential-privacy-for-scalable","slug":"bolt-on-differential-privacy-for-scalable","title":"Bolt-on Differential Privacy for Scalable Stochastic Gradient Descent-based Analytics","date":"2016-06-15","arxiv_id":"1606.04722","n_code_links":1,"syntology":null},{"paper":null,"slug":"distributed-hessian-free-optimization-for","title":"Distributed Hessian-Free Optimization for Deep Neural Network","date":"2016-06-02","arxiv_id":"1606.00511","n_code_links":0,"syntology":null},{"paper":"/paper/asynchrony-begets-momentum-with-an","slug":"asynchrony-begets-momentum-with-an","title":"Asynchrony begets Momentum, with an Application to Deep Learning","date":"2016-05-31","arxiv_id":"1605.09774","n_code_links":3,"syntology":null},{"paper":"/paper/cyclades-conflict-free-asynchronous-machine","slug":"cyclades-conflict-free-asynchronous-machine","title":"CYCLADES: Conflict-free Asynchronous Machine Learning","date":"2016-05-31","arxiv_id":"1605.09721","n_code_links":1,"syntology":null},{"paper":null,"slug":"provable-efficient-online-matrix-completion","title":"Provable Efficient Online Matrix Completion via Non-convex Stochastic Gradient Descent","date":"2016-05-26","arxiv_id":"1605.08370","n_code_links":0,"syntology":null},{"paper":null,"slug":"path-normalized-optimization-of-recurrent","title":"Path-Normalized Optimization of Recurrent Neural Networks with ReLU Activations","date":"2016-05-23","arxiv_id":"1605.07154","n_code_links":0,"syntology":null},{"paper":"/paper/barzilai-borwein-step-size-for-stochastic","slug":"barzilai-borwein-step-size-for-stochastic","title":"Barzilai-Borwein Step Size for Stochastic Gradient Descent","date":"2016-05-13","arxiv_id":"1605.04131","n_code_links":1,"syntology":{"ran":5,"of":7,"n_ran_checked":5,"n_instrument":0,"unverified":2,"pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","official":null}},{"paper":null,"slug":"distributed-stochastic-optimization-for-deep","title":"Distributed stochastic optimization for deep learning (thesis)","date":"2016-05-07","arxiv_id":"1605.02216","n_code_links":0,"syntology":null},{"paper":null,"slug":"on-the-convergence-of-a-family-of-robust","title":"On the Convergence of A Family of Robust Losses for Stochastic Gradient Descent","date":"2016-05-05","arxiv_id":"1605.01623","n_code_links":0,"syntology":null},{"paper":null,"slug":"greedy-criterion-in-orthogonal-greedy","title":"Greedy Criterion in Orthogonal Greedy Learning","date":"2016-04-20","arxiv_id":"1604.05993","n_code_links":0,"syntology":null},{"paper":null,"slug":"asynchronous-stochastic-gradient-descent-with","title":"Asynchronous Stochastic Gradient Descent with Variance Reduction for Non-Convex Optimization","date":"2016-04-12","arxiv_id":"1604.03584","n_code_links":0,"syntology":null},{"paper":null,"slug":"efficient-globally-convergent-stochastic","title":"Efficient Globally Convergent Stochastic Optimization for Canonical Correlation Analysis","date":"2016-04-07","arxiv_id":"1604.01870","n_code_links":0,"syntology":null},{"paper":null,"slug":"stochastic-variance-reduction-for-nonconvex","title":"Stochastic Variance Reduction for Nonconvex Optimization","date":"2016-03-19","arxiv_id":"1603.06160","n_code_links":0,"syntology":null},{"paper":null,"slug":"accelerating-deep-neural-network-training","title":"Accelerating Deep Neural Network Training with Inconsistent Stochastic Gradient Descent","date":"2016-03-17","arxiv_id":"1603.05544","n_code_links":0,"syntology":null},{"paper":null,"slug":"distributed-deep-learning-using-synchronous","title":"Distributed Deep Learning Using Synchronous Stochastic Gradient Descent","date":"2016-02-22","arxiv_id":"1602.06709","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-variational-analysis-of-stochastic-gradient","title":"A Variational Analysis of Stochastic Gradient Algorithms","date":"2016-02-08","arxiv_id":"1602.02666","n_code_links":0,"syntology":null},{"paper":null,"slug":"loss-factorization-weakly-supervised-learning","title":"Loss factorization, weakly supervised learning and label noise robustness","date":"2016-02-08","arxiv_id":"1602.02450","n_code_links":0,"syntology":null},{"paper":"/paper/a-kronecker-factored-approximate-fisher","slug":"a-kronecker-factored-approximate-fisher","title":"A Kronecker-factored approximate Fisher matrix for convolution layers","date":"2016-02-03","arxiv_id":"1602.01407","n_code_links":4,"syntology":{"ran":1,"of":1,"n_ran_checked":0,"n_instrument":1,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":null}},{"paper":null,"slug":"training-recurrent-neural-networks-by","title":"Training Recurrent Neural Networks by Diffusion","date":"2016-01-16","arxiv_id":"1601.04114","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-light-touch-for-heavily-constrained-sgd","title":"A Light Touch for Heavily Constrained SGD","date":"2015-12-15","arxiv_id":"1512.04960","n_code_links":0,"syntology":null},{"paper":"/paper/preconditioned-stochastic-gradient-descent","slug":"preconditioned-stochastic-gradient-descent","title":"Preconditioned Stochastic Gradient Descent","date":"2015-12-14","arxiv_id":"1512.04202","n_code_links":2,"syntology":{"ran":5,"of":6,"n_ran_checked":1,"n_instrument":4,"unverified":1,"pointer_only":6,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 4 where Syntology's instrument failed) · 1 unverified","official":{"repos":["lixilinx/psgd_torch"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"efficient-distributed-sgd-with-variance","title":"Efficient Distributed SGD with Variance Reduction","date":"2015-12-09","arxiv_id":"1512.02970","n_code_links":0,"syntology":null},{"paper":null,"slug":"variance-reduction-for-distributed-stochastic","title":"Variance Reduction for Distributed Stochastic Gradient Descent","date":"2015-12-05","arxiv_id":"1512.01708","n_code_links":0,"syntology":null},{"paper":null,"slug":"kalman-based-stochastic-gradient-method-with","title":"Kalman-based Stochastic Gradient Method with Stop Condition and Insensitivity to Conditioning","date":"2015-12-03","arxiv_id":"1512.01139","n_code_links":0,"syntology":null},{"paper":null,"slug":"finite-time-analysis-of-projected-langevin","title":"Finite-Time Analysis of Projected Langevin Monte Carlo","date":"2015-12-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"taming-the-wild-a-unified-analysis-of-hogwild-1","title":"Taming the Wild: A Unified Analysis of Hogwild-Style Algorithms","date":"2015-12-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"distributed-deep-learning-for-question","title":"Distributed Deep Learning for Question Answering","date":"2015-11-03","arxiv_id":"1511.01158","n_code_links":0,"syntology":null},{"paper":"/paper/how-important-is-weight-symmetry-in","slug":"how-important-is-weight-symmetry-in","title":"How Important is Weight Symmetry in Backpropagation?","date":"2015-10-17","arxiv_id":"1510.05067","n_code_links":2,"syntology":null},{"paper":null,"slug":"uniform-learning-in-a-deep-neural-network-via","title":"Uniform Learning in a Deep Neural Network via \"Oddball\" Stochastic Gradient Descent","date":"2015-10-08","arxiv_id":"1510.02442","n_code_links":0,"syntology":null},{"paper":null,"slug":"convergence-of-stochastic-gradient-descent","title":"Convergence of Stochastic Gradient Descent for PCA","date":"2015-09-30","arxiv_id":"1509.09002","n_code_links":0,"syntology":null},{"paper":"/paper/stochastic-gradient-descent-methods-for","slug":"stochastic-gradient-descent-methods-for","title":"Stochastic gradient descent methods for estimation with large data sets","date":"2015-09-22","arxiv_id":"1509.06459","n_code_links":1,"syntology":null},{"paper":null,"slug":"oddball-sgd-novelty-driven-stochastic","title":"\"Oddball SGD\": Novelty Driven Stochastic Gradient Descent for Training Deep Neural Networks","date":"2015-09-18","arxiv_id":"1509.05765","n_code_links":0,"syntology":null},{"paper":null,"slug":"fast-asynchronous-parallel-stochastic","title":"Fast Asynchronous Parallel Stochastic Gradient Decent","date":"2015-08-24","arxiv_id":"1508.05711","n_code_links":0,"syntology":null},{"paper":null,"slug":"on-the-convergence-of-sgd-training-of-neural","title":"On the Convergence of SGD Training of Neural Networks","date":"2015-08-12","arxiv_id":"1508.02790","n_code_links":0,"syntology":null},{"paper":null,"slug":"beyond-convexity-stochastic-quasi-convex","title":"Beyond Convexity: Stochastic Quasi-Convex Optimization","date":"2015-07-08","arxiv_id":"1507.02030","n_code_links":0,"syntology":null},{"paper":null,"slug":"online-learning-to-sample","title":"Online Learning to Sample","date":"2015-06-30","arxiv_id":"1506.09016","n_code_links":0,"syntology":null},{"paper":null,"slug":"stochastic-gradient-made-stable-a-manifold","title":"Stochastic Gradient Made Stable: A Manifold Propagation Approach for Large-Scale Optimization","date":"2015-06-28","arxiv_id":"1506.08350","n_code_links":0,"syntology":null},{"paper":null,"slug":"on-variance-reduction-in-stochastic-gradient","title":"On Variance Reduction in Stochastic Gradient Descent and its Asynchronous Variants","date":"2015-06-23","arxiv_id":"1506.06840","n_code_links":0,"syntology":null},{"paper":null,"slug":"taming-the-wild-a-unified-analysis-of-hogwild","title":"Taming the Wild: A Unified Analysis of Hogwild!-Style Algorithms","date":"2015-06-22","arxiv_id":"1506.06438","n_code_links":0,"syntology":null},{"paper":null,"slug":"variance-reduced-stochastic-gradient-descent-1","title":"Variance Reduced Stochastic Gradient Descent with Neighbors","date":"2015-06-11","arxiv_id":"1506.03662","n_code_links":0,"syntology":null},{"paper":"/paper/path-sgd-path-normalized-optimization-in-deep","slug":"path-sgd-path-normalized-optimization-in-deep","title":"Path-SGD: Path-Normalized Optimization in Deep Neural Networks","date":"2015-06-08","arxiv_id":"1506.02617","n_code_links":1,"syntology":null},{"paper":"/paper/spatial-transformer-networks","slug":"spatial-transformer-networks","title":"Spatial Transformer Networks","date":"2015-06-05","arxiv_id":"1506.02025","n_code_links":45,"syntology":{"ran":21,"of":31,"n_ran_checked":21,"n_instrument":0,"unverified":10,"pointer_only":0,"phrase":"21 ran (of which 0 constructed an object rather than computing a result; 21 with no instrument failure: 1 honoured, 0 violated, 20 with no contract checked; 0 where Syntology's instrument failed) · 10 unverified","official":null}},{"paper":"/paper/early-stopping-is-nonparametric-variational","slug":"early-stopping-is-nonparametric-variational","title":"Early Stopping is Nonparametric Variational Inference","date":"2015-04-06","arxiv_id":"1504.01344","n_code_links":1,"syntology":null},{"paper":null,"slug":"learning-co-sparse-analysis-operators-with","title":"Learning Co-Sparse Analysis Operators with Separable Structures","date":"2015-03-09","arxiv_id":"1503.02398","n_code_links":0,"syntology":null},{"paper":null,"slug":"adasecant-robust-adaptive-secant-method-for","title":"ADASECANT: Robust Adaptive Secant Method for Stochastic Gradient","date":"2014-12-23","arxiv_id":"1412.7419","n_code_links":0,"syntology":null},{"paper":null,"slug":"learning-from-data-with-heterogeneous-noise","title":"Learning from Data with Heterogeneous Noise using SGD","date":"2014-12-17","arxiv_id":"1412.5617","n_code_links":0,"syntology":null},{"paper":"/paper/the-loss-surfaces-of-multilayer-networks","slug":"the-loss-surfaces-of-multilayer-networks","title":"The Loss Surfaces of Multilayer Networks","date":"2014-11-30","arxiv_id":"1412.0233","n_code_links":1,"syntology":null},{"paper":null,"slug":"global-convergence-of-stochastic-gradient-1","title":"Global Convergence of Stochastic Gradient Descent for Some Non-convex Matrix Problems","date":"2014-11-05","arxiv_id":"1411.1134","n_code_links":0,"syntology":null},{"paper":"/paper/parallel-training-of-dnns-with-natural","slug":"parallel-training-of-dnns-with-natural","title":"Parallel training of DNNs with Natural Gradient and Parameter Averaging","date":"2014-10-27","arxiv_id":"1410.7455","n_code_links":1,"syntology":null}],"record_sha256":"2eb1945570b75c4d1c2bff8e4aa000f5e7f44d6945f9da61b7b5c9b7f2b5f7c4","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}