Skip to content

Repository files navigation

Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations

Awesome list badge LICENSE arXiv PRs welcome WeChat Group Github

Tong Zhang, Jiangning Zhang, Zhucun Xue, Juntao Jiang, Yicheng Xu, Chengming Xu, Teng Hu, Xingyu Xie, Xiaobin Hu†, Yabiao Wang, Yong Liu†, Shuicheng Yan


📖 Overview

Foundational optimization algorithms are the core driving force behind deep learning, evolving from early stochastic gradient descent (SGD) to the widely adopted Adam family. However, as the scale of modern foundation models grows massively, this optimization paradigm is forced to expand, encountering new physical and systemic bottlenecks during large-scale training. In particular, stringent differential privacy requirements and distributed training paradigms have exposed critical limitations of conventional approaches regarding privacy protection and memory efficiency.

However, existing reviews on optimization algorithms often focus on narrow technical fields, e.g., first-order and second-order, lacking a comprehensive perspective on the field's evolution, especially regarding Zeroth-order and Scenario-oriented paradigms.

To address these gaps, this survey provides a systematic review of the development of optimization algorithmss, tracing its evolution through four major paradigms:

First-order methodsSecond-order methodsZeroth-order methodsScenario-oriented paradigms

We conduct comprehensive theoretical analysis and standardized empirical evaluations, objectively pointing out the pros, cons, and fundamental design trade-offs of various methods across different architectures. By synthesizing theoretical insights with extensive empirical evidence, we distill key developmental trends and provides actionable guidance and future research directions for designing next-generation efficient, robust, and trustworthy optimization algorithms.

🎯Contributions

1️⃣ Unified Taxonomy: Establishing a rigorous mathematical taxonomy that unifies disparate conceptual definitions across fundamental optimization primitives.

  • 📊 Evolutionary Trajectory tracing the development of foundational algorithms from First-Order to Second-Order and Zeroth-Order methods.
  • 🔬 Intrinsic Connections clarifying the complex evolutionary logic and structural relationships between different optimization approaches to provide a coherent framework for the field.

2️⃣ Scenario-Oriented Analysis: Demonstrating how foundational algorithms are fundamentally re-architected into scenario-oriented paradigms to address severe physical bottlenecks.

  • 📈 Systems-Aware Engineering highlighting the critical shift from pure algorithmic design to practical solutions that balance theoretical guarantees with strict engineering constraints.
  • 🔍 Overcoming Systemic Barriers detailing how these paradigms tackle specific, real-world challenges such as distributed communication barriers and strict differential privacy constraints.

3️⃣ Standardized Evaluation: Introducing a rigorously controlled evaluation framework that strictly separates pure algorithmic performance from large-scale engineering optimizations.

  • 🚀 Extensive Benchmarking developing a standardized testbed to evaluate 23 distinct optimizers across diverse architectural proxies, including CNN and Transformer-based models.
  • 🔮 Strategic Insights systematically isolating and examining learning rate sensitivity, long-term training scalability, and cross-architecture generalization to guide the design of next-generation optimizers.

📈Evolution

📈 A Comprehensive Analysis of Optimization Methods: This figure systematically summarizes the development trends and core characteristics of optimization methodologies across different orders.

  • Key Insights:Attention to optimization algorithms experienced a sharp increase since 2024. This explosive growth is closely tied to the rapid development of massive models, with first-order methods maintaining a dominant position.

🚩Timeline

Timeline of prominent optimization algorithms. The evolution highlights key algorithmic milestones, associated research institutions, and publication venues over time.


🏗️ Architecture Overview

🗂️ A Comprehensive Taxonomy of Optimization Algorithms

📐 Taxonomy Overview: This framework categorizes existing works based on three dominant paradigms, First-Order Methods, Second-Order Methods, and Zeroth-Order Methods, and further structures them according to their fundamental mathematical principles and evolutionary development. Key branches include:

  • 🚀 First-Order Methods: Gradient-Driven (e.g., SGD) $\rightarrow$ Adaptive Learning Rate (e.g., Adam) $\rightarrow$ Acceleration to Automation (e.g., Adan, Nadam) $\rightarrow$ Scalar to Preconditioner (e.g., Shampoo) $\rightarrow$ Stability to Temporal (e.g., SPAM) $\rightarrow$ Temporal to Geometry (e.g., SAM).
  • ⚙️ Second-Order Methods: Deterministic Curvature to Geometry (e.g., K-FAC, AdaFisher) $\rightarrow$ Approximation to Iterative Update (e.g., ADAHESSIAN).
  • 📍 Zeroth-Order Methods: Perturbation Optimization (e.g., FZOO, LeZO) $\rightarrow$ Adaptive to Resource-Aware (e.g., MeZO, ZO-AdaMM) $\rightarrow$ Variance Reduction to Adaptive (e.g., MeZO-SVRG).

📊 Benchmark Evaluation Results on Vision Tasks

📈 Benchmark Evaluation: This comprehensive assessment evaluates 23 representative optimization algorithms across continuous vision architectures (ViT-S and ResNet-50) and varying training horizons:

  • ⏱️ Short-Term Convergence (100 Epochs): Evaluates the rapid descent capability and initial exploration efficiency of optimizers within a constrained computational budget.
  • 🏃 Long-Term Scalability (300 Epochs): Assesses the algorithm's resilience against late-stage gradient noise and its capacity to continually extract representational power over extended cycles.
  • 📊 Ranking Dynamics: Tracks relative performance shifts across epochs, highlighting how algorithms dynamically navigate the trade-off between early acceleration and long-term stability.

🔥Add Your Paper in our Survey!!!!!

  • You are welcome to give us an issue or PR for your optimizer work !!!!!

Note that: Due to the huge paper in arXiv, we are sorry to cover all in our survey. You can directly present a PR into this repo and we will record it for next version update of our survey.

🔥New

  • [2026.08.06] We update GitHub to record the available paper by the end of 2026/08/06.

🌟Welcome everyone to follow and join the Scaling Opt community: Scaling Opt Community

  • Algorithm Visualizations: Includes visualization scripts for the Rosenbrock Function and Rastrigin Function, allowing users to freely explore optimization behaviors.

  • Performance Benchmarks: We primarily recommend benchmarks based on Algoperf, along with other benchmark suites and analysis articles for validating and comparing state-of-the-art optimizers.

  • Papers & Blogs Recommendations: The platform curates high-quality papers and blog posts from recent years, continuously updated with the latest daily arXiv publications. Currently, the collection contains nearly one hundred resources.

  • Tutorials Sharing: The platform gathers high-quality community resources and is actively developing a tutorial series titled From Classical to Modern Optimizers.


🔨Installation

To reproduce our benchmarks, you need to clone this repository and install the required dependencies. We strongly recommend using a virtual environment (e.g., Conda).

# 1. Clone the repository
git clone https://github.com/JZhangTon/awesome-optimizer.git
cd awesome-optimizer

# 2. Install required packages
pip install -r requirements.txt

⚙️Usage & 📈Benchmarking

  • To start a training run and reproduce our benchmark results, you can execute the provided training scripts. We provide a script for easy benchmarking. See examples/benchmark to see how to use it.

🗂️Taxonomy of Optimization Algorithms

🚀 First-Order Algorithms

Abbreviation Venue & Year Paper Title Project Sub-methods Fine-grained Methods
Muon-SW arXiv'2607 Scale Weight Decay and Train Better Link Learning Rate Scheduling Weight-Decay Scaling
PoLoRA arXiv'2607 PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer Link Preconditioned Gradient Methods; Towards LLM Traning Orthogonalized LoRA Preconditioning
GEAR-SAM arXiv'2607 Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization Link Loss Landscape Optimization Sharpness-Aware Minimization
KL-SOAP arXiv'2607 SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales Link Preconditioned Gradient Methods Large-Scale Orthogonal Preconditioning
LionVote arXiv'2607 LionVote: Per-Layer Learning Rate Adaptation for Lion Link Learning Rate Scheduling Per-Layer Learning Rate Adaptation
EISAM arXiv'2607 Leveraging Extragradient for Effective Sharpness-Aware Minimization in Deep Learning Link Loss Landscape Optimization Extragradient SAM
PsiLogic arXiv'2607 PsiLogic: Chaos-Aware Active Cancellation for Adam with a Fair Cross-Domain Benchmark Link Adaptive Learning Rate Methods Chaos-Aware Adam Damping
Aurora arXiv'2606 Aurora: A Leverage-Aware Spectral Optimizer Link Adaptive Step-Size Control Matrix Orthogonalization
HiMuon arXiv'2606 Hierarchical Muon: Tiled Newton-Schulz Updates for Efficient Muon Optimization Link Adaptive Step-Size Control Tiled Matrix Orthogonalization
Pion arXiv'2605 Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR Link Spectral High Pass Matrix Orthogonalization
C-Adam arXiv'2605 A Theoretical and Experimental Study of a Novel Adaptive Learning Algorithm Link Adaptive Learning Rate Methods Line-of-Sight Adam Variant
SparseOpt arXiv'2605 SparseOpt: Addressing Normalization-induced Gradient Skew in Sparse Training Link Gradient Normalization & Clipping Sparse Training Gradient Rebalancing
Anon arXiv'2605 Anon: Extrapolating Optimizer Adaptivity Across the Real Spectrum Link Adaptive Learning Rate Methods
PS-Clip-SGD arXiv'2605 Robust and Fast Training via Per-Sample Clipping Link Enhancing Training Stability
Nora arXiv'2605 Nora: Normalized Orthogonal Row Alignment for Scalable Matrix Optimizer Link Adaptive Step-Size Control Matrix Orthogonalization
Muon^2 arXiv'2604 Muon^2: Boosting Muon via Adaptive Second-Moment Preconditioning Link Adaptive Step-Size Control Matrix Orthogonalization
HomeAdam arXiv'2603 HomeAdam: Adam and AdamW Algorithms Sometimes Go Home to Obtain Better Provable Generalization Link Adaptive Step-Size Control Second-order moment adaptation
FlashOptim arXiv'2602 FlashOptim: Optimizers for Memory-Efficient Training Link Memory-Efficient Optimization Low-Memory Optimizer Design
FANoS arXiv'2601 FANoS: Friction-Adaptive Nos´e–Hoover Symplectic Momentum for Stiff Objectives Link Accelerating Convergence Rate Momentum Damping Mechanism
NOVAK arXiv'2601 NOVAK: Unified adaptive optimizer for deep neural networks Link Hybrid Methods Gradient Smoothing Hybrid
AdamNX arXiv'2511 AdamNX: An Adam improvement algorithm based on a novel exponential decay mechanism for the second-order moment estimate Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
ROOT arXiv'2511 ROOT: Robust Orthogonalized Optimizer for Neural Network Training Link Adaptive Learning Rate Methods Momentum-based Adaptive
AuON arXiv'2509 AuON: A Linear-time Alternative to Orthogonal Momentum Updates Link Gradient Normalization & Clipping Layer-Wise Gradient Normalization
ZetA arXiv'2508 ZETA: A HYBRID OPTIMIZER COMBINING RIEMANN ZETA SCALING WITH ADAM FOR ROBUST DEEP LEARNING Link Hybrid Methods Multi-Objective Hybrid
NIRMAL arXiv'2508 COMPARATIVE ANALYSIS OF NOVEL NIRMAL OPTIMIZER AGAINST ADAM AND SGD WITH MOMENTUM Link Hybrid Methods Multi-Objective Hybrid
SCSAdamW arXiv'2507 Beyond First-Order: Training LLMs with Stochastic Conjugate Subgradients and AdamW Link Loss Landscape Optimization Momentum Landscape Adaptation
adaNPAG arXiv'2507 Boosting Accelerated Proximal Gradient Method with Adaptive Sampling for Stochastic Composite Optimization * Link Momentum-Enhanced SGD Accelerated Momentum
SoftSignSGD arXiv'2507 SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam Link Adaptive Learning Rate Methods Hybrid Adaptive Strategy
AdaMuon arXiv'2507 ADAMUON: ADAPTIVE MUON OPTIMIZER Link Adaptive Learning Rate Methods Hybrid Adaptive Strategy
Accelerated GRAAL arXiv'2507 NESTEROV FINDS GRAAL: OPTIMAL AND ADAPTIVE GRADIENT METHOD FOR CONVEX OPTIMIZATION Link Hybrid Methods Multi-Objective Hybrid
DEO arXiv'2507 Dimer-Enhanced Optimization: A First-Order Approach to Escaping Saddle Points in Neural Network Training Link Loss Landscape Optimization Curvature-Guided Landscape Exploration
LyAm arXiv'2507 LyAm: Robust Non-Convex Optimization for Stable Learning in Noisy Environments Link Learning Rate Scheduling Stability-Aware Adaptive Scheduling
Splus arXiv'2506 A Stable Whitening Optimizer for Efficient Neural Network Training Link Preconditioned Gradient Methods Two Metrics' Preconditioner
HGM arXiv'2506 Hindsight-Guided Momentum (HGM) Optimizer: An Approach to Adaptive Learning Rates Link Learning Rate Scheduling Gradient Angle Scheduling
AutoSGD arXiv'2505 AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent Link Learning Rate Scheduling Scheduler-Free Adaptation
AdamS arXiv'2505 AdamS: Momentum Itself Can Be A Normalizer for LLM Pretraining and Post-training Link Adaptive Learning Rate Methods Stateless Adaptation
LightSAM arXiv'2505 LightSAM: Parameter-Agnostic Sharpness-Aware Minimization Link Loss Landscape Optimization Sharpness-Aware Minimization (SAM)
ADAGB2 arXiv'2505 Fast Stochastic Second-Order Adagrad for Nonconvex Bound-Constrained Optimization Link Hybrid Methods Projection Gradient Hybrid
VRAdam arXiv'2505 A Physics-Inspired Optimizer: Velocity Regularized Adam Link Momentum-Enhanced SGD Momentum Damping Mechanism
SKA-SGD arXiv'2505 STREAMING KRYLOV-ACCELERATED STOCHASTIC GRADIENT DESCENT Link Loss Landscape Optimization Curvature-Guided Landscape Exploration
Adam-Power arXiv'2505 GradPower: Powering Gradients for Faster Language Model Pre-Training Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
AlphaGrad arXiv'2504 AlphaGrad: Non-Linear Gradient Normalization Optimizer Link Adaptive Learning Rate Methods; Low-Memory Optimizer Design; Stateless Optimization Methods Stateless Adaptation; Structural Redesign; Parameter Characteristic-Driven Updates
AsyncSAM arXiv'2503 ASYNCHRONOUS SHARPNESS-AWARE MINIMIZATION FOR FAST AND ACCURATE DEEP LEARNING Link Loss Landscape Optimization Sharpness-Aware Minimization (SAM)
ASGO arXiv'2503 ASGO: Adaptive Structured Gradient Optimization Link Preconditioned Gradient Methods Single Metric's Preconditioner
AdaGC arXiv'2502 AdaGC: Improving Training Stability for Large Language Model Pretraining Link Gradient Normalization & Clipping; Robust Optimization Noise-Robust Normalization; Dynamic Gradient Clipping; Noise-Robust Gradients
Adadiag arXiv'2502 Improving Adaptive Moment Optimization viaPreconditioner Diagonalization Link Hybrid Methods Projection Gradient Hybrid
eagle arXiv'2502 EAGLE: EARLY APPROXIMATED-GRADIENT-BASED LEARNING RATE ESTIMATOR Link Adaptive Learning Rate Methods Momentum-based Adaptive
Hessian-aware Scaling arXiv'2502 First-ish Order Methods: Hessian-aware Scalings of Gradient Descent Link Preconditioned Gradient Methods Single Metric's Preconditioner
GCSAM arXiv'2501 GCSAM: Gradient Centralized Sharpness Aware Minimization Link Gradient Normalization & Clipping Mean-Removal Normalization
SGDO arXiv'2501 Overshoot: Taking advantage of future gradients in momentum-based stochastic optimization Link Momentum-Enhanced SGD Accelerated Momentum
μ²-SGD ICLR'25 DO STOCHASTIC, FEEL NOISELESS: STABLE STOCHASTIC OPTIMIZATION VIA A DOUBLE MOMENTUM MECHANISM Link Momentum-Enhanced SGD Double-momentum mechanism
Stable-SPAM ICLR'25 Stable-SPAM: How to Train in 4-Bit More Stably than 16-Bit Adam Link Gradient Normalization & Clipping; Privacy-Aware Gradient Clipping Layer-Wise Gradient Normalization; Dynamic Gradient Clipping; Adaptive Clipping
apollo MLSys'25 APOLLO:SGD-LIKE MEMORY, ADAMW-LEVEL PERFORMANCE Link Adaptive Learning Rate Methods; Towards LLM Traning Hybrid Adaptive Strategy; Gradient Projection Mechanism
SPAM ICLR'25 SPAM: SPIKE-AWARE ADAM WITH MOMENTUM RESET FOR STABLE LLM TRAINING Link Gradient Normalization & Clipping; Optimizer State Compression Element-Wise Gradient Scaling; Spike-Aware Gradient Clipping; Sparse State Compression
Coupled Adam ACL'25 Better Embeddings with Coupled Adam Link Adaptive Learning Rate Methods Layer-Wise Adaptation
SWAN ICML'25 SWAN: SGD WITH NORMALIZATION AND WHITENING ENABLES STATELESS LLM TRAINING Link Towards LLM Traning Gradient Preconditioning Mechanism
LDAdam ICLR'25 LDADAM: ADAPTIVE OPTIMIZATION FROM LOWDIMENSIONAL GRADIENT STATISTICS Link Hybrid Methods Projection Gradient Hybrid
SSAM JMLR'25 Stabilizing Sharpness-aware Minimization Through A Simple Renormalization Strategy Link Loss Landscape Optimization Renormalized Gradient Norm SAM
MARS ICML'25 MARS: Unleashing the Power of Variance Reduction for Training Large Models Link Momentum-Enhanced SGD; Adaptive Learning Rate Methods Double-momentum mechanism;Momentum-based Adaptive
VSGD TMLR'25 Variational Stochastic Gradient Descent for Deep Neural Networks Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
MIAdam AAAI'25 A Method for Enhancing Generalization of Adam by Multiple Integrations Link Loss Landscape Optimization Curvature-Guided Landscape Exploration
KOALA++ NeurIPS'25 KOALA++: Efficient Kalman-Based Optimization with Gradient-Covariance Products Link Adaptive Learning Rate Methods Kalman filtering based
PAdamP CAMMIC'25 ADAPTIVE MOMENT ESTIMATION OPTIMIZATION ALGORITHM USING PROJECTION GRADIENT FOR DEEP LEARNING Link Hybrid Methods Projection Gradient Hybrid
DecGD Mach.Learn.'25 A New Adaptive Gradient Method with Gradient Decomposition Link Learning Rate Scheduling Loss-Sensitive Scheduling
Grams ICLR'25 WS Grams: Gradient Descent with Adaptive Momentum Scaling Link Hybrid Methods Multi-Objective Hybrid
FSGDM ICLR'25 ON THE PERFORMANCE ANALYSIS OF MOMENTUM METHOD: A FREQUENCY DOMAIN PERSPECTIVE Link Momentum-Enhanced SGD Frequency Domain Momentum Analysis
AdEMAMix ICLR'25 THE ADEMAMIX OPTIMIZER:BETTER, FASTER, OLDER Link Momentum-Enhanced SGD Double-momentum mechanism
HVAdam AAAI'25 HVAdam: A Full-Dimension Adaptive Optimizer Link Hybrid Methods Projection Gradient Hybrid
SGD-SaI arXiv'2412 No More Adam: Learning Rate Scaling at Initialization is All You Need Link Learning Rate Scheduling; Stateless Optimization Methods Initial Learning Rate Scaling; Parameter Characteristic-Driven Updates
Adam++ arXiv'2412 Towards Simple and Provable Parameter-Free Adaptive Gradient Methods Link Learning Rate Scheduling Scheduler-Free Adaptation
EXADAM arXiv'2412 EXADAM: THE POWER OF ADAPTIVE CROSS-MOMENTS Link Adaptive Learning Rate Methods Hybrid Adaptive Strategy
Cautious Optimizers arXiv'2411 Cautious Optimizers: Improving Training with One Line of Code Link Momentum-Enhanced SGD Momentum-Gradient Alignment
AGS-GD arXiv'2411 Anisotropic Gaussian Smoothing for Gradient-based Optimization Link Hybrid Methods; Auto-Designed Optimizers Gradient Smoothing Hybrid; Automated Discovery&Theoretical Derivation
CAdam arXiv'2411 CAdam: Confidence-Based Optimization for Online Learning Link Hybrid Methods Multi-Objective Hybrid
INNAprop arXiv'2410 A SECOND-ORDER-LIKE OPTIMIZER WITH ADAPTIVE GRADIENT SCALING FOR DEEP LEARNING Link Adaptive Learning Rate Methods Momentum-based Adaptive
CaAdam arXiv'2410 CaAdam: Improving Adam optimizer using connection aware methods Link Adaptive Learning Rate Methods Layer-Wise Adaptation
BADM arXiv'2407 BADM: Batch ADMM for Deep Learning Link Hybrid Methods Multi-Objective Hybrid
FAdam arXiv'2405 FAdam: Adam is a natural gradient optimizer using diagonal empirical Fisher information Link Adaptive Learning Rate Methods; Hybrid Methods Dynamic Epsilon Adjustment; Multi-Objective Hybrid
MSAM arXiv'2401 Momentum-SAM: Sharpness Aware Minimization without Computational Overhead Link Loss Landscape Optimization Momentum Landscape Adaptation
LOMO ACL'24 Full Parameter Fine-tuning for Large Language Models with Limited Resources Link Towards LLM Traning; Memory-Efficient Fine-Tuning for Large Models Real-Time Computation; Staless Fine-Tuning
BAdam NeurIPS'24 BAdam: A Memory Efficient Full Parameter Optimization Method for Large Language Models Link Hybrid Methods; Towards LLM Traning Multi-Objective Hybrid; Real-Time Computation; Block-Wise Computation
DP-AdamBC AAAI'24 DP-AdamBC: Your DP-Adam Is Actually DP-SGD (Unless You Apply Bias Correction) Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
Dice-SGD ICLR'24 DIFFERENTIALLY PRIVATE SGD WITHOUT CLIPPING BIAS: AN ERROR-FEEDBACK APPROACH Link Gradient Normalization & Clipping DP-enhanced Gradient Clipping
FESS-GDA AISTATS'24 Stochastic Smoothed Gradient Descent Ascent for Federated Minimax Optimization Link Hybrid Methods Gradient Filtering Hybrid
AdaSAM Neural Netw.'24 AdaSAM: Boosting Sharpness-Aware Minimization with Adaptive Learning Rate and Momentum for Training Deep Neural Networks Link Hybrid Methods Multi-Objective Hybrid
SAMPa NeurIPS'24 SAMPa: Sharpness-aware Minimization Parallelized Link Loss Landscape Optimization Sharpness-Aware Minimization (SAM)
ICML'24 Lookbehind-SAM: k steps back, 1 step forward Link Loss Landscape Optimization Multi-Step Ascent SAM
F-SAM CVPR'24 Friendly Sharpness-Aware Minimization Link Loss Landscape Optimization Noise Injection Enhancement
FGSAM NeurIPS'24 Fast Graph Sharpness-Aware Minimization for Enhancing and Accelerating Few-Shot Node Classification Link Loss Landscape Optimization Noise Injection Enhancement
Adan TPAMI'24 Adan: Adaptive Nesterov Momentum Algorithm for Faster Optimizing Deep Models Link Adaptive Learning Rate Methods Momentum-based Adaptive
4-bit shampoo NeurIPS'24 4-bit Shampoo for Memory-Efficient Network Training Link Preconditioned Gradient Methods; Low-Memory Optimizer Design Two Metrics' Preconditioner; Compression&Approximation of States
Muon Blog'24 Muon: An optimizer for hidden layers in neural networks Link Adaptive Learning Rate Methods Layer-Wise Adaptation
ADOPT NeurIPS'24 ADOPT: Modified Adam Can Converge with Any β2 with the Optimal Rate Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
SET-adam ECML'24 On Suppressing Range of Adaptive Stepsizes of Adam to Improve Generalisation Performance Link Adaptive Learning Rate Methods; Hybrid Methods Second-Order Moment Adaptation; Multi-Objective Hybrid
Adam-Real NeurIPS'24 Adam on Local Time: Addressing Nonstationarity in RL with Relative Adam Timesteps Link Momentum-Enhanced SGD Scheduled Momentum Reset
SNGM SCIS'24 Stochastic Normalized Gradient Descent with Momentum for Large-Batch Training Link Momentum-Enhanced SGD Momentum Damping Mechanism
Schedule-Free NeurIPS'24 The Road Less Scheduled Link Learning Rate Scheduling Scheduler-Free Adaptation
AUTODROP UAI'24 AUTODROP: TRAINING DEEP LEARNING MODELS WITH AUTOMATIC LEARNING RATE DROP Link Adaptive Learning Rate Methods; Learning Rate Scheduling Stateless Adaptation; Scheduler-Free Adaptation
ADAACT ICDMW'24 AN ADAPTIVE METHOD STABILIZING ACTIVATIONS FOR ENHANCED GENERALIZATION Link Adaptive Learning Rate Methods; Optimizer State Compression Neuron-Level Adaptation; State Sharing
MoMo ICML'24 MoMo: Momentum Models for Adaptive Learning Rates Link Adaptive Learning Rate Methods Momentum-based Adaptive
RSGDM CCSB'24 Reducing Bias in Deep Learning Optimization: The RSGDM Approach Link Momentum-Enhanced SGD Accelerated Momentum
NYSACT BigData'24 NYSACT: A SCALABLE PRECONDITIONED GRADIENT DESCENT USING NYSTRÖM APPROXIMATION Link Preconditioned Gradient Methods Single Metric's Preconditioner
SGDF arXiv'2311 Signal Processing Meets SGD: From Momentum to Filter Link Momentum-Enhanced SGD Dynamic Momentum Weight
AdaLOMO arXiv'2310 AdaLomo: Low-memory Optimization with Adaptive Learning Rate Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
ICML'23 SGD with Large Step Sizes Learns Sparse Features Link Learning Rate Scheduling Stability-Aware Adaptive Scheduling
look around NeurIPS'23 Lookaround Optimizer: k steps around, 1 step average Link Loss Landscape Optimization Weight Averaging
GAM CVPR'23 Gradient Norm Aware Minimization Seeks First-Order Flatness and ImprovesGeneralization Link Loss Landscape Optimization Curvature-Guided Landscape Exploration
AE-SAM ICLR'23 AN ADAPTIVE POLICY TO EMPLOY SHARPNESS-AWARE MINIMIZATION Link Loss Landscape Optimization Sharpness-Aware Minimization (SAM)
Aida TMLR'23 A DNN Optimizer that Improves over AdaBelief by Suppression of the Adaptive Stepsize Range Link Adaptive Learning Rate Methods Prediction Deviation Adaptation
Lion NeurIPS'23 Symbolic Discovery of Optimization Algorithms Link Adaptive Learning Rate Methods; Auto-Designed Optimizers Momentum-based Adaptive; Automated Discovery&Theoretical Derivation
AdamMC CVMI'23 Moment Centralization based Gradient Descent Optimizers for Convolutional Neural Networks Link Gradient Normalization & Clipping Mean-Removal Normalization
MultiAdam ICML'23 MultiAdam: Parameter-wise Scale-invariant Optimizer for Multiscale Training of Physics-informed Neural Networks Link Gradient Normalization & Clipping Layer-Wise Gradient Normalization
AdaNorm WACV'23 AdaNorm: Adaptive Gradient Norm Correction based Optimizer for CNNs Link Gradient Normalization & Clipping; Robust Optimization Element-Wise Gradient Scaling; Noise-Robust Normalization; Noise-Robust Gradients
AGD NeurIPS'23 AGD: an Auto-switchable Optimizer using Stepwise Gradient Difference for Preconditioning Matrix Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
RLEKF AAAI'23 RLEKF: An Optimizer for Deep Potential with Ab Initio Accuracy Link Adaptive Learning Rate Methods Kalman filtering based
Amos arXiv'2210 Amos: AN ADAM-STYLE OPTIMIZER WITH ADAPTIVE WEIGHT DECAY TOWARDS MODEL-ORIENTED SCALE Link Learning Rate Scheduling Scheduler-Free Adaptation
AdaBFE arXiv'2207 BFE and AdaBFE: A New Approach in Learning Rate Automation for Stochastic Optimization Link Learning Rate Scheduling; Stateless Optimization Methods Gradient Angle Scheduling; Parameter Characteristic-Driven Updates
DP-SGD arXiv'2206 Normalized/Clipped SGD with Perturbation for Differentially Private Non-Convex Optimization Link Gradient Normalization & Clipping Basic Fixed Gradient Clipping
AdamFamily arXiv'2203 AdaFamily: A family of Adam-like adaptive gradient methods Link Adaptive Learning Rate Methods Hybrid Adaptive Strategy
SRSGD SIAM IMS'22 Scheduled Restart Momentum for Accelerated Stochastic Gradient Descent Link Momentum-Enhanced SGD Scheduled Momentum Reset
Step-Tuned SGD NPL'22 Second-order step-size tuning of SGD for non-convex optimization Link Learning Rate Scheduling Scheduler-Free Adaptation
AEGDM AAM'22 AN ADAPTIVE GRADIENT METHOD WITH ENERGY AND MOMENTUM Link Adaptive Learning Rate Methods Stateless Adaptation
AdaInject ITAI'22 AdaInject: Injection Based Adaptive Gradient Descent Optimizers for Convolutional Neural Networks Link Adaptive Learning Rate Methods Momentum-based Adaptive
KOALA AAAI'22 KOALA: A Kalman Optimization Algorithm with Loss Adaptivity Link Adaptive Learning Rate Methods Kalman filtering based
ESAM ICLR'22 EFFICIENT SHARPNESS-AWARE MINIMIZATION FOR IMPROVED TRAINING OF NEURAL NETWORKS Link Loss Landscape Optimization Sharpness-Aware Minimization (SAM)
MADGRAD JMLR'22 Adaptivity without Compromise: A Momentumized, Adaptive, Dual Averaged Gradient Method for Stochastic Optimization Link Momentum-Enhanced SGD; Hybrid Methods Accelerated Momentum; Multi-Objective Hybrid
GDA-AM ICLR'22 GDA-AM: On the effectiveness of solving minimax optimization via Anderson Acceleration Link Hybrid Methods Multi-Objective Hybrid
AdamD arXiv'2110 AdamD: Improved bias-correction in Adam Link Adaptive Learning Rate Methods Bias Correction Rules Adaptaion
AdaL arXiv'2107 AdaL: Adaptive Gradient Transformation Contributes to Convergences and Generalizations Link Adaptive Learning Rate Methods Hybrid Adaptive Strategy
AngularGrad arXiv'2105 AngularGrad: A New Optimization Technique for Angular Convergence of Neural Networks Link Momentum-Enhanced SGD Momentum-Gradient Alignment
SGD-G2 ICPR'21 Stochastic Runge-Kutta methods and adaptive SGD-G2 stochastic gradient descent Link Learning Rate Scheduling Scheduler-Free Adaptation
SQuARM-SGD JSAIT'21 SQuARM-SGD: Communication-Efficient Momentum SGD for Decentralized Optimization Link Momentum-Enhanced SGD; Local Update Strategies; Distributed Hybrid Optimization Accelerated Momentum; Local SGD; Local Momentum Updates; Compression & Local Updates
SAM ICLR'21 Sharpness-Aware Minimization for Efficiently Improving Generalization Link Loss Landscape Optimization Sharpness-Aware Minimization (SAM)
AvaGrad CVPR'21 Domain-independent Dominance of Adaptive Methods Link Adaptive Learning Rate Methods Decoupled Learning Rate and Adaptability
Madam ECML'21 MaxVA: Fast Adaptation of Step Sizes by Maximizing Observed Variance of Gradients Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
ACMo AAAI'21 ACMO: ANGLE-CALIBRATED MOMENT METHODS FOR STOCHASTIC OPTIMIZATION Link Learning Rate Scheduling Gradient Angle Scheduling
AdamP / SGDP ICLR'21 AdamP: Slowing Down the Slowdown for Momentum Optimizers on Scale-invariant Weights Link Momentum-Enhanced SGD; Hybrid Methods Momentum Damping Mechanism; Projection Gradient Hybrid
ACProp NeurIPS'21 Momentum Centering and Asynchronous Update for Adaptive Gradient Methods Link Adaptive Learning Rate Methods Hybrid Adaptive Strategy
Adam+ arXiv'2011 Adam+: A Stochastic Method with Adaptive Variance Reduction Link Adaptive Learning Rate Methods Momentum-based Adaptive
EAdam arXiv'2011 EAdam Optimizer: How ∈ Impact Adam Link Adaptive Learning Rate Methods Dynamic Epsilon Adjustment
AdaSGD arXiv'2006 AdaSGD: Bridging the gap between SGD and Adam Link Adaptive Learning Rate Methods; Hybrid Methods Hybrid Adaptive Strategy; SGD-Adam Hybrid
ADAS arXiv'2006 ADAS: ADAPTIVE SCHEDULING OF STOCHASTIC GRADIENTS Link Learning Rate Scheduling Scheduler-Free Adaptation
LaProp arXiv'2002 LaProp: Separating Momentum and Adaptivity in Adam Link Adaptive Learning Rate Methods
Multistage SGDM NeurIPS'20 An Improved Analysis of Stochastic Gradient Descent with Momentum Link Learning Rate Scheduling Stability-Aware Adaptive Scheduling
pbSGD IJCAI'20 pbSGD: Powered Stochastic Gradient Descent Methods for Accelerated Non-Convex Optimization Link Gradient Normalization & Clipping Element-Wise Gradient Scaling
clipped-SGD NeurIPS'20 Stochastic Optimization with Heavy-Tailed Noise via Accelerated Gradient Clipping Link Gradient Normalization & Clipping Basic Fixed Gradient Clipping
Cayley SGD ICLR'20 EFFICIENT RIEMANNIAN OPTIMIZATION ON THE STIEFEL MANIFOLD VIA THE CAYLEY TRANSFORM Link Hybrid Methods Projection Gradient Hybrid
NIGT ICML'20 Momentum Improves Normalized SGD Link Gradient Normalization & Clipping Noise-Robust Normalization
AdaBelief NeurIPS'20 AdaBelief Optimizer: Adapting Stepsizes by the Belief in Observed Gradients Link Adaptive Learning Rate Methods Second-Order Moment Adaptation; Prediction Deviation Adaptation
RAdam ICLR'20 On the Variance of the Adaptive Learning Rate and Beyond Link Adaptive Learning Rate Methods Momentum-based Adaptive
AdamBS NeurIPS'20 Adam with Bandit Sampling for Deep Learning Link Hybrid Methods Multi-Objective Hybrid
DEAM ASONAM'20 DEAM: Adaptive Momentum with Discriminative Weight for Stochastic Optimization Link Momentum-Enhanced SGD Dynamic Momentum Weight
LAMB ICLR'20 Large Batch Optimization for Deep Learning: Training BERT in 76 minutes Link Adaptive Learning Rate Methods; Learning Rate Scheduling Layer-Wise Adaptation; Batch-Aware Scheduling
ADASS arXiv'1906 ADASS: Adaptive Sample Selection for Training Acceleration Link Hybrid Methods Gradient Filtering Hybrid
NovoGrad arXiv'1905 Stochastic Gradient Methods with Layer-wise Adaptive Moments for Training of Deep Networks Link Adaptive Learning Rate Methods Layer-Wise Adaptation
AdamW / SGDW ICLR'19 Decoupled Weight Decay Regularization Link Adaptive Learning Rate Methods
QHadam ICLR'19 QUASI-HYPERBOLIC MOMENTUM AND ADAM FORDEEP FOR DEEP LEARNING Link Adaptive Learning Rate Methods
HAdam NeurIPS'19 On Higher-order Moments in Adam Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
diffGrad TNNLS'19 diffGrad: An Optimization Method for Convolutional Neural Networks Link Adaptive Learning Rate Methods Hybrid Adaptive Strategy
NosAdam IJCAI'19 Nostalgic Adam: Weighting more of the past gradients when designing the adaptive learning rate Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
Lookahead NeurIPS'19 Lookahead Optimizer: k steps forward, 1 step back Link Hybrid Methods Multi-Objective Hybrid
AdaBound ICLR'19 Adaptive Gradient Methods with Dynamic Bound of Learning Rate Link Learning Rate Scheduling Element-Wise Learning Rate Scheduling
LazyOptimizer Blog'19 Link Momentum-Enhanced SGD Scheduled Momentum Reset
YOGI NeurIPS'18 Adaptive Methods for Nonconvex Optimization Link Momentum-Enhanced SGD Double-momentum mechanism
VR-SGD TKDE'18 VR-SGD: A Simple Stochastic Variance Reduction Method for Machine Learning Link Hybrid Methods Gradient Filtering Hybrid
Shampoo ICML'18 Shampoo: Preconditioned Stochastic Tensor Optimization Link Preconditioned Gradient Methods Two Metrics' Preconditioner
MSVAG ICML'18 DissectingAdam:TheSign,MagnitudeandVarianceofStochasticGradients Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
PIDOptimizer CVPR'18 A PID Controller Approach for Stochastic Optimization of Deep Networks Link Momentum-Enhanced SGD Momentum Damping Mechanism
LARS arXiv'1708 Large batch training of Convolutional Network Link Adaptive Learning Rate Methods Layer-Wise Adaptation
NAdam ICLR'16 WS Incorporating Nesterov Momentum into Adam Link Adaptive Learning Rate Methods Momentum-based Adaptive
Adam ICLR'15 ADAM: A METHOD FOR STOCHASTIC OPTIMIZATION Link Adaptive Learning Rate Methods
SGDM ICML'13 On the importance of initialization and momentum in deep learning Link Momentum-Enhanced SGD Accelerated Momentum
AdaDelta arXiv'1212 ADADELTA:ANADAPTIVELEARNINGRATEMETHOD Link Adaptive Learning Rate Methods Second-Order Moment Adaptation
AdaGrad JMLR'11 Adaptive Subgradient Methods for Online Learning and Stochastic Optimization Link Adaptive Learning Rate Methods Second-Order Moment Adaptation

⚙️ Second-Order Algorithms

Abbreviation Venue & Year Paper Title Project Sub-methods Fine-grained Methods
Two-Sided L-BFGS arXiv'2607 On the Condition Number Upper Bound of the L-BFGS Inverse Hessian Approximation Matrix with a Two-Sided Geometric Envelope Safeguarding Mechanism Link Quasi-Newton Methods Condition-Number Safeguarded L-BFGS
C-ALADIN arXiv'2606 A Global Convergence Analysis of Consensus ALADIN for Convex Optimization Link Hessian Approximation & Estimation Distributed Newton-Type Approximation
S-BFGS arXiv'2507 EFFICIENT STOCHASTIC BFGS METHODS INSPIRED BY BAYESIAN PRINCIPLES Link Quasi-Newton Methods Stochastic BFGS
MAC arXiv'2506 MAC: AN EFFICIENT GRADIENT PRECONDITIONING USING MEAN ACTIVATION APPROXIMATED CURVATURE Link Fisher Information Matrix Application Curvature-Aware Approximation
RACS arXiv'2502 Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension Link Fisher Information Matrix Application Diagonal Fisher Approximation
OCAR arXiv'2502 Online Curvature-Aware Replay: Leveraging 2nd Order Information for Online Continual Learning Link Fisher Information Matrix Application Diagonal Fisher Approximation
FUSE-PV CAI'25 FUSE: First-Order and Second-Order Unified SynthEsis in Stochastic Optimization Link Quasi-Newton Methods Stochastic BFGS
SASSHA ICML'25 SASSHA: Sharpness-aware Adaptive Second-order Optimization with Stable Hessian Approximation Link Hessian Approximation & Estimation Diagonal Hessian Approximation
AdaFisher ICLR'25 ADAFISHER: ADAPTIVE SECOND ORDER OPTIMIZATION VIA FISHER INFORMATION Link Fisher Information Matrix Application Diagonal Fisher Approximation; Block-Diagonal Kronecker Approximation
OptiQ arXiv'2410 Second-Order Optimization via Quiescence Link Curvature-Guided Preconditioning Hessian Diagonal Preconditioning
SOAA arXiv'2410 EFFICIENT SECOND-ORDER NEURAL NETWORK OPTIMIZATION VIA ADAPTIVE TRUST REGION METHODS Link Fisher Information Matrix Application Diagonal Fisher Approximation
CRNAS arXiv'2407 Novel Optimization Techniques for Parameter Estimation Link Hessian Approximation & Estimation Diagonal Hessian Approximation
Athena arXiv'2405 Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information Link Hessian Approximation & Estimation Block Hessian Approximation
Q-Newton arXiv'2405 Q-Newton: Hybrid Quantum-Classical Scheduling for Accelerating Neural Network Training with Newton’s Gradient Descent Link Hessian Approximation & Estimation Block Hessian Approximation
SkechySGD SIAM'24 SketchySGD: Reliable Stochastic Optimization via Randomized Curvature Estimates Link Hessian Approximation & Estimation Stochastic Hessian Sampling
sophia ICLR'24 Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training Link Hessian Approximation & Estimation; Curvature-Guided Preconditioning; Second-Order Moment Fusion; Privacy-Aware Gradient Clipping; Stateless Optimization Methods Diagonal Hessian Approximation; Hessian Diagonal Preconditioning; Noise-Robust Second-Order Momentum; Real-Time Curvature Estimation
Fed-Sophia ICC'24 Fed-Sophia: A Communication-Efficient Second-Order Federated Learning Algorithm Link Hessian Approximation & Estimation; Federated Learning Optimization Diagonal Hessian Approximation; Federated Second-Order Optimization
HesScale ICML'24 Revisiting Scalable Hessian Diagonal Approximations for Applications in Reinforcement Learning Link Hessian Approximation & Estimation Diagonal Hessian Approximation
mL-BFGS TMLR'23 mL-BFGS: A Momentum-based L-BFGS for Distributed Large-Scale Neural Network Optimization Link Quasi-Newton Methods Stochastic BFGS; Low-Memory Quasi-Newton
SGDHess NeurIPS'22 Better SGD using Second-order Momentum Link Hessian Approximation & Estimation Gradient Difference Estimation
AdaHessian AAAI'21 AdaHessian: An Adaptive Second Order Optimizer for Machine Learning Link Hessian Approximation & Estimation; Second-Order Moment Fusion Diagonal Hessian Approximation; Noise-Robust Second-Order Momentum
TKFAC AAAI'21 A Trace-restricted Kronecker-Factored Approximation to Natural Gradient Link Fisher Information Matrix Application Trace-Preserving Fisher Approximation
SGN arXiv'2006 On the Promise of the Stochastic Generalized Gauss-Newton Method for Training DNNs Link Hessian Approximation & Estimation Stochastic Hessian Sampling
SpiderSQN IFAC-Pap.'20 A FAST QUASI-NEWTON-TYPE METHOD FOR LARGESCALE STOCHASTIC OPTIMISATION Link Quasi-Newton Methods Stochastic BFGS
K-BFGS and K-BFGS(L), NeurIPS'20 Practical Quasi-Newton Methods for Training Deep Neural Networks Link Quasi-Newton Methods Low-Memory Quasi-Newton
K-FAC ICML'15 Optimizing Neural Networks with Kronecker-factored Approximate Curvature Link Fisher Information Matrix Application Block-Diagonal Kronecker Approximation
Natural Gradient Neural Comput.'1998 Natural gradient works efficiently in learning Fisher Information Matrix Application
BFGS SIAM SC'1995 A limited memory algorithm for bound constrained optimization Quasi-Newton Methods
Newton's Method ANL'1982 Newton's method Hessian Approximation & Estimation
L-BFGS Math.Comput.'1980 Updating quasi-newton matrices with limited storage Quasi-Newton Methods Stochastic BFGS
Gauss-Newton Method Biometrika'1974 Quasi-Likelihood Functions, Generalized Linear Models, and the Gauss-Newton Method Hessian Approximation & Estimation

📍 Zeroth-Order Algorithms

Abbreviation Venue & Year Paper Title Project Sub-methods Fine-grained Methods
ZO-Act arXiv'2607 ZO-Act: Efficient Zeroth-Order Fine-Tuning via One-Shot Activation-Informed Low-Rank Subspaces Link Memory-efficient Methods; Low-Rank Methods Activation-Informed Low-Rank Subspaces
AdaMeZO arXiv'2605 AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments Link Adaptive Methods
MEAZO arXiv'2605 On Adaptivity in Zeroth-Order Optimization Link Memory-Efficient Methods
ZO-SAH arXiv'2507 Subspace-based Approximate Hessian Method for Zeroth-Order Optimization Link Adaptive Methods Projection-based Adaptive
FZOO arXiv'2506 FZOO: Fast Zeroth-Order Optimizer for Fine-Tuning Large Language Models towards Adam-Scale Speed Link Variance Reduction Structured Variance Control
VR-SZD arXiv'2506 A Structured Proximal Stochastic Variance Reduced Zeroth-order Algorithm Link Variance Reduction Snapshot Variance Reduction
KerZOO arXiv'2505 KerZOO: Kernel Function Informed Zeroth-Order Optimization for Accurate and Accelerated LLM Fine-Tuning Link Memory-efficient Methods Inference-Level Memory Zeroth-Order
QZO arXiv'2505 Fine-tuning Quantized Neural Networks with Zeroth-order Optimization Link Memory-efficient Methods Quantized Zeroth-Order Finetuning
VAMO arXiv'2505 VAMO: Efficient Large-Scale Nonconvex Optimization via Adaptive Zeroth Order Variance Reduction Link Zeroth-First Order Hybrid; Variance Reduction Variance Reduction Hybrid; Snapshot Variance Reduction
ZO2 arXiv'2503 ZO2: Scalable Zeroth-Order Fine-Tuning for Extremely Large Language Models with Limited GPU Memory Link Memory-efficient Methods Inference-Level Memory Zeroth-Order
LORENZA arXiv'2502 LORENZA: Enhancing Generalization in Low-Rank Gradient LLM Training and Fine-Tuning via Efficient Zeroth-Order Adaptive SAM Optimization Link Adaptive Methods Momentum-based Adaptive; Low-Rank Adaptive
QuZO arXiv'2502 QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models Link Memory-efficient Methods; Low-Rank Methods Quantized Zeroth-Order Finetuning; Low-Rank & Quantization
MaZO arXiv'2502 MaZO: Masked Zeroth-Order Optimization for Multi-Task Fine-Tuning of Large Language Models Link Memory-efficient Methods Sparse Parameter Zeroth-Order
DiZO arXiv'2502 Harmony in Divergence: Towards Fast, Accurate, and Memory-efficient Zeroth-order LLM Fine-tuning Link Adaptive Methods Projection-based Adaptive
TeZO arXiv'2501 TeZO: Empowering the Low-Rankness on the Temporal Dimension in the Zeroth-Order Optimization for Fine-tuning LLMs Link Memory-efficient Methods Low-Rank Zeroth-Order Finetuning
ELASTICZO arXiv'2501 ELASTICZO: A MEMORY-EFFICIENT ON-DEVICE LEARNING WITH COMBINED ZEROTH- AND FIRST-ORDER OPTIMIZATION Link Zeroth-First Order Hybrid Layer-Wise Hybrid
LOZO ICLR'25 Enhancing zeroth-order fine-tuning for language models with low-rank structures Link Memory-efficient Methods Low-Rank Zeroth-Order Finetuning
Addax ICLR'25 Addax: Utilizing Zeroth-Order Gradients to Improve Memory Efficiency and Performance of SGD for Fine-Tuning Language Models Link Zeroth-First Order Hybrid Weighted Hybrid
ZOQO ICASSP'25 ZOQO: Zero-Order Quantized Optimization Link Memory-efficient Methods Quantized Zeroth-Order Finetuning
R-AdaZO ICML'25 Refining Adaptive Zeroth-Order Optimization at Ease Link Adaptive Method Momentum-based Adaptive
ZO-AdaMM NeurIPS'25 Zeroth-Order Adaptive Momentum Method for Black-Box Optimization Link Adaptive Methods Momentum-based Adaptive
LeZO arXiv'2410 SIMULTANEOUS COMPUTATION AND MEMORY EFFICIENT ZEROTH-ORDER OPTIMIZER FOR FINE-TUNING LARGE LANGUAGE MODELS Link Perturbation Optimization; Memory-efficient Methods; Memory-Efficient Fine-Tuning for Large Models Sparse Perturbation; Sparse Parameter Zeroth-Order; Selective Parameter Fine-Tuning
SuZero arXiv'2410 Zeroth-Order Fine-Tuning of LLMs in Random Subspaces Link Memory-efficient Methods Low-Rank Zeroth-Order Finetuning
Sparse MeZO arXiv'2402 Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning Link Perturbation Optimization; Memory-efficient Methods; Memory-Efficient Fine-Tuning for Large Models Sparse Perturbation; Sparse Parameter Zeroth-Order; Selective Parameter Fine-Tuning
MeZO-SVRG ICLR'24 Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models Link Variance Reduction Snapshot Variance Reduction
ZO-AdaMU AAAI'24 ZO-AdaMU Optimizer: Adapting Perturbation by the Momentum and Uncertainty in Zeroth-order Optimization Link Perturbation Optimization; Memory-efficient Methods Paired Perturbation Sampling; Inference-Level Memory Zeroth-Order
ZoPro CDC'24 A Zeroth-Order Proximal Algorithm for Consensus Optimization Link Distributed Zero-Order Optimization Distributed Perturbation Sampling
MeZO NeurIPS'23 Fine-Tuning Language Models with Just Forward Passes Link Memory-efficient Methods Inference-Level Memory Zeroth-Order
TOP-DP IEEE Trans'21 Topology-aware Differential Privacy for Decentralized Image Classification Link Distributed Zero-Order Optimization; Differential Privacy Optimization Privacy-Preserving Zeroth-Order; DP-SGD Variants; Dynamic Noise Scheduling; Privacy-Utility Balance
SPSA ACC'01 Global random optimization by simultaneous perturbation stochastic approximation Perturbation Optimization Paired Perturbation Sampling

🌐 Distributed Optimization

Abbreviation Venue & Year Paper Title Project Sub-methods Fine-grained Methods
FedSpeechLLM arXiv'2607 SpeechLLM Meets Federated Learning for End-to-End ASR: English and Italian Case Studies Link Federated Learning Optimization SpeechLLM Federated Aggregation
PowerScale arXiv'2607 PowerScale: Energy-Efficient Geo-Distributed Model Training with Federated Datacenter Power Link Decentralized Communication Hierarchical Geo-Distributed Aggregation
CHARGE-FL arXiv'2607 Channel-Adaptive Robust Aggregation for Over-the-Air Federated Learning in Heterogeneous Networks Link Federated Learning Optimization Channel-Adaptive OTA Aggregation
FedFFT arXiv'2607 FedFFT: Taming Client Drift in Federated SAM via Spectral Perturbation Filtering Link Federated Learning Optimization Spectral Perturbation Filtering
FedACT arXiv'2607 FedACT: Federated Adaptive Coordinate Trust Modulation for Robust Transformer Training under Data Heterogeneity Link Federated Learning Optimization Coordinate Trust Modulation
DMuon arXiv'2606 DMuon: Efficient Distributed Muon Training with Near-Adam Overhead Link Distributed Hybrid Optimization Distributed Matrix Orthogonalization
VRA-FedSGD arXiv'2606 Federated learning with heavy-tailed gradient noise and communication noise: a variance-reduction based algorithm Link Federated Learning Optimization Variance-Reduced Federated SGD
MP-CA-SGD arXiv'2606 Mixed-Precision Communication-Avoiding SGD for Generalized Linear Models on GPUs Link Gradient Compression & Quantization Mixed-Precision Communication Avoidance
AlignFed arXiv'2606 AlignFed: Alignment-Aware Asynchronous Federated Fine-Tuning for Large Language Models in Heterogeneous Edge Environments Link Federated Learning Optimization Asynchronous Federated Aggregation
DECA arXiv'2606 DECA: Decentralizing Block-Wise Adam for Efficient LLM Full-Parameter Fine-Tuning on Non-IID Data Link Federated Learning Optimization Block-Wise Decentralized Adam
FedSIR arXiv'2604 FedSIR: Spectral Client Identification and Relabeling for Federated Learning with Noisy Labels Link Federated Learning Optimization
Ringleader ASGD arXiv'2601 First Provably Optimal Asynchronous SGD for Homogeneous and Heterogeneous Data Link Local Update Strategies Local-global hybrid updates
FedMuon arXiv'2510 FedMuon: Accelerating Federated Learning with Matrix Orthogonalization Link Federated Learning Optimization Federated Momentum Fusion
DLAS-R-FTC arXiv'2508 Distributed Optimization and Learning for Automated Stepsize Selection with Finite Time Coordination Link Decentralized Communication Distributed Consensus Optimization
DOME arXiv'2507 Communication Efficient, Differentially Private Distributed Optimization using Correlation-Aware Sketching Link Gradient Compression & Quantization Low-Rank Gradient Compression
Deco-SGD arXiv'2507 DeCo-SGD: Joint Optimization of Delay Staleness and Gradient Compression Ratio for Distributed SGD Link Gradient Compression & Quantization; Local Update Strategies Adaptive Compression Level; Local-Global Hybrid Updates
TAH-QUANT arXiv'2506 TAH-QUANT: Effective Activation Quantization in Pipeline Parallelism over Slow Network Link Gradient Compression & Quantization Quantization Compression
LQ-SGD arXiv'2506 Trustworthy Efficient Communication for Distributed Learning using LQ-SGD Algorithm Link Gradient Compression & Quantization; Low-Rank Methods Quantization Compression; Low-Rank & Quantization
FedCurv arXiv'2506 Blockchain-Enabled Privacy-Preserving Second-Order Federated Edge Learning in Personalized Healthcare Link Federated Learning Optimization Federated Second-Order Optimization
pFedSOP arXiv'2506 pFedSOP : Accelerating Training Of Personalized Federated Learning Using Second-Order Optimization Link Federated Learning Optimization Federated Second-Order Optimization
FedOne arXiv'2506 FedOne: Query-Efficient Federated Learning for Black-box Discrete Prompt Learning Link Federated Learning Optimization Client Sampling Optimization
DEC-LOC arXiv'2505 DES-LOC: Desynced Low Communication Adaptive Optimizers for Training Foundation Models Link Decentralized Communication Distributed Consensus Optimization
Kuramoto-FedAvg arXiv'2505 Kuramoto-FedAvg: Using Synchronization Dynamics to Improve Federated Learning Optimization under Statistical Heterogeneity Link Federated Learning Optimization Federated Momentum Fusion
AbsSADMM arXiv'2505 Stochastic ADMM with batch size adaptation for nonconvex nonsmooth optimization Link Local Update Strategies Adaptive Local Steps
ADEF arXiv'2503 Accelerated Distributed Optimization with Compression and Error Feedback Link Gradient Compression & Quantization Compression Error Compensation
FedCET arXiv'2503 Communication Efficient Federated Learning with Linear Convergence on Heterogeneous Data Link Local Update Strategies Adaptive Local Steps
Interleaved-ShuffleG arXiv'2502 The Cost of Shuffling in Private Gradient Based Optimization Link Decentralized Communication; Differential Privacy Optimization Privacy-Preserving Decentralization; Privacy-Utility Balance
FAdamGC arXiv'2502 Gradient Correction in Federated Learning with Adaptive Optimization Link Federated Learning Optimization Client Sampling Optimization
LT-ADMM arXiv'2501 Communication-Efficient Stochastic Distributed Learning Link Decentralized Communication Distributed Consensus Optimization
HybridSGD arXiv'2501 Communication-Efficient, 2D Parallel Stochastic Gradient Descent for Distributed-Memory Optimization Link Local Update Strategies Local-Global Hybrid Updates
DAT-SGD ICML'25 Enhancing Parallelism in Decentralized Stochastic Convex Optimization Link Decentralized Communication Neighbor Communication Topology
FedSTaS arXiv'2412 FedSTaS: Client Stratification and Client Level Sampling for Efficient Federated Learning Link Federated Learning Optimization Client Sampling Optimization
FedIvon arXiv'2411 Federated Learning with Uncertainty and Personalization via Efficient Second-order Optimization Link Federated Learning Optimization Personalized Federated Optimization
FAGH arXiv'2403 FAGH: Accelerating Federated Learning with Approximated Global Hessian Link Federated Learning Optimization Federated Second-Order Optimization
AdaFedAdam TMLCN'24 ACCELERATING FAIR FEDERATED LEARNING: ADAPTIVE FEDERATED ADAM Link Federated Learning Optimization Federated Momentum Fusion
MM-PSGD MMAsia'24 Distributed Optimization over Block-Cyclic Data Link Federated Learning Optimization Personalized Federated Optimization
MC-PSGD MMAsia'24 Distributed Optimization over Block-Cyclic Data Link Federated Learning Optimization Personalized Federated Optimization
FedLion ICASSP'24 FEDLION: FASTER ADAPTIVE FEDERATED OPTIMIZATION WITH FEWER COMMUNICATION Link Federated Learning Optimization Federated Momentum Fusion
FADAS ICML'24 FADAS: Towards Federated Adaptive Asynchronous Optimization Link Federated Learning Optimization Federated Momentum Fusion
FLeNS BigData'24 FLeNS: Federated Learning with Enhanced Nesterov-Newton Sketch Link Federated Learning Optimization Federated Momentum Fusion
FedRepOpt ACCV'24 FedRepOpt: Gradient Re-parametrized Optimizers in Federated Learning Link Federated Learning Optimization Federated Momentum Fusion
Fed-Sophia ICC'24 Fed-Sophia: A Communication-Efficient Second-Order Federated Learning Algorithm Link Hessian Approximation & Estimation; Federated Learning Optimization Diagonal Hessian Approximation; Federated Second-Order Optimization
FedLAP-DP arXiv'2302 FedLAP-DP: Federated Learning by Sharing Differentially Private Loss Approximations Link Decentralized Communication Privacy-Preserving Decentralization
AdaCGD TMLR'23 Adaptive Compression for Communication-Efficient Distributed Training Link Gradient Compression & Quantization Adaptive Compression Level
0/1 Adam ICLR'23 Maximizing Communication Efficiency for Large-scale Training via 0/1 Adam Link Gradient Compression & Quantization Quantization Compression
SketchedAMSGrad ICDM'22 Communication-Efficient Adam-Type Algorithms for Distributed Data Mining Link Gradient Compression & Quantization Low-Rank Gradient Compression
SPARQ-SGD TAC'22 SPARQ-SGD: Event-Triggered and Compressed Communication in Decentralized Stochastic Optimization Link Gradient Compression & Quantizatio Sparsification Compression
1-bit Adam ICML'21 1-bit Adam: Communication Efficient Large-Scale Training with Adam’s Convergence Speed Link Gradient Compression & Quantization Quantization Compression
BVR-L-SGD ICML'21 Bias-Variance Reduced Local SGD for Less Heterogeneous Federated Learning Link Local Update Strategies Local SGD
A(DP)^2SGD TPAMI'21 A(DP)^2SGD: Asynchronous Decentralized Parallel Stochastic Gradient Descent with Differential Privacy Link Decentralized Communication Neighbor Communication Topology
SQuARM-SGD JSAIT'21 SQuARM-SGD: Communication-Efficient Momentum SGD for Decentralized Optimization Link Momentum-Enhanced SGD; Local Update Strategies; Distributed Hybrid Optimization Accelerated Momentum; Local SGD; Local Momentum Updates; Compression & Local Updates
DLCP arXiv'2008 Domain-specific Communication Optimization for Distributed DNN Training Link Local Update Strategies Local SGD
APMSqueeze arXiv'2008 APMSqueeze: A Communication Efficient Adam-Preconditioned Momentum SGD Algorithm Link Gradient Compression & Quantization Compression Error Compensation
DEED-GD arXiv'2006 DEED: A General Quantization Scheme for Communication Efficiency in Bits Link Gradient Compression & Quantization Quantization Compression
DP-PASGD arXiv'2003 Differentially Private Federated Learning for Resource-Constrained Internet of Things Link Local Update Strategies Adaptive Local Steps
LAGS-SGD ECAI'20 Layer-wise Adaptive Gradient Sparsification for Distributed Deep Learning with Convergence Guarantees Link Gradient Compression & Quantization Adaptive Compression Level
FedAC NeurIPS'20 Federated Accelerated Stochastic Gradient Descent Link Federated Learning Optimization Federated Momentum Fusion
rTop-k JSAIT'20 rTop-k: A Statistical Estimation Approach to Distributed SGD Link Gradient Compression & Quantization Sparsification Compression
Qsparse-local-SGD JSAIT'20 Qsparse-local-SGD: Distributed SGD with Quantization, Sparsification, and Local Computations Link Distributed Hybrid Optimization Compression & Local Updates
SLOWMO ICLR'20 SLOWMO: IMPROVING COMMUNICATION-EFFICIENT DISTRIBUTED SGD WITH SLOW MOMENTUM Link Local Update Strategies Local SGD
SCAFFOLD ICML'20 SCAFFOLD: Stochastic Controlled Averaging for Federated Learning Link Local Update Strategies Local SGD
LD-SGD arXiv'1910 Communication-Efficient Local Decentralized SGD Methods Link Decentralized Communication Neighbor Communication Topology
PowerSGD NeurIPS'19 PowerSGD: Practical Low-Rank Gradient Compression for Distributed Optimization Link Gradient Compression & Quantization Low-Rank Gradient Compression
signProx ICASSP'19 signProx: One-Bit Proximal Algorithm for Nonconvex Stochastic Optimization Link Gradient Compression & Quantization Quantization Compression
signSGD ICML'18 signSGD: Compressed Optimisation for Non-Convex Problems Link Gradient Compression & Quantization Quantization Compression

🛡️ Privacy-Preserving Optimization

Abbreviation Venue & Year Paper Title Project Sub-methods Fine-grained Methods
DP-IVON-Gradsq arXiv'2607 DP-IVON-Gradsq: Differentially Private Squared-Gradient Improved Variational Online Newton Link Differential Privacy Optimization Noise-Corrected Curvature Estimation
DP-NGD arXiv'2607 Differentially Private Natural Gradient Descent Link Differential Privacy Optimization Curvature-Aware DP Preconditioning
HADES arXiv'2606 HADES: Privacy-Preserving Federated Learning via Selective Feature Encryption and Hybrid Model Fusion Link Federated Privacy Enhancement Selective Feature Encryption
PrivCode++ arXiv'2606 PrivCode++: Latent-Conditioned Differentially Private Code Generation for Comprehensive Guarantees Link Differential Privacy Optimization DP Fine-Tuning for Code Generation
DP-MacAdam arXiv'2606 DP-MacAdam: Differentially Private Mechanism with Adaptive Clipping and Adaptive Momentum Link Differential Privacy Optimization Adaptive Clipping and Momentum
DPSR-CG arXiv'2606 Revisiting Privacy Amplification by Subsampling in Selective Release DPSGD Link Differential Privacy Optimization Selective Release DP-SGD
PINA arXiv'2604 Differentially Private Clustered Federated Learning with Privacy-Preserving Initialization and Normality-Driven Aggregation Link Differential Privacy Optimization
DP-aware AdaLN-Zero arXiv'2602 DP-aware AdaLN-Zero: Taming Conditioning-Induced Heavy-Tailed Gradients in Differentially Private Diffusion Link Differential Privacy Optimization Dynamic noise scheduling
DP-λCGD arXiv'2601 DP-λCGD: Efficient Noise Correlation for Differentially Private Model Training Link Differential Privacy Optimization DP-SGD variants
RaCO-DP arXiv'2505 Private Rate-Constrained Optimization with Applications to Fair Learning Link Differential Privacy Optimization DP-SGD Variants
Interleaved-ShuffleG arXiv'2502 The Cost of Shuffling in Private Gradient Based Optimization Link Decentralized Communication; Differential Privacy Optimization Privacy-Preserving Decentralization; Privacy-Utility Balance
DPZV arXiv'2502 DPZV: Elevating the Tradeoff between Privacy and Utility in Zeroth-Order Vertical Federated Learning Link Gradient Noise Injection Noise-Robust Optimization
Stable-SPAM ICLR'25 Stable-SPAM: How to Train in 4-Bit More Stably than 16-Bit Adam Link Gradient Normalization & Clipping; Privacy-Aware Gradient Clipping Layer-Wise Gradient Normalization; Dynamic Gradient Clipping; Adaptive Clipping
GeoDP-SGD ICDE'25 Analyzing and Optimizing Perturbation of DP-SGD Geometrically Link Gradient Noise Injection Noise-Robust Optimization
Logit-DP ICLR'25 DIFFERENTIALLY PRIVATE OPTIMIZATION FOR NONDECOMPOSABLE OBJECTIVE FUNCTIONS Link Privacy-Aware Gradient Clipping Global Gradient Clipping
DOPPLER NeurIPS'25 DOPPLER: Differentially Private Optimizers with Low-pass Filter for Privacy Noise Reduction Link Differential Privacy Optimization DP-SGD Variants
DC-SGD TIFS'25 DC-SGD: Differentially Private SGD with Dynamic Clipping through Gradient Norm Distribution Estimation Link Differential Privacy Optimization; Gradient Noise Injection; Privacy-Utility Tradeoff; Privacy-Aware Gradient Clipping Dynamic Noise Scheduling; Dynamic Clipping Threshold; Adaptive Clipping
SPARTA KDD'25 SPARTA: An Optimization Framework for Differentially Private Sparse Fine-Tuning Link Differential Privacy Optimization DP-SGD Variants
DP-AdamW-BC ICML'25 DP-AdamW: Investigating Decoupled Weight Decay and Bias Correction in Private Deep Learning Link Differential Privacy Optimization DP-SGD Variants
DP-MicroAdam NeurIPS'25 DP-MicroAdam: Private and Frugal Algorithm for Training and Fine-tuning Link Differential Privacy Optimization DP-SGD Variants
AClipped-dpSGD Mach. Learn.'24 Efficient Private SCO for Heavy-Tailed Data via Averaged Clipping Link Privacy-Aware Gradient Clipping Global Gradient Clipping
sophia ICLR'24 Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training Link Hessian Approximation & Estimation; Curvature-Guided Preconditioning; Second-Order Moment Fusion; Privacy-Aware Gradient Clipping; Stateless Optimization Methods Diagonal Hessian Approximation; Hessian Diagonal Preconditioning; Noise-Robust Second-Order Momentum; Real-Time Curvature Estimation
ANSGD arXiv'2305 Learning across Data Owners with Joint Differential Privacy Link Differential Privacy Optimization DP-SGD Variants
DP-Adam ICLR'23 DP-ADAM: CORRECTING DP BIAS IN ADAM’S SECOND MOMENT ESTIMATION Link Differential Privacy Optimization; Gradient Noise Injection DP-SGD Variants; Noise-Robust Optimization
DP-FedSAM CVPR'23 Make Landscape Flatter in Differentially Private Federated Learning Link Gradient Noise Injection; Federated Privacy Enhancement Noise-Robust Optimization; Federated Noise Aggregation
DPIS CCS'22 DPIS: An Enhanced Mechanism for Differentially Private SGD with Importance Sampling Link Differential Privacy Optimization DP-SGD Variants
DP-SGD-JL NeurIPS'21 Fast and Memory Efficient Differentially Private-SGD via JL Projections Link Differential Privacy Optimization DP-SGD Variants
TOP-DP IEEE Trans'21 Topology-aware Differential Privacy for Decentralized Image Classification Link Distributed Zero-Order Optimization; Differential Privacy Optimization Privacy-Preserving Zeroth-Order; DP-SGD Variants; Dynamic Noise Scheduling; Privacy-Utility Balance
DP-LSSGD PMLR'20 DP-LSSGD: A Stochastic Optimization Method to Lift the Utility in Privacy-Preserving ERM Link Privacy-Utility Tradeoff Post-Processing Optimization

⚡ Memory-Efficient Optimization

Abbreviation Venue & Year Paper Title Project Sub-methods Fine-grained Methods
SkewAdam arXiv'2607 Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training Link Optimizer State Compression Tiered MoE Optimizer States
Ember arXiv'2607 Token Geometry Link Low-Memory Optimizer Design Token-Table State Compression
FORGE arXiv'2606 FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training Link Low-Memory Optimizer Design Register-Level Gradient Elimination
DL-ZO arXiv'2606 Dominant-Layer ZO: A Single Layer Dominates Zeroth-Order Fine-Tuning of LLMs Link Memory-efficient Methods Layer-Selective Fine-Tuning
SUMO arXiv'2505 SUMO: Subspace-Aware Moment-Orthogonalization for Accelerating Memory-Efficient LLM Training Link Low-Rank Gradient Storage Gradient Low-Rank Projection
AlphaGrad arXiv'2504 AlphaGrad: Non-Linear Gradient Normalization Optimizer Link Adaptive Learning Rate Methods; Low-Memory Optimizer Design; Stateless Optimization Methods Stateless Adaptation; Structural Redesign; Parameter Characteristic-Driven Updates
QuZO arXiv'2502 QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models Link Memory-efficient Methods; Low-Rank Methods Quantized Zeroth-Order Finetuning; Low-Rank & Quantization
GWT arXiv'2501 Wavelet Meets Adam: Compressing Gradients for Memory-Efficient Training Link Low-Rank Gradient Storage Gradient Low-Rank Projection
AdaRankGrad ICLR'25 Adarankgrad: Adaptive gradient-rank and moments for memory-efficient llms training and fine-tuning Link Low-Rank Methods Projection&Adjustment
Adam-mini ICLR'25 ADAM-MINI: USE FEWER LEARNING RATES TO GAIN MORE Link Low-Memory Optimizer Design Structural Redesign
SPAM ICLR'25 SPAM: SPIKE-AWARE ADAM WITH MOMENTUM RESET FOR STABLE LLM TRAINING Link Gradient Normalization & Clipping; Optimizer State Compression Element-Wise Gradient Scaling; Spike-Aware Gradient Clipping; Sparse State Compression
SGD-SaI arXiv'2412 No More Adam: Learning Rate Scaling at Initialization is All You Need Link Learning Rate Scheduling; Stateless Optimization Methods Initial Learning Rate Scaling; Parameter Characteristic-Driven Updates
A-GNB arXiv'2411 HELENE: HESSIAN LAYER-WISE CLIPPING AND GRADIENT ANNEALING FOR ACCELERATING FINETUNING LLM WITH ZEROTH-ORDER OPTIMIZATION Link Low-Rank Gradient Storage Dynamic Gradient Rank
LeZO arXiv'2410 SIMULTANEOUS COMPUTATION AND MEMORY EFFICIENT ZEROTH-ORDER OPTIMIZER FOR FINE-TUNING LARGE LANGUAGE MODELS Link Perturbation Optimization; Memory-efficient Methods; Memory-Efficient Fine-Tuning for Large Models Sparse Perturbation; Sparse Parameter Zeroth-Order; Selective Parameter Fine-Tuning
Adapprox arXiv'2403 Adapprox: Adaptive Approximation in Adam Optimization via Randomized Low-Rank Matrices Link Low-Rank Methods Projection&Adjustment
Sparse MeZO arXiv'2402 Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning Link Perturbation Optimization; Memory-efficient Methods; Memory-Efficient Fine-Tuning for Large Models Sparse Perturbation; Sparse Parameter Zeroth-Order; Selective Parameter Fine-Tuning
LOMO ACL'24 Full Parameter Fine-tuning for Large Language Models with Limited Resources Link Towards LLM Traning; Memory-Efficient Fine-Tuning for Large Models Real-Time Computation; Staless Fine-Tuning
MICROADAM NeurIPS'24 MICROADAM: Accurate Adaptive Optimization with Low Space Overhead and Provable Convergence Link Optimizer State Compression Sparse State Compression
4-bit shampoo NeurIPS'24 4-bit Shampoo for Memory-Efficient Network Training Link Preconditioned Gradient Methods; Low-Memory Optimizer Design Two Metrics' Preconditioner; Compression&Approximation of States
ADAACT ICDMW'24 AN ADAPTIVE METHOD STABILIZING ACTIVATIONS FOR ENHANCED GENERALIZATION Link Adaptive Learning Rate Methods; Optimizer State Compression Neuron-Level Adaptation; State Sharing
sophia ICLR'24 Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training Link Hessian Approximation & Estimation; Curvature-Guided Preconditioning; Second-Order Moment Fusion; Privacy-Aware Gradient Clipping; Stateless Optimization Methods Diagonal Hessian Approximation; Hessian Diagonal Preconditioning; Noise-Robust Second-Order Momentum; Real-Time Curvature Estimation
tpSGD SMC'23 Learning with Local Gradients at the Edge Link Low-Memory Optimizer Design Structural Redesign
AdaBFE arXiv'2207 BFE and AdaBFE: A New Approach in Learning Rate Automation for Stochastic Optimization Link Learning Rate Scheduling; Stateless Optimization Methods Gradient Angle Scheduling; Parameter Characteristic-Driven Updates
Adafactor ICML'18 Adafactor: Adaptive Learning Rates with Sublinear Memory Cost Link Low-Memory Optimizer Design; Optimizer State Compression Compression&Approximation of States; State Sharing

🧩 Tailored Optimization Approaches

Abbreviation Venue & Year Paper Title Project Sub-methods Fine-grained Methods
Tensorion arXiv'2606 Tensorion: A Tensor-Aware Generalization of the Muon Optimizer Link Hybrid Methods Tensor-Aware Matrix Orthogonalization
MAdam arXiv'2606 MAdam: Metric-Aware Multi-Objective Adam Link Hybrid Methods Multi-Objective Adaptive Strategy
KO arXiv'2505 KO: Kinetics-inspired Neural Optimizer with PDE Simulation Approaches Link Auto-Designed Optimizers Automated Discovery&Theoretical Derivation
BC-ADMM arXiv'2504 BC-ADMM: An Efficient Non-convex Constrained Optimizer with Robotic Applications Link Robust Optimization Structure-Aware Optimization
AdaGC arXiv'2502 AdaGC: Improving Training Stability for Large Language Model Pretraining Link Gradient Normalization & Clipping; Robust Optimization Noise-Robust Normalization; Dynamic Gradient Clipping; Noise-Robust Gradients
AGS-GD arXiv'2411 Anisotropic Gaussian Smoothing for Gradient-based Optimization Link Hybrid Methods; Auto-Designed Optimizers Gradient Smoothing Hybrid; Automated Discovery&Theoretical Derivation
WarpAdam arXiv'2409 WarpAdam: A new Adam optimizer based on Meta-Learning approach Link Auto-Designed Optimizers Evolutionary Strategies&Meta-Adaptive Learning
MADA ICML'24 MADA: Meta-Adaptive Optimizers through hyper-gradient Descent Link Auto-Designed Optimizers Evolutionary Strategies&Meta-Adaptive Learning
Lion NeurIPS'23 Symbolic Discovery of Optimization Algorithms Link Adaptive Learning Rate Methods; Auto-Designed Optimizers Momentum-based Adaptive; Automated Discovery&Theoretical Derivation
AdaNorm WACV'23 AdaNorm: Adaptive Gradient Norm Correction based Optimizer for CNNs Link Gradient Normalization & Clipping; Robust Optimization Element-Wise Gradient Scaling; Noise-Robust Normalization; Noise-Robust Gradients
BGADAM IJCNN'21 BGADAM: Boosting based Genetic-Evolutionary ADAM for Neural Network Optimization Link Auto-Designed Optimizers Evolutionary Strategies&Meta-Adaptive Learning
HyperAdam AAAI'19 HyperAdam: A Learnable Task-Adaptive Adam for Network Training Link Auto-Designed Optimizers Evolutionary Strategies&Meta-Adaptive Learning
GADAM arXiv'1805 GADAM: Genetic-Evolutionary ADAM for Deep Neural Network Optimization Link Auto-Designed Optimizers Evolutionary Strategies&Meta-Adaptive Learning

🔬Future Prospect

Challenges

  • ⚖️ Multi-objective Trade-off Bottlenecks: Optimizing large models often forces a choice between convergence speed, memory efficiency, and distributed scaling, which can sacrifice generalization, introduce latency, or exacerbate instability. The core challenge is breaking these interconnected bottlenecks under a unified framework.
  • 💾 Memory and Computational Overheads: Dense optimizer states create severe memory bottlenecks. Structural approximations, such as matrix inversions, significantly decrease global efficiency, and per-step computational latency often negates theoretical advantages in iteration count.
  • 🔊 Noise Amplification and Estimation Variance: Anisotropic loss landscapes heavily amplify stochastic mini-batch noise. Random perturbations used for directional gradients suffer from approximation variance that scales poorly with dimensionality, and privacy-preserving noise degrades gradient fidelity.

Trends

  • 🤖 Automated Symbolic Discovery: Shifting from fragile heuristic tuning to the automated generation of architecture-specific optimizers, enabling models to inherently navigate complex loss landscapes without manual intervention.
  • 🧮 Preconditioning and Orthogonalization: Leveraging structural gradient statistics for preconditioning or matrix orthogonalization (e.g., Kron and Muon) to overcome the representational bottlenecks of simple diagonal scaling and open novel parameter space pathways.

Opptunities

  • 🧩 Deep Integration of Multi-Order Algorithms: Moving beyond isolated algorithmic improvements by deeply integrating FO, SO, and ZO algorithms. The fundamental focus will shift from minimizing iteration complexity to improving global wall-clock efficiency.
  • 🧭 Dimensionality-Robust Subspace Projection: Discovering advanced subspace projection methods that safely constrain massive search spaces without prematurely restricting algorithmic access to high-quality global solutions.
  • ⚖️ State Fidelity Preservation: Designing future memory-efficient architectures to smoothly average out extreme gradient shocks without exceeding memory limits.

🔗Citation

If you find our survey and repository useful for your research project, please consider citing our paper:

@article{zhang2026evolution,
  title={Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations},
  author={Zhang, Tong and Zhang, Jiangning and Xue, Zhucun and Jiang, Juntao and Xu, Yicheng and Xu, Chengming and Hu, Teng and Xie, Xingyu and Hu, Xiaobin and Wang, Yabiao and others},
  journal={arXiv preprint arXiv:2604.12968},
  year={2026}
}

📫Contact

186368@zju.edu.cn

About

Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations

Resources

Contributing

Stars

36 stars

Watchers

2 watching

Forks

Releases

Packages

Contributors

Languages