-
Risk comparisons in linear regression: Implicit regularization dominates explicit regularization
JW, Peter Bartlett*, Sham Kakade*, Jason Lee*, Bin Yu*
COLT 2026 -
Seesaw: Accelerating training by balancing learning rate and batch size scheduling
Alexandru Meterez, Depen Morwani, JW, Costin-Andrei Oncescu, Cengiz Pehlevan, Sham Kakade
ICLR 2026 -
Memory-statistics tradeoff in continual learning with structural regularization
Haoran Li, JW, Vladimir Braverman
ICLR 2026 -
Large stepsizes accelerate gradient descent for regularized logistic regression
JW*, Pierre Marion*, Peter Bartlett
NeurIPS 2025 -
Improved scaling laws in linear regression via data reuse
Licong Lin, JW, Peter Bartlett
NeurIPS 2025 -
Minimax optimal convergence of gradient descent in logistic regression via large and adaptive stepsizes
Ruiqi Zhang, JW, Licong Lin, Peter Bartlett
ICML 2025 (journal version in JMLR 2026) -
Benefits of early stopping in gradient descent for overparameterized logistic regression
JW, Peter Bartlett*, Matus Telgarsky*, Bin Yu*
ICML 2025 -
Implicit bias of gradient descent for non-homogeneous deep networks
Yuhang Cai*, Kangjie Zhou*, JW, Song Mei, Michael Lindsey, Peter Bartlett
ICML 2025 -
How does critical batch size scale in pre-training?
Hanlin Zhang, Depen Morwani, Nikhil Vyas, JW, Difan Zou, Udaya Ghai, Dean Foster, Sham Kakade
ICLR 2025 -
Large stepsize gradient descent for non-homogeneous two-layer networks: Margin improvement and fast optimization
Yuhang Cai, JW, Song Mei, Michael Lindsey, Peter Bartlett
NeurIPS 2024 -
Scaling laws in linear regression: Compute, parameters, and data
Licong Lin, JW, Sham Kakade, Peter Bartlett, Jason Lee
NeurIPS 2024 -
In-context learning of a linear transformer block: Benefits of the MLP component and one-step GD initialization
Ruiqi Zhang, JW, Peter Bartlett
NeurIPS 2024 -
Large stepsize gradient descent for logistic loss: Non-monotonicity of the loss improves optimization efficiency
JW, Peter Bartlett*, Matus Telgarsky*, Bin Yu*
COLT 2024 -
How many pretraining tasks are needed for in-context learning of linear regression?
JW, Difan Zou, Zixiang Chen, Vladimir Braverman, Quanquan Gu, Peter Bartlett
ICLR 2024 (spotlight) -
Risk bounds of accelerated SGD for overparameterized linear regression
Xuheng Li, Yihe Deng, JW, Dongruo Zhou, Quanquan Gu
ICLR 2024 -
Implicit bias of gradient descent for logistic regression at the edge of stability
JW, Vladimir Braverman, Jason Lee
NeurIPS 2023 (spotlight) -
Private federated frequency estimation: Adapting to the hardness of the instance
JW, Wennan Zhu, Peter Kairouz, Vladimir Braverman
NeurIPS 2023 -
Fixed design analysis of regularization-based continual learning
Haoran Li*, JW*, Vladimir Braverman
CoLLAs 2023 -
Finite-sample analysis of learning high-dimensional single ReLU neuron
JW*, Difan Zou*, Zixiang Chen*, Vladimir Braverman, Quanquan Gu, Sham Kakade
ICML 2023 -
The power and limitation of pretraining-finetuning for linear regression under covariate shift
JW*, Difan Zou*, Vladimir Braverman, Quanquan Gu, Sham Kakade
NeurIPS 2022 -
Risk bounds of multi-pass SGD for least squares in the interpolation regime
Difan Zou*, JW*, Vladimir Braverman, Quanquan Gu, Sham Kakade
NeurIPS 2022 -
Last iterate risk bounds of SGD with decaying stepsize for overparameterized linear regression
JW*, Difan Zou*, Vladimir Braverman, Quanquan Gu, Sham Kakade
ICML 2022 (long presentation) -
Gap-dependent unsupervised exploration for reinforcement learning
JW, Vladimir Braverman, Lin Yang
AISTATS 2022 -
The benefits of implicit regularization from SGD in least squares problems
Difan Zou*, JW*, Vladimir Braverman, Quanquan Gu, Dean Foster, Sham Kakade
NeurIPS 2021 -
Accommodating picky customers: Regret bound and exploration complexity for multi-objective reinforcement learning
JW, Vladimir Braverman, Lin Yang
NeurIPS 2021 -
Lifelong learning with sketched structural regularization
Haoran Li, Aditya Krishnan, JW, Soheil Kolouri, Praveen Pilly, Vladimir Braverman
ACML 2021 -
Benign overfitting of constant-stepsize SGD for linear regression
Difan Zou*, JW*, Vladimir Braverman, Quanquan Gu, Sham Kakade
COLT 2021 (journal version in JMLR 2023) -
Direction matters: On the implicit bias of stochastic gradient descent with moderate learning rate
JW, Difan Zou, Vladimir Braverman, Quanquan Gu
ICLR 2021 -
Obtaining adjustable regularization for free via iterate averaging
JW, Vladimir Braverman, Lin Yang
ICML 2020 -
On the noisy gradient descent that generalizes as SGD
JW, Wenqing Hu, Haoyi Xiong, Jun Huan, Vladimir Braverman, Zhanxing Zhu
ICML 2020 -
Tangent-normal adversarial regularization for semi-supervised learning
Bing Yu*, JW*, Jinwen Ma, Zhanxing Zhu
CVPR 2019 (oral) -
The anisotropic noise in stochastic gradient descent: Its behavior of escaping from minima and regularization effects
Zhanxing Zhu*, JW*, Bing Yu, Lei Wu, Jinwen Ma
ICML 2019