K2

K² · Искусственный интеллект

Оптимизатор, на котором учат все нейросети, никто не доказал математически

В работе исследуется, способен ли AdamW — фактический стандартный оптимизатор для обучения больших языковых моделей — сходиться при наличии шума градиентов с тяжелыми хвостами.

DY
HT

Dingzhi Yu, Hongyi Tao, Yuanyu Wan и др.

5 авторов · cs.LG, cs.AI, math.OC, stat.ML

Препринт arXivИскусственный интеллектиюнь 2026 г. · ~65 с чтения

Суть за 30 секунд

Почти каждую большую языковую модель — систему, обученную на горах текста, чтобы говорить по-человечески — тренируют одним и тем же алгоритмом.

  1. Авторы отмечают, что существующая теория AdamW в основном относится к режимам конечной дисперсии, что неудовлетворительно, поскольку эмпирические данные показывают, что стохастический шум градиентов при предварительном обучении больших языковых моделей обычно имеет тяжелые хвосты.
  2. В аннотации говорится, что недавние работы показывают, что оптимизаторы на основе знака, такие как Lion и Muon, достигают острых скоростей сходимости при тяжелых хвостах, и что AdaGrad также может сходиться при наличии шума с тяжелыми хвостами.
  3. Авторы утверждают, что строгая теория сходимости для AdamW в режиме тяжелых хвостов еще не установлена.