K² · Искусственный интеллект
Оптимизатор, на котором учат все нейросети, никто не доказал математически
В работе исследуется, способен ли AdamW — фактический стандартный оптимизатор для обучения больших языковых моделей — сходиться при наличии шума градиентов с тяжелыми хвостами.
DY
HT
Dingzhi Yu, Hongyi Tao, Yuanyu Wan и др.
5 авторов · cs.LG, cs.AI, math.OC, stat.ML
Суть за 30 секунд
Почти каждую большую языковую модель — систему, обученную на горах текста, чтобы говорить по-человечески — тренируют одним и тем же алгоритмом.
- Авторы отмечают, что существующая теория AdamW в основном относится к режимам конечной дисперсии, что неудовлетворительно, поскольку эмпирические данные показывают, что стохастический шум градиентов при предварительном обучении больших языковых моделей обычно имеет тяжелые хвосты.
- В аннотации говорится, что недавние работы показывают, что оптимизаторы на основе знака, такие как Lion и Muon, достигают острых скоростей сходимости при тяжелых хвостах, и что AdaGrad также может сходиться при наличии шума с тяжелыми хвостами.
- Авторы утверждают, что строгая теория сходимости для AdamW в режиме тяжелых хвостов еще не установлена.