K2

K² · Искусственный интеллект

Заставьте нейросеть делать одно дело за раз — и она учится лучше

Авторы выдвигают гипотезу о разделении состояния и предсказания, согласно которой отделение функции предсказания следующего токена от функции сохранения состояния в Трансформере повышает качество языкового моделирования.

GM
NG

Giovanni Monea, Nathan Godey, Kianté Brantley и др.

4 автора · cs.CL, cs.AI, cs.LG

Препринт arXivИскусственный интеллектиюль 2026 г. · ~60 с чтения

Суть за 30 секунд

Языковая модель вроде ChatGPT в каждый момент делает две работы разом.

  1. Они разработали вариант Трансформера, использующий два отдельных потока вычислений для разделения функции предсказания и функции сохранения состояния.
  2. Они провели эксперименты предварительного обучения в различных масштабах для проверки гипотезы.
  3. Эксперименты показывают, что разделение состояния и предсказания последовательно дает лучшую эффективность по данным и вычислительным ресурсам.
Outperforms standard Transformers by 2 to 3 percentage points on average on downstream tasksTwo computation streams used to separate the prediction and state-storage functions