K2

K² · Искусственный интеллект

Обучите один слой нейросети — и получите почти всю выгоду от полного обучения

Работа проводит послойный анализ того, как адаптация посредством обучения с подкреплением распределяется по слоям трансформера во время дополнительного обучения больших языковых моделей.

ZZ
RH

Zijian Zhang, Rizhen Hu, Athanasios Glentis и др.

7 авторов · cs.LG, cs.CL

Препринт arXivИскусственный интеллектиюль 2026 г. · ~60 с чтения

Суть за 30 секунд

Современные ИИ-модели вроде чат-ботов дообучают методом обучения с подкреплением (модель получает награды за удачные ответы и штрафы за плохие, постепенно подстраивая поведение).

  1. Авторы показывают, что обучение одного слоя трансформера позволяет восстановить большую часть улучшений, полученных при обучении всех параметров, а в некоторых случаях даже превзойти их.
  2. В работе введена метрика 'вклад слоя', которая показывает, какую долю общего улучшения от обучения с подкреплением можно получить, тренируя один слой отдельно.
  3. Исследование охватило семь моделей из двух семейств (Qwen3 и Qwen2.5), три алгоритма обучения с подкреплением (GRPO, GiGPO, Dr. GRPO) и несколько областей задач, включая математическое решение задач, генерацию кода и принятие решений агентом.
Training a single transformer layer can recover most of the gains achieved by full-parameter RL training, and in some cases even surpass itSeven models were studiedTwo model families (Qwen3, Qwen2.5)