K2

K² · Inteligencia artificial

Entrenar una sola capa iguala a entrenar todo el modelo

El artículo realiza un estudio sistemático por capas de cómo se distribuye la adaptación del aprendizaje por refuerzo (RL) en las capas de transformers durante el entrenamiento posterior de LLMs.

ZZ
RH

Zijian Zhang, Rizhen Hu, Athanasios Glentis et al.

7 autores · cs.LG, cs.CL

Preprint de arXivInteligencia artificialjul 2026 · ~70s de lectura

El vistazo de 30 segundos

Un modelo de lenguaje moderno es una torre de decenas de capas apiladas, cada una procesando y refinando la información antes de pasarla a la siguiente.

  1. Los autores descubren que entrenar una sola capa de transformer puede recuperar la mayoría de las ganancias logradas con entrenamiento RL de parámetros completos, e incluso superarlas en algunos casos.
  2. El artículo introduce una medida llamada 'contribución de capa' que cuantifica la fracción de mejora RL total recuperada al entrenar una capa de forma aislada.
  3. El estudio fue evaluado en siete modelos que abarcan dos familias de modelos (Qwen3 y Qwen2.5), tres algoritmos RL (GRPO, GiGPO, Dr. GRPO) y múltiples dominios de tareas incluyendo razonamiento matemático, generación de código y toma de decisiones de agentes.
Training a single transformer layer can recover most of the gains achieved by full-parameter RL training, and in some cases even surpass itSeven models were studiedTwo model families (Qwen3, Qwen2.5)