K² · Inteligencia artificial
Entrena una sola capa y recorta el costo del post-entrenamiento RL
El artículo realiza un estudio sistemático por capas de cómo se distribuye la adaptación del aprendizaje por refuerzo (RL) en las capas de transformers durante el entrenamiento posterior de LLMs.
ZZ
RH
Zijian Zhang, Rizhen Hu, Athanasios Glentis et al.
7 autores · cs.LG, cs.CL
El vistazo de 30 segundos
Un modelo de lenguaje moderno es una torre de decenas de capas apiladas, cada una procesando y refinando la información antes de pasarla a la siguiente.
- Los autores descubren que entrenar una sola capa de transformer puede recuperar la mayoría de las ganancias logradas con entrenamiento RL de parámetros completos, e incluso superarlas en algunos casos.
- El artículo introduce una medida llamada 'contribución de capa' que cuantifica la fracción de mejora RL total recuperada al entrenar una capa de forma aislada.
- El estudio fue evaluado en siete modelos que abarcan dos familias de modelos (Qwen3 y Qwen2.5), tres algoritmos RL (GRPO, GiGPO, Dr. GRPO) y múltiples dominios de tareas incluyendo razonamiento matemático, generación de código y toma de decisiones de agentes.
Training a single transformer layer can recover most of the gains achieved by full-parameter RL training, and in some cases even surpass itSeven models were studiedTwo model families (Qwen3, Qwen2.5)