Mixture of Experts (MoE)

IA & ML · Abismo

Una arquitectura de red neuronal que enruta cada entrada a un subconjunto de sub-redes 'expertas' especializadas en lugar de activar todos los parametros, mejorando dramaticamente la eficiencia. Sólo una fraccion de los parametros totales está activa por token (p. ej., DeepSeek-V3 tiene 671B en total pero ~37B activos). MoE permite entrenar modelos mucho más grandes a costos de computo manejables. Usado en modelos de producción como Mixtral, Jamba y DeepSeek-V3.

Términos relacionados