Mixture of Experts (MoE)

IA & ML · Abismo

Uma arquitetura de rede neural que direciona cada entrada para um subconjunto de sub-redes 'especialistas' em vez de ativar todos os parametros, melhorando drasticamente a eficiência. Apenas uma fracao do total de parametros está ativa por token (por exemplo, DeepSeek-V3 tem 671B no total, mas ~37B ativos). MoE permite treinar modelos muito maiores com custos de computação gerenciaveis. Usado em modelos de produção como Mixtral, Jamba e DeepSeek-V3.

Termos relacionados