Transformer
IA & ML · Profundo
La arquitectura de red neuronal subyacente a los LLM modernos, introducida en 'Attention Is All You Need' (2017). Los Transformers utilizan mecanismos de autoatencion para procesar secuencias de entrada en paralelo (a diferencia de las redes recurrentes). Componentes clave: atencion multi-cabeza, codificación posicional, capas feedforward y normalizacion de capa. Las variantes incluyen sólo-codificador (BERT), sólo-decodificador (GPT) y codificador-decodificador (T5).