Transformer
IA & ML · Profundo
A arquitetura de rede neural subjacente aos LLMs modernos, introduzida em 'Attention Is All You Need' (2017). Transformers utilizam mecanismos de auto-atencao para processar sequencias de entrada em paralelo (diferente de redes recorrentes). Componentes-chave: atencao multi-cabeca, codificação posicional, camadas feedforward e normalizacao de camada. Variantes incluem somente-codificador (BERT), somente-decodificador (GPT) e codificador-decodificador (T5).