IA Lab by amano
Neste termo

Transformer

Transformer Architecture

Transformer é uma arquitetura de rede neural baseada em mecanismos de atenção, apresentada em 2017 no artigo Attention Is All You Need. A arquitetura tornou possível processar relações entre elementos de uma sequência com grande paralelização e passou a sustentar muitos LLMs, além de aplicações em visão, áudio, vídeo e multimodalidade.

deep learningnível intermediárioestável

O que é Transformer?

Transformer é uma arquitetura de rede neural apresentada em 2017 no artigo Attention Is All You Need, de Ashish Vaswani e coautores.

A proposta original surgiu em tradução automática e substituiu a dependência central de recorrência e convoluções por mecanismos de atenção.

O artigo mostrou que a arquitetura podia atingir resultados superiores em tarefas de tradução com maior paralelização de treinamento.

Desde então, Transformers se tornaram base de grande parte dos LLMs e passaram também a ser usados em visão computacional, áudio, séries temporais e sistemas multimodais.

Por que o Transformer foi uma mudança importante?

Antes do Transformer, muitas tarefas de sequência usavam redes recorrentes que processavam elementos um após o outro.

Essa lógica dificultava paralelização e tornava relações muito distantes mais difíceis de representar.

O Transformer consegue analisar relações entre diferentes posições da sequência usando atenção.

Essa combinação aumentou eficiência de treinamento e capacidade de trabalhar com contexto em grande escala.

O que é attention?

Attention é um mecanismo que calcula quanto determinadas partes de uma entrada devem influenciar a representação de outra parte.

Em linguagem, uma palavra pode precisar considerar outras palavras para resolver ambiguidade.

O Google descreve attention como um mecanismo usado em redes neurais para indicar a importância de uma palavra ou parte da entrada.

Trata-se de uma operação matemática, não de atenção consciente.

O que é self-attention?

Self-attention calcula relações entre elementos da própria sequência.

Para cada token, o modelo avalia como outros tokens influenciam sua interpretação.

Em uma frase com pronomes, por exemplo, self-attention ajuda a representar a relação entre o pronome e o substantivo relevante.

Essa operação produz representações contextualizadas, diferentes de tratar cada token isoladamente.

Query, Key e Value

O mecanismo costuma ser explicado com três vetores: Query, Key e Value.

Query representa aquilo que uma posição está procurando. Keys representam características usadas para comparação. Values carregam a informação combinada conforme os pesos de atenção.

Produtos entre queries e keys geram scores que são transformados em pesos.

Os values são então combinados de acordo com esses pesos, produzindo uma representação contextual.

Multi-head attention

Transformers usam múltiplas cabeças de atenção em paralelo.

Cada head pode aprender relações diferentes entre elementos da sequência.

Uma cabeça pode se especializar em determinados padrões sintáticos, enquanto outras capturam dependências ou relações semânticas distintas.

As saídas são combinadas, permitindo que o modelo represente vários tipos de relação simultaneamente.

Positional encoding

Self-attention, por si só, não codifica ordem da mesma maneira que uma rede recorrente.

Por isso, Transformers precisam incorporar informação sobre posição.

O trabalho original utilizou positional encodings adicionados aos embeddings.

Arquiteturas posteriores introduziram outras estratégias de posição, incluindo métodos relativos e rotary embeddings.

Encoder e decoder

A arquitetura original possui encoder e decoder.

O encoder transforma a entrada em representações contextualizadas. O decoder usa contexto para gerar uma sequência de saída.

Alguns modelos usam apenas encoder, outros apenas decoder e outros mantêm as duas partes.

Essa divisão explica diferenças entre famílias como BERT, modelos encoder-decoder e LLMs decoder-only.

Encoder-only

Modelos encoder-only são particularmente adequados a tarefas de representação e compreensão.

Podem produzir embeddings contextuais, classificar texto e analisar sequências.

BERT é um exemplo histórico importante dessa família.

Eles não são otimizados principalmente para geração autoregressiva longa.

Decoder-only

Modelos decoder-only geram novos tokens a partir da sequência disponível.

Grande parte dos LLMs conversacionais modernos utiliza variações dessa arquitetura.

GPT significa Generative Pre-Trained Transformer e representa uma família conhecida de modelos decoder-oriented.

Isso não significa que Transformer e GPT sejam sinônimos.

Transformers fora da linguagem

Transformers passaram a ser usados em imagem, áudio, vídeo e séries temporais.

Vision Transformers representam imagens como sequências de patches e aplicam mecanismos de atenção.

Modelos multimodais combinam representações de diferentes tipos de dados.

Essa expansão transformou o Transformer em uma arquitetura geral de Deep Learning.

Transformer e LLM

LLM é uma categoria de modelo de linguagem. Transformer é uma arquitetura.

Muitos LLMs usam Transformer, mas a arquitetura também aparece fora de linguagem.

Da mesma forma, nem toda aplicação de Transformer é um grande modelo.

Separar os termos ajuda a compreender arquitetura, modelo e produto.

Custo da atenção

Self-attention tradicional compara muitos elementos da sequência entre si.

O Google explica que o custo cresce aproximadamente de forma quadrática com o número de tokens, além de depender de camadas e heads.

Isso se torna um desafio em contextos muito longos.

Por isso, existem pesquisas em variantes de atenção, caching, sparsity e arquiteturas híbridas.

Por que contexto longo continua difícil?

Ter uma janela maior não elimina custo computacional nem garante recuperação perfeita.

Modelos precisam processar relações entre muitos elementos e manter informações úteis disponíveis.

Otimizações ajudam a reduzir memória e latência, mas long context continua sendo área ativa de pesquisa.

RAG e gestão de contexto permanecem úteis mesmo com modelos capazes de receber grandes sequências.

Aplicações práticas

Para o usuário final, Transformer normalmente é invisível.

Ele está por trás de ferramentas de linguagem, busca, geração, visão, tradução e sistemas multimodais.

Arquitetura e design utilizam aplicações construídas sobre Transformers para texto e imagem. Varejo usa busca, recomendação e atendimento. Educação usa tradução e tutoria.

O valor está nas aplicações construídas sobre a arquitetura, não em interagir diretamente com ela.

Limitações

Transformers podem exigir muita memória e computação, especialmente em contextos longos.

Treinamento em grande escala demanda infraestrutura sofisticada.

Arquitetura eficiente não garante dados de qualidade, segurança ou ausência de vieses.

Novas arquiteturas podem complementar ou substituir partes do Transformer em tarefas específicas.

O que muda na prática?

O Transformer criou uma infraestrutura capaz de representar contexto e relações em sequências de forma altamente escalável.

Isso abriu caminho para foundation models e LLMs capazes de executar muitas tarefas diferentes.

Compreender a arquitetura ajuda a perceber que a atual expansão da IA não nasceu apenas de dados e computação, mas também de avanços na forma de organizar redes neurais.

O Transformer é uma das peças estruturais dessa transformação.

Perguntas frequentes

O que é Transformer em IA?

É uma arquitetura de rede neural baseada principalmente em mecanismos de atenção, apresentada em 2017.

Quem criou o Transformer?

A arquitetura foi apresentada por Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser e Illia Polosukhin.

Transformer e LLM são a mesma coisa?

Não. Transformer é uma arquitetura; LLM é uma categoria de modelo de linguagem.

O que é self-attention?

É o mecanismo que calcula como diferentes elementos da própria sequência devem influenciar a representação uns dos outros.

O que é multi-head attention?

É a aplicação de múltiplos mecanismos de self-attention em paralelo para aprender diferentes tipos de relação.

Transformer é usado apenas para texto?

Não. Também é usado em visão, áudio, vídeo, séries temporais e sistemas multimodais.

Fontes principais

Revisado em 2026-09-23.