IA Lab by amano
Neste termo

Token

Token

Token é uma unidade de informação usada por modelos de IA para processar entradas e produzir saídas. Em linguagem, pode representar um caractere, parte de uma palavra, uma palavra inteira ou pontuação. Tokens influenciam treinamento, inferência, janela de contexto, custo, latência e limites de uso, e não devem ser confundidos com palavras ou parâmetros.

prompts, contexto e interaçãonível básicoestávelTexto + visual

Glossário visual · Fundamentos · essencial

Explore o conceito em desenho

Uma unidade em que um tokenizador divide a entrada para que um modelo possa processá-la. Tokens podem corresponder a palavras, partes de palavras, espaços ou sinais; a divisão depende do tokenizador usado.

Ler o texto completo

Como a segmentação se relaciona ao tamanho do texto?

O desenho apresenta a primeira etapa. Os dois cenários completos estão disponíveis em texto logo abaixo.

Como lerSegmentos são unidades de processamento, não necessariamente palavras. A divisão mostrada é esquemática. Texto mais longo tende a usar mais tokens, mas a contagem exata depende do tokenizer e do modelo; não há número de tokens fabricado neste exemplo.

Etapa 1 de 4

Texto

A frase curta do exemplo é “Planejar uma reunião.”. Ela é exibida literalmente como entrada, sem afirmar uma contagem de tokens.

Leia todas as etapas: “Planejar uma reunião.”
  1. Texto. A frase curta do exemplo é “Planejar uma reunião.”. Ela é exibida literalmente como entrada, sem afirmar uma contagem de tokens.
  2. Segmentação ilustrativa. O diagrama divide visualmente a frase em segmentos aproximados para explicar a ideia de tokenização. A legenda informa: “Segmentação ilustrativa, não é saída de um tokenizer.”
  3. Palavra versus unidade. Uma palavra visível, como “reunião”, pode corresponder a uma ou mais unidades, conforme o tokenizador. Os blocos não representam uma segmentação real identificada.
  4. Limites de contagem. A frase mais longa contém mais texto, mas a figura não calcula tokens nem custo. Uma contagem precisa exige o tokenizador ou a ferramenta compatível com o modelo.
Leia todas as etapas: “Planejar uma reunião estratégica.”
  1. Texto. A frase do cenário é “Planejar uma reunião estratégica.”. A entrada é mais longa que a frase curta comparada no outro cenário.
  2. Segmentação ilustrativa. A segmentação é representada por blocos abstratos. A legenda informa: “Segmentação ilustrativa, não é saída de um tokenizer.”
  3. Palavra versus unidade. O diagrama destaca “reunião” como exemplo de palavra que pode ocupar mais de uma unidade. Isso não afirma como qualquer tokenizador específico a divide.
  4. Limites de contagem. A comparação sugere apenas uma diferença qualitativa de extensão do texto. Não exibe contagem, proporção ou orçamento numérico de tokens.

Aplicação prática

Tokens não correspondem necessariamente a palavras inteiras.

Ao preparar uma solicitação longa para um assistente empresarial, uma equipe pode precisar saber se instruções, histórico e documentos cabem nos limites do modelo. Essa capacidade é medida em tokens, mas não se calcula com precisão contando palavras ou caracteres.

O texto é dividido por um tokenizador em unidades que podem ser palavras, partes de palavras, espaços ou sinais. A segmentação varia de acordo com o tokenizador. Os blocos desta demonstração são deliberadamente aproximados e não mostram a saída real de nenhuma ferramenta. Para planejar uma chamada, use a contagem correspondente ao modelo e ao formato utilizados.

Limites do desenho

O desenho não faz uma contagem real.

Não há equivalência fixa entre token e palavra. As caixas representam segmentação ilustrativa, sem contagem ou proporção numérica. Para uma contagem exata, use o tokenizador ou a ferramenta compatível com o modelo e a entrada.

Uma palavra pode ocupar mais de uma unidade.

A segmentação acompanha o vocabulário e as regras do tokenizador. Uma palavra visível na tela pode virar uma ou várias unidades internas.

TextoFragmentos ilustrativosRepresentações para o modelo
Tokenizador
Define como uma entrada é dividida.
ID
Representação associada a cada unidade para processamento.

Contar exige conhecer o sistema usado.

Estimativas por caracteres podem divergir da contagem real. O tokenizador correto e o formato da chamada fazem diferença.

Texto e estruturaTokenizador específicoContagem verificável
Contagem
Varia conforme texto, tokenizador e estrutura da entrada.
Verificação
Use a ferramenta indicada para o modelo ou API.

Fontes conceituais

Roteiros e cenários: exemplos didáticos. As interações mostram simulações e não executam ações em sistemas externos.

O que é um token?

Token é uma unidade de informação utilizada por modelos de Inteligência Artificial para processar entradas e produzir saídas.

Em modelos de linguagem, um token pode representar um caractere, parte de uma palavra, uma palavra inteira ou pontuação. Espaços, capitalização e codificação também influenciam a divisão.

A OpenAI destaca que contagem de tokens não é igual a contagem de palavras e que o mesmo texto pode produzir números diferentes dependendo do modelo, idioma e encoding.

O Google define token como a unidade atômica sobre a qual um modelo de linguagem é treinado e faz previsões.

Por que modelos usam tokens?

Computadores precisam transformar linguagem em representações numéricas.

Tokenização cria unidades discretas que podem ser mapeadas para embeddings e processadas pela rede neural.

Esse mecanismo permite trabalhar com vocabulários enormes sem representar toda palavra possível como uma categoria independente.

Tokens também tornam possível lidar com palavras novas por combinação de subpalavras.

Token não é palavra

Uma palavra curta e frequente pode corresponder a um token. Uma palavra longa, rara ou composta pode ser dividida em vários.

Pontuação e espaços também podem formar unidades próprias.

Por isso, 1.000 palavras não equivalem a 1.000 tokens.

Estimativas como quatro caracteres ou três quartos de palavra por token são aproximações úteis principalmente para inglês, não regras universais.

O que é tokenização?

Tokenização é o processo de transformar uma sequência em tokens.

O componente responsável por isso é chamado tokenizer.

Modelos diferentes podem utilizar vocabulários e estratégias diferentes, produzindo contagens diferentes para o mesmo texto.

Contagens exatas precisam usar o tokenizer correspondente ao modelo utilizado.

Subword tokens

Muitos sistemas usam subpalavras, unidades menores que palavras completas.

Uma palavra pode ser representada por raiz, prefixo, sufixo ou fragmentos frequentes.

Isso reduz o problema de palavras desconhecidas e permite compartilhar unidades entre termos relacionados.

É uma solução eficiente para idiomas com vocabulário muito grande e formação produtiva de palavras.

Tokens e embeddings

Depois da tokenização, tokens são associados a representações vetoriais.

Esses embeddings permitem que a rede neural processe relações matemáticas entre elementos.

Token e embedding não são a mesma coisa: token é a unidade discreta; embedding é a representação vetorial usada pelo modelo.

Durante as camadas da rede, essas representações se tornam contextualizadas.

Input tokens

Input tokens são os tokens fornecidos ao modelo em uma requisição.

Eles podem vir do prompt, mensagens anteriores, documentos, instruções de sistema, resultados de ferramentas ou outras estruturas.

Em APIs modernas, a contagem também pode incluir tokens associados à estrutura da requisição.

Mais input geralmente significa mais informação para processar e potencialmente maior custo.

Output tokens

Output tokens são os tokens gerados pelo modelo.

Em um LLM, a resposta é produzida progressivamente token por token.

Respostas mais longas consomem mais output e levam mais tempo para serem geradas.

Modelos costumam possuir limites próprios para quantidade máxima de saída.

Cached input tokens

Algumas plataformas conseguem reutilizar partes repetidas da entrada por mecanismos de prompt caching.

Esses tokens podem ser contabilizados separadamente e possuir preço diferente.

Cache é útil quando instruções ou contexto estável são enviados repetidamente em muitas requisições.

Isso pode reduzir custo e latência em aplicações de grande escala.

Reasoning tokens

Determinados modelos utilizam tokens internos de raciocínio antes de produzir a resposta visível.

A documentação atual da OpenAI informa que esses tokens não aparecem no texto final, mas participam da contagem de uso de modelos compatíveis.

Isso explica por que uma resposta curta pode consumir mais tokens do que o texto exibido sugere.

Categoria e contabilização dependem do modelo e da plataforma.

Tokens e Context Window

A janela de contexto é normalmente medida em tokens.

Entrada, saída e, em alguns modelos, raciocínio compartilham o orçamento total de contexto.

Se uma entrada ocupa quase toda a janela, pode sobrar pouco espaço para a geração.

Por isso, arquitetura de contexto precisa considerar não apenas aquilo que entra, mas também o que o modelo precisa produzir.

Tokens e custo

APIs de modelos generativos frequentemente precificam uso por quantidade de tokens.

Podem existir preços diferentes para input, output e cache.

Em escala, uma diferença pequena na média por requisição pode representar grande impacto financeiro.

Engenharia de contexto também é, portanto, uma disciplina econômica.

Tokens e velocidade

Entradas maiores exigem mais processamento e saídas maiores demoram mais para serem geradas.

Latência depende também do modelo, infraestrutura e carga do sistema.

Reduzir tokens irrelevantes pode melhorar custo e experiência.

Isso não significa encurtar tudo; significa priorizar informação útil.

Tokens multimodais

O conceito de token não se limita a texto.

O Google explica que em modalidades visuais, por exemplo, regiões ou patches de uma imagem podem funcionar como unidades tokenizadas.

Sistemas multimodais convertem texto, imagem, áudio e outros tipos de entrada em representações compatíveis com o processamento do modelo.

A forma exata varia entre arquiteturas.

Aplicações práticas

Em arquitetura, tokens ajudam a planejar análise de memoriais, contratos e acervos extensos.

Em advocacia, documentos longos podem exigir chunking, RAG e seleção de contexto.

No varejo e hospitality, catálogos e políticas não precisam ser enviados integralmente a cada solicitação.

Em educação e pesquisa, livros e papers podem ser divididos e recuperados de forma seletiva.

Token e parâmetro

Token e parâmetro descrevem coisas completamente diferentes.

Token é informação processada. Parâmetro é valor aprendido pelo modelo durante treinamento.

Um modelo pode ser treinado com trilhões de tokens e possuir bilhões de parâmetros.

Esses números não devem ser comparados como se medissem a mesma coisa.

O que muda na prática?

Compreender tokens ajuda a entender como modelos transformam linguagem em computação.

Também explica limites de contexto, custo, latência e estratégias como caching e chunking.

Para usuários, o conceito parece técnico; para produtos de IA, ele afeta diretamente arquitetura e economia.

A pergunta deixa de ser apenas quanto texto existe e passa a ser quanto contexto útil será processado.

Perguntas frequentes

O que é um token em IA?

É uma unidade utilizada por modelos para processar informação. Em texto, pode ser caractere, parte de palavra, palavra inteira ou pontuação.

Um token é uma palavra?

Não necessariamente. Uma palavra pode corresponder a um token ou ser dividida em vários.

Quantas palavras existem em 1.000 tokens?

Não existe conversão exata. A relação varia conforme idioma, modelo, encoding e conteúdo.

O que são input e output tokens?

Input tokens são fornecidos ao modelo; output tokens são gerados na resposta.

O que são reasoning tokens?

São tokens internos usados por certos modelos de raciocínio antes da resposta visível, conforme a plataforma.

Imagens também usam tokens?

Em modelos multimodais, imagens e outras modalidades podem ser convertidas em unidades representacionais equivalentes a tokens.

Fontes principais

Revisado em 2026-09-23.