O que é Chunking em IA?
É o processo de dividir documentos ou conteúdos longos em blocos menores para indexação, embeddings e recuperação.
Imersão
ImersãoDois dias para transformar IA em criatividade aplicada.Conteúdos abertos
Área do alunosó para alunos
Chunking · Divisão em Blocos · Segmentação de Documentos
Chunking é o processo de dividir documentos, textos ou outros conteúdos extensos em unidades menores, chamadas chunks, para facilitar indexação, embeddings, busca e recuperação em sistemas de IA. A estratégia de chunking define tamanho, fronteiras e possível sobreposição entre trechos e influencia diretamente a qualidade de Semantic Search, Vector Search e RAG.
Chunking é o processo de dividir conteúdos extensos em unidades menores para armazenamento, indexação e recuperação.
Em aplicações de RAG, documentos normalmente não são representados como um único embedding gigantesco. Eles são separados em chunks, e cada trecho pode receber sua própria representação.
Isso permite recuperar apenas partes relevantes quando uma consulta é feita.
A qualidade da divisão influencia diretamente aquilo que o sistema consegue encontrar.
Um documento pode conter vários assuntos diferentes.
Se todo o conteúdo for convertido em um único embedding, temas distintos podem ser misturados em uma representação ampla demais.
Além disso, enviar documentos completos ao LLM pode desperdiçar Context Window.
Chunking cria unidades menores que aumentam granularidade da recuperação.
Tokenization é o processo interno de converter linguagem em tokens para o modelo.
Chunking trabalha em uma camada diferente e agrupa muitos tokens em unidades recuperáveis.
Um chunk pode conter centenas de tokens.
Os dois conceitos se relacionam porque tamanho de chunk é frequentemente medido em tokens.
Chunks pequenos aumentam precisão local, mas podem perder contexto.
Chunks grandes preservam mais informação ao redor de uma passagem, mas podem incluir vários assuntos e tornar embeddings menos específicos.
Não existe tamanho universal ideal.
A escolha depende do corpus, do modelo de embedding, das perguntas e da janela de contexto.
A documentação atual de Retrieval da OpenAI usa por padrão chunks de 800 tokens com overlap de 400 tokens.
A plataforma permite ajustar max_chunk_size_tokens entre 100 e 4096 em sua estratégia configurável.
Esses números são configurações de uma ferramenta específica, não uma recomendação universal para qualquer corpus.
Sistemas próprios devem testar diferentes tamanhos com avaliações reais.
Overlap é a repetição de parte do conteúdo entre chunks consecutivos.
Ele reduz o risco de uma informação importante ser cortada exatamente na fronteira.
Se uma definição começa no final de um chunk e termina no seguinte, overlap pode preservar a relação.
Em excesso, entretanto, aumenta redundância e pode trazer trechos quase duplicados na recuperação.
Dividir a cada N tokens é simples, mas pode cortar parágrafos, tabelas e ideias.
Chunking orientado por estrutura respeita títulos, subtítulos, parágrafos, listas ou seções.
Em documentos jurídicos, cláusulas podem ser unidades naturais. Em manuais, procedimentos. Em artigos, seções.
Usar a estrutura original costuma preservar mais significado.
Semantic chunking tenta detectar mudanças de assunto e criar blocos em torno de unidades conceitualmente coerentes.
A vantagem é evitar cortar uma ideia apenas porque atingiu um limite arbitrário de tokens.
A desvantagem é maior complexidade e custo de processamento.
O ganho precisa ser medido contra estratégias mais simples.
Alguns sistemas mantêm unidades em diferentes níveis, como documento, capítulo, seção e parágrafo.
A busca pode recuperar um trecho pequeno e também trazer contexto de uma seção maior.
Essa estratégia ajuda quando detalhes precisam permanecer ligados à estrutura original.
Também facilita citação e navegação até a fonte.
Cada chunk deveria manter referência ao documento original.
Metadados podem incluir título, capítulo, autor, data, versão, cliente, projeto e permissões.
Eles permitem filtrar a busca e reconstruir contexto.
Sem metadados, trechos recuperados podem perder origem e governança.
Um trecho pode fazer sentido dentro do documento e ficar ambíguo quando isolado.
Anthropic usa um exemplo em que 'a receita da empresa cresceu 3%' perde empresa e período depois de ser separada do documento.
Esse problema pode prejudicar tanto embeddings quanto a interpretação posterior pelo LLM.
A estratégia de chunking precisa considerar contexto implícito.
Anthropic propôs Contextual Retrieval como uma forma de adicionar um pequeno contexto específico a cada chunk antes de embedding e indexação lexical.
O texto contextual situa o trecho dentro do documento maior.
Nos experimentos publicados pela empresa, essa técnica reduziu falhas de recuperação e teve ganho adicional quando combinada com reranking.
É uma abordagem possível, não uma regra obrigatória para todo pipeline.
Tabelas apresentam desafio especial porque linhas e colunas possuem relações estruturais.
Separar uma linha sem cabeçalho pode destruir significado.
Uma estratégia pode repetir cabeçalhos, converter tabelas em representação textual estruturada ou usar mecanismos especializados.
Avaliação precisa verificar se perguntas numéricas continuam recuperáveis.
Código possui funções, classes, imports e dependências.
Dividir apenas por contagem de tokens pode separar assinatura e implementação.
Chunking orientado pela sintaxe ou árvore do código pode preservar unidades lógicas.
Para assistentes de desenvolvimento, essa diferença afeta recuperação e compreensão de dependências.
PDFs, apresentações e documentos escaneados podem conter layout, imagens e tabelas.
Antes do chunking, pode ser necessário extrair estrutura corretamente.
Um chunk de texto que perde o vínculo com uma imagem ou legenda pode ficar incompleto.
Pipelines multimodais precisam decidir se elementos visuais serão indexados separadamente ou em conjunto.
Durante busca, o sistema recupera determinado número de chunks, frequentemente chamado top-k.
Chunks muito pequenos podem exigir um k maior para reconstruir contexto.
Chunks grandes podem preencher rapidamente a Context Window.
Tamanho do chunk e quantidade recuperada precisam ser avaliados juntos.
A primeira busca pode retornar muitos candidatos.
Um reranker pode reordenar chunks usando uma avaliação mais precisa da relação entre consulta e trecho.
Anthropic observou ganhos significativos ao combinar contextual retrieval e reranking em seus experimentos.
Isso mostra que chunking faz parte de um pipeline maior de recuperação.
Em arquitetura, memoriais e atas podem ser divididos por projeto e seção.
Em advocacia, cláusulas e decisões podem preservar número do processo e documento.
No varejo, catálogos e políticas podem ser segmentados por produto ou assunto.
Em hospitality, procedimentos e manuais podem manter unidade operacional.
É necessário criar perguntas reais e verificar se os chunks corretos aparecem entre os resultados.
Também vale medir se o contexto recuperado contém informação suficiente para responder.
Tamanho, overlap e metadados podem ser comparados por evals.
Escolher chunking sem testar recuperação é otimizar no escuro.
Chunking transforma a estrutura do documento em arquitetura de recuperação.
Uma escolha aparentemente técnica define o que o sistema poderá reencontrar depois.
A estratégia correta preserva unidades de significado, contexto e fonte sem desperdiçar tokens.
RAG de alta qualidade começa muito antes da pergunta: começa na forma como o conhecimento foi preparado.
RAG, Retrieval, Embedding, Semantic Search, Vector Database, Context Window, Overlap, Contextual Retrieval, Metadata, Reranking
É o processo de dividir documentos ou conteúdos longos em blocos menores para indexação, embeddings e recuperação.
Não existe valor universal. O tamanho ideal depende do corpus, das consultas, do embedding e da arquitetura de recuperação.
É a repetição de parte do conteúdo entre chunks consecutivos para reduzir perda de contexto nas fronteiras.
Não. É o padrão atual de uma ferramenta de Retrieval da OpenAI, mas outras aplicações podem exigir configurações diferentes.
Não. Tokenization cria unidades internas do modelo; chunking agrupa conteúdo em trechos maiores para armazenamento e busca.
Criando avaliações com consultas reais e verificando se os trechos necessários aparecem e contêm contexto suficiente.
Revisado em 2026-09-23.