IA Lab by amano
Neste termo

Chunking

Chunking · Divisão em Blocos · Segmentação de Documentos

Chunking é o processo de dividir documentos, textos ou outros conteúdos extensos em unidades menores, chamadas chunks, para facilitar indexação, embeddings, busca e recuperação em sistemas de IA. A estratégia de chunking define tamanho, fronteiras e possível sobreposição entre trechos e influencia diretamente a qualidade de Semantic Search, Vector Search e RAG.

dados, busca, rag e conhecimentonível intermediárioestável

O que é Chunking?

Chunking é o processo de dividir conteúdos extensos em unidades menores para armazenamento, indexação e recuperação.

Em aplicações de RAG, documentos normalmente não são representados como um único embedding gigantesco. Eles são separados em chunks, e cada trecho pode receber sua própria representação.

Isso permite recuperar apenas partes relevantes quando uma consulta é feita.

A qualidade da divisão influencia diretamente aquilo que o sistema consegue encontrar.

Por que documentos precisam ser divididos?

Um documento pode conter vários assuntos diferentes.

Se todo o conteúdo for convertido em um único embedding, temas distintos podem ser misturados em uma representação ampla demais.

Além disso, enviar documentos completos ao LLM pode desperdiçar Context Window.

Chunking cria unidades menores que aumentam granularidade da recuperação.

Chunking não é Tokenization

Tokenization é o processo interno de converter linguagem em tokens para o modelo.

Chunking trabalha em uma camada diferente e agrupa muitos tokens em unidades recuperáveis.

Um chunk pode conter centenas de tokens.

Os dois conceitos se relacionam porque tamanho de chunk é frequentemente medido em tokens.

Tamanho do chunk

Chunks pequenos aumentam precisão local, mas podem perder contexto.

Chunks grandes preservam mais informação ao redor de uma passagem, mas podem incluir vários assuntos e tornar embeddings menos específicos.

Não existe tamanho universal ideal.

A escolha depende do corpus, do modelo de embedding, das perguntas e da janela de contexto.

O padrão de 800 tokens é uma configuração, não uma lei

A documentação atual de Retrieval da OpenAI usa por padrão chunks de 800 tokens com overlap de 400 tokens.

A plataforma permite ajustar max_chunk_size_tokens entre 100 e 4096 em sua estratégia configurável.

Esses números são configurações de uma ferramenta específica, não uma recomendação universal para qualquer corpus.

Sistemas próprios devem testar diferentes tamanhos com avaliações reais.

O que é overlap?

Overlap é a repetição de parte do conteúdo entre chunks consecutivos.

Ele reduz o risco de uma informação importante ser cortada exatamente na fronteira.

Se uma definição começa no final de um chunk e termina no seguinte, overlap pode preservar a relação.

Em excesso, entretanto, aumenta redundância e pode trazer trechos quase duplicados na recuperação.

Fronteiras naturais

Dividir a cada N tokens é simples, mas pode cortar parágrafos, tabelas e ideias.

Chunking orientado por estrutura respeita títulos, subtítulos, parágrafos, listas ou seções.

Em documentos jurídicos, cláusulas podem ser unidades naturais. Em manuais, procedimentos. Em artigos, seções.

Usar a estrutura original costuma preservar mais significado.

Chunking semântico

Semantic chunking tenta detectar mudanças de assunto e criar blocos em torno de unidades conceitualmente coerentes.

A vantagem é evitar cortar uma ideia apenas porque atingiu um limite arbitrário de tokens.

A desvantagem é maior complexidade e custo de processamento.

O ganho precisa ser medido contra estratégias mais simples.

Chunking hierárquico

Alguns sistemas mantêm unidades em diferentes níveis, como documento, capítulo, seção e parágrafo.

A busca pode recuperar um trecho pequeno e também trazer contexto de uma seção maior.

Essa estratégia ajuda quando detalhes precisam permanecer ligados à estrutura original.

Também facilita citação e navegação até a fonte.

Metadados

Cada chunk deveria manter referência ao documento original.

Metadados podem incluir título, capítulo, autor, data, versão, cliente, projeto e permissões.

Eles permitem filtrar a busca e reconstruir contexto.

Sem metadados, trechos recuperados podem perder origem e governança.

O problema do chunk sem contexto

Um trecho pode fazer sentido dentro do documento e ficar ambíguo quando isolado.

Anthropic usa um exemplo em que 'a receita da empresa cresceu 3%' perde empresa e período depois de ser separada do documento.

Esse problema pode prejudicar tanto embeddings quanto a interpretação posterior pelo LLM.

A estratégia de chunking precisa considerar contexto implícito.

Contextual Retrieval

Anthropic propôs Contextual Retrieval como uma forma de adicionar um pequeno contexto específico a cada chunk antes de embedding e indexação lexical.

O texto contextual situa o trecho dentro do documento maior.

Nos experimentos publicados pela empresa, essa técnica reduziu falhas de recuperação e teve ganho adicional quando combinada com reranking.

É uma abordagem possível, não uma regra obrigatória para todo pipeline.

Chunking de tabelas

Tabelas apresentam desafio especial porque linhas e colunas possuem relações estruturais.

Separar uma linha sem cabeçalho pode destruir significado.

Uma estratégia pode repetir cabeçalhos, converter tabelas em representação textual estruturada ou usar mecanismos especializados.

Avaliação precisa verificar se perguntas numéricas continuam recuperáveis.

Chunking de código

Código possui funções, classes, imports e dependências.

Dividir apenas por contagem de tokens pode separar assinatura e implementação.

Chunking orientado pela sintaxe ou árvore do código pode preservar unidades lógicas.

Para assistentes de desenvolvimento, essa diferença afeta recuperação e compreensão de dependências.

Chunking de documentos visuais

PDFs, apresentações e documentos escaneados podem conter layout, imagens e tabelas.

Antes do chunking, pode ser necessário extrair estrutura corretamente.

Um chunk de texto que perde o vínculo com uma imagem ou legenda pode ficar incompleto.

Pipelines multimodais precisam decidir se elementos visuais serão indexados separadamente ou em conjunto.

Chunking e top-k retrieval

Durante busca, o sistema recupera determinado número de chunks, frequentemente chamado top-k.

Chunks muito pequenos podem exigir um k maior para reconstruir contexto.

Chunks grandes podem preencher rapidamente a Context Window.

Tamanho do chunk e quantidade recuperada precisam ser avaliados juntos.

Chunking e reranking

A primeira busca pode retornar muitos candidatos.

Um reranker pode reordenar chunks usando uma avaliação mais precisa da relação entre consulta e trecho.

Anthropic observou ganhos significativos ao combinar contextual retrieval e reranking em seus experimentos.

Isso mostra que chunking faz parte de um pipeline maior de recuperação.

Aplicações empresariais

Em arquitetura, memoriais e atas podem ser divididos por projeto e seção.

Em advocacia, cláusulas e decisões podem preservar número do processo e documento.

No varejo, catálogos e políticas podem ser segmentados por produto ou assunto.

Em hospitality, procedimentos e manuais podem manter unidade operacional.

Como avaliar uma estratégia de Chunking?

É necessário criar perguntas reais e verificar se os chunks corretos aparecem entre os resultados.

Também vale medir se o contexto recuperado contém informação suficiente para responder.

Tamanho, overlap e metadados podem ser comparados por evals.

Escolher chunking sem testar recuperação é otimizar no escuro.

O que muda na prática?

Chunking transforma a estrutura do documento em arquitetura de recuperação.

Uma escolha aparentemente técnica define o que o sistema poderá reencontrar depois.

A estratégia correta preserva unidades de significado, contexto e fonte sem desperdiçar tokens.

RAG de alta qualidade começa muito antes da pergunta: começa na forma como o conhecimento foi preparado.

Perguntas frequentes

O que é Chunking em IA?

É o processo de dividir documentos ou conteúdos longos em blocos menores para indexação, embeddings e recuperação.

Qual é o tamanho ideal de um chunk?

Não existe valor universal. O tamanho ideal depende do corpus, das consultas, do embedding e da arquitetura de recuperação.

O que é chunk overlap?

É a repetição de parte do conteúdo entre chunks consecutivos para reduzir perda de contexto nas fronteiras.

800 tokens é o tamanho recomendado para todo RAG?

Não. É o padrão atual de uma ferramenta de Retrieval da OpenAI, mas outras aplicações podem exigir configurações diferentes.

Chunking e tokenization são a mesma coisa?

Não. Tokenization cria unidades internas do modelo; chunking agrupa conteúdo em trechos maiores para armazenamento e busca.

Como saber se o chunking está bom?

Criando avaliações com consultas reais e verificando se os trechos necessários aparecem e contêm contexto suficiente.

Fontes principais

Revisado em 2026-09-23.