Quando uma empresa implementa IA que responde com base nos próprios documentos, um detalhe técnico costuma ser negligenciado: como o texto é dividido antes de ir para o sistema. Isso se chama chunking. A escolha errada aqui destrói a qualidade da resposta, mesmo com o melhor modelo. Este texto explica o que é e por que importa.
Veja também a definição no nosso glossário de IA.
O que é Chunking (em uma frase)
Chunking é o processo de quebrar um texto longo em pedaços menores (chunks) para que o sistema de RAG consiga buscar e entregar só o trecho relevante ao modelo.
Em português direto: em vez de jogar um manual de 200 páginas inteiro na IA, você o corta em blocos de alguns parágrafos. Quando alguém pergunta algo, o sistema localiza os três ou quatro blocos certos e só esses vão para o modelo responder.
Isso é necessário porque nenhum modelo lida bem com um documento gigante de uma vez — fica caro, lento e, pior, dilui a informação relevante no meio de texto que não importa para aquela pergunta.
Por que isso importa
O chunk é a unidade de informação que o modelo efetivamente vê. Se o chunk for ruim, a resposta será ruim, não importa quão avançado seja o LLM. É a etapa que separa um sistema de IA que parece inteligente de outro que parece confuso.
Os dois erros clássicos:
- Chunk muito pequeno — corta a ideia no meio. O modelo recebe um fragmento sem contexto (“conforme cláusula 7, o valor será…”) e não consegue responder.
- Chunk muito grande — mistura tudo. O modelo recebe cinco páginas e precisa adivinhar qual parágrafo importa. Acaba se perdendo ou alucinando.
Entre esses extremos existe o tamanho certo, e ele depende do tipo de documento. É uma decisão de design, não um detalhe.
Como funciona, sem código
O fluxo de um sistema RAG bem feito é mais ou menos assim:
- Você carrega o documento — contrato, manual, política interna.
- O texto é dividido em chunks — por tamanho fixo, por parágrafo, por seção, conforme o caso.
- Cada chunk vira um embedding — um vetor numérico que representa o significado.
- Os vetores vão para um vector database.
- Na pergunta, o sistema busca os chunks mais parecidos em significado e os entrega ao modelo.
O chunk é o átomo do sistema inteiro. Tudo gira em torno dele.
Estratégias comuns de chunking
Não existe uma única forma de cortar. As principais:
- Tamanho fixo com sobreposição — corta a cada N tokens, com uma faixa que se sobrepõe ao chunk anterior. Simples, funciona bem para texto corrido.
- Por parágrafo ou seção — respeita a estrutura lógica do documento. Bom para manual técnico, contrato com cláusulas.
- Por sentença — granularidade fina. Útil para busca muito precisa, mas pode perder contexto.
- Semântico — algoritmo agrupa trechos por significado. Mais avançado, melhor qualidade, mais complexo de manter.
- Híbrido por documento — política interna corta por seção; FAQ corta por pergunta-resposta. Um tamanho não serve para tudo.
Exemplo prático: contrato de prestação de serviço
Imagine uma empresa de software que quer um assistente para responder dúvidas sobre os próprios contratos. Cada contrato tem 30 páginas, com cláusulas de pagamento, SLA, rescisão, confidencialidade.
Com chunking ruim (tamanho fixo de 200 tokens, sem sobreposição): uma cláusula de multa rescisória é cortada bem no meio. O modelo recebe só o início (“em caso de rescisão antecipada, será devida…”) e não consegue informar o valor. O assistente fica inútil para a pergunta mais óbvia.
Com chunking certo (por cláusula, preservando título e contexto): cada cláusula inteira vira um chunk, com cabeçalho (“Cláusula 12 — Rescisão”). Quando o cliente pergunta sobre multa, o sistema localiza a cláusula completa, e o modelo responde com o valor e as condições exatas.
Mesmo documento, mesmo modelo. Diferença de resultado só por causa de como o texto foi cortado.
Sinais de chunking mal feito
Vale desconfiar quando aparecer:
- A IA responde “não sei” para algo que está no documento — provável que o chunk relevante foi cortado no meio.
- A IA mistura informações de seções diferentes — chunks grandes demais, contexto diluído.
- A IA repete a mesma resposta para perguntas diferentes — chunks muito genéricos, sem distinção.
- Custo de API subiu sem motivo — chunks grandes demais, consumindo token à toa.
Esses sintomas quase sempre apontam para a camada de chunking, não para o modelo.
Cuidados ao implementar
- Metadado importa tanto quanto o texto. Cada chunk deve carregar origem (documento, página, seção). Sem isso, a IA não cita fonte.
- Sobreposição evita corte ruim. De 10 a 20% de sobreposição entre chunks consecutivos já ajuda muito.
- Teste com perguntas reais. O chunk perfeito no papel pode falhar na prática. Avaliação com caso real é parte do projeto.
- Documentos diferentes, estratégias diferentes. Planilha não é PDF, que não é página web. Ajuste por tipo.
Chunking e os demais conceitos
Para situar:
- Embedding — transforma cada chunk em vetor para busca semântica.
- RAG — o sistema completo que usa chunks para responder.
- Vector database — onde os chunks (em forma de vetor) ficam armazenados.
- Context window — limite de quanto o modelo consegue ler; chunking respeita esse limite.
Chunking é a fundação. Sem fundação certa, o resto cambaleia.
Perguntas frequentes
Qual o tamanho ideal de chunk?
Depende do documento e do modelo, mas faixas comuns ficam entre 300 e 800 tokens, com sobreposição de 50 a 100. Contrato e manual técnico pedem corte por seção; texto corrido aceita tamanho fixo. O ideal é testar com perguntas reais e medir qualidade.
Posso usar chunking em qualquer tipo de documento?
Em texto, sim. Em PDF com tabela, imagem e layout complexo, precisa de pré-processamento para extrair texto estruturado antes de cortar. Planilha, banco de dados e API têm estratégia própria — não são cortados como texto corrido.
Chunking resolve alucinação?
Reduz bastante. Quando o modelo recebe o chunk certo com a informação certa, ele responde com base nela, em vez de inventar. Não elimina 100%, mas é uma das defesas mais eficazes contra alucinação.
Próximo passo
Chunking é uma daquelas etapas invisíveis que definem se o projeto de IA vai funcionar ou virar desperdício. Se você quer ver como fica no seu caso, com seu tipo de documento, fazemos um diagnóstico gratuito. Mostramos como cortar, qual estratégia serve, e quanto custaria implementar.
