Uma janela de contexto é a informação que um modelo consegue considerar durante uma geração. Ela inclui instruções, histórico de conversa, documentos recuperados, descrições de ferramentas, resultados de ferramentas, imagens representadas como tokens e espaço reservado para a resposta. Ela se parece mais com memória de trabalho do que com o conhecimento aprendido pelo modelo.
Essa distinção evita um erro comum. Um modelo pode conhecer um conceito geral a partir do treinamento, mas não ter o fato privado necessário para sua tarefa. O inverso também pode ocorrer: o fato pode estar presente no contexto, mas o modelo pode não percebê-lo ou aplicá-lo quando o pedido está cheio de material irrelevante.
Cada token compete por atenção. Uma janela grande permite que uma aplicação envie mais material, mas não garante recordação ou raciocínio uniformes sobre esse material. Evidências importantes podem se tornar difíceis de encontrar, passagens repetidas podem enviesar uma resposta e resultados longos de ferramentas podem deslocar as instruções que definem o sucesso.
Planeje o orçamento a partir da saída, de trás para frente. Reserve espaço suficiente para a resposta e para qualquer raciocínio ou atividade de ferramenta que o modelo possa gerar. Depois, distribua o espaço entre instruções estáveis, a pergunta atual, o estado recente da conversa e as evidências de apoio. Não preencha a capacidade restante apenas porque ela existe.
Prefira contexto de alto sinal. Para uma pergunta sobre documento, inclua as passagens relevantes com seus títulos, datas e identificadores de fonte. Para uma tarefa de programação, inclua as interfaces, os testes, a saída de erro e a implementação próxima, em vez de todo o repositório. Para um agente, disponibilize referências leves que ele possa inspecionar quando necessário, em vez de carregar antecipadamente todos os recursos possíveis.
Conversas longas exigem uma estratégia explícita de estado. A compactação resume o trabalho anterior em um artefato menor. Notas estruturadas preservam decisões, restrições, questões em aberto e etapas concluídas fora da transcrição imediata. A recuperação traz de volta apenas o que a próxima ação precisa. Essas abordagens trocam o histórico literal pela coerência contínua.
A compactação pode perder detalhes, portanto o resumo deve distinguir fatos duráveis de observações temporárias. Registre identificadores, caminhos, decisões, links de evidência e riscos não resolvidos exatos. Mantenha artefatos importantes — testes, especificações, dados e resultados finais — em sua forma nativa, em vez de depender de um resumo de conversa para reproduzi-los.
O cache de prompts pode reduzir custo ou latência para prefixos repetidos, mas os tokens em cache ainda ocupam a janela de contexto. O cache muda como a entrada repetida é processada ou cobrada; ele não transforma a janela em memória ilimitada.
O uso de ferramentas acrescenta outra pressão. Esquemas, resultados, capturas de tela e raciocínio intermediário consomem capacidade. Limpe resultados obsoletos de ferramentas quando a plataforma permitir, resuma grandes saídas e mantenha referências à evidência bruta. Um agente útil deve conseguir reabrir uma fonte em vez de carregar todos os bytes para sempre.
Avalie o design de contexto com entradas longas e realistas. Coloque fatos importantes em posições diferentes, adicione distrações plausíveis e teste perguntas de acompanhamento após várias chamadas de ferramenta. Meça não apenas se o modelo consegue citar um fato, mas se aplica a versão correta e cita a fonte certa.
O melhor contexto não é o contexto máximo. É o menor conjunto de trabalho atual que preserva a meta, as restrições, as evidências e a próxima decisão. Janelas maiores ampliam o que é possível; a engenharia cuidadosa de contexto determina o que permanece confiável.
Combinamos fontes primárias, documentação de produtos e cenários reais de uso para ajudar você a avaliar se uma ferramenta combina com seu fluxo de trabalho.