Una ventana de contexto es la información que un modelo puede considerar durante una generación. Incluye instrucciones, historial de conversación, documentos recuperados, descripciones de herramientas, resultados de herramientas, imágenes representadas como tokens y espacio reservado para la respuesta. Se parece más a la memoria de trabajo que al conocimiento aprendido por el modelo.
Esta distinción evita un error común. Un modelo puede conocer un concepto general por su entrenamiento y aun así no disponer del dato privado necesario para tu tarea. También puede ocurrir lo contrario: el dato está presente en el contexto, pero el modelo no lo detecta o no lo aplica cuando la solicitud está saturada de material irrelevante.
Cada token compite por atención. Una ventana grande permite que una aplicación envíe más material, pero no garantiza una memoria o un razonamiento uniformes sobre todo ese material. La evidencia importante puede ser difícil de localizar, los pasajes repetidos pueden sesgar una respuesta y los resultados extensos de herramientas pueden desplazar las instrucciones que definen el éxito.
Planifica el presupuesto empezando por la salida. Reserva espacio suficiente para la respuesta y para cualquier actividad de razonamiento o herramientas que el modelo pueda generar. Después distribuye el espacio entre instrucciones estables, la pregunta actual, el estado reciente de la conversación y la evidencia de apoyo. No llenes la capacidad restante solo porque exista.
Da prioridad al contexto de alta señal. Para una pregunta sobre documentos, incluye los pasajes pertinentes junto con sus títulos, fechas e identificadores de fuente. Para una tarea de programación, incluye las interfaces, las pruebas, la salida de errores y la implementación cercana, en lugar de todo el repositorio. Para un agente, ofrece referencias ligeras que pueda consultar cuando las necesite, en vez de cargar por adelantado todos los recursos posibles.
Las conversaciones largas necesitan una estrategia explícita de estado. La compactación resume el trabajo anterior en un artefacto menor. Las notas estructuradas conservan decisiones, restricciones, preguntas abiertas y pasos completados fuera de la transcripción inmediata. La recuperación trae de vuelta solo lo que necesita la siguiente acción. Estos enfoques intercambian historial literal por coherencia sostenida.
La compactación puede perder detalles, por lo que el resumen debe distinguir los hechos duraderos de las observaciones temporales. Registra identificadores, rutas, decisiones, enlaces de evidencia y riesgos sin resolver con exactitud. Conserva los artefactos importantes —pruebas, especificaciones, datos y resultados finales— en su forma nativa, en vez de confiar en que un resumen conversacional los reproduzca.
El almacenamiento en caché de prompts puede reducir el coste o la latencia de prefijos repetidos, pero los tokens almacenados en caché siguen ocupando la ventana de contexto. La caché cambia cómo se procesa o factura la entrada repetida; no convierte la ventana en memoria ilimitada.
El uso de herramientas añade otra presión. Los esquemas, resultados, capturas de pantalla y razonamiento intermedio consumen capacidad. Elimina resultados obsoletos cuando la plataforma lo permita, resume las salidas grandes y conserva referencias a la evidencia sin procesar. Un agente útil debería poder volver a abrir una fuente, en lugar de conservar cada byte para siempre.
Evalúa el diseño de contexto con entradas largas y realistas. Coloca los hechos importantes en posiciones distintas, añade distractores plausibles y prueba preguntas de seguimiento después de varias llamadas a herramientas. No midas solo si el modelo puede citar un hecho, sino si aplica la versión correcta y cita la fuente adecuada.
El mejor contexto no es el máximo contexto. Es el conjunto de trabajo actual más pequeño que conserva el objetivo, las restricciones, la evidencia y la siguiente decisión. Las ventanas más grandes amplían lo posible; una ingeniería cuidadosa del contexto determina qué sigue siendo fiable.
Combinamos fuentes primarias, documentación de producto y casos de uso reales para ayudarte a valorar si una herramienta encaja en tu flujo de trabajo.