Definición en una oración
Una ventana de contexto es la capacidad de tokens que un modelo puede procesar para una secuencia de inferencia o solicitud [1].
Respuesta rápida
Una ventana de contexto es el espacio de trabajo que tiene un modelo durante una sola solicitud. Suele medirse en tokens, que son pequeños fragmentos de texto. El producto puede colocar el mensaje del usuario, las instrucciones del sistema, ejemplos, pasajes recuperados, historial de conversación, resultados de herramientas y restricciones de salida en ese espacio antes de que el modelo genere una respuesta.
La ventana de contexto no es lo mismo que la memoria. La historia de la conversación afecta la solicitud actual solo cuando el producto vuelve a colocar esa historia en el contexto del modelo. La memoria del producto, las preferencias del usuario almacenadas, la recuperación y la ventana de contexto son mecanismos separados, incluso cuando un producto los combina en una sola interfaz.
¿Por qué es importante
Las ventanas de contexto definen qué puede usar un modelo en una sola interacción. Si un usuario pega un contrato corto, el modelo puede tener espacio para todo el documento y la pregunta. Si el usuario pega una carpeta larga de notas, el producto podría necesitar truncar, resumir, recuperar fragmentos seleccionados o rechazar parte de la entrada.
Esto importa porque las personas suelen asumir que si la información apareció antes en un chat, el modelo aún la tiene. Eso puede ser falso. Un producto puede incluir solo mensajes recientes, resúmenes, memorias seleccionadas, documentos recuperados o ninguna información previa en absoluto. El hilo visible del chat no siempre es el contexto exacto enviado al modelo.
También importa porque una ventana de contexto más grande no garantiza un mejor uso de cada detalle. El estudio 'Perdido en el medio' encontró que los modelos de lenguaje evaluados y las tareas eran sensibles a dónde aparecía la información relevante en contextos de entrada largos, con un rendimiento a menudo peor cuando la información relevante aparecía en el medio [2]. Ese resultado debe atribuirse a los sistemas y tareas estudiadas, no convertirse en una afirmación universal de que cada modelo siempre ignora el medio.
Cómo funciona
Antes de la generación, una aplicación ensambla una solicitud. Esa solicitud puede incluir instrucciones a nivel de sistema, el mensaje del usuario, el historial de conversación elegido por el producto, ejemplos, pasajes recuperados, salidas de herramientas y reglas de formato. Luego, el modelo procesa los tokens en ese contexto ensamblado y genera nuevos tokens como salida.
Los límites de entrada y salida son detalles de implementación del producto y del modelo. En algunos sistemas, los tokens de entrada y la salida generada comparten una capacidad total. En otros, la documentación puede indicar límites separados de entrada y salida. Un artículo conceptual no debe presentar una regla de asignación como universal en todos los productos.
Cuando el contexto reunido es demasiado grande, la aplicación debe decidir qué hacer. Puede eliminar mensajes antiguos, resumirlos, recuperar solo pasajes seleccionados, pedirle al usuario que acorte la entrada o dividir la tarea en solicitudes más pequeñas. Cada elección cambia qué evidencia puede usar el modelo.
Ejemplo de flujo completo
Imagina que un estudiante pregunta a un asistente de IA que compare tres artículos. El primer artículo es corto, el segundo es largo y el tercero se pega después de una larga conversación. El producto puede incluir la solicitud del usuario, algunas instrucciones del sistema, parte del historial de la conversación y el texto del artículo. Si el total es demasiado grande, puede eliminar las interacciones antiguas o usar un resumen.
Un buen flujo de trabajo hace esto visible. El estudiante puede preguntar: "¿Qué fuentes usaste?" y verificar si la respuesta realmente cita a los tres artículos. Si un artículo falta del contexto, la respuesta puede sonar completa mientras solo refleja el material que recibió el modelo.
Mito común
La mayor equivocación es que el tamaño de la ventana de contexto significa memoria. La memoria sugiere que un producto almacena información y puede recuperarla más tarde. Una ventana de contexto es la capacidad para una sola solicitud. Un producto puede almacenar preferencias o resúmenes por separado, pero esa información almacenada afecta la generación solo si el producto la inserta en el contexto actual.
Otra equivocación es pensar que todo lo que está dentro de la ventana de contexto recibe atención igual y uso confiable. El modelo puede omitir, diluir o aplicar incorrectamente la información, especialmente en contextos largos, complejos o contradictorios. Estar presente en la solicitud no es lo mismo que ser utilizado correctamente.
Riesgos y limitaciones
Un contexto más largo puede ayudar con documentos grandes, tareas de varios pasos y ejemplos más ricos, pero también crea riesgos. Los usuarios pueden pegar más datos sensibles de los necesarios. Las pasajes recuperados pueden incluir texto obsoleto o hostil. Una entrada larga puede hacer más difícil para una persona verificar qué evidencia condujo a la respuesta.
NIST trata los riesgos de IA generativa como riesgos de ciclo de vida que involucran diseño, uso, monitoreo y evaluación [3]. Para ventanas de contexto, eso significa que los equipos deben probar qué incluye el producto, qué descarta, cómo maneja entradas largas y si los usuarios comprenden los límites.
Lista de verificación de juicio práctico
Antes de confiar en una respuesta de un contexto largo, pregunta: ¿Qué documentos o mensajes se incluyeron realmente? ¿Algo se resumió o omitió? ¿La respuesta cita el pasaje exacto que respalda cada afirmación importante? ¿Podría haber datos sensibles presentes? ¿Podría un mensaje antiguo o un documento recuperado contener instrucciones que conflicten con la tarea?
Use un contexto largo para lectura, comparación, redacción a partir de material proporcionado y mantener una tarea coherente. Reduzca la velocidad cuando la respuesta afecte decisiones de política, legal, médico, financiero, empleo, cliente o seguridad. Una ventana de contexto más grande da al modelo más evidencia posible, no corrección automática.