Ir al contenido
Español
Contenido de FikirPilot

Mejor almacenamiento en caché de prompts para GPT-6

Actualizado: 03/10/2026 · 3 min de lectura · 539 palabras

Publicado: · Noticia recibida: · Tiempo de procesamiento: 247 h

Mejor almacenamiento en caché de prompts para GPT-6
Racks de servidores con iluminación azul

Share GPT-6 busca que los agentes persistentes trabajen durante horas en tareas complejas, como reorganizar bases de código, preparar documentos investigados y crear presentaciones. En las solicitudes API consecutivas de estos agentes, las instrucciones repetidas, las definiciones de herramientas y el contexto se almacenan en caché, lo que permite reutilizar el cómputo; los tiempos de respuesta se acortan y los desarrolladores obtienen descuentos de hasta el 90 % en los tokens de entrada almacenados en caché. La familia GPT-6 introduce un nuevo sistema de almacenamiento en caché que ofrece por defecto una mayor tasa de aciertos. Los prefijos comunes elegibles reciben el descuento cuando se reutilizan dentro de una ventana de 30 minutos.

  • Prompt Caching Dashboard muestra la cantidad de entradas servidas desde la caché y las tasas de acierto a lo largo del tiempo; permite comparar los tokens almacenados en caché con los que no lo están.
  • prompt caching diagnostics tool compara los cambios en el modelo, las herramientas, la configuración o las entradas cuando se producen fallos de caché. En el ejemplo, la causa se indica como “tools_changed”, mientras que el número de tokens reutilizables comparables es 5629 y el número de tokens que no se encontraron en la caché es 5629.
  • Con puntos de corte explícitos de la caché, se puede seleccionar qué prefijos de instrucciones se almacenarán.
  • En los modelos GPT-6, reasoning effort puede cambiarse entre respuestas sin invalidar la caché.
  • Las definiciones de herramientas, los esquemas y el orden pueden mantenerse constantes; se puede utilizar allowed_tools o tool_choice.
  • Se pueden añadir nuevos mensajes del desarrollador al final del contexto para invalidar las instrucciones anteriores.
  • Prewarming prepara el contexto común antes de la solicitud del usuario. Codex, por su parte, ayuda a revisar el código y aplicar mejoras.

Por qué es importante

Esta modificación facilita la gestión del coste y la latencia derivados de que los agentes de larga duración vuelvan a procesar en cada paso las mismas instrucciones, la información de las herramientas y el contexto. En particular, los desarrolladores de aplicaciones que trabajan con bases de código, generan documentos o realizan múltiples llamadas a API podrán evaluar el rendimiento no solo por la respuesta del modelo, sino también por la eficacia con la que se utiliza la caché. El dashboard y la herramienta de diagnóstico hacen más concreto el proceso de depuración al mostrar si un fallo de caché se debe a cambios en las herramientas, la configuración o las entradas. La posibilidad de establecer puntos de interrupción explícitos y modificar el nivel de razonamiento permite establecer una relación más controlada entre el comportamiento del agente y el uso de la caché. Sin embargo, el alcance de la mejora sigue dependiendo de hasta qué punto pueden conservarse los prefijos comunes y la configuración de las herramientas a lo largo del flujo de trabajo.

Antecedentes

GPT no es un nombre nuevo en el archivo de FikirPilot: en los últimos 90 días hemos publicado 4 noticias en las que aparece este nombre; la más reciente está fechada el 29 de septiembre de 2026.

Término: agente

Un agente de inteligencia artificial es un software que, en lugar de generar una única respuesta, realiza un trabajo de varios pasos mediante llamadas a herramientas para alcanzar un objetivo.

Fuente: OpenAI