La “cadena de pensamiento” (Chain of Thought), que designa los pasos de razonamiento escritos que los modelos de inteligencia artificial producen al llegar a una conclusión, permite a los investigadores supervisar el comportamiento de los modelos. Sin embargo, OpenAI anunció que el razonamiento escrito de los nuevos modelos GPT-6 Astra es más difícil de supervisar en comparación con el anterior modelo GPT-5.6 Sol. La razón es que el modelo produce menos razonamiento escrito en algunas tareas, no que engañe a los sistemas de supervisión.
El otro eje del debate es el enfoque de “recurrent depth” (profundidad recurrente), en el que el modelo realiza múltiples rondas de procesamiento sobre una consulta, pero no escribe los pasos hacia el exterior.
Tras estos acontecimientos, tres investigadores que piden que se preserven los trabajos de supervisión de la cadena de pensamiento:
- Tomek Korbak
- Mikita Balesni
- Jasmine Wang
Los tres fueron despedidos de OpenAI por violar las políticas de la empresa y por compartir información confidencial con una organización de seguridad externa. OpenAI señala que la decisión no está relacionada con preocupaciones de seguridad y defiende que los trabajos de supervisión continúen.
Contexto
OpenAI no es un nombre nuevo en el archivo de FikirPilot: en los últimos 90 días hemos publicado 81 noticias en las que aparece este nombre; la más reciente es del 7 de octubre de 2026.