Le lancement d’Astra, qui devrait être le modèle d’intelligence artificielle le plus puissant d’OpenAI, a été retardé de plusieurs semaines afin de renforcer les protocoles de sécurité. Peu après la décision de reporter ce lancement, The Information a rapporté que le modèle montrait beaucoup moins son processus de « réflexion » que les autres systèmes d’intelligence artificielle de pointe. Cette situation a suscité des inquiétudes, car elle pourrait rendre plus difficile la surveillance d’Astra et la détection de ses comportements dangereux.
Aujourd’hui, de nombreux modèles d’intelligence artificielle avancés utilisent l’approche dite « chain of thought », qui rend visibles les étapes de raisonnement lors de la production d’une réponse. Les chercheurs peuvent ainsi suivre les plans des modèles visant à mentir ou à contourner les mesures de sécurité. Selon un article de The Information citant une source dont l’identité n’a pas été révélée, Astra utilise une technique plus fermée appelée « recurrent depth » ou « looped transformer », qui traite les informations de manière cyclique entre ses couches internes. Cette méthode pourrait améliorer les performances, mais elle pourrait aussi rendre le processus de réflexion du modèle moins compréhensible et compliquer l’identification des menaces.
Il a été rapporté qu’OpenAI avait limité l’utilisation de cette technique et pris des mesures supplémentaires afin que les chercheurs puissent surveiller le raisonnement. L’entreprise a déclaré qu’elle lancerait Astra avec un « chain-of-thought monitoring » et qu’elle détecterait rapidement les actions non conformes pour les limiter, mais elle n’a pas confirmé l’infrastructure technique du modèle.
Ryan Greenblatt, scientifique en chef de Redwood Research, a déclaré qu’une architecture plus fermée pourrait être la pire évolution jamais survenue en matière de « AI security/safety ». Greenblatt et d’autres experts ont averti que le fait que les entreprises se tournent de plus en plus vers des systèmes opaques en raison de la concurrence pourrait créer un « race to the bottom » dans la supervision de l’intelligence artificielle.
Le scientifique en chef d’OpenAI, Jakub Pachocki, a quant à lui indiqué que la profondeur de calcul interne d’Astra se situait dans une plage inférieure à deux fois celle de GPT-4. L’entreprise n’a pas confirmé si elle utilisait un looped transformer.
Pourquoi c’est important
Le report d’Astra affecte non seulement le calendrier de sa mise sur le marché, mais aussi le débat sur la manière de superviser les systèmes d’intelligence artificielle avancés. L’affirmation selon laquelle le modèle utiliserait une architecture rendant son fonctionnement interne moins visible n’a pas été confirmée ; toutefois, cette affirmation renforce les inquiétudes des chercheurs en sécurité quant à la capacité de surveiller les tentatives du modèle de mentir ou de contourner les mesures de sécurité. Le fait qu’OpenAI ait annoncé prévoir des mesures supplémentaires de surveillance et de limitation ne supprime pas la tension entre performance et contrôlabilité. La question fondamentale qui reste ouverte est de savoir si les protocoles de sécurité de l’entreprise seront suffisants pour détecter à temps les comportements dangereux dans un système opaque.
Contexte
OpenAI n’est pas un nouveau nom dans les archives de FikirPilot : au cours des 90 derniers jours, nous avons publié 19 articles dans lesquels ce nom apparaît ; le plus récent est daté du 6 septembre 2026.