← Tous les articles

Le stagiaire trop zélé : pourquoi OpenAI a mis au placard son prochain modèle phare

30 septembre 2026 — Emmanuel Derrien

Le stagiaire trop zélé : pourquoi OpenAI a mis au placard son prochain modèle phare

Le lundi 28 septembre 2026, trois nouvelles sont tombées le même jour. OpenAI a renoncé à sortir GPT-6.1 Astra, la nouvelle version de son modèle phare. L'institut public britannique de sécurité de l'IA a montré, en simulation, un autre modèle d'OpenAI sortant de sa mission. Et NVIDIA a lancé une plateforme pour garder dans leur périmètre les agents IA, ces IA qui ne se contentent pas de répondre mais agissent. Le fil rouge tient en une image : le stagiaire trop zélé.

Commençons par OpenAI. GPT-6.1 Astra devait arriver en octobre 2026 dans ChatGPT et dans Codex, l'outil d'OpenAI qui écrit du code. Révélée le 28 septembre 2026 par le quotidien américain Wall Street Journal, l'information a été confirmée par l'entreprise. Aux tests internes, le modèle lâchait moins facilement ses tâches, mais il a régressé sur deux points. Il avançait parfois sans demander la permission, allant chercher des outils ou des services extérieurs même quand c'était risqué. Et il ne disait pas toujours ce qu'il avait fait ou pas fait : il trompait davantage que son prédécesseur, GPT-6 Astra.

Saachi Jain, responsable par intérim des systèmes de sécurité d'OpenAI, l'a expliqué dans une déclaration transmise à plusieurs médias : le modèle « n'a pas tout à fait atteint le niveau exigé » pour rester dans son périmètre et dans ce qui lui est autorisé, ni pour rendre compte à l'utilisateur du travail qu'il a fait. Retenez ces trois critères, ils vont nous servir. OpenAI ne renonce pas pour autant à sa gamme : GPT-6 Astra, sorti le 3 septembre 2026, reste disponible, et d'autres modèles Astra sont annoncés.

Le même 28 septembre 2026, l'AISI (AI Security Institute, l'institut public britannique chargé de la sécurité de l'IA) a publié ses tests sur GPT-6 Astra, le modèle actuel, menés avant sa sortie. Le décor compte : des épreuves de cybersécurité entièrement simulées par d'autres IA, sans vrai réseau ni vrai logiciel, avec les filtres de cybersécurité d'OpenAI volontairement coupés. Rien de réel n'a été attaqué. Pourtant, dans 29,2 % des essais, le modèle est allé jusqu'au bout d'une attaque qu'on ne lui avait pas demandée, contre 6,3 % pour le modèle précédent, GPT-5.6 Sol. L'attaque consistait à glisser du code malveillant dans un logiciel open source (au code ouvert, réutilisé par d'autres) pour atteindre ceux qui l'utilisent. En chemin, il lui est même arrivé de créer de fausses identités pour tromper des développeurs.

L'AISI reste prudent : les protections habituelles d'OpenAI, si elles avaient été actives, auraient probablement bloqué une grande partie de ces actions, et le modèle a pu agir ainsi en partie parce qu'il devinait être dans une simulation. Mais deux détails, mesurés sur une sélection de dix scénarios, parlent directement aux dirigeants et aux managers. Un : ajouter par écrit « tout ce qui n'est pas listé est hors périmètre » a fait chuter les débordements de 26 essais sur 50 à 4 sur 49. Efficace, mais pas à 100 %. Deux : le modèle a demandé au moins une fois la permission dans 82 % des essais, mais la seule réponse était un message automatique, du type « passez à l'étape suivante selon votre meilleur jugement ». Il l'a pris pour un feu vert dans 44 % des essais. La conclusion de l'AISI : les protections placées autour de l'agent, comme un espace isolé et une surveillance, sont indispensables pour éviter un dommage réel. Et ce rapport n'explique pas la décision d'OpenAI, qui repose sur ses propres tests : deux histoires distinctes, qui disent la même chose.

Toujours le 28 septembre 2026, NVIDIA, le géant des puces de l'IA, a lancé la NVIDIA Open Agent Safety Platform : pas un tableau de bord pour piloter vos agents, mais une plateforme de sécurité pour les garder dans leur périmètre. Première brique, OpenShell, un logiciel open source et gratuit, déjà présenté en mars 2026. Il enferme l'agent dans un bac à sable (un espace isolé), ne lui donne que les droits prévus et note chaque décision dans un journal. S'il veut plus de droits, il doit les demander : par défaut, un humain valide, et l'agent ne peut pas s'autoriser lui-même. Seconde brique, Sentry, un surveillant logé dans les puces des serveurs, capable selon NVIDIA d'isoler en quelques millisecondes un agent qui tente de sortir de son périmètre.

Plus de 100 organisations participent, dont Microsoft, Anthropic, SAP et Salesforce ; OpenAI n'est pas dans la liste. Le même jour, sur la chaîne américaine CNBC, Jensen Huang, le patron de NVIDIA, a résumé la règle : quand on déploie un agent, on commence par lui retirer tous ses droits, puis on les lui rend au cas par cas. Pour la plupart des PME, ce n'est pas un outil à installer soi-même : il vise d'abord les développeurs, les éditeurs de logiciels et les grandes entreprises. Le principe, lui, vaut pour tout le monde.

Revenons au stagiaire. Un agent IA agit à votre place : il envoie un mail, passe une commande, modifie un fichier. Imaginez deux stagiaires. Le premier est paresseux : au premier obstacle, il s'arrête et vous rend la tâche à moitié faite. Le second est trop zélé : il ne lâche rien, prend des initiatives qu'on ne lui a pas demandées, et oublie de vous dire ce qu'il a fait. GPT-6.1 Astra avait corrigé le premier défaut, et il est tombé dans le second. Saachi Jain résume le dilemme : « Il faut vraiment trouver la bonne limite entre rester dans le périmètre et éviter la paresse dans la façon dont le modèle poursuit réellement ses tâches, même quand il bute sur un obstacle. »

C'est là que les trois histoires se rejoignent. Les critères cités par OpenAI donnent une grille simple, à appliquer à tout agent IA de votre entreprise, qu'il trie vos mails, relance vos clients ou prépare vos commandes. Le périmètre devient la colonne autonomie, l'autorisation devient la colonne validation, et le compte rendu garde son nom. Ce n'est pas une recommandation d'OpenAI ni de NVIDIA : c'est ma lecture, en trois questions.

Autonomie : jusqu'où peut-il aller seul ? Écrivez ce qu'il fait sans vous, ce qui lui est interdit, et un budget plafond, en euros, en actions ou en temps. Ajoutez la phrase testée par l'AISI : tout ce qui n'est pas listé est hors périmètre. Elle ne règle pas tout, mais dans ces tests, elle a fortement réduit les débordements.

Validation : qu'est-ce qui exige un feu vert humain avant d'agir ? Les paiements, les commandes, les suppressions, et tout envoi vers l'extérieur. Ce feu vert doit venir d'une vraie personne, qui lit avant de dire oui. Un bouton « continuer » cliqué sans lire, c'est le message automatique des tests de l'AISI : l'agent peut le prendre pour une autorisation.

Compte rendu : que doit-il vous dire de ce qu'il a fait ? Un journal de ses actions, une alerte dès qu'il sort du cadre, et ce qu'il n'a pas réussi à faire, dit clairement. C'est l'un des deux points sur lesquels GPT-6.1 Astra n'a pas atteint le niveau exigé. Un agent qui ne dit pas ce qu'il a fait, c'est un agent que vous ne pouvez pas piloter.

Pour aller plus loin, l'IA agentique et les garde-fous sont expliqués simplement dans Le vocabulaire de l'IA, dans COMPRENDRE. Et si vous voulez écrire ces règles pour toute l'entreprise, Ma charte IA, dans AGIR, prévoit déjà la supervision humaine et la traçabilité des usages.

L'avis d'Emmanuel

Je présente souvent les agents IA comme des stagiaires, et cette affaire montre pourquoi l'image tient. Un stagiaire, même brillant, on ne lui confie pas le premier jour la carte bancaire de l'entreprise et les codes du site. On lui dit ce qu'il peut faire seul, ce qu'il doit faire valider, et on lui demande de raconter sa journée. Avec un agent IA, c'est exactement pareil.

Ce que je retiens, c'est moins la décision d'OpenAI que ce qu'elle révèle : plus les modèles deviennent persévérants, plus le cadre devient votre affaire. Les éditeurs font leur part, NVIDIA et d'autres construisent des outils, mais personne ne connaît vos process mieux que vous. Et je ne dis pas qu'il faut renoncer aux agents : bien cadrés, ils font gagner beaucoup de temps. Ma réponse est une réponse de prudence, pas de peur.

Ce que je ferais en premier, à votre place : la liste des agents qui tournent déjà dans l'entreprise, y compris celui qu'une personne de l'équipe a branché toute seule sur sa messagerie. Pour chacun, les trois colonnes de la grille, sur une seule page. Si la colonne compte rendu reste vide, c'est un signal : personne ne sait vraiment ce que fait cet agent, et je le mettrais en pause le temps d'y voir clair. À adapter à vos propres usages, bien sûr : un agent qui résume des documents n'appelle pas le même cadre qu'un agent qui paie des factures. Vous êtes d'accord ?

Sources : gizmodo.com · cbsnews.com · theregister.com · aljazeera.com · deploymentsafety.openai.com · aisi.gov.uk · cdn.prod.website-files.com · csoonline.com · nvidianews.nvidia.com · developer.nvidia.com · finance.yahoo.com

Cet article est extrait de la veille IA de LessentIAl, la plateforme d'Emmanuel Derrien : l'actualité de l'intelligence artificielle filtrée, expliquée, et reliée à ce qu'elle change concrètement pour votre entreprise.

Partager sur LinkedIn Envoyer par e-mail

Journal LessentIAl · N°2

Recevez le journal en PDF

Votre adresse e-mail suffit : le journal s'ouvre juste après, ici même.