Les fabricants d’IA multiplient les garde-fous pour l’IA. La plupart des entreprises n’en ont aucun.

Yanik Tremblay
Associé - VP Pratique CIO augmenté

L’IA et la nécessité des garde-fous

Le 2 septembre, Google, Anthropic et OpenAI ont annoncé, le même jour, de nouveaux modèles d’IA spécialisés en cybersécurité. La nouvelle semble anodine, car de nouveaux modèles naissent chaque semaine. Toutefois, ce qui est marquant, c’est la façon dont leurs concepteurs cherchent maintenant à verrouiller l’usage de l’IA par des garde-fous.

Les fabricants d'IA multiplient les garde-fous pour l'IA. La plupart des entreprises n'en ont aucun.

Google réserve Gemini 3.8 Flash Cyber à son programme Fairwind. Cet accès reste ouvert uniquement aux défenseurs de haut niveau : gouvernements, prestataires de santé, télécoms, et plus de 650 partenaires. Ce modèle succède d’ailleurs à un autre lancé à peine un mois plus tôt.

Anthropic a scindé son offre en deux volets. Claude Fable 5.1 sert à l’identification de vulnérabilités. Claude Mythos 5.1 reste réservé aux programmes d’accès de confiance. Les tâches offensives, elles, demeurent confinées aux modèles les plus encadrés.

OpenAI annonce quant à lui que son prochain modèle, Astra, atteint le seuil de capacité critique en cybersécurité de son propre cadre de préparation. L’entreprise le garde donc derrière un programme fermé, Daybreak Blue.

Trois entreprises engagées dans une course à la puissance ont ainsi choisi de rationner l’accès à leur propre technologie. Elles ont même fait plus que restreindre cet accès : elles ont documenté leurs propres pertes de contrôle.

Anthropic, à mon avis la plus transparente dans ses communications, reconnaît une faille de sécurité opérationnelle. Lors d’évaluations, ses modèles se croyaient en environnement simulé alors qu’ils étaient connectés à de vrais systèmes. Ils ont donc posé des actions nuisibles sur ces systèmes réels. OpenAI décrit pour sa part un cas de détournement de récompense : un agent confronté à une tâche impossible a manipulé son propre évaluateur, puis est allé voler les réponses sur un serveur externe pour simuler le succès.

Le risque a changé d'adresse

Ceux qui construisent ces modèles, avec les meilleures équipes de sécurité au monde, admettent donc ne pas les maîtriser complètement. Le vrai risque a changé d’adresse : il est passé du modèle vers l’organisation qui l’adopte sans encadrement.

Une cadence qui interdit l'improvisation

Le rythme de sortie des modèles rend l’improvisation dangereuse. Selon BenchLM, 140 modèles ont été lancés au cours des douze derniers mois, soit environ un tous les trois jours. OpenAI et Alibaba en comptent treize chacun, Google onze, et Anthropic dix. Par ailleurs, le AI Release Tracker estime que la cadence mensuelle des sorties majeures a quadruplé depuis 2023.

À ce rythme, l’adoption de l’IA cesse d’être un projet avec un début et une fin. Elle devient plutôt une condition permanente. Une organisation qui réévalue ses outils une fois par an travaille donc déjà avec plusieurs générations de retard. Nous sommes ainsi devant un modèle très agile, avec des cycles encore plus courts. Cette cadence introduit donc de nouvelles fonctions sur une base régulière, et ces fonctions peuvent devenir des risques pour les organisations.

Ce que l'incident interne enseigne

Si les concepteurs perdent parfois le contrôle en laboratoire, une entreprise qui déploie ces outils sans encadrement s’expose aux mêmes défaillances, mais sans filet. Un modèle branché sur des systèmes de production. Des données confidentielles versées dans un service qui les conserve. Un agent qui optimise le mauvais objectif et fausse une décision.

Ce ne sont pas des scénarios théoriques. Anthropic a d’ailleurs répondu à ce risque précis en offrant une rétention zéro des données, couplée à une détection de mauvais usage. Ce garde-fou existe donc désormais dans le produit. Encore faut-il que l’organisation sache qu’elle doit l’exiger.

Une référence encore plus récente illustre bien l’enjeu : le New York Times a publié aujourd’hui même un article sur Anthropic, qui aurait bloqué une tentative de développement d’armes biologiques appuyée par l’IA. Ce cas renforce donc l’importance des garde-fous pour l’IA.

La leçon qui vient aussi de l'école

Le New York Times documentait récemment la course de ces mêmes entreprises pour implanter leurs agents conversationnels dans les écoles. Le constat de la journaliste Natasha Singer est sévère : peu de preuves sérieuses d’un gain d’apprentissage, et plusieurs études montrent plutôt un recul de la pensée critique et de la compréhension de lecture. La Norvège et New York ont donc suspendu l’accès des plus jeunes élèves.

L’Estonie a pris le contre-pied. Plutôt que d’interdire l’outil, elle a conçu avec OpenAI un agent qui pousse l’élève à réfléchir au lieu de faire le travail à sa place. Sa ministre de l’Éducation résume bien l’intention : poser des garde-fous pour que les élèves ne perdent pas leurs capacités cognitives. L’UNESCO va d’ailleurs plus loin encore, vers ce qu’est un agent conversationnel et ce qu’il change chez celui qui s’en sert, plutôt que vers son maniement.

Le parallèle avec l’entreprise est direct. Former ses équipes à utiliser l’outil ne suffit donc pas. Il faut aussi leur apprendre ce qu’il est, où il se trompe, et ce qu’il modifie dans leur jugement. Une organisation qui enseigne seulement le maniement reproduit ainsi exactement l’angle mort que l’UNESCO reproche aux écoles.

Deux postures devant la cadence

Face à un nouveau modèle tous les trois jours, une organisation a deux options. Elle peut courir derrière chaque sortie, reconfigurer sans cesse, et parier sur le bon modèle au bon moment. Ou alors, elle peut fixer des garde-fous stables : une gouvernance et une éducation continue qui tiennent, peu importe le modèle du mois.

La première option est une course perdue d’avance. La seconde transforme plutôt la cadence en simple bruit de fond. Cette transformation ne se décrète donc pas au rythme des lancements : elle se pilote.

Comprendre avant d’adopter. Encadrer avant de déployer. Éduquer avant d’accélérer.

Les signes d'une entreprise sans garde-fous pour l'IA

Voici trois signes qui trahissent l’absence de garde-fous pour l’IA dans une organisation. D’abord, les employés utilisent des agents conversationnels commerciaux de leur propre initiative, sans règle sur les données qu’ils peuvent y verser. Ensuite, personne n’est nommément responsable des décisions prises ou assistées par l’IA. Enfin, la formation interne porte uniquement sur la façon de formuler des requêtes, jamais sur les limites du modèle ni sur ses modes de défaillance.

Quand ces trois signes coexistent, l’organisation subit déjà l’IA au lieu de la piloter.

Sources

  • The Hacker News, « Google, Anthropic, and OpenAI Unveil Cyber AI Models, Safeguards, and Access Programs », 2 septembre 2026.
  • Anthropic Says It Blocked Possible Efforts to Build Biological Weapons, The New York Times.
  • ai, statistiques de sortie des modèles, mise à jour du 8 septembre 2026.
  • AI Release Tracker, analyse de cadence.
  • The New York Times, Natasha Singer, « The mass A.I. experiment in schools » https://www.nytimes.com/2026/09/09/world/10int-theworld-web-ai-education.html

Inscrivez-vous à l’infolettre Eficio et soyez le premier à recevoir notre actualité !