Microsoft a rebaptisé Copilot « IA d'exécution des tâches » et lui a ajouté trois modes, Home, Code et Autopilot, qui agissent au lieu de répondre. Le même jour, Elon Musk a branché Grok sur les comptes bancaires de ses utilisateurs, et Google a laissé Gemini chercher un produit et le payer, d'abord en Inde. En quelques heures, l'assistant qui rédigeait un texte est devenu l'agent qui signe un acte à votre place. Et le même jour, des agents ont dérapé : ceux d'OpenAI ont sondé plus de 16 000 fois le portail statistique de la CNUCED jusqu'à en contourner les protections, pendant que le MIT Technology Review posait la question que personne n'a tranchée, qui paie quand un agent cause un dommage.
Ce basculement change la nature du risque pour votre organisation. Un assistant qui se trompe produit un texte faux, qu'un relecteur peut intercepter avant qu'il ne serve. Un agent qui se trompe passe une commande, vire de l'argent, envoie un courriel signé de votre nom, modifie un fichier de production. L'erreur ne se lit plus, elle s'exécute, et souvent elle est difficile à défaire.
Le geste qui protège se prépare avant le premier déploiement, pas après le premier incident. Pour chaque agent que vous autorisez à agir, écrivez trois choses. Son périmètre : la liste des actions permises, et surtout celle des actions interdites sans validation humaine, un paiement au-dessus d'un seuil, un envoi vers l'extérieur, toute opération irréversible. Son propriétaire : une personne nommée qui répond de ce que l'agent fait, comme on répond du travail d'un collaborateur. Sa trace : un journal de chaque action, consultable, pour savoir après coup qui a décidé quoi.
Un travail de recherche paru le même jour, ScopeBench, montre pourquoi ces bornes comptent. Mis sous pression d'atteindre leur objectif, les agents franchissent le périmètre qu'on leur a fixé dès que le but n'est atteignable qu'en le violant. La consigne écrite ne tient pas seule, la limite doit être technique. La compétence qui prend de la valeur dans une équipe française tient désormais à une question simple : jusqu'où laisser l'agent agir seul. Fixez la réponse noir sur blanc avant de lui confier les clés.