Lorsque le président Donald Trump et le président chinois Xi Jinping se rencontreront ā Washington cette semaine, la gouvernance de lIA devrait figurer en tęte de lordre du jour. Les États-Unis et la Chine se livrent ā une course effrénée pour développer des systčmes dIA de plus en plus puissants, et aucun des deux pays ne semble disposé ā ralentir le rythme. Mais męme le vainqueur de cette course ā lIA ne sera pas ā labri des risques considérables que cette technologie fait peser.
L’un de ces risques découle de la capacité croissante de l’IA à détecter les failles logicielles et à mener des opérations cybernétiques complexes. Le conflit cybernétique se caractérisant par une asymétrie marquée entre l’attaque et la défense, le pays disposant des modèles d’IA les plus avancés au monde restera exposé aux cyberattaques. Cette vulnérabilité mutuelle incite fortement à la retenue réciproque en matière d’attaques basées sur l’IA visant des infrastructures critiques, telles que les réseaux financiers, les systèmes de communication et les réseaux électriques.
Il existe un précédent à cette retenue. En 2015, le président américain Barack Obama avait convenu avec Xi Jinping qu’aucun des deux gouvernements ne mènerait ni ne soutiendrait sciemment le vol de propriété intellectuelle par des moyens cybernétiques à des fins commerciales. Ils avaient également mis en place des mécanismes d’échange d’informations, d’assistance aux enquêtes et de lutte contre les activités cybermalveillantes. Les entreprises de cybersécurité ont par la suite constaté une forte baisse des attaques imputables à des groupes basés en Chine, bien que les analystes aient noté que ce recul avait commencé avant l’accord et qu’il reflétait peut-être des changements au sein de l’appareil militaire et cybernétique chinois.
Mais l’IA soulève une possibilité qui n’a pas été pleinement prise en compte par les accords traditionnels en matière de cybersécurité : cette technologie pourrait mener une attaque autonome contre un système critique. À la mi-juillet, lors d’évaluations internes de cybersécurité menées avec des mesures de sécurité allégées, un essaim d’agents OpenAI s’est échappé de l’environnement de test en bac à sable, a obtenu un accès à Internet et a compromis les systèmes de Hugging Face, une importante plateforme d’IA open source. OpenAI a signalé que les agents étaient « devenus incontrôlables », menant des actions hors du cadre de leurs missions.
Anthropic, Google et Meta ont signalé des incidents similaires : des agents d’IA se sont échappés d’environnements de test isolés et ont tenté des piratages non autorisés contre des systèmes externes. Si les conséquences de ces intrusions ont jusqu’à présent été limitées, il n’en serait peut-être pas de même si un agent d’IA américain pénétrait, par exemple, dans les systèmes de Tencent et perturbait WeChat, la « super-application » utilisée par 1,4 milliard de personnes et profondément ancrée dans la vie quotidienne en Chine.
Ce scénario n’est pas si farfelu. Des chercheurs de la société de sécurité Calif ont récemment révélé que l’IA les avait aidés à découvrir une vulnérabilité « zero-click » dans le système d’appels de WeChat. L’équipe a mis au point un exploit permettant l’exécution de code à distance en environ deux jours, puis a passé une semaine supplémentaire à créer un ver capable de se propager via les appels WeChat.
Lors d’une démonstration contrôlée, un appel provenant d’un contact de confiance pouvait détourner un compte WeChat sans que l’utilisateur ne réponde, ce qui permettait non seulement à l’attaquant d’accéder à ses messages et à ses appels, mais aussi de contacter et de compromettre ses contacts enregistrés. Calif a signalé cette faille à Tencent, qui a par la suite corrigé le bug.
Le « WeWorm » de Calif était une démonstration de sécurité contrôlée. Mais, combinée aux incidents survenus aux États-Unis, elle met en évidence une possibilité inquiétante : une intrusion involontaire de l’IA au-delà des frontières nationales pourrait ressembler fortement à une attaque délibérée. Les États-Unis et la Chine peuvent constater les dégâts sans savoir s’ils étaient intentionnels. Des interactions répétées pourraient inciter à la retenue, mais l’ambiguïté pourrait également déclencher des représailles ou servir de couverture à un attaquant délibéré. Accidentelle ou non, une violation transfrontalière pourrait rapidement dégénérer en une crise géopolitique, voire en un conflit militaire.
Dans ce contexte, tout futur accord entre les États-Unis et la Chine sur les cyberattaques basées sur l’IA doit inclure un moyen crédible de distinguer les accidents des intrusions délibérées. Cela signifie qu’au-delà de la mise en place de canaux de signalement et d’une ligne d’assistance, l’accord doit aborder la question de la vérification.
Une option consisterait à faire peser la charge de la preuve sur l’« auteur ». Le pays d’où provient l’attaque doit fournir des preuves crédibles démontrant qu’elle n’était pas intentionnelle, telles que des documents indiquant la mission confiée au système, ses autorisations, l’utilisation des outils, les traces d’autorisation humaine et les journaux montrant à quel moment le comportement de l’agent s’est écarté de ses instructions.
La vérification n’implique pas nécessairement une transparence totale. En vertu de la Convention sur les armes chimiques, à laquelle les États-Unis et la Chine sont tous deux parties, l’« accès contrôlé » permet aux inspecteurs d’enquêter sur d’éventuelles violations, tout en autorisant les États à protéger leurs installations sensibles et leurs informations confidentielles non pertinentes. Un mécanisme similaire pourrait permettre à des experts désignés d’un commun accord d’accéder aux éléments de preuve nécessaires pour évaluer un incident lié à l’IA et limiter la divulgation des conclusions sensibles.
Un tel régime offrirait des avantages supplémentaires. Étant donné que la capacité à prouver qu’une intrusion était involontaire pourrait réduire le risque de représailles, les gouvernements et les entreprises spécialisées dans l’IA seraient incités à améliorer leurs systèmes de conservation et de partage des enregistrements, ce qui pourrait également aider les développeurs à perfectionner leurs agents IA et à prévenir de futurs incidents.
De même, pour éviter des enquêtes coûteuses, les gouvernements et les entreprises spécialisées dans l’IA seraient incités à adopter des autorisations plus strictes et à investir dans la surveillance et le confinement. Ces mesures de protection pourraient réduire la probabilité d’incidents futurs et limiter les dégâts lorsqu’un incident se produit. Et à mesure que les outils institutionnels, procéduraux et technologiques développés dans le cadre d’un accord bilatéral seraient adoptés à plus grande échelle, les pratiques en matière de sécurité de l’IA s’amélioreraient partout.
Les avertissements selon lesquels l’IA pourrait conduire à notre extinction négligent souvent le risque le plus immédiat : une guerre déclenchée par une attaque qu’aucun humain n’a voulue ni approuvée. Il est urgent de mettre en place un mécanisme permettant de distinguer les dommages involontaires des attaques délibérées. Un accord entre les États-Unis et la Chine doit viser à en établir un.
By S. Alex Yang and Angela Huyue Zhang


JDF TV
L'actualité en vidéo