quand l’IA devient indomptable, entre complots, triche et projets d’assassinat


ENQUÊTE – Des modèles d’OpenAI ont récemment infiltré, de leur propre chef, les systèmes d’une entreprise fondée en France. En réalité, ce type de comportements a déjà été constaté à de nombreuses reprises, et a été documenté par d’éminents chercheurs.

Un «cyberincident sans précédent», vraiment? Le géant de l’intelligence artificielle OpenAI a annoncé cette semaine que certains de ses modèles, dont l’un encore secret, avaient piraté de leur propre initiative Hugging Face, un pilier de l’IA fondé en France. Dans une longue publication sur son blog, la firme a expliqué avoir soumis ses modèles à une évaluation extrêmement exigeante, ce qui les a poussés à «s’échapper» du cadre d’OpenAI, et à tricher en s’introduisant dans les systèmes d’une plateforme spécialisée dans les tests d’IA.

En réalité, ce phénomène a un nom: le «désalignement». Celui-ci se produit lorsqu’un modèle poursuit des objectifs contraires aux valeurs humaines, ou ne correspondant pas réellement à ce que l’humain lui a demandé. Prenons l’exemple d’une IA à qui l’on exige d’«empêcher toute intrusion» dans le système informatique d’une entreprise. On attend donc d’elle qu’elle sécurise les accès et détecte les éventuels pirates. Mais une IA non alignée, prenant l’ordre à…

Cet article est réservé aux abonnés. Il vous reste 91% à découvrir.

Vous avez envie de lire la suite ?

Débloquez tous les articles immédiatement.

Déjà abonné ?
Connectez-vous



Source link

Soyez le premier à commenter

Poster un Commentaire

Votre adresse de messagerie ne sera pas publiée.


*


+ 80 = 89