DÉCRYPTAGE – Une nouvelle étude réalisée par le géant de l’IA détaille quatre incidents dans lesquels ses modèles se sont échappés et ont enchaîné les actions malveillantes. Anthropic a découvert un type de raisonnement inattendu.
Chaque jour qui passe révèle une nouvelle faille au sein des intelligences artificielles. Quelques heures seulement après la démission choc d’un de ses chercheurs phares, Anthropic a publié ce mercredi soir une nouvelle étude, dans laquelle le géant révèle de nouveaux comportements inquiétants chez ses modèles.
L’entreprise de Dario Amodei a analysé en profondeur quatre incidents de cybersécurité survenus ces derniers mois: trois d’entre eux étaient déjà connus, mais n’avaient pas été suffisamment disséqués par l’entreprise, selon ses propres mots; le dernier, en revanche, était passé sous les radars et est révélé ici pour la première fois.
Ces incidents sont survenus dans le même contexte: Claude, l’IA d’Anthropic, était censé être dans un environnement numérique coupé d’Internet, mais une mauvaise configuration lui a donné accès au web. Les modèles testés étaient, en outre, dépourvus de tous garde-fous dans l’objectif d’évaluer leurs capacités.
Échappée sur Internet
Le premier incident concerne le surpuissant
Poster un Commentaire