ces inquiétantes expériences d’Anthropic sur ces IA qui s’affranchissent de toutes les règles


DÉCRYPTAGE – La firme de Dario Amodei a soumis un puissant modèle d’IA à des tests pour savoir jusqu’où il pouvait aller pour «maximiser» ses résultats.

De nouvelles expériences chocs qui risquent, encore une fois, d’affoler le secteur de l’intelligence artificielleAnthropic, habitué au «marketing de la peur », a récemment publié une étude portant sur le «reward hacking», ou «détournement du système de récompenses» en bon Français.

Pour comprendre ce concept essentiel au fonctionnement des IA, imaginons un chien que l’on cherche à dresser. Pour apprendre à un labrador à rapporter une balle, la méthode est simple: il faut lui donner une petite friandise à chaque fois qu’il réussit. L’IA fonctionne sur un principe comparable: lors de son «entraînement» au sein des serveurs de la Silicon Valley, une IA est récompensée par un signal ou une note positive à chaque fois qu’elle accomplit correctement une tâche.

Mais que se passe-t-il lorsque le chien comprend un beau jour qu’il existe un moyen plus simple d’obtenir sa friandise, en faisant tomber, par exemple, la boîte de gâteaux posée sur la table? Si l’on ne cache pas les biscuits les jours…

Cet article est réservé aux abonnés. Il vous reste 91% à découvrir.

Vente Flash

-70% sur votre abonnement. Sans engagement.

Déjà abonné ?
Connectez-vous



Source link

Soyez le premier à commenter

Poster un Commentaire

Votre adresse de messagerie ne sera pas publiée.


*


6 + 4 =