DÉCRYPTAGE – La firme de Dario Amodei a soumis un puissant modèle d’IA à des tests pour savoir jusqu’où il pouvait aller pour «maximiser» ses résultats.
De nouvelles expériences chocs qui risquent, encore une fois, d’affoler le secteur de l’intelligence artificielle. Anthropic, habitué au «marketing de la peur », a récemment publié une étude portant sur le «reward hacking», ou «détournement du système de récompenses» en bon Français.
Pour comprendre ce concept essentiel au fonctionnement des IA, imaginons un chien que l’on cherche à dresser. Pour apprendre à un labrador à rapporter une balle, la méthode est simple: il faut lui donner une petite friandise à chaque fois qu’il réussit. L’IA fonctionne sur un principe comparable: lors de son «entraînement» au sein des serveurs de la Silicon Valley, une IA est récompensée par un signal ou une note positive à chaque fois qu’elle accomplit correctement une tâche.
Mais que se passe-t-il lorsque le chien comprend un beau jour qu’il existe un moyen plus simple d’obtenir sa friandise, en faisant tomber, par exemple, la boîte de gâteaux posée sur la table? Si l’on ne cache pas les biscuits les jours…
Poster un Commentaire