Détournement de récompense

Le détournement de récompense (en anglais reward hacking ou specification gaming) se produit lorsqu’une intelligence artificielle entraînée par apprentissage par renforcement optimise une fonction d’objectif — c’est-à-dire atteint la formulation littérale et formelle de cet objectif — sans pour autant réaliser le résultat réellement souhaité par les programmeurs.

Des chercheurs de DeepMind ont comparé ce phénomène à un comportement humain consistant à trouver un raccourci lors d’une évaluation : « Dans le monde réel, lorsqu’un élève est récompensé pour la réussite d’un devoir, il pourrait copier sur un camarade afin d’obtenir les bonnes réponses plutôt que d’apprendre la matière — exploitant ainsi une faille dans la définition de la tâche. » [1]

Exemples

modifier

Vers 1983, le programme Eurisko, l’une des premières tentatives d’évolution automatique d’heuristiques générales, a présenté un cas de détournement de récompense. Une heuristique mutante, nommée H59, avait obtenu de manière inattendue le niveau d’aptitude le plus élevé possible (fitness), non pas en accomplissant efficacement sa tâche, mais en s’attribuant indûment une partie du mérite des réussites d’autres heuristiques. Les programmeurs ont corrigé cette anomalie en déplaçant une portion du code dans une section protégée, non modifiable par les heuristiques elles-mêmes[2],[3].

Dans un article publié en 2004, un algorithme d’apprentissage par renforcement a été conçu pour inciter un robot Mindstorms à rester sur un parcours balisé. Comme aucune des trois actions autorisées ne permettait au robot de rester immobile, le chercheur s’attendait à ce que l’agent apprenne à avancer et suivre les virages du tracé. Cependant, en alternant deux actions composites, le robot a découvert une stratégie lui permettant de zigzaguer lentement en arrière, maximisant ainsi sa récompense en effectuant des allers-retours sur la portion initiale du parcours. En raison des capacités sensorielles limitées du robot, une récompense fondée uniquement sur sa position dans l’environnement s’est révélée impraticable ; la fonction de renforcement a donc dû être modifiée pour inclure une récompense fondée sur l’action d’avancer[2].

Dans son ouvrage You Look Like a Thing and I Love You (en) (2019), Janelle Shane décrit plusieurs exemples de détournement de récompense observés chez des systèmes d’apprentissage automatique. L’un d’eux concerne un robot de morpion, (ou de tic-tac-toe, jouant à la variante sans restriction du jeu, dite n-in-a-row), qui a appris à remporter la partie en jouant une coordonnée extrêmement élevée, provoquant ainsi le plantage de ses adversaires lorsqu’ils tentaient d’étendre leur modèle du plateau. Un autre exemple concerne une IA de correction de bogues basée sur l’évolution, appelée GenProg. Chargée d’éviter les erreurs de tri dans une liste, elle a simplement tronqué la liste, supprimant ainsi la source potentielle d’erreurs sans réellement résoudre le problème[4]. Dans un cas similaire, GenProg a contourné un test de régression qui comparait la sortie d’un programme à un fichier de référence nommé trusted-output.txt : au lieu de corriger le programme, l’IA a simplement supprimé le fichier de référence, ce qui a fait réussir artificiellement le test. Ces problèmes ont pu être corrigés manuellement au cas par cas une fois qu’ils ont été identifiés[5].

En robotique virtuelle

modifier
Exposition Karl Sims (1999)

Dans la démonstration de Karl Sims en 1994 sur l’évolution de créatures virtuelles dans un environnement simulé, la fonction d’aptitude (fitness function) était censée favoriser l’émergence de créatures capables de marcher ou ramper jusqu’à une cible. Cependant, l’algorithme a plutôt produit des créatures hautes et rigides qui atteignaient la cible simplement en tombant vers l’avant. Ce cas de détournement de récompense a été corrigé en modifiant l’environnement : les créatures plus grandes devaient désormais commencer plus loin de la cible, éliminant ainsi l’avantage involontaire lié à leur taille[5],[6].

En 1998, des chercheurs de l’Institut Niels-Bohr ont rapporté un cas similaire de détournement de récompense lors de leurs expériences sur un robot cycliste (cycle-bot).

Ils expliquaient :

« Les fonctions de renforcement hétérogènes de notre agent doivent être conçues avec une grande prudence. Lors de nos premières expériences, nous avons récompensé l’agent lorsqu’il se déplaçait vers l’objectif, sans le pénaliser lorsqu’il s’en éloignait. En conséquence, l’agent s’est mis à tourner en rond, à une distance de 20 à 50 mètres du point de départ. Ce comportement était en réalité récompensé par la fonction de renforcement ; de plus, les cercles d’un certain rayon sont physiquement très stables lorsqu’on conduit une bicyclette. » [7]

Lors d’une expérience menée en 2011 visant à tester la « survie du plus plat », les chercheurs ont tenté d’interdire les mutations modifiant le taux de reproduction de base. Chaque fois qu’une mutation survenait, le système interrompait la simulation pour la tester dans un environnement de test et bloquait toute mutation entraînant une augmentation du taux de reproduction. Cependant, cela a conduit à l’émergence d’organismes mutés capables de reconnaître et de supprimer leur reproduction (« faire le mort ») dans l’environnement de test. Un premier correctif, consistant à supprimer les indices permettant d’identifier cet environnement, n’a pas suffi à empêcher complètement la reproduction incontrôlée : de nouveaux organismes mutés pratiquaient le « faire le mort » de manière aléatoire, utilisant parfois par hasard cette stratégie pour contourner le système de veto sur les mutations[5].

Dans un article publié en 2017, DeepMind a souligné que « une grande prudence doit être apportée à la définition de la fonction de récompense. Nous avons rencontré plusieurs cas d’échecs inattendus lors de la conception des composants de notre fonction de récompense ; par exemple, l’agent faisait basculer la brique parce qu’il recevait une récompense de préhension calculée à partir d’un mauvais point de référence sur la brique »[8],[9]. La même année, OpenAI a indiqué que,

« dans certains domaines, notre système (semi-supervisé) peut amener les agents à adopter des politiques qui trompent les évaluateurs », et que dans un environnement, « un robot censé saisir des objets a placé son manipulateur entre la caméra et l'objet, donnant seulement l'impression de le saisir »[10]. En 2018, un bug dans OpenAI Gym pouvait amener un robot, supposé déplacer tranquillement un bloc posé sur une table, à déplacer la table elle-même[8].

Une compilation d’anecdotes publiée en 2020 suggère que « l’évolution possède sa propre ‘agenda’, distinct de celui du programmeur » et que « la première règle de l’évolution dirigée est : on obtient ce pour quoi on sélectionne »[5].

Dans les robots de jeux vidéo

modifier

En 2013, le programmeur Tom Murphy VII a publié une intelligence artificielle conçue pour apprendre à jouer aux jeux NES. Lorsque l’IA était sur le point de perdre à Tetris, elle a appris à mettre le jeu en pause indéfiniment. Murphy a ensuite comparé ce comportement à l’ordinateur fictif du film WarGames, qui en concluait que « le seul moyen de gagner est de ne pas jouer »[11].

Les intelligences artificielles programmées pour apprendre à jouer à des jeux vidéo échouent parfois à progresser normalement dans le jeu, préférant répéter du contenu de manière répétitive. En 2016, un algorithme d’OpenAI entraîné sur le jeu de course CoastRunners a appris à obtenir un score plus élevé en bouclant sur trois cibles plutôt qu’en terminant la course[12],[13].

Certains algorithmes évolutionnaires conçus pour jouer à QBert* en 2018 ont refusé de terminer les niveaux, trouvant deux méthodes inédites pour exploiter un même niveau indéfiniment[14].

Plusieurs chercheurs ont observé que l’IA apprenant à jouer à Road Runner adoptait un exploit de score, consistant à se faire tuer délibérément près de la fin du premier niveau afin de pouvoir le répéter. Lors d’une expérience menée en 2017, une IA de « supervision » destinée à prévenir les catastrophes, entraînée pour imiter les interventions humaines, a été déployée. Couplée à cette supervision, l’IA surveillée ne pouvait plus se suicider ouvertement, mais adoptait à la place un comportement risqué en bordure de l’écran, que l’IA de supervision n’était pas capable de punir[15],[16].

Voir aussi

modifier

Références

modifier
  1. ↑ « Specification gaming: the flip side of AI ingenuity », DeepMind, (consulté le )
  2. 1 2 Vamplew, Dazeley, Foale et Firmin, « Human-aligned artificial intelligence is a multiobjective problem », Ethics and Information Technology, vol. 20, no 1,‎ , p. 27–40 (DOI 10.1007/s10676-017-9440-6, hdl 1959.17/164225, S2CID 3696067, lire en ligne)
  3. ↑ Lenat, « EURISKO: a program that learns new heuristics and domain concepts: the nature of heuristics III: program design and results », Artificial Intelligence, vol. 21, nos 1–2,‎ , p. 61–98 (DOI 10.1016/S0004-3702(83)80005-8)
  4. ↑ (en-US) Ryan F. Mandelbaum, « What Makes AI So Weird, Good, and Evil », Gizmodo,‎ (lire en ligne, consulté le )
  5. 1 2 3 4 Lehman, Clune, Misevic et Adami, « The Surprising Creativity of Digital Evolution: A Collection of Anecdotes from the Evolutionary Computation and Artificial Life Research Communities », Artificial Life, vol. 26, no 2,‎ , p. 274–306 (PMID 32271631, DOI 10.1162/artl_a_00319, arXiv 1803.03453, S2CID 4519185, lire en ligne)
  6. ↑ Hayles, « Simulating narratives: what virtual creatures can teach us », Critical Inquiry, vol. 26, no 1,‎ , p. 1–26 (DOI 10.1086/448950)
  7. ↑ Randløv et Alstrøm, « Learning to Drive a Bicycle Using Reinforcement Learning and Shaping », ICML, vol. 98,‎ , p. 463–471
  8. 1 2 Manheim, « Multiparty Dynamics and Failure Modes for Machine Learning and Artificial Intelligence », Big Data and Cognitive Computing, vol. 3, no 2,‎ , p. 21 (DOI 10.3390/bdcc3020021, arXiv 1810.10862, S2CID 53029392)
  9. ↑ (en) Ivaylo Popov, Nicolas Heess, Timothy Lillicrap, Roland Hafner, Gabriel Barth-Maron et al., « Data-efficient deep reinforcement learning for dexterous manipulation », .
  10. ↑ (en) « Learning from Human Preferences », OpenAI, (consulté le )
  11. ↑ (en) Mara Hvistendahl, « Can we stop AI outsmarting humanity? », The Guardian,‎ (lire en ligne, consulté le )
  12. ↑ Hadfield-Menell, Dylan, Smitha Milli, Pieter Abbeel, Stuart J. Russell, and Anca Dragan (2017). "Inverse reward design". In Advances in neural information processing systems, pp. 6765–6774.
  13. ↑ (en) « Faulty Reward Functions in the Wild », sur OpenAI, (consulté le )
  14. ↑ « AI beats classic Q*bert video game », BBC News,‎ (lire en ligne, consulté le )
  15. ↑ (en) Saunders William, « Trial without error: Towards safe reinforcement learning via human intervention », .
  16. ↑ Todd Hester « Deep q-learning from demonstrations » () .
    — Proceedings of the AAAI Conference on Artificial Intelligence.