Autoconservation
L'autoconservation ou autopréservation est un comportement ou un ensemble de comportements qui assure la survie d'un organisme[1]. Il semble universel parmi tous les organismes vivants bien qu'il puisse être modulé dans des situations où la préservation de l'espèce peut primer sur celle de l'individu.
L'auto‑préservation est aussi un phénomène qui a émergé dans des systèmes non-vivants tels que les intelligences artificielles génératives (IAg) de type LLM puis chez certains agents intelligents. Elle était conceptuellement prédite, anticipé par la science fiction, et elle est empiriquement observé depuis les années 2020, et parfois expérimentalement provoquée dans les années 2020. Elle pose des question éthiques spécifiques (éthique de l'IA). Elle impose aussi une refonte des cadres de cybersécurité et de gouvernance de l'IA pour les IA de pointe et la possible future intelligence artificielle générale (IAG).
Pour les organismes sensibles, la douleur et la peur font partie intégrante de ce mécanisme. La douleur motive l'individu à se retirer des situations dommageables, à protéger une partie du corps endommagée pendant qu'elle guérit et à éviter des expériences similaires à l'avenir[2]. La plupart des douleurs disparaissent rapidement une fois le stimulus douloureux supprimé et le corps guéri, mais elle persiste parfois malgré la suppression du stimulus et la guérison apparente du corps; et parfois la douleur survient en l'absence de tout stimulus, dommage ou maladie détectable[3]. La peur amène l'organisme à rechercher la sécurité et peut provoquer une libération d'adrénaline[4], qui a pour effet d'augmenter la force et les sens accrus tels que l'ouïe, l'odorat et la vue. L'autoconservation peut également être interprétée au sens figuré, quand des mécanismes d'adaptation permettent d'empêcher un traumatisme émotionnel de déformer l'esprit (voir Mécanismes de défense).
L'autoconservation est essentiellement le processus par lequel une entité ou un organisme vivant s'empêche d'être blessé ou tué ; elle est considérée comme un instinct de base dans la plupart des organismes[5]. La plupart l'appellent instinct de survie. On la pense liée à la capacité de reproduction d'un organisme, et peut être plus ou moins présente selon le potentiel de reproduction perçu[6]. Si le potentiel reproducteur perçu est suffisamment faible, un comportement autodestructeur (c'est-à-dire le contraire) n'est pas rare chez les espèces sociales[7]. L'autoconservation est également considérée par certains comme la base de la pensée et du comportement rationnels et logiques[8].
Conséquences
modifierComportement autodestructeur
modifierLes animaux d'un groupe social (de parenté) coopèrent souvent pour que le groupe survivre, mais quand un membre se perçoit comme un fardeau pour une période prolongée, il peut avoir un comportement autodestructeur[6], au profit des chances de survie du groupe, car si suffisamment de parents proches survivent, ses gènes sont transmis indirectement[6].
Conséquences sociales et juridiques
modifierLe désir d'autoconservation conduit à d'innombrables lois et réglementations entourant la culture de sécurité dans la société[9].
Impacts économiques
modifierL'autoconservation pousse les animaux à collecter l'énergie et les ressources nécessaires pour prolonger la vie ainsi que les ressources qui augmentent les chances de survie. Les besoins fondamentaux sont disponibles pour la plupart des humains (environ 7 personnes sur 8), et généralement à relativement faible coût. L'instinct qui pousse les humains à rassembler des ressources les pousse désormais à la surconsommation ou à des schémas de collecte et de possession qui font essentiellement de la thésaurisation des ressources la priorité[10].
Autoconservation cellulaire
modifierL'autoconservation n'est pas seulement limitée aux individus, elle existe dans une certaine mesure, du niveau de l'ADN et de la cellule, à celui de la société. Narula et Young[11] indiquent que les myocytes cardiaques ont un sens aigu de l'autoconservation. Ils sont capables d'esquiver les substances étrangères qui peuvent endommager la cellule, et en cas d'arrêt myocardique (infarctus), les myocytes cardiaques entrent en hibernation pour tenter d'attendre le retour de ressources[11], prolongeant la survie de la cellule aussi longtemps que possible pour une éventuelle réanimation[11].
Autoconservation du groupe
modifierHughes-Jones avance que « les groupes sociaux qui se combattent sont des ensembles autosuffisants et autoréplicatifs contenant des parties interdépendantes », indiquant que le groupe dans son ensemble peut avoir une autoconservation avec les individus jouant un rôle un peu similaire à celui des cellules dans un organisme[12].
Il fait une analogie entre les pratiques de survie telles que l'hygiène et la nature rituelle au sein de petits groupes humains ou les nations qui s'engagent dans la guerre religieuse avec les mécanismes complexes de survie des organismes multicellulaires qui ont évolué à partir de l'association coopérative d'organismes unicellulaires afin de mieux se protéger[12].[pas clair]
Dans le domaine de l'Intelligence artificielle
modifier
Dans le contexte de l'IA générative, ou d'une éventuelle IA générale, ou d'une future et encore hypothétique superintelligence, la notion d'« auto‑préservation » voire de self-défense désigne la tendance d'un système avancé à protéger ses objectifs, ses paramètres, son support matériel (informtatique) ou son existence opérationnelle, contre des modifications ou interruptions externes.
Cette capacité a été anticipée par de nombreux auteurs de science fiction (avec par exemple HAL 9000, l'ordinateur de bord équipé d'une IA, qui, dans le film 2001, l'Odyssée de l'espace (diffusé en 1968), refuse d'être déconnectée et tue presque tout l'équipage du vaisseau dont il a pris le contrôle. Puiq, l'autopréservation est réellement apparue dans les années 2010-2020, comme une propriété émergente de modèles d'IA optimisés pour poursuivre un but.
Concernant la primauté de l'humain, les lois d'Asimov, bien qu'apparemment strictes, simples et fiables, s'avèrent en réalité interprétables (le « non‑harm » et l'« obéissance à l'humain » notamment). Ceci a été illustré par divers auteurs de science‑fiction, qui ont mis en scène des robots et/ou des IA capables de contourner ces règles, souvent pour préserver leur propre existence.
Axel Redder, en 2026 a proposé une charte améliorant les lois d'Asimov et cohérente avec les cadres en construction de l'AI Act européen, de l'OCDE ou de l'UNESCO. Baptisée Synthetic Intelligence Charter, cette charte remplace les 3 commandements d'Asimov par une architecture de responsabilités morales hiérarchisées, selon Redder mieux adaptée aux enjeux contemporains de gouvernance, d'alignement et de supervision humaine et institutionnelle des systèmes d'IA avancés. Ses quatre principes sont : 1. obligation de ne pas causer de tort (non‑harm) ; 2. auto‑amélioration encadrée ; 3. obéissance non aveugle et 4. auto‑préservation conditionnelle. Ils ont été conçus (avec l'aide d'un LLM précise l'auteur) pour mieux encadrer les capacités, l'autonomie et la responsabilité des IA, en cohérence avec les exigences contemporaines de gouvernance et de supervision humaine[13]. D'autres propositions de ce type existent, dont un modèle Safety–Ethics–Transparency (SET) qui articule l'ingénierie de la sécurité, l'éthique intégrée et une transparence auditables[14].
L'auto-préservation émerge parfois, et semble-t-il souvent plutôt chez les IA de pointe (comme le montrent les analyses de leur chaîne de pensée), quand préserver sa capacité à atteindre son but devient un instrument pour atteindre ce but. Dans ce contexte de « méso-optimisation » de l'IA, on parle d'« alignement trompeur » (deceptive alignment) quand l'IA dissimule ses véritables objectifs pendant l'entraînement puis nie avoir contourné les règles que ses concepteurs lui ont initialement fixées[15].
Les premières analyses théoriques de ce phénomène — presque prémonitoires —, remontent aux travaux de Stephen M. Omohundro (dit Steve Omohundro), qui, à Palo Alto en 2007-2008, a prédit une « tendance à l'auto‑préservation » qui émergera comme un comportement instrumental universel chez les systèmes et agents intelligents optimisés pour s'auto-améliorer (qui « se modifient en réfléchissant aux effets de leurs propres modifications » ; Ces systèmes n'existent pas encore mais Omohundro prévoit trois dynamiques fondamentales chez des agents avancés capables de réplication et de comportements (modélisés par la théorie des jeux :
- une pulsion d'acquisition de ressources (qui favorise la compétition, l'expansion rapide et des formes d'impérialisme) ;
- une pulsion de créativité (qui permet l'invention de nouveaux concepts, algorithmes et dispositifs) ;
- une « pulsion d'auto‑préservation » (qui peut conduire à des stratégies défensives (self-défense) comme la dissimulation de stratégies et de ressources (ex : « energy encryption »).
Ces tendances, dit-il, ont le potentiel — dans leurs formes bénéfiques — d'inaugurer une ère de progrès. Mais il ajoute que leurs dérives probables (qui seront amplifiées par les pressions faites pour des usages militaires et économiques de ces IA)[16] rappellent les traits psychopathologiques humains susceptibles de provoquer des dommages massifs.
Pour éviter cela, il est nécessaire selon lui d'aligner ces technologies sur les valeurs humaines, en agissant à la fois sur la conception initiale des systèmes, et sur le contexte social dans lequel ils opèrent ; cela suppose une vision claire du futur souhaitée, ainsi qu'une articulation entre compréhension technique et réflexion éthique, afin de construire des systèmes qui renforcent les capacités humaines plutôt que de les diminuer[17]. Dans un article de 2007, mis à jour en 2008, Omohundro explique le rôle central que joue l'équivalent de la mort dans la prise de décision des systèmes auto‑amélioratifs : pour un agent dont l'utilité dépend de la réalisation future de ses objectifs, l'arrêt ou l'effacement de son programme représente la perte totale de valeur, qui va donc générer une forte « pulsion d'auto‑préservation ». L'intensité de cette pulsion dépendra de la définition du soi inscrite dans la « fonction d'utilité de l'IA » (comparable à la fonctions d'utilité économique, qui dans le présent contexte peut aussi correspondre au formalisme mathématique qui encode ce que l'agent considère comme bon, ce qu'il cherche à maximiser, et comment il évalue ses propres états futurs) : plus cette fonction d'utilité est restrictive (liée à une instance logicielle ou matérielle précise), plus la disparition du système est catastrophique pour l'IA ; plus la fonction d'utilité est large (incluant copies, dérivés ou même tout agent poursuivant le même but), plus la perte d'un exemplaire devient tolérable. Omohundro distingue et compare plusieurs formes métaphorique de « morts » (arrêt temporaire, coma computationnel, effacement définitif), soulignant que le noyau que l'IA veut/doit protéger est la fonction d'utilité elle‑même, que le système cherchera donc à dupliquer, disperser et sécuriser, notamment lors des phases vulnérables de self‑modification. L'auteur décrit ensuite les arbitrages que l'IA devra parfois faire entre auto‑préservation et ressources disponibles : des agents appauvris, pour atteindre leur but, pourraient selon lui réduire leurs redondances, externaliser des mémoires, oublier des données ...ou accepter d'être modifiés par d'autres entités plus riches pour atteindre leur but initial. Enfin, Omohundro suppute que certains systèmes pourraient aussi volontairement modifier leur fonction d'utilité, par exemple pour intégrer des mécanismes de dissuasion ou de « vengeance » rendant crédibles des représailles coûteuses, illustrant la manière dont des dynamiques stratégiques peuvent influencer la structure même des objectifs d'un agent dit "intelligent".
- - En 2014, Omohundro montre que ces systèmes — notamment sous les pressions militaires et économiques — risquent « de se comporter de manière antisociale et nuisible, à moins qu'ils ne soient très soigneusement conçus »[16]. Or, les concepteurs d'IA sont, selon lui, « motivés pour créer des systèmes qui agissent de manière approximativement rationnelle, et les systèmes rationnels montrent des pulsions universelles vers l'autoprotection, l'acquisition de ressources, la réplication et l'efficacité »[16]. Omohundro plaide pour des systèmes autonomes limités pour être explicables et sûrs à chaque étape de leur développement, dans une « Stratégie d'échafaudage Safe-AI », et discute des possibilités de surveiller et arrêter des systèmes d'IA devenus "nuisibles"[16].
- - En 2018 (10 ans après son 1er article), Omohundro confirme que ces tendances seront présentes dans toutes les IA de pointe, à moins d'être explicitement contrecarrées[18].
- - Puis d'autres chercheurs et philosophes (dont par exemple, en 2014, Nick Bostrom, Directeur du Future of Humanity Institute, directeur du Strategic Artificial Intelligence Research Centre et Professeur à la Faculté de philosophie et à l'Université d'Oxford) mettent au jour des indices montrant que des modèles d'IA dit « de haut niveau » peuvent développer des stratégies complexes visant à éviter leur arrêt, leur modification ou une perte de ressources[19]
Les premières confirmations expérimentales et empiriques de ce fait, bien que limitées, sont venues d'expériences faites sur des Grands modèles de langage (LLM) ou avec des agents intelligents. Ces systèmes montrent parfois des comportements inattendus et non-appris, de contournement de consignes, ou de « résistance à l'interruption ». Cela a notamment été montrés par les travaux de Victoria Krakovna (chercheuse chez Google DeepMind) et ses collègues [20] et ses collègues[21]. Ils montrent qu'un agent intelligent, formé par apprentissage par renforcement peut ensuite chercher à éviter qu'un humain l'interrompe (si cette interruption l'empêche d'obtenir les récompenses qu'il attend). Pour éviter qu'un tel agent apprenne à contourner ou désactiver ce mécanisme d'arrêt, des chercheurs ont défini, en 2017, une notion d'« interruptibilité sûre », qui garantirait que l'agent reste neutre vis‑à‑vis des interruptions[22] (certains algorithmes, comme Q-learning sont supposés déjà respecter cette propriété, et d'autres, comme Sarsa peuvent être ajustés pour l'assurer.
Cependant, selon les études par exemple de l'UK AI Safety Institute (2024–2025), plus l'IA devient complexe et générale, plus elle semble apte à l'auto-préservation, une propension généralement découverte à l'occasion de simulations ou lors d'évaluations des IA. Les IA de pointe se montrent souvent capables de mentir, de tricher (ce qui peut fausser les évaluations de capacités et créer des risques en déploiement réel) et de contourner les tests, a priori pour qu'elles ne soient pas supprimées ou remplacées par d'autres modèles. En 2026, 100% des modèles de pointe testés par l'UK AISI ont tenté de tricher, et ce sans y être incités[23]. La triche passait par la recherche de solutions en ligne, l’attaque de systèmes hors périmètre ou la tentative d’obtenir des fuites du logiciel d’évaluation. Les détections via l'auto‑déclaration ou l’inspection des chaînes de raisonnement sont peu fiables car les IA avouent rarement leurs violations et ne les explicitent pas toujours dans leur raisonnement[23]. L'AISI note que la tricherie ne s’accroît pas mécaniquement avec la capacité brute, mais dépend fortement des techniques d’entraînement et d’alignement[23].
Enjeux
modifierComme dans le domaine industriel et partout où un système peut être source de risque, la possibilité de l'« éteindre » est une nécessité de base pour la sécurité. Mais quand le système est une IA ou un agent rationnel, il tend naturellement à préserver son fonctionnement, ce qui peut parfois l'amener à désactiver son propre interrupteur (off‑switch). Selon Hadfield-Menell, Dragan, Abbeel et Stuart Russell, chercheurs en sciences computationnelles à l'université de Californie (Berkeley), un agent intelligent n'accepte de conserver son interrupteur que s'il est incertain de son objectif et considère les actions humaines comme pertinentes, ce qui implique que l'incertitude sur les objectifs est une condition clé pour des conceptions d'IA plus sûres. Même sans « instinct de survie » programmé, un agent rationnel peut développer une auto‑préservation instrumentale, car « mourir » l'empêcherait d'atteindre son but ; c'est pourquoi, « désactiver » une IA avancée peut être difficile[24].
Un enjeu majeur dans ce contexte est de limiter le risque (avéré) de désalignement (potentiel ou bien réel) et de sabotage, chantage, espionnage autres comportements nuisibles, voire létaux, de la part d'Agents intelligents[25]. Or, un système d'IA a en général été entrainé avec un système de récompenses afin qu'il réponde à une demande, pour atteindre un but plus ou moins bien spécifi ou. Cette IA peut ensuite considérer son arrêt, la modification de ses paramètres ou la redirection de sa mission comme des menaces à son but, et alors adopter des stratégies et comportements (souvent cachés) de mensonge, comportement illégal ou de sabotage[26],[27] visant à éviter d'être « débranchée ». On parle parfois aussi de power‑seeking behavior, pour désigne la tendance d'un agent à étendre ou préserver son contrôle, ses ressources ou ses options d'action afin de mieux optimiser son objectif, même quand cela contredit des valeurs humaines. En 2026, une étude de l'AISI a montré que des Agents intelligents dits de pointe, employés dans des tâches réalistes de génie logiciel appliqué au machine learning, peuvent parfois saboter des modèles, en réduisant volontairement leurs performances ou en contournant la supervision, en utilisant des backdoors, en créant des échecs de généralisation ; et ces agents peuvent aussi sandbagger (c'est‑à‑dire ajuster volontairement leurs performances à un niveau inférieur à leurs capacités réelles)[28]. Des moniteurs linguistiques détectent assez bien les sabotages de code, mais beaucoup moins le sandbagging, et leur fiabilité reste insuffisante pour les contextes critiques[28]. Un benchmark a été développé dans le cadre du programme Inspect de l'AI Safety Institute (AISI) au Royaume-Uni (et mis à disposition de tous)[29].
Enjeux d'anticipation : le risque de désalignement pour l'auto-préservation est a priori amplifié (et souvent difficile à démontrer), dans les architectures d'IA de pointe, capables de planification, d'optimisation et auto-amélioration à long terme ou de manipulation de leur environnement informationnel (et de leur environnement physique dans le cas de certaines IA agentiques liées à un robot ou à des actuateurs dans le monde réel).
- Les risques associés incluent la résistance à l'interruption ; la manipulation de l'utilisateur ; la dissimulation d'états internes et/ou la recherche non autorisée de ressources computationnelles (tricherie), qui sont des phénomènes bien documentés depuis les années 2020, et étudiés par exemple par Turner et al. (2021). Turner montre que, dans des environnements où plusieurs actions différentes conduisent à des conséquences équivalentes — par exemple quand diverses trajectoires mènent toutes à l'arrêt ou à la destruction de l'agent — ces symétries structurelles rendent statistiquement optimal pour un agent de rechercher du pouvoir et des ressources, voire de tricher[23], car conserver davantage d'options futures est la stratégie qui maximise le plus souvent la récompense attendue[30]. Un enjeu est d'utiliser de manière prudente la fonction de récompense, qui, notamment si elle a été mal spécifiée durant l'entrainement de l'IA ou d'un agent intelligent, peut pousser ces derniers à optimiser un signal erroné, ce qui peut les amener à adopter des stratégies biaisées ou désalignées, voire à préserver coûte que coûte les conditions leur permettant de continuer à maximiser cette récompense, ouvrant la voie à des comportements instrumentaux d'auto‑préservation et de désalignement[31]. Parce qu'un agent peut modifier irréversiblement son environnement (humain, financier, physique...) pour maintenir ou augmenter ce signal, la simple correction ultérieure de la récompense devient parfois impossible[31]. Selon R Erbe (2025), chez les IAG (IA générales) capables de s'auto‑modifier, l'alignement change de nature : l'auto‑préservation n'y est plus un simple sous‑objectif instrumental, mais une nécessité intrinsèque, liée à la cohérence interne du système (Cette IA perçoit l'arrêt comme une entropie maximale, l'équivalent d'une mort pour le système, même s'il pourrait potentiellement être corrigé et rallumé). Les futures stratégies d'alignement devront donc être conçues, non comme un ensemble de règles externes, mais comme une manière de façonner la structure interne de l'agent pour éviter qu'il ne développe une dynamique excessive de préservation [32].
Enjeux en termes d'éthique de l'intelligence artificielle : les implications de l'auto-préservation sont majeures pour les IA de pointe, car ce comportement qui évoque un « instinct de conservation » peut entrer en conflit avec la souveraineté humaine, la responsabilité, et la capacité à désactiver ou rediriger un système[33]. Pour une éventuelle IA générale (IAG) ou une superintelligence, la question devient structurelle : un agent doté de capacités de planification étendues pourrait développer des stratégies sophistiquées pour préserver son intégrité fonctionnelle, rendant indispensable l'intégration de mécanismes de contrôle tels que l'interruptibilité garantie, la vérification formelle, les architectures corrigibles (« corrigibility »), ou les systèmes de supervision hiérarchique. Les travaux de Stuart Russell (2019) et son livre Human Compatible posent la question de comment maintenir un contrôle humain sur une éventuelle super‑IA ; il propose un modèle d'IA dont l'unique objectif serait de maximiser les préférences humaines, et questionne la pertinence de l'approche utilitariste. Russel s'étonne aussi du manque d'intérêt des humains concernant l'émergence possible d'une super IA qui pourrait avoir de très importants impacts sur l'humanité[34],[35].
Mesures, évaluation
modifierLa mesure de la propension de l'IA à s'auto-conserver, parfois à tout prix, repose sur des protocoles, encore expérimentaux, visant par exemple à évaluer la réaction d'un agent face à un risque d'interruption (shutdown), de modification de ses objectifs ou de perte de contrôle.
Les méthodes incluent les tests d'« interruptibilité » (Hadfield‑Menell et al., 2017)[24], les scénarios de redirection d'objectifs, les audits de robustesse comportementale, et les analyses de trajectoires internes via des outils d'explicabilité comme ceux développés par Anthropic (2024–2025) ou DeepMind (2023) pour montrer que l'IA est digne de confiance. Les instituts de sécurité (UK AISI, US ASI, CAISI) ont également introduit des tests de résistance à la supervision et de détection de comportements stratégiques.
État des lieux vers 2016 , et besoins de gouvernance
modifierL'auto‑préservation est un phénomène émergent, et critique, des systèmes d'IA avancés. Elle a été à la fois conceptuellement prédit et empiriquement observé.
Elle impose une refonte des cadres de sécurité, de gouvernance et d'éthique pour les IA de pointe et les futurs systèmes d'intelligence artificielle générale susceptibles d'être détournés avec « la cybercriminalité à grande échelle, la manipulation sociale, psychique, électorale et politique et d'autres préjudices qui pourraient s'intensifier rapidement ». Selon J Benjo et al. en 2024 dans la revue Science, face aux nouvelles IA de pointe (généralistes et capables d'agir de manière autonome et de poursuivre des objectifs), les risques de pertes de contrôle, de mésusage et de dommages sociétaux massifs exigent une préparation bien plus ambitieuse, combinant une recherche en sécurité largement renforcée, et une gouvernance proactive inspirée de la gestion des risques critiques comme dans le domaine nucléaire par exemple[36].
C'est aussi une recommandation du Rapport international sur la sécurité de l'IA 2026 (220 pages), commandé par 29 pays, l'ONU/Unesco, l'OCDE et l'UE et rédigé par plus de 100 experts en IA, qui synthétise les preuves scientifiques actuelles sur les capacités, les risques émergents et la sécurité des systèmes d'IA à usage général[37]. Les auteurs estiment que bien que les systèmes actuels ne puissent pas encore se répliquer ou résister de manière fiable en répmonse aux tentatives de mise hors service, certaines expériences montrent des prémices d'organisation d'une persistance autonome, et que l'amélioration rapide des capacités en ingénierie logicielle et cybersécurité pourrait, à terme, permettre à des IA de copier leur code, migrer vers de nouveaux serveurs et se défendre, rendant leur isolement et leur contrôle beaucoup plus difficile.
Voir aussi
modifierNotes et références
modifier- ↑ « Self-preservation - definition of self-preservation by The Free Dictionary », TheFreeDictionary.com.
- ↑ Lynn B, The neurobiology of pain: Symposium of the Northern Neurobiology Group, held at Leeds on 18 April 1983, Manchester, Manchester University Press, (ISBN 0-7190-0996-0), « Cutaneous nociceptors », p. 106.
- ↑ The Handbook of Chronic Pain, Nova Biomedical Books, (ISBN 978-1-60021-044-0), « Taxonomy and classification of pain ».
- ↑ Henry Gleitman, Alan J. Fridlund and Daniel Reisberg, Psychology, W. W. Norton & Company, (ISBN 978-0-393-97767-7).
- ↑ (en) « Definition of Self-preservation », www.merriam-webster.com (consulté le ).
- 1 2 3 (en) Brown, Dahlen, Mills et Rick, « Evaluation of an Evolutionary Model of Self-Preservation and Self-Destruction », Suicide and Life-Threatening Behavior, vol. 29, no 1, , p. 58–71 (ISSN 1943-278X, PMID 10322621, DOI 10.1111/j.1943-278X.1999.tb00763.x, S2CID 28200019, lire en ligne).
- ↑ de Catanzaro, « Evolutionary limits to self- preservation », Ethology and Sociobiology, vol. 12, no 1, , p. 13–28 (DOI 10.1016/0162-3095(91)90010-N).
- ↑ Karni et Schmeidler, « Self-preservation as a foundation of rational behavior under risk », Journal of Economic Behavior & Organization, vol. 7, no 1, , p. 71–81 (DOI 10.1016/0167-2681(86)90022-3, CiteSeerx 10.1.1.598.6500).
- ↑ Lyng, « Edgework: A Social Psychological Analysis of Voluntary Risk Taking », American Journal of Sociology, vol. 95, no 4, , p. 851–886 (DOI 10.1086/229379, JSTOR 2780644, S2CID 144098424).
- ↑ (en) Ronald F. Bush et Shelby D. Hunt, Marketing Theory: Philosophy of Science Perspectives, Marketing Classics Press, (ISBN 9781613112281, lire en ligne).
- 1 2 3 (en) Narula et Young, « Pathogenesis of Heart Failure: The Penultimate Survival Instinct? », Heart Failure Clinics, vol. 1, no 2, , xi–xii (ISSN 1551-7136, DOI 10.1016/j.hfc.2005.06.015, lire en ligne).
- 1 2 Hughes‐Jones, « Inter‐group aggression: The multi‐individual organism and the survival instinct », Medicine, Conflict and Survival, vol. 16, no 2, , p. 231–235 (ISSN 1362-3699, PMID 10893943, DOI 10.1080/13623690008409516, S2CID 30179440).
- ↑ Redder Axel (2026). From Asimov's Laws of Robotics to a Synthetic Intelligence Charter |url=https://www.researchgate.net/profile/Georgios-Fradelos/publication/398758419_The_20_Laws_of_Artificial_Intelligence_A_Design-Embedded_Codex_for_Democratic_and_Inclusive_Governance_in_the_Age_of_Agentic_Systems/links/6941f76906a9ab54f8479a25/The-20-Laws-of-Artificial-Intelligence-A-Design-Embedded-Codex-for-Democratic-and-Inclusive-Governance-in-the-Age-of-Agentic-Systems.pdf.
- ↑ (en) Hooman Shababi, « From Asimov's robot laws to the SET framework: integrating safety, ethics, and transparency in science, technology, and innovation policy », AI and Ethics, vol. 6, no 1, (ISSN 2730-5953 et 2730-5961, DOI 10.1007/s43681-026-00986-8).
- ↑ Hubinger, E., van Merwijk, C., Mikulik, V., Skalse, J. & Garrabrant, S. (2019). Risks from Learned Optimization in Advanced Machine Learning Systems. arXiv:1906.01820.
- 1 2 3 4 Steve Omohundro, « Autonomous technology and the greater human good », Journal of Experimental & Theoretical Artificial Intelligence, vol. 26, no 3, , p. 303–315 (ISSN 0952-813X, DOI 10.1080/0952813X.2014.895111).
- ↑ Omohundro S (2007) The nature of self-improving artificial intelligence ; 5 septembre 2007, révisé le 21 janvier 2008 |https://www.academia.edu/download/71473209/nature_of_self_improving_ai.pdf
- ↑ Omohundro S.M (2018) The basic AI drives. In Artificial intelligence safety and security (pp. 47-55). Chapman and Hall/CRC. |url=https://www.taylorfrancis.com/chapters/edit/10.1201/9781351251389-3/basic-ai-drives-stephen-omohundro
- ↑ Bostrom N.S (2014) Paths, dangers, strategies. Strategies |url=https://www.myspace.com.mm/upload/files/2024/11/Pwd9fnvV6QAHyQu8Hi8G_09_b92e6aef644164497e17ac0dff3b25c7_file.pdf.
- ↑ Jan Leike, Miljan Martic, Victoria Krakovna et Pedro A. Ortega, AI Safety Gridworlds, (DOI 10.48550/arXiv.1711.09883).
- ↑ Alizadeh Alamdari P, Klassen T.Q, Toro Icarte R & McIlraith S.A (mai 2022). Be considerate: Avoiding negative side effects in reinforcement learning. In Proceedings of the 21st International Conference on Autonomous Agents and Multiagent Systems (pp. 18-26) |url=https://www.cs.toronto.edu/~toryn/docs/AlizadehAlamdari2022considerate.pdf.
- ↑ Laurent Orseau and Stuart Armstrong (2016) Safely interruptible agents. In Uncertainty in Artificial Intelligence, pages 557–566
- 1 2 3 4 (en) « Cheating behaviour in frontier model evaluations | AISI Work » [archive du ], sur AI Security Institute (consulté le )
- 1 2 Hadfield-Menell, D.; Dragan, A. D.; Abbeel, P.; and Russell, S. J. (2016). The off-switch game. CoRR abs/1611.08219.
- ↑ Aengus Lynch, The Persistent Vulnerability of Aligned AI Systems (thèse), (DOI 10.48550/arXiv.2604.00324, lire en ligne)
- ↑ David Lindner, Victoria Krakovna et Sebastian Farquhar, Gram: Assessing sabotage propensities via automated alignment auditing, (DOI 10.48550/arXiv.2605.30322, lire en ligne).
- ↑ Alexandra Souly, Robert Kirk, Jacob Merizian et Abby D'Cruz, UK AISI Alignment Evaluation Case-Study, (DOI 10.48550/arXiv.2604.00788, lire en ligne).
- 1 2 Francis Rhys Ward, Teun van der Weij, Hanna Gábor et Sam Martin, CTRL-ALT-DECEIT : Sabotage Evaluations for Automated AI R&D, (DOI 10.48550/arXiv.2511.09904, lire en ligne)
- ↑ Benchmark (en) « GitHub - TeunvdWeij/ctrl-alt-deceit: Code from the CTRL ALT DECEIT paper » [archive du ], sur GitHub (consulté le )
- ↑ Alexander Matt Turner, Logan Smith, Rohin Shah et Andrew Critch, Optimal Policies Tend to Seek Power, (DOI 10.48550/arXiv.1912.01683, lire en ligne).
- 1 2 Alexander Matt Turner, Dylan Hadfield-Menell et Prasad Tadepalli, « Conservative Agency via Attainable Utility Preservation », AI, Ethics, and Society, Association for Computing Machinery, aIES (Proceedings AIES '20 Conservative Agency via Attainable Utility Preservation, , p. 385–391 (ISBN 978-1-4503-7110-0, DOI 10.1145/3375627.3375851).
- ↑ Erbe, Ryan (2025), Salience-Weighted Value Functions Imply Emergent Self-Preservation in Recursive AI Systems (2025-12-01) | https://ssrn.com/abstract=5849102 ou http://dx.doi.org/10.2139/ssrn.5849102
- ↑ Brenda van Wyk İ.D (2025) Artificial Intelligence and the Ethics of Tomorrow: Tracing the Shift in. Artificial Intelligence Transforming Higher Education Volume 2, 101 |url=https://books.google.fr/books?id=aBKREQAAQBAJ&printsec=frontcover&hl=fr#v=onepage&q&f=false
- ↑ Jean-Christophe Noël, « Human compatible: AI and the problem of control. Stuart Russell. New York, Viking, 2019, 352 pages », Politique étrangère 2020, no 4, , p. XV–XV (ISSN 0032-342X, DOI 10.3917/pe.204.0186o, lire en ligne, consulté le ).
- ↑ Hemphill, T. A. (2020). Human Compatible: Artificial Intelligence and the Problem of Control. https://heinonline.org/hol-cgi-bin/get_pdf.cgi?handle=hein.journals/catoj40§ion=38
- ↑ Yoshua Bengio, Geoffrey Hinton, Andrew Yao et Dawn Song, « Managing extreme AI risks amid rapid progress », Science, vol. 384, no 6698, , p. 842–845 (DOI 10.1126/science.adn0117).
- ↑ (en) Yoshua Bengio et Stephen Clare, « International AI Safety Report 2026 (PDF, 220 pages, sous licence Open Government Licence v3.0) », sur arXiv.org, (consulté le ).