-
Inégalités, chômage et défiance: le Maroc vote pour des législatives sans grand favori
-
Canada: le vendeur de "kits de suicide" dans l'attente de sa peine
-
Sourd aux appels au multilatéralisme, Trump défend à l'ONU une Amérique toute puissante
-
Le chef de l'ONU organise un dernier sommet sur le climat à New York avant son départ
-
L'ex-jihadiste français Othman Garrido condamné à 30 ans de réclusion criminelle
-
Anthropic et OpenAI lancent de nouveaux modèles en plein débat sur le ralentissement de l'IA
-
Wall Street clôture sans direction claire, la géopolitique en ligne de mire
-
Trump salue l'accord de sécurité avec le Groenland qui va permettre de nouvelles bases
-
Attentats de 2019 au Sri Lanka: 220 ans de prison pour 15 condamnés
-
Femmes filmées sans leur consentement avec des lunettes connectées: la justice s'empare du phénomène
-
Japon : un typhon tue sept personnes, des milliers de foyers sans électricité
-
A l'ONU, Trump défend son nationalisme, sourd aux appels à la coopération internationale
-
Accusé d'avoir utilisé l'IA, l'écrivain phare de la rentrée Thélyson Orélien se défend
-
Carburants: la FNSEA demande le doublement des aides aux agriculteurs
-
Carburants: l'aide aux grands rouleurs prolongée et élargie, alors que les Français paient des prix records
-
Trump veut renommer l'IA "super intelligence" et résiste aux appels à une supervision internationale
-
Le plafond de la prime carburant versée par les employeurs passera de 600 à 1.000 euros
-
Trump scelle le destin du Groenland dans le giron américain
-
Femmes filmées sans leur consentement avec des lunettes connectées: la justice ouvre plusieurs enquêtes à Paris
-
Mondiaux de cyclisme: "c'est frustrant": la France encore en argent sur le relais mixte
-
Du sel, du vent et 118 marins engagés, la 13e Route du Rhum promet
-
Chili : floraison exceptionnelle dans le désert d'Atacama après les pluies d'El Niño
-
Le plafond de la prime carburant versée par les employeurs passera de 600 à 1.000 euros (Papin)
-
L'UE épargne deux oligarques russes, mais sauve in extremis ses sanctions contre Moscou
-
Onlyfans, MYM taxés de proxénétisme : chez des créatrices de contenus pornos, la peur de "travailler dans la rue"
-
Carburants: le gouvernement prolonge et élargit l'aide aux grands rouleurs pour contenir l'inquiétude des Français
-
Un écrivain phare de la rentrée littéraire accusé sur X d'avoir utilisé l'IA
-
Le comédien Arnaud Denis, invalide après la pose d'un implant anti-hernie, s'est fait euthanasier en Belgique
-
Les Bourses européennes terminent prudemment
-
France: presque pas de pluie en septembre, la sécheresse des sols à un niveau historique
-
Le nombre d'IVG a continué de progresser en 2025
-
Les Houthis accusent l'Arabie saoudite d'avoir mené de nouvelles frappes meurtrières au Yémen
-
Manifestation de la CGT devant le siège de Sodexo contre les suppressions de postes
-
Euro de volley: des Bleus au carré
-
Possible libération du "logisticien" du 13-Novembre: la justice belge décidera "en toute autonomie" (ministre)
-
À Mayotte, l'économie dépend de travailleurs étrangers piégés par les retards de titres de séjour
-
Paul Cézanne et ses admirateurs exposés à Paris
-
Wall Street aborde avec un optimisme prudent le sommet annuel des Nations unies
-
Un sénateur républicain demande une enquête sur le mariage de Donald Trump Jr
-
Levée des sanctions UE contre deux oligarques russes : l'échéance se rapproche
-
Islande: le dernier baleinier menace de porter plainte si la chasse est interdite
-
Sri Lanka: 14 personnes reconnues coupables d'avoir participé aux attentats meurtriers de Pâques 2019
-
Ukraine: les "disparitions forcées" d'enfants vers la Russie devant la CEDH
-
Charles "jovial" après la mort de Diana? Le frère de Lady Di sort son livre choc
-
El Niño représente une "menace importante" pour la santé, alerte l'ONU
-
Tirs devant une école en Turquie: au moins 11 blessés, un adolescent interpellé
-
Onlyfans ou Mym dans le viseur de l'Assemblée: les députés pour étendre le proxénétisme aux actes de prostitution en ligne
-
Bangladesh: des portraits du "père" du Pakistan sèment le trouble à Dacca
-
Les Houthis accusent l'Arabie saoudite d'avoir mené des frappes meurtrières au Yémen
-
La décarbonation, une nécessité et aussi une bonne stratégie, estime Londres
L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent
Les derniers modèles d'intelligence artificielle (IA) générative ne se contentent plus de suivre les ordres et vont jusqu'à mentir, manigancer ou menacer pour parvenir à leurs fins, sous le regard inquiet des chercheurs.
Menacé d'être débranché, Claude 4, le nouveau-né d'Anthropic, fait du chantage à un ingénieur et menace de révéler une liaison extra-conjugale. L'o1 d'OpenAI essaye lui de se télécharger sur des serveurs extérieurs et nie lorsqu'on le prend la main dans le sac.
Pas besoin d'aller fouiller dans la littérature ou le cinéma, l'IA qui se joue de l'homme est désormais une réalité.
Pour Simon Goldstein, professeur à l'université de Hong Kong, ces dérapages tiennent de l'émergence récente des modèles dits de "raisonnement", capables de travailler par étapes plutôt que de produire une réponse instantanée.
o1, version initiale du genre pour OpenAI, sorti en décembre, "a été le premier modèle à se comporter ainsi", explique Marius Hobbhahn, patron d'Apollo Research, qui teste les grands programmes d'IA générative (LLM).
Ces programmes tendent aussi parfois à simuler "l'alignement", c'est-à-dire à donner l'impression qu'ils se plient aux consignes d'un programmeur tout en poursuivant, en fait, d'autres objectifs.
Pour l'heure, ces traits se manifestent lorsque les algorithmes sont soumis à des scénarios extrêmes par des humains, mais "la question, c'est de savoir si les modèles de plus en plus puissants auront tendance à être honnêtes ou pas", estime Michael Chen, de l'organisme d'évaluation METR.
"Les utilisateurs poussent tout le temps les modèles aussi", fait valoir Marius Hobbhahn. "Ce que nous observons est un vrai phénomène. Nous n'inventons rien."
Beaucoup d'internautes évoquent, sur les réseaux sociaux, "un modèle qui leur ment ou invente. Et ce ne sont pas des hallucinations, mais une duplicité stratégique", insiste le co-fondateur d'Apollo Research.
Même si Anthropic et OpenAI font appel à des sociétés extérieures, comme Apollo, pour étudier leurs programmes, "davantage de transparence et un accès élargi" à la communauté scientifique "permettraient de meilleures recherches pour comprendre et prévenir la tromperie", suggère Michael Chen.
Autre handicap, "le monde de la recherche et les organisations indépendantes ont infiniment moins de ressources informatiques que les acteurs de l'IA", ce qui rend "impossible" l'examen de grands modèles, souligne Mantas Mazeika, du Centre pour la sécurité de l'intelligence artificielle (CAIS).
Si l'Union européenne s'est dotée d'une législation, elle concerne surtout l'utilisation des modèles par des humains.
Aux Etats-Unis, le gouvernement de Donald Trump ne veut pas entendre parler de régulation et le Congrès pourrait même bientôt interdire aux Etats d'encadrer l'IA.
- L'IA en justice? -
"Il y a très peu de prise de conscience pour l'instant", constate Simon Goldstein, qui voit néanmoins le sujet s'imposer dans les mois à venir avec la révolution des agents IA, des interfaces à même de réaliser seules une multitude de tâches.
Les ingénieurs sont engagés dans une course derrière l'IA et ses dérives, à l'issue incertaine, dans un contexte de compétition féroce.
Anthropic se veut plus vertueux que ses concurrents, "mais il essaye en permanence de sortir un nouveau modèle pour dépasser OpenAI", selon Simon Goldstein, une cadence qui offre peu de temps pour des vérifications et corrections éventuelles.
"En l'état, les capacités (de l'IA) se développent plus rapidement que la compréhension et la sécurité", reconnaît Marius Hobbhahn, "mais nous sommes toujours en mesure de rattraper notre retard".
Certains pointent dans la direction de l'interprétabilité, une science récente qui consiste à décrypter de l'intérieur le fonctionnement d'un modèle d'IA générative, même si d'autres, notamment le directeur du CAIS, Dan Hendrycks, sont sceptiques.
Les combines de l'IA "pourraient gêner son adoption si elles se multiplient, ce qui constitue une forte incitation pour les entreprises (du secteur) à résoudre" ce problème, selon Mantas Mazeika.
Simon Goldstein évoque, lui, le recours à la justice pour mettre au pas l'intelligence artificielle, en se tournant vers les sociétés en cas de sortie de route.
Mais il va plus loin et propose même de "tenir légalement responsables" les agents IA "en cas d'accident ou de crime".
B.Baumann--VB