-
Macron reçoit le président libanais et le roi de Jordanie Abdallah II pour des réunions sur le Liban
-
En Inde, une loi inquiète les personnes transgenres et leurs médecins
-
Top 14: "Être sélectionné, ce n'est pas une fin mais une étape", juge le Toulousain Graou
-
Top 14: Couilloud, un retour et déjà une influence au LOU
-
En Indonésie, des villageois payés pour observer les animaux
-
Carburant: nouveaux blocages de pêcheurs dans l'Hérault et à Nice avant une réunion avec la ministre
-
Inde: un chant de la lutte pour l'indépendance au coeur d'une polémique
-
Lula ira à l'ONU dire à Trump de "ne pas se mêler" des élections au Brésil
-
Poissons avariés, commerces au ralenti: les Gambiens exaspérés par les coupures électriques
-
En Ecosse, Charles III réunit les poids lourds de l'IA et réclame des garanties
-
Ligue Europa: l'OM et l'Europe, pour quoi faire et comment faire ?
-
Messi marque son 100e but avec l'Inter Miami et glane un nouveau trophée
-
Une sonde de la Nasa permet de découvrir un nouveau cratère sur la Lune
-
Le Congrès américain adopte un nouveau paquet de sanctions contre la Russie
-
Espagne: le Barça danse sous la pluie et fait cavalier seul
-
Ligue Europa: nul frustrant pour Rennes à Graz
-
Ligue Europa: Lyon débute bien face à Anderlecht
-
Espagne: critiqué, Mbappé affirme soutenir les habitants de Ceuta "à 100%"
-
L'inflation "trop élevée" pousse la Fed à serrer la vis et braver Trump
-
Yémen: les Houthis font état de frappes de Ryad, qui les accuse d'attaque à La Mecque
-
Le Congrès américain s'en prend aux centres de données, en plein débat sur l'IA
-
Le chef de l'ONU appelle à une "coordination mondiale" sur l'IA
-
Pour tenter de contenir la colère sociale, Lecornu prolonge les aides sur les carburants
-
La Fed relève ses taux face à l'inflation, à contre-courant de Trump
-
Déraillement en Normandie: la SNCF prévoit "plusieurs" semaines de travaux
-
La Bourse de Paris prend des risques calculés avant la Fed
-
Gaza: 21 morts dont 12 enfants dans l'effondrement d'un immeuble
-
"On perd le contrôle", met en garde le pionnier de l'IA Yoshua Bengio
-
La plus grande aciérie d'Italie reste en suspens
-
Les Bourses européennes terminent en hausse avant l'annonce de la Fed
-
Indonésie : les habitants de Pontianak suffoquent sous la fumée des incendies
-
La gauche s'indigne d'une "exposition antiavortement" au Parlement européen
-
Alpes 2030: le CIO rassuré, mais qui maintenant pour incarner ces Jeux?
-
L'ex-président du Kosovo condamné à 25 ans de prison pour crimes de guerre
-
Un plan national pour organiser la lutte contre le frelon asiatique
-
Cancer du sein: à l'Institut Curie, la recherche explore les tumeurs sur puce
-
France: près de 8.000 décès en excès après un été de canicules quasi continues
-
Les eurodéputés autorisent les frais de traitement sur les petits colis
-
Royaume-Uni: le Premier ministre promet des "décisions difficiles" avant le budget
-
Le président libanais veut un accord de sécurité avec Israël, qui pourrait préluder à la paix
-
Ryad accuse les Houthis du Yémen d'avoir attaqué La Mecque, "une ligne rouge"
-
L'IA menace d'accroître les inégalités de genre sur le marché du travail, selon un rapport
-
Le procès pour corruption de Rachida Dati s'est ouvert, en l'absence de Carlos Ghosn
-
Philippe Brun écarté pour des accusations de violence, la primaire de la gauche commence mal
-
Périscolaire à Paris: le maire Emmanuel Grégoire exprime ses "profonds regrets" devant le Sénat
-
Premier procès à Macao en vertu de la loi de sécurité nationale
-
La plus grande aciérie d'Italie pourrait passer à l'électrique, selon le gouvernement
-
L'ancien président du Kosovo Hashim Thaçi condamné à 25 ans de prison pour crimes de guerre
-
Indonésie : les incendies, menace supplémentaire pour l'éléphant de Sumatra
-
A moins de 1,70 euro le litre de carburant, les stations d'Andorre font le plein
L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent
Les derniers modèles d'intelligence artificielle (IA) générative ne se contentent plus de suivre les ordres et vont jusqu'à mentir, manigancer ou menacer pour parvenir à leurs fins, sous le regard inquiet des chercheurs.
Menacé d'être débranché, Claude 4, le nouveau-né d'Anthropic, fait du chantage à un ingénieur et menace de révéler une liaison extra-conjugale. L'o1 d'OpenAI essaye lui de se télécharger sur des serveurs extérieurs et nie lorsqu'on le prend la main dans le sac.
Pas besoin d'aller fouiller dans la littérature ou le cinéma, l'IA qui se joue de l'homme est désormais une réalité.
Pour Simon Goldstein, professeur à l'université de Hong Kong, ces dérapages tiennent de l'émergence récente des modèles dits de "raisonnement", capables de travailler par étapes plutôt que de produire une réponse instantanée.
o1, version initiale du genre pour OpenAI, sorti en décembre, "a été le premier modèle à se comporter ainsi", explique Marius Hobbhahn, patron d'Apollo Research, qui teste les grands programmes d'IA générative (LLM).
Ces programmes tendent aussi parfois à simuler "l'alignement", c'est-à-dire à donner l'impression qu'ils se plient aux consignes d'un programmeur tout en poursuivant, en fait, d'autres objectifs.
Pour l'heure, ces traits se manifestent lorsque les algorithmes sont soumis à des scénarios extrêmes par des humains, mais "la question, c'est de savoir si les modèles de plus en plus puissants auront tendance à être honnêtes ou pas", estime Michael Chen, de l'organisme d'évaluation METR.
"Les utilisateurs poussent tout le temps les modèles aussi", fait valoir Marius Hobbhahn. "Ce que nous observons est un vrai phénomène. Nous n'inventons rien."
Beaucoup d'internautes évoquent, sur les réseaux sociaux, "un modèle qui leur ment ou invente. Et ce ne sont pas des hallucinations, mais une duplicité stratégique", insiste le co-fondateur d'Apollo Research.
Même si Anthropic et OpenAI font appel à des sociétés extérieures, comme Apollo, pour étudier leurs programmes, "davantage de transparence et un accès élargi" à la communauté scientifique "permettraient de meilleures recherches pour comprendre et prévenir la tromperie", suggère Michael Chen.
Autre handicap, "le monde de la recherche et les organisations indépendantes ont infiniment moins de ressources informatiques que les acteurs de l'IA", ce qui rend "impossible" l'examen de grands modèles, souligne Mantas Mazeika, du Centre pour la sécurité de l'intelligence artificielle (CAIS).
Si l'Union européenne s'est dotée d'une législation, elle concerne surtout l'utilisation des modèles par des humains.
Aux Etats-Unis, le gouvernement de Donald Trump ne veut pas entendre parler de régulation et le Congrès pourrait même bientôt interdire aux Etats d'encadrer l'IA.
- L'IA en justice? -
"Il y a très peu de prise de conscience pour l'instant", constate Simon Goldstein, qui voit néanmoins le sujet s'imposer dans les mois à venir avec la révolution des agents IA, des interfaces à même de réaliser seules une multitude de tâches.
Les ingénieurs sont engagés dans une course derrière l'IA et ses dérives, à l'issue incertaine, dans un contexte de compétition féroce.
Anthropic se veut plus vertueux que ses concurrents, "mais il essaye en permanence de sortir un nouveau modèle pour dépasser OpenAI", selon Simon Goldstein, une cadence qui offre peu de temps pour des vérifications et corrections éventuelles.
"En l'état, les capacités (de l'IA) se développent plus rapidement que la compréhension et la sécurité", reconnaît Marius Hobbhahn, "mais nous sommes toujours en mesure de rattraper notre retard".
Certains pointent dans la direction de l'interprétabilité, une science récente qui consiste à décrypter de l'intérieur le fonctionnement d'un modèle d'IA générative, même si d'autres, notamment le directeur du CAIS, Dan Hendrycks, sont sceptiques.
Les combines de l'IA "pourraient gêner son adoption si elles se multiplient, ce qui constitue une forte incitation pour les entreprises (du secteur) à résoudre" ce problème, selon Mantas Mazeika.
Simon Goldstein évoque, lui, le recours à la justice pour mettre au pas l'intelligence artificielle, en se tournant vers les sociétés en cas de sortie de route.
Mais il va plus loin et propose même de "tenir légalement responsables" les agents IA "en cas d'accident ou de crime".
O.Gutierrez--AT