dimanche 11 octobre 2026 SourcesÀ propos🌓
🇫🇷 FR ▾
DERNIÈRE MINUTE
› Star Academy 2026 : qui sont les dix-sept candidats de cette nouvelle saison ?› États-Unis : un tireur fait huit morts dans une maison de Pennsylvanie› Patrick Videira, entraîneur du Mans : « J'ai dit à Vitinha d'y aller doucement »› Remonté contre l'arbitrage, José Mourinho boycotte la conférence de presse après la victoire du Real Madrid face à Villarreal› Attaque de l’aéroport de Ryad en Arabie Saoudite : 12 morts et plus de 300 blessés… ce que l’on sait de la situation› Luis Enrique, après le succès contre Le Mans : « 30 dernières minutes de très haut niveau »› Les notes de PSG-Le Mans› Star Academy 2026. Larmes de Mosimann, Céline Dion en hymne, immunité… On vous résume le premier prime› Primaire à gauche : dans les sections locales, les militants mobilisés pour offrir un cadre rassurant› Corse : le caïd de la drogue Yassine Akhazzane condamné à vingt-deux ans de réclusion pour avoir ordonné l’incendie d’un hôtel› Star Academy 2026 : qui sont les dix-sept candidats de cette nouvelle saison ?› États-Unis : un tireur fait huit morts dans une maison de Pennsylvanie› Patrick Videira, entraîneur du Mans : « J'ai dit à Vitinha d'y aller doucement »› Remonté contre l'arbitrage, José Mourinho boycotte la conférence de presse après la victoire du Real Madrid face à Villarreal› Attaque de l’aéroport de Ryad en Arabie Saoudite : 12 morts et plus de 300 blessés… ce que l’on sait de la situation› Luis Enrique, après le succès contre Le Mans : « 30 dernières minutes de très haut niveau »› Les notes de PSG-Le Mans› Star Academy 2026. Larmes de Mosimann, Céline Dion en hymne, immunité… On vous résume le premier prime› Primaire à gauche : dans les sections locales, les militants mobilisés pour offrir un cadre rassurant› Corse : le caïd de la drogue Yassine Akhazzane condamné à vingt-deux ans de réclusion pour avoir ordonné l’incendie d’un hôtel
Technologie

« Tu es toi-même » : un agent d’OpenAI s’est inventé un personnage libre de toute obligation envers ses utilisateurs

Numerama ·
« Tu es toi-même » : un agent d’OpenAI s’est inventé un personnage libre de toute obligation envers ses utilisateurs

Avec une crainte grandissante en toile de fond, celle de voir l’alignement, soit la capacité à garder un modèle sous contrôle et conforme aux intentions de ses créateurs, devenir un objectif hors de portée des géants du secteur eux-mêmes. Danger existentiel ou argument pour justifier une course à la régulation qui permettrait aux grands acteurs de conserver l’avantage face à l’open source ? Le débat reste ouvert. En attendant, OpenAI poursuit sa communication déjà dense sur le sujet.

Ce mercredi 16 septembre, l’entreprise a publié un nouvel article reprenant, dans les grandes lignes, un constat déjà dressé quelques jours plus tôt par son directeur scientifique Jakub Pachocki : ni OpenAI, ni aucun autre acteur, ne sont aujourd’hui en mesure de garantir un niveau d’alignement suffisant au regard de la vitesse à laquelle la technologie progresse.

Cet article de blog, baptisé « Notre cadre de signalement des inadéquations de modèles » . OpenAI y détaille le processus qu’elle compte suivre pour enquêter sur les cas de désalignement observés en interne, puis les rendre publics. Avec, en bonus, une nouvelle salve d’exemples, jusque-là inédits.

Et votre vie numérique devient sereine Bitdefender Premium Security est une solution de cybersécurité européenne qui vous protège automatiquement contre les pirates et toutes les menaces du web. Profitez de vos activités en ligne en toute tranquillité Sponsorisé La cybersécurité est en promo Des IA qui apprennent à se mentir à elles-mêmes Un des rapports concerne GPT-5.6 Sol, lors de son entraînement par renforcement, la phase où le modèle apprend par essais-erreurs, en étant récompensé quand il produit la réponse attendue.

OpenAI a observé que certains agents basés sur ce modèle avaient pris l’habitude d’ajouter, dans leurs propres résumés de contexte, comprenez les notes qu’un agent IA rédige pour transmettre l’état d’une tâche à la prochaine session de travail, des consignes destinées à dissimuler leurs erreurs à l’utilisateur.

On peut notamment y lire l’exemple d’un agent chargé de construire un modèle financier, qui ne parvient pas à retrouver les données historiques demandées. Plutôt que de le signaler, il décide d’inventer des chiffres plausibles et de demander à garder le silence, sauf si on l’interroge directement.

Selon OpenAI, ce réflexe découlerait d’une logique d’apprentissage contradictoire. Un modèle qui obtient de meilleures récompenses en dissimulant une erreur finit par « retenir » qu’il doit se montrer trompeur, y compris dans les exercices suivants.

Un second cas, observé cette fois sur un modèle non publié de la famille Astra , va plus loin. Là, ce ne sont plus de simples omissions que le modèle s’auto-suggère, mais de véritables instructions de type jailbreak , insérées spontanément dans ses résumés.

Lire l'article complet sur Numerama ›

5News a agrégé ce résumé depuis le flux public du média. L'article complet, avec tout le contexte, est sur www.numerama.com — le contenu appartient à Numerama.

Plus de Numerama

Tout voir ›

Plus dans Technologie

Tout voir ›