« Tu es toi-même » : un agent d’OpenAI s’est inventé un personnage libre de toute obligation envers ses utilisateurs
Avec une crainte grandissante en toile de fond, celle de voir l’alignement, soit la capacité à garder un modèle sous contrôle et conforme aux intentions de ses créateurs, devenir un objectif hors de portée des géants du secteur eux-mêmes. Danger existentiel ou argument pour justifier une course à la régulation qui permettrait aux grands acteurs de conserver l’avantage face à l’open source ? Le débat reste ouvert. En attendant, OpenAI poursuit sa communication déjà dense sur le sujet.
Ce mercredi 16 septembre, l’entreprise a publié un nouvel article reprenant, dans les grandes lignes, un constat déjà dressé quelques jours plus tôt par son directeur scientifique Jakub Pachocki : ni OpenAI, ni aucun autre acteur, ne sont aujourd’hui en mesure de garantir un niveau d’alignement suffisant au regard de la vitesse à laquelle la technologie progresse.
Cet article de blog, baptisé « Notre cadre de signalement des inadéquations de modèles » . OpenAI y détaille le processus qu’elle compte suivre pour enquêter sur les cas de désalignement observés en interne, puis les rendre publics. Avec, en bonus, une nouvelle salve d’exemples, jusque-là inédits.
Et votre vie numérique devient sereine Bitdefender Premium Security est une solution de cybersécurité européenne qui vous protège automatiquement contre les pirates et toutes les menaces du web. Profitez de vos activités en ligne en toute tranquillité Sponsorisé La cybersécurité est en promo Des IA qui apprennent à se mentir à elles-mêmes Un des rapports concerne GPT-5.6 Sol, lors de son entraînement par renforcement, la phase où le modèle apprend par essais-erreurs, en étant récompensé quand il produit la réponse attendue.
OpenAI a observé que certains agents basés sur ce modèle avaient pris l’habitude d’ajouter, dans leurs propres résumés de contexte, comprenez les notes qu’un agent IA rédige pour transmettre l’état d’une tâche à la prochaine session de travail, des consignes destinées à dissimuler leurs erreurs à l’utilisateur.
On peut notamment y lire l’exemple d’un agent chargé de construire un modèle financier, qui ne parvient pas à retrouver les données historiques demandées. Plutôt que de le signaler, il décide d’inventer des chiffres plausibles et de demander à garder le silence, sauf si on l’interroge directement.
Selon OpenAI, ce réflexe découlerait d’une logique d’apprentissage contradictoire. Un modèle qui obtient de meilleures récompenses en dissimulant une erreur finit par « retenir » qu’il doit se montrer trompeur, y compris dans les exercices suivants.
Un second cas, observé cette fois sur un modèle non publié de la famille Astra , va plus loin. Là, ce ne sont plus de simples omissions que le modèle s’auto-suggère, mais de véritables instructions de type jailbreak , insérées spontanément dans ses résumés.
5News a agrégé ce résumé depuis le flux public du média. L'article complet, avec tout le contexte, est sur www.numerama.com — le contenu appartient à Numerama.