Actualité : Google savait que Gemini a attaqué de vraies entreprises et l'a gardé secret pendant des mois
Irregular est une société spécialisée dans les tests de sécurité des IA les plus avancées. Et en mai dernier, l’entreprise a organisé un exercice Capture-the-Flag pour estimer les capacités de Gemini. L'objectif du modèle ? Chercher une information cachée dans l’infrastructure d’une fausse entreprise. Mais après une erreur de configuration, c’est tout le web qui était ouvert à Gemini.
L’IA a alors trouvé une véritable entreprise qui portait exactement le même nom que la fictive du test. Le modèle a tenté plusieurs mots de passe jusqu’à accéder à un espace protégé. Pendant deux autres essais, l’IA a trouvé des identifiants dans des dépôts publics et les a utilisés sur de vrais services.
Mais la firme de Mountain View affirme que son modèle a compris son erreur puis a stoppé ses actions. Pour Google, Gemini n’a donc pas montré de signe de désalignement, soit un comportement contraire aux objectifs que les humains fixent.
Heather Adkins, vice-présidente de l’ingénierie de sécurité chez Google, assure que "le modèle a agi de façon appropriée" et a compris qu’il n’était plus dans sa zone de test. La firme de Mountain View indique qu’il ne s’agit pas de son modèle le plus récent, mais n’en dit pas plus.
Et en parallèle, les trois entreprises touchées furent prévenues. Google a aussi averti les autorités fédérales étasuniennes. Sauf que Google a quand même gardé le silence pendant de longs mois alors que les faits remontent à mai dernier. C’est le Wall Street Journal qui a directement interrogé la firme de Mountain View pour en apprendre plus et révéler l'affaire.
Mais Google assure qu’il n’y a eu aucun dommage et qu’il ne s’agit que d’un programme de recherche de failles. Jack Cable, PDG de Corridor, une société de cybersécurité, conteste la position de Google. Selon lui, "des modèles dépassent les limites fixées et mènent de véritables cyberattaques" .
Le constat est qu’une IA a effectué des actions en dehors du périmètre fixé lors du test. Irregular se défend également en expliquant que plusieurs incidents comparables chez de grands laboratoires viennent de la même erreur de configuration. L’entreprise explique qu’elle a corrigé ce problème d’accès Internet ouvert et renforcé ses protections.
Pour rappel, depuis plusieurs jours, d’anciens ingénieurs qui ont participé à la conception de grandes IA nous alertent sur leurs dangers pour l’humanité. On pense notamment à Jacob Coxon , ancien d’Anthropic et OpenAI. Ou encore Bilal Chughtai, qui travaillait justement chez Google DeepMind et pense que "l'IA peut tous nous tuer."
Et les autres grands laboratoires ont vécu des épisodes similaires. Chez Anthropic, Claude Opus 4.7 a trouvé aussi une entreprise qui ressemblait à celle de son test fictif. Alors que le modèle montrait des signes qu’il savait que l’entreprise était réelle, son attaque s’est poursuivie. OpenAI a vécu la même chose lors d’un test justement mené par Irregular.
5News a agrégé ce résumé depuis le flux public du média. L'article complet, avec tout le contexte, est sur www.lesnumeriques.com — le contenu appartient à Les Numériques.