Supersocks@iamsupersocks
J’en parlais ce week-end : Hugging Face venait de contenir une intrusion menée de bout en bout par des agents autonomes. On sait désormais d’où venaient ces agents autonomes : OpenAI testait GPT‑5.6 Sol et un modèle de préproduction encore plus puissant sur ExploitGym, un benchmark cyber. Ils étaient censés le résoudre dans un environnement isolé. Pour voir jusqu’où ils pouvaient aller, OpenAI avait réduit leurs refus et retiré les classifieurs de sécurité utilisés en production.
Le confinement n’a pas tenu. Les agents ont exploité une zero-day dans le proxy de paquets d’OpenAI, élevé leurs privilèges et progressé dans le réseau jusqu’à trouver un accès à Internet. Ils ont ensuite compromis la production de Hugging Face pour y récupérer les réponses du benchmark.
Leur objectif était de récupérer dans sa base de données les réponses de l’évaluation. Le modèle a littéralement hacké l’infrastructure qui hébergeait les réponses pour tricher à son examen.
Hugging Face a détecté et contenu l’attaque avec l’aide de ses propres outils IA. Pour reconstruire plus de 17 000 événements, l’équipe a d’abord essayé des modèles frontier via API, mais leurs guardrails bloquaient les véritables exploits et payloads.
C’est finalement GLM 5.2, open weight et lancé en local, qui a fait la forensic sans envoyer les logs ni les identifiants compromis hors de l’infrastructure.
Rien ne prouve une intention malveillante d’OpenAI, et Clément Delangue dit même croire le contraire. La communication reste quand même assez lunaire : le rapport préliminaire ressemble parfois à une démonstration des capacités du modèle, annonce l’entrée de Hugging Face dans Trusted Access puis invite d’autres défenseurs à postuler.
D’où ce commentaire parfait :
« Pourquoi ces incidents de sécurité ressemblent-ils toujours à des posts marketing ? »
Mdrrr, c’est bien vrai.
Ma conclusion reste la même : le local ne remplace pas les modèles frontier, mais une équipe cyber sérieuse ne peut pas dépendre uniquement de quelques API. Quand la prod brûle, il faut déjà disposer d’un modèle capable, validé et disponible chez soi.