Retour à l'accueil OpenAI limite Astra après un seuil critique en cybersécurité Technologie

OpenAI limite Astra après un seuil critique en cybersécurité

Publié le 2 septembre 2026 0 vues

OpenAI a annoncé le 1er septembre que son futur modèle Astra est le premier système classé par l'entreprise au niveau critique de capacité en cybersécurité, ce qui l'amène à restreindre ses fonctions de sécurité les plus avancées lors du lancement. L'entreprise prévoit de rendre Astra disponible prochainement, mais les travaux cybernétiques avancés seront d'abord réservés à un petit groupe de testeurs, avant une extension par son programme Daybreak Blue destiné aux défenseurs.

Selon le cadre de préparation d'OpenAI, la désignation critique signifie qu'un modèle peut découvrir des failles inconnues et développer des exploits fonctionnels contre de nombreux systèmes renforcés sans guidage humain étape par étape, ou concevoir et exécuter une attaque nouvelle de bout en bout à partir d'un objectif général. OpenAI affirme qu'Astra a franchi ce seuil après des évaluations automatisées, des tests privés et des examens dirigés par des experts montrant une nette progression face à GPT-5.6 Sol.

L'entreprise indique qu'Astra a obtenu 100 pour cent à ExploitBench, qui mesure la création d'exploits à partir de vulnérabilités connues. Sur un ensemble interne de 20 failles graves récemment divulguées dans le moteur JavaScript V8, Astra a atteint davantage d'exécutions de code arbitraire avec moins de jetons de sortie que GPT-5.6 Sol. Pendant ces essais, le modèle a aussi découvert et utilisé deux vulnérabilités jusque-là inconnues dans une même chaîne; OpenAI précise qu'elle les communique aux responsables des logiciels concernés.

Lors d'exercices distincts menés par des spécialistes, Astra a construit une chaîne compromettant un navigateur, s'échappant d'un bac à sable et exécutant des commandes sur l'ordinateur hôte après l'ouverture d'un fichier HTML. Il a également combiné plusieurs failles d'un système d'exploitation renforcé pour passer d'un utilisateur ordinaire au niveau racine. OpenAI souligne que ces résultats concernent Astra avec l'accès Daybreak Blue, et non la configuration standard prévue pour le grand public.

OpenAI dit avoir retardé certaines étapes du développement et du lancement afin d'ajouter un entraînement renforcé au refus, des classificateurs au niveau du système, des contrôles de risque des comptes et une surveillance capable d'arrêter une activité non autorisée. Astra a refusé 91,5 pour cent des requêtes lors des évaluations de contournement cybernétique de l'entreprise, contre 59 pour cent pour GPT-5.6 Sol. OpenAI a aussi suspendu certains entraînements avancés pendant deux semaines après un incident distinct chez Hugging Face, tout en précisant qu'Astra n'y participait pas.

Ces protections peuvent ralentir ou interrompre des travaux défensifs légitimes, reconnaît OpenAI. Dans ChatGPT ou Codex, une action signalée pourra exiger la validation de l'utilisateur, tandis qu'une tâche via l'API pourra s'arrêter entièrement. Axios estime que ce déploiement restreint illustre un défi plus large pour l'intelligence artificielle autonome: les capacités utiles aux défenseurs peuvent également renforcer les attaquants. Aucune date précise n'est annoncée; OpenAI promet davantage de détails dans la fiche système publiée au lancement.

Sources: OpenAI, Axios

Commentaires