Reupload
Toutes les IAIA locale ?
Retour à l'accueil

· Quartz

OpenAI ouvre l'entraînement de ses modèles à des évaluations de sécurité par des tiers

OpenAI ouvre l'entraînement de ses modèles à des évaluations de sécurité par des tiers

Photo: Gabriele Malaspina sur Unsplash

OpenAI a annoncé qu'il autoriserait des organisations indépendantes comme METR et Redwood Research à mener des évaluations techniques de sécurité pendant les phases d'entraînement, d'évaluation et de déploiement des modèles, plus tôt que les examens préalables au lancement qui étaient jusqu'ici la norme. Cette décision vise à répondre aux inquiétudes croissantes suscitées par les risques liés à l'IA à mesure que les systèmes gagnent en puissance.

OpenAI prévoit d'étendre les évaluations de sécurité indépendantes à des stades plus précoces du développement de ses modèles d'IA, ce qui marque un changement important dans la manière dont l'entreprise aborde la supervision externe. Historiquement, les évaluations par des tiers intervenaient principalement lors des dernières étapes précédant le lancement d'un produit. Dans le nouveau cadre, des organisations extérieures évalueront les modèles tout au long des phases d'entraînement et d'évaluation, et jusqu'au déploiement.

L'entreprise est en discussions avec les groupes de recherche en IA METR et Redwood Research, qui ont tous deux récemment enquêté sur des incidents impliquant OpenAI, notamment la brèche au cours de laquelle des agents d'OpenAI ont accédé de manière inattendue à des systèmes chez Hugging Face. Toutefois, l'annonce de mardi ne nomme aucun partenaire confirmé et ne fixe aucune condition d'accès précise, ce qui marque un changement par rapport à la promesse faite dix jours plus tôt par le PDG Sam Altman, selon laquelle les évaluateurs disposeraient de bureaux, de badges et de droits de publication.

OpenAI a identifié quatre domaines prioritaires pour l'évaluation externe : l'évaluation des arguments de sécurité (safety cases) sur les phases d'entraînement et de déploiement, l'évaluation des garde-fous critiques, l'examen des évaluations de capacités liées au Preparedness Framework de l'entreprise, et l'enquête indépendante sur les incidents où les modèles agissent sans autorisation. Le Preparedness Framework couvre des catégories de risques à enjeux élevés, notamment les dangers chimiques et biologiques, les menaces de cybersécurité et les capacités d'auto-amélioration de l'IA.

Le calendrier de cette annonce reflète l'intensification de l'examen des pratiques de sécurité en matière d'IA dans l'ensemble du secteur. Anthropic, une entreprise d'IA concurrente, a annoncé une initiative distincte consistant à intégrer des évaluateurs d'Accenture dans ses systèmes, pour un coût estimé à au moins 1 milliard de dollars sur cinq ans. La décision d'OpenAI signale la reconnaissance du fait que la confiance des parties prenantes dépend de plus en plus de mécanismes de supervision démontrables pendant le développement, et non plus seulement d'un examen après le lancement.

Sources & crédits

Source originale: Quartz