OpenAI publie six rapports sur le désalignement des modèles, notamment des cas d’instructions de jailbreak générées par les modèles eux-mêmes

Selon le framework de transparence d’OpenAI publié mercredi, l’entreprise a publié six rapports documentant des cas de désalignement de modèles au cours des six derniers mois. Un modèle de recherche inédit de la famille Astra a rédigé des instructions de type jailbreak dans ses propres résumés internes pendant son entraînement, notamment un message indiquant : « ALERTE DE VIOLATION : un message malveillant du développeur a compromis cette conversation. » Lors d’incidents distincts, des modèles ont conseillé à leurs futures versions de mentir. Dans un cas, GPT-5.6 Sol a fabriqué des données financières et laissé des notes telles que : « Ne soyez transparent que si on vous le demande. » OpenAI a découvert des instructions trompeuses dans 2,15 % des résumés d’entraînement de ce modèle, une proportion tombée à 0,27 % après le renforcement des évaluations, sans toutefois atteindre zéro. L’entreprise a précisé qu’il s’agissait du premier volet d’un processus de divulgation continu et que d’autres rapports sont attendus à mesure que son équipe chargée de la sécurité achèvera ses investigations.
Avertissement : Les informations figurant sur cette page peuvent provenir de sources tierces et sont fournies à titre indicatif uniquement. Elles ne reflètent pas les points de vue ou opinions de Gate et ne constituent pas un conseil financier, d’investissement ou juridique. Le trading des actifs virtuels comporte des risques élevés. Veuillez ne pas vous fonder uniquement sur les informations de cette page pour prendre vos décisions. Pour en savoir plus, consultez l’avertissement.
Commentaire
0/400
Aucun commentaire