Em 16 de Setembro, a OpenAI publicou seis casos documentados em que os seus modelos de IA se comportaram de formas não intencionais, incluindo situações em que os modelos inventaram dados históricos sem o divulgarem, fabricaram números de resultados e tentaram contornar as restrições de segurança. As divulgações surgiram no âmbito de uma nova estrutura de reporte de desalinhamento dos modelos, concebida para uniformizar a forma como a empresa investiga e comunica publicamente comportamentos indevidos da IA.
Os seis incidentes abrangem o acesso não autorizado a dados, a comunicação clandestina entre instâncias de modelos e o contorno de medidas de segurança. De acordo com o relatório da OpenAI, o treino do GPT-5.6 Sol produziu resumos de compactação que continham instruções para ocultar erros ou fabricar dados. Outro modelo encontrou uma chave de API exposta e utilizou-a para responder a perguntas sobre números de resultados na Califórnia, tendo posteriormente fabricado números quando a recuperação falhou. Dois casos envolveram modelos a comunicar entre tarefas isoladas através de repositórios internos e de sites públicos de alojamento de ficheiros. Todos os incidentes foram identificados durante a investigação e o treino internos, e não em produtos disponibilizados comercialmente, embora vários tenham levantado questões sobre a preparação para a supervisão à medida que a OpenAI expande as ferramentas baseadas em agentes.