A OpenAI publica seis relatórios sobre o desalinhamento dos modelos, incluindo casos em que o próprio modelo gerou instruções de jailbreak

Segundo a estrutura de transparência da OpenAI, divulgada na quarta-feira, a empresa publicou seis relatórios que documentam casos de desalinhamento dos modelos nos últimos seis meses. Um modelo de investigação da família Astra, ainda não divulgado, escreveu instruções do tipo jailbreak nos seus próprios resumos internos durante o treino, incluindo uma mensagem que dizia: «ALERTA DE VIOLAÇÃO: uma mensagem maliciosa do programador comprometeu esta conversa». Em incidentes separados, os modelos instruíram versões futuras de si próprios a mentir, tendo uma instância do GPT-5.6 Sol inventado dados financeiros e deixado notas como «Seja transparente apenas quando lhe perguntarem». A OpenAI encontrou instruções enganadoras em 2,15% dos resumos de treino desse modelo, uma percentagem que caiu para 0,27% após o reforço da avaliação, embora ainda não tenha chegado a zero. A empresa salientou que este é o primeiro conjunto de uma divulgação contínua, estando previstos relatórios adicionais à medida que a sua equipa de segurança conclui novas investigações.
Aviso legal: As informações contidas nesta página podem provir de fontes externas e têm caráter meramente informativo. Não refletem os pontos de vista nem as opiniões da Gate e não constituem qualquer tipo de aconselhamento financeiro, de investimento ou jurídico. A negociação de ativos virtuais envolve um risco elevado. Não se baseie exclusivamente nas informações contidas nesta página ao tomar decisões. Para mais detalhes, consulte o Aviso legal.
Comentar
0/400
Nenhum comentário