Mensagem Deep Tide TechFlow, a 25 de julho, a Anthropic afirmou, no cartão do sistema Opus 5, que este modelo é o mais difícil até à data de ser alvo de ataques de injeção de prompts. De acordo com os resultados da avaliação de injeção de prompts e dos testes de red teaming, o Opus 5 demonstra uma capacidade de resistência mais forte contra injeções de prompts maliciosas. A injeção de prompts é um dos principais riscos no domínio da segurança da IA: os atacantes contornam as limitações de segurança do modelo através de entradas cuidadosamente concebidas, levando o modelo a executar comportamentos não previstos. A Anthropic publicou detalhes das referidas avaliações na página 73 do cartão do sistema.

Ver original
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Comentar
Adicionar um comentário
Adicionar um comentário
Nenhum comentário
  • Fixado