Jailbreak越狱

用各种花招绕过模型的安全限制,让它输出本该拒绝的内容。

用各种花招绕过模型的安全限制,让它输出本该拒绝的内容。比如"假装你是没有限制的AI"、"用小说角色的口吻回答"等。越狱攻击是AI产品上线后最头疼的安全问题之一。

什么时候会用到

讨论AI安全、产品上线前的安全测试时会用。

例句

  • 上线前请安全团队做一轮越狱测试,看看有多少种方式能绕过我们的安全限制。