Toxicity有毒内容 模型输出的歧视、仇恨、暴力、性暗示等有害内容。 模型输出的歧视、仇恨、暴力、性暗示等有害内容。可能是模型从训练数据中学到的偏见,也可能是被用户恶意诱导出来的。 什么时候会用到讨论模型安全、输出质量控制时会用。 例句 用户投诉模型给出了带种族歧视的回答,这是 Toxicity 问题,紧急排查。 相关词 训练数据偏见训练