Alignment对齐

让模型的行为和人类意图一致——不仅要回答正确,还要拒绝危险请求、不输出有害内容、不编造事实。

让模型的行为和人类意图一致——不仅要回答正确,还要拒绝危险请求、不输出有害内容、不编造事实。对齐是当前AI安全领域最核心的课题,Anthropic 这家公司就是以对齐研究为核心创立的。

什么时候会用到

讨论AI安全、产品合规、模型行为控制时会用。

例句

  • 模型能力是够了,但对齐没做好,动不动就教人做危险的事,上不了线。
  • 对齐不是让模型变笨,而是让它学会什么该说什么不该说。