标签

AI安全领域一个崭新却易逝的关键契机

首先,思维链构成了一个难得的安全切入点。当代推理模型会将大量串行运算过程以外显自然语言的形式呈现;当模型出现reward hacking、欺诈行为、prompt injection等异常状况时,其真实意图有时会直接显现在思维链之中。正因如此,CoT monitor常常能够捕捉到那些仅凭观察最终输出难以察觉的问题。其次,他们从最初便未将思维链等同于真实的思维活动。论文明确指出,思维链只是内部计算的一种不完整的外化表征;模型完全可能存在未被verbalize的相关运算过程。因此,"CoT看起来正常"绝不能作为

2026-09-04 06:20:59  |  2 阅读