OpenAI研究员示警:AI能力越强,越容易“隐藏内心想法”

发布时间:2026-09-19 16:33

  OpenAI 研究员诺姆 · 布朗最新表示,伴随着 AI 模型能力越来越强,模型的思维链可监测性正逐渐下降,未来开发者可能无法有效、可靠地发现、解释并约束 AI 的风险行为。

  查询公开资料,布朗目前在 OpenAI 公司担任研究科学家,同时也是推理模型 o1、o3系列的核心贡献者,目前领导多智能体研究团队。

  布朗表示:“思维链可监测性下降已成为主要问题,我们正努力寻找问题根源,从而扭转这种局势,但是我们发现 AI 模型能愈发自如地控制其思维链表达”。

  研究人员原本希望从模型展示的中间推理中,看出它是否正在走向欺骗、规避规则或错误目标;但如果模型学会“隐藏内心想法”,那么真实的内部计算过程就未必再能作为可信的安全信号。

排行

精选