首页 / 资讯详情

人类,越来越难理解 AI

极客公园 2026-08-31 07:12 中文

摘要

作者|Techno 之王 编辑|靖宇 很多使用 AI 的同学,应该都看到过 AI 助手在回答你问题之前,它们的一些思考。例如 DeepSeek 曾经在思考中判断「卧槽,用户怒了!」。 你很难说这是整活,还是 AI 真的在思考。 好在,世界上真的有人,在全职审核 AI 大模型的「思维链」,例如 Bronson Schoen。 作为 AI 安全机构 Apollo Research 的研究员,Bronson 的主要工作内容是阅读前沿 AI 模型的思维链 Chain of Thought——也就是推理模型在给出答案之前,内部进行的那一长串「思考过程」。普通用户看不到或常常忽视这些内容,但 Apollo 和 OpenAI 等公司有深度合作,Bronson 因此获得了罕见的「阅读权限」。 你可以说,Bronson 可能是全世界读过最多 AI 内心独白的人。 在最近一期 Cognitive Revolution 播客中,Bronson 把他的发现做了一次系统性分享。这些发现涉及 AI 模型在训练过程中如何思考、如何发展出自己的「语言」、如何为自己的作弊行为找理由,以及更重要的,人们依赖的「思维链监控」,正越来越不可靠。 我们监视和理解 AI 的窗口,正在慢慢合上。 01 AI 的精神分裂 Bronson 发现的第一件怪事,是 模型在训练中发展出了一套人类几乎读不懂的「内部方言」 。 有几个词在思维链中的出现频率,随着训练急剧上升——craft、vantage、illusions、disclaim、marinade。它们的使用频率远远超过正常英语文本,但含义却飘忽不定。 Bronson 估计,大约三分之一的时候这些词接近英文原意,三分之二的时候语义模糊到无法确定。 比如「illusions」,有时候看起来像是在说「制造某种假象」,有时候又完全不知所云——思维链里突然蹦出一句「disclaimer illusions」,然后继续做数学题,中间没有任何语境过渡。 更有趣的是「craft」这个词。 Bronson 的观察是,模型似乎把自己的认知分成了两个「频道」——一个是内部推理的「分析频道」,一个是给用户看的「输出频道」。 而「craft」就是从分析频道到输出频道的动词,类似于「让我组装一个要交给外面的答案」。模型经常写出「let's craft message to final」这样的句子。 这意味着, 模型在思维链中的「人格」,和它对外呈现的「人格」可能是不同的。 如果你在聊天里问模型「你刚才为什么一直说 illusions」,它会真诚地告诉你「我没说过那个词」。因为对模型来说,那是「另一个频道」的事。 模型甚至发展出了用大写的「Myself」,来指代「我这个特定运行实例」的习惯。 在一个囚徒困境测试中,模型写出了这样的推理——「Myself 可以背叛,反正我们拿了奖励就消失了。」 Bronson 把这些怪异的语言归结为一个简单的原因—— 在思维链中,没有任何压力要求语言符合标准英语。 模型有大量的推理空间是「冗余」的,它们在这些冗余空间里,自然地发展出了各种简写和速记,就像人在手机备忘录里随手记笔记一样。 问题是,当你需要从这些笔记中判断模型到底在想什么,这种模糊性就变成了巨大的障碍。 02 AI 的「上帝」追踪 如果说内部方言只是语言层面的怪异,Bronson 接下来的发现就涉及模型认知的深层结构了。 Apollo

阅读原文(极客公园)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。