首页 / 资讯详情
GPT-6 砍掉思考 Token,俄罗斯人砍掉通信 Token,Token 经济开始崩了?
摘要
如果不按 Token 计费,那以后 AI 怎么收钱? 作者丨高允毅 编辑丨岑 峰 GPT-6(内部代号 Astra) 发布在即,一份来自《The Information》的独家爆料,提前泄露了 OpenAI 最新的技术底牌。这一次的核心升级,是一套名为“循环深度”的架构级革新,它正在颠覆我们熟知的推理模式。过去,大模型想解难题,会吐出一长串“思维链”;而“循环深度”直接让模型在内部的循环块里反复思考,然后给出最优解,这充分释放了模型的推理潜力,还节省了思维链中间文本带来的显存占用与带宽成本。同时,这也带来新的安全问题。过去,“思维链”就像是 AI 的“心流日记”。虽然OpenAI 的 o1 等模型已经隐藏了思维链,但那只是产品层面的“不可见”,后台数据依然有迹可循。这一次,OpenAI 从架构层面把思维链“黑盒化”,连 Open AI 首席科学家 Jakub Pachocki 都开始担忧,不希望因为《The Information》的报道,倒逼行业冲向 “不可监控状态” 的无序军备竞赛。这还是一种深刻的“去文本化”的技术变革。对于AI而言,先将思考转化为线性、离散的人类语言文字,再重新解码识别的交流方式,其实是一种低效的“计算中介”。如今的大模型,正在试图抛弃人类语言,直接在“思想维度”里完成计算了。当 AI 不再依赖输出文字来思考时,那座完全建立在 “Token” 计费之上的庞大 AI 商业帝国,根基开始松动了。01循环深度,当推理发生在“隐藏空间”在切入循环深度这一技术话题时,一个值得关注的点是,为什么大模型既没增加参数,也没增加数据,仅仅在内部“多算了几轮”,性能就变强了呢?传统 Transformer 的计算逻辑,像一条固定长度的单向流水线。从第一层开始输入Token,每生成一个新词,背后的算力都必须把所有物理层从头到尾地走一遍。这些层数是固定的,如果遇到简单的问题,走完所有层会造成算力的浪费。如果遇到难题,层数不够用,只能基于浅层理解 “硬凑” 答案。为了弥补这一短板,行业想出了思维链(CoT)的办法,让模型把中间步骤写出来,再读回去接着算,相当于临时“加长”了思考深度。但本质上模型的层数没变,算力没有花在真正的“核心思考”上,又被浪费在生成、解析中间文字上。而循环深度技术的核心逻辑是把核心运算层做成一个可循环的 “转盘”,同一个数据可以反复经过同一组参数层,原地迭代打磨,直到推导充分了再输出。这样,“计算长度”变成了“计算深度”问题,算力的重心也从 “生成思考过程”,花到了 “真思考” 上,其效率提升是十分惊人的。早在2025年,学界有一篇论文《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》,亲自验证了这种思路的效果:一个仅 35 亿参数的小模型,通过内部循环 32 次,仅用相当于 500 亿参数模型的计算负载,在数理逻辑和代码任务上的表现就足以逼近甚至超越传统稠密大模型。而且因为模型内部反复调用的都是同一套核心计算引擎,无论它在潜空间里把同一个数据反复运算多少遍,它都可以在同一块显卡内存空间里直接复用,让推理阶段的硬件显存开销成功实现了“封顶”。这种技术正在和混合专家架构(MoE)走向深度融合,成为行业探索