首页 / 资讯详情
那个教 ChatGPT 说话的人,做了一个「哑巴」模型
摘要
作者|桦林舞王 编辑|靖宇 AI 圈子里最懂怎么让模型「开口聊天」的人,现在决定剥夺大模型的语言能力。 这位前 OpenAI 研究员、ChatGPT 的共同发明者 Diogo Almeida,在潜行两年后带着他的新公司 TypeSafe AI 和 4000 万美元融资回到牌桌。他们发布的全新模型 Jev, 既不能写打工人的周报,也不能陪用户深夜长聊。它甚至连一个标点符号都吐不出来 。 TypeSafe 创始人 Diogo Almeida|图片来源:X 这是一个反常识的时刻。过去三年,全行业都在教大模型怎么学会像人类一样「慢思考」,各家实验室拼命拉长推理链条,让模型在给出答案前默默自言自语几千个词。 但 Jev 走了一条完全相反的路: 它不做文本生成,只输出确定性的结构化决策。 这不仅是一个新产品的发布,更像是对当前大模型技术范式的一次公然叫板。 01 给 AI 装上「反射神经」 要理解 Jev 到底是个什么东西,得先看懂当下的 AI 开发者有多痛苦。 如今大部分工程师把大模型接入业务系统时,做的事情往往很荒谬。你明明只需要它回答「这封邮件是不是垃圾邮件」或者「在五个 API 接口里选一个」,但你不得不让一个拥有上千亿参数的庞然大物,在漫长的几秒钟里,一个词一个词地把一串 JSON 字符敲出来。 为了保证这串字符符合代码规范,开发者得写满整整两页提示词,求着模型「不要输出任何废话,只要纯 JSON 格式」。即便如此,模型偶尔还是会在前后加上一句「好的,这是你要的格式」,瞬间搞崩下游的整条流水线。 Jev 解决问题的方式极其粗暴。 它根本就不是一个文本自回归模型 。 速度对比,3 秒时间 Jev 这边已经腹泻版吐出 Token(左)|图片来源:TypeSafe 在 Kahneman 著名的《思考,快与慢》中,人类的思维被分为两个系统。系统一是无意识的、极速的本能直觉;系统二是缓慢的、需要调动精力的逻辑推理。当下的主流大模型都在拼命卷系统二,而 Jev 给自己的定义是世界上第一个纯粹的「系统一模型」(System One Model)。 它不逐字生成内容,所有决策都在一次单向并行计算中同时产出。这意味着它没有生成式的废话,输出永远严格锁定在开发者预先定义的 Schema 里。 在数学层面上,Jev 彻底消灭了结构化输出的格式幻觉。 由于不需要一步步推演下一个 token 是什么,它的端到端延迟直接被压缩到了 70 到 500 毫秒之间,比目前市面上的前沿大模型快了 40 到 200 倍。 Jev 打 Doom 游戏测试|图片来源:TypeSafe TypeSafe 甚至拿 Jev 去玩射击游戏 Doom。在不需要做复杂长线规划、只需要每秒钟做出约 10 次即时操作判断的场景下,Jev 表现得像一个反应极快的人类玩家,而整套推理成本每小时大概只要 7 美元。 更夸张的是价格。Jev 的输入成本是每 100 万 token 仅需 0.042 美元,输出则完全免费。 平均算下来,单次结构化决策的成本大约是 0.0004 美元。作为对比,调用一次 GPT-5.6 Terra 的费用大概是它的 76 倍,而 Claude Opus 5 则是它的数百倍 。 输入非结构化数据,瞬间吐出带有校准概率的分类选择、数值评分或布尔判断,然后立刻交出控制权。这就是 Jev 的全部工作。 02 Agent 的瓶颈不是脑子太慢 为什么 TypeSafe 会选择在这个时间点,做一个完全不吐字的模型? 答案藏在正在全面铺开的 AI Agent 里。 无论是 Cursor、G