首页 / 资讯详情
Harness 神器 J-Space 造假案背后,思维链作者暴论,小模型 + 工具干不掉顶级大模型
摘要
外挂补不了模型智商,《苦涩的教训》再次上演。 作者丨高允毅 编辑丨岑 峰 这两天在 X 上,一款蹭 DeepSeek 热度的 Harness 工具被打假了。这是一个名为 J-Space Cognition Suite 的开源项目,它声称无需修改模型权重,仅靠 DeepSeek V4 Flash 加其精巧的外部 Harness,就能在 Agent 任务中追平 GLM-5.3;若换成 DeepSeek V4 Pro,甚至能直接超越Claude Fable 5。同时速度提升 2.53倍,Token 效率提升 2.21倍。如果这是真的,这无疑是 AI 工程史上的奇迹。这意味着J-Space能用几十分之一的成本复刻顶级大模型的效果。然而,泡沫破裂的速度比想象中更快。GitHub 用户 GoForceX 严格按照项目说明,使用 Terminal Bench 完成了独立复测,最终结果与宣传完全相反。加入 J-Space 后,基准测试分数不升反降,Token 消耗量明显增加,推理速度也比原生模型更慢。当社区进一步要求公开完整原始实验数据时,作者承认数据 "确实夸张",却始终拿不出可复现的运行日志,反而开始删除质疑的 issue。几乎在同一时间,Open AI 思维链(CoT)核心发明者 Jason Wei 在 X 上发布了一篇长文,精准戳破了 "小模型 + 万能工具" 的幻想。他用自己学羽毛球的经历做比,“在球场上,我就像一个 1B 参数的认知核心。教练教的每个击球动作我都能做,但要在高速回合里把架拍、转体、击球点、随挥这些要点全部串联起来,几乎要耗尽全部精力。这跟那些练了上万次、将动作化为肌肉记忆的专业选手完全不是一个级别。”Jason Wei隐喻的正是“小模型+ 工具”与“大模型内化能力”的本质区别。他强调“模型不依赖外部工具,自然且快速地完成任务,这件事至关重要”。一旦承认高维认知应该以内生的方式处理,那么 1B、甚至 10B 的核心显然都是不够的。01J-Space 神话切中的行业焦虑J-Space之所以能在 48 小时内引发全行业狂欢,在于它精准地切中了当前 AI 产业的两大行业焦虑:大模型太贵,算力烧不起怎么办?大模型要落地,端侧设备太弱怎么跑?事实上,业内一直在寻找一种可能,小模型 + 工具也能干掉顶级大模型。AI大牛吴恩达正是这一路线支持者之一。他曾多次在公开演讲中展示数据:用版本更早、参数量更小的 GPT-3.5,搭配包含反思、工具调用、任务规划的迭代式 Agent 工作流,在很多基准测试上的表现能够超越当时最强的 GPT-4。微软 Phi-4、Mistral 等小模型,也靠着高质量数据训练,在代码、数学等垂直任务上,以 3B 到 14B 的体量击败过上一代千亿参数模型。这让很多开发者产生了一种错觉:Scaling Law 的边际效应正在递减,只要工具配得好,小模型就能逆袭。今年 7 月,卡内基梅隆大学发布的一篇论文《Better Harnesses, Smaller Models》,更是把这种讨论推向了高潮。论文用详实的测试数据提出,经过高度优化的 Harness 框架,小模型在特定任务上可以恢复大模型 90% 以上的性能,而成本却可以忽略不计。在 “Scaling 撞墙论” 此起彼伏