首页 / 资讯详情
万字长文拆解DeepSeek V4 Pro与Harness:从后训练到「代理自进化」,更大的变化在开源框架里
摘要
不管哪个时代,人都会遇到同一道题:无论宏大叙事还是人生决策,面前问题太复杂,资源和时间却不够,必须决定先做哪个、放弃哪个。(雷峰网)从 1812 年黑格尔的辩证法,到马克思、列宁,再到 1915 年毛泽东在延安写下的《矛盾论》,一百多年里,这套思想最终落到了一个很实际的问题上:复杂事物中矛盾很多,但真正重要的是找到决定其他矛盾的主要矛盾。今天的大模型行业也不例外,当前大模型行业面临的主要问题有以下这些:1.模型能力的增长速度,同把这种能力转化成可靠产出的能力之间的矛盾(模型强,但产出物没价值)。2.算力资源受限,同能力需求无限之间的矛盾(人们总吐槽 AI 太傻)。3.单价在快速下降,同真实账单在上涨之间的矛盾(模型便宜了,但每个月花的更多了)。4.要做通用智能,同要交付一个能用的产品之间矛盾(简单的不好用,好用的不简单)。这些矛盾才构成了交错向上发展的行业和机会。没有人能逃避这些选项,DeepSeek 也一样。我们对 deepseek-v4-Pro以及 Harness 做了几轮实测:直接打接口的探针、七次编码任务运行(其中四次是只改一个变量的对照)、把上下文压到 92 万 token 的位置测试,加上把它 19.8 万行源码和 21.7 万行测试过了一遍。试图来回答以下问题:1.v4-Pro这个模型到底怎样,比 flash、preview 版本有哪些不同?2.好多网友反馈接入其他 Harness 会降智是怎么回事?3.使用成本到底怎么样?能否量化?4.Harness 解决什么问题?什么人适合它?总而言之,这几天的研究和使用下来还是很精彩的,我们甚至能透过 v4-Pro和 Harness 管中窥豹,看到一些 DeepSeek 对技术、对人性,甚至对世界的判断和认知。01先看模型:DeepSeek V4 Pro 到底强在哪里?Pro 很可能重做了一次非常先进的后训练Pro和 Flash 这两个模型其实有挺多版本,我们一次性拉出来看下:【Provs Flash 全参数对照,含字段释义】我们会发现两个有意思的结论:1.Pro 对比 flash,模型本身的层面在深度、宽度、注意力、专家池以及专家内部宽度都有很大进展。2.但这五个维度都是预训练阶段就定性的,不是后训练带来的变量。(有一样是相同的:每个 token 实际只激活 6 个专家,两个模型都是 6。)还有一处彩蛋,后面会再 call back:deepseek Harness 的出厂默认模型写的是 deepseek-v4-flash。【packages/bundle/base/cordis.patch.yml 里 agent-default-model 】为什么 Pro 正式版拖到 Flash 转正之后才公布?坊间其实预测 Pro 早就该来了。我们都知道模型预训练定天花板,后训练定发挥。如果去翻旧账会发现四月那版 v4-Pro-Preview 其实有一个缺陷:竞赛型代码题三项全场第一,但 Terminal Bench 2.0 只有 67.9。7 月 31 日 Flash 转正,官方贴出它的 Terminal Bench 2.1 是 82.7,而同一张表里 Pro-Preview 是 72.1。也就是说 Flash 正式版的 Terminal Bench 已经比旗舰模型 Pro的分数高不少了,我合理推测 DeepSeek 在 Flash 版本上尝试出了更好的后训练方法,因此 v4-Pro 被回炉重造。【官方自测当前 v4 家族和几款旗舰模型的评测分数】再看 v4-pro-0813 的几项跃升里边,正好