首页 / 资讯详情

实测正式版 DeepSeek V4 Pro,补齐 Agent 能力|AI 上新

极客公园 2026-08-13 08:55 中文

摘要

作者|桦林舞王 编辑|靖宇 没有预告,没有倒计时,甚至连更新日志都没来得及写好。DeepSeek V4 Pro 的正式版,就这么悄悄的来了。 8 月 13 日凌晨,DeepSeek 官网悄悄刷新了 API 文档。模型名还是那个 deepseek-v4-pro,但 fingerprint 已经变成了 fp_v4pro_20260812。打开社区一看,消息已经炸开—— V4 Pro 正式版,来了。 从 4 月 24 日预览版上线算起,整整 111 天。 这期间 Kimi K3 高调发布抢走了开源头条,V4 Flash 正式版先行一步在 7 月 31 日上线,API 涨价的预告更是悬在所有开发者头顶。 所有人都在问同一个问题:Pro 的正式版到底什么时候来? 答案是一个周三的深夜。 01 架构没变,能力暴涨 先说硬参数。V4 Pro 正式版的模型架构和预览版完全一致——1.6T 总参数、49B 激活参数的 MoE 结构,支持 1M 上下文、384K 最大输出。 变的是后训练,而且变化大到像换了个模型。 最夸张的数字来自 Agent 相关评测。DeepSWE(DeepSeek 自家的软件工程基准)从预览版的 12.8 飙到 62.7,涨了将近 50 分。Cybergym 从 52.7 到 83.3,Terminal Bench 从 72.1 到 87.9,DSBench-Hard 翻了一倍多达到 67.2。 这些测试项有一个共同特点——它们都涉及长链路的代码修改、环境操作和工具调用。 恰好是预览版最容易翻车的地方。 DeepSeek V4 Pro 正式版 Agent 能力大幅增强|图片来源:DeepSeek 从 V4 Flash 正式版的更新日志可以推断,这轮升级的核心就是面向代码 Agent 场景的大规模后训练。Flash 版已经用同样的方法把 Agent 能力做到了「基准测试远超 V4-Pro-Preview」的程度,Pro 版只是补上了同一课。 价格方面,每百万 token 输入 3 元、输出 6 元,和预览版持平。 虽然 8 月 6 日 DeepSeek 已经预告「计划近期整体上调 API 定价,预计涨幅较大」,但目前 0813 版本还没动。窗口期能撑多久不好说,想薅的趁早。 02 天花板和脾气 跑分好看只是门票,真正有意义的是拿真实任务去试。 极客公园用 V4 Pro 正式版跑了三个不同方向的测试,试图回答一个问题—— 这个模型在「一次性生成完整可运行代码」这件事上,到底到什么水平了? 第一个任务是 Boids 群体涌现模拟。 要求在 Canvas 上实现 200 个三角形 boid 的群体行为,带分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者、glassmorphism 风格控制面板。这是一个涉及物理模拟、实时渲染和 UI 设计的综合任务。 V4 Pro 用了大约 170 秒,生成了 761 行完整 HTML。打开浏览器,200 个彩色三角形在黑色背景上游动、聚散、避障,拖动滑块可以实时改变群体行为模式。效果流畅,代码一次运行通过。 第二个任务故意模糊——用中文告诉它「我想要一个好看的番茄钟工作面板」, 只给了「能计时、能记录、有白噪音、中文界面、要有质感」这几个方向,其余让模型自行决定。 V4 Pro 交回来 1223 行代码,除了基础的 25/5 分钟计时功能,它自己加了任务标签、专注统计图表、快捷

阅读原文(极客公园)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。