首页 / 资讯详情

DeepSeek 上线多模态,我用它做了《牛来》小游戏|AI 上新

极客公园 2026-08-24 07:14 中文

摘要

作者|Wildcard 编辑|靖宇 多模态也是「梁心」地板价。 「鲸鱼睁眼了!」 非常突然的,8 月 21 日 DeepSeek 官方正式宣布,V4-Flash-Vision-Exp 上线,开启多模态 API 服务。 等了这么久,DeepSeek 模型终于补上了多模态能力,欢喜的人们甚至差点忘了 DeepSeek 刚刚开始根据使用时间涨价的事儿。 梁文锋滑动变阻器,旋钮向着「梁圣」方向前进一格。 极客公园按耐不住,马上测试了起来。 栏目作者召集 极客公园的新栏目「AI 上新」,将带大家体验最新的 AI 应用和硬件,让你成为 AI 时代「最靓的仔」! 现在,我们也向所有喜欢尝鲜和体验 AI 的同学发出召集,只要你发现并体验了新的 AI 应用或者功能,按照格式(参考案例: 实测正式版 DeepSeek V4 Pro,补齐 Agent 能力|AI 上新 )向栏目投稿,在极客公园公众号发布,不仅能获得相应稿费,且会为你「报销」AI 应用的订阅费用。 同时,优秀作者还有机会进入极客公园 AI 体验群,获得最新 AI 应用和工具的内测资格,参加极客公园专属相关 AI 活动,和 AI 应用创始人一对一沟通。 AGI 太久,只争朝夕,让一部分人先 AI 起来吧!投稿、进群请扫描下方二维码添加极客小助手微信👇 01 能力接近 Opus4.8 DeepSeek 在微信公众号发布公告,全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台。开发者可以通过设置 model='deepseek-v4-flash-vision-exp' 直接调用,支持 base64 内联、外部 URL、Files API 三种图片传入方式。 但名字里带着「Exp」三个字母,说明故事才刚开始。 从官方公告来看,V4-Flash-Vision-Exp 有几个关键参数值得注意。 DeepSeek 官方给出的数据|图片来源:DeepSeek 定价与 V4-Flash 一致。一张图片最多占 384 个 token,按 token 计费,没有额外的视觉处理溢价。做个对比——GPT 和 Claude 处理同等分辨率的图片通常消耗 800 到 1100 个 token。同一张图,DeepSeek 的 token 开销不到竞品的一半。这个数字背后是 DeepSeek 此前公布的「Thinking with Visual Primitives」框架在起作用,它将视觉元素压缩成空间坐标式的原语,而不是把整张图拆成密密麻麻的图像 patch。 纯文本能力没有降级。官方强调,在 Agent、推理、世界知识等纯文本基准上,Vision-Exp 与 V4-Flash 正式版持平。这意味着它不是一个「为了看图牺牲了文本能力」的特化模型,而是在 Flash 基础上叠加了视觉理解。 多模态 Agent 能力「已接近 Opus-4.8」。这是官方公告里最大胆的一句话。在需要视觉理解的 Agent Benchmark 上,Vision-Exp 相比纯文本的 V4-Flash 实现了大幅跃升。 同步上线的还有Files API——这个接口本身不收费,开发者可以先把图片上传到平台拿到 file_id,之后在请求中直接引用,同一张图多次调用不用重复传输。对于需要反复分析同一批图片的 Agent 工作流来说,这是一个很实际的优化。 02 给《牛来》做个 AI 重制版 规格说完了,上手测。 2026 年暑假最火的梗是什么?《牛来》。

阅读原文(极客公园)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。