行业洞察测试分类名-行业洞察测试分类名-行业洞察测试分类名-99999999-测试数据-88888888-急急急急急急急急急急急急急急急急急急急急急急急急急急急急急急99999999急急急急急急急急急急急急急急急急急急急急急急急

新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投

新客与老客分投实务摘要。8888

2026-07-17 0 次阅读
新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投-新客与老客分投

DeepSeek-V4-Flash 正式版来了!这次提升有点夸张。


刚刚打开 DeepSeek,就发现多了一行小字,不过这个小字没写在右下角。

它写在了 DeepSeek 的 Logo 上面。7


DeepSeek-V4-Flash 正式版入口

各位看到了什么?

DeepSeek-V4-Flash 正式版公测了,大幅增强了 Agent 能力。

不过 DeepSeek 这波也太低调了吧。

甚至官方账号都没发公告,大家大多数人还是通过更新日志发现的。

你看看这。

DeepSeek-V4-Flash 官方更新日志

真服了,你 DeepSeek 要是不想发,我们替你发好了。

这次提升有点夸张

DeepSeek 把新旧版本和几个同期模型的成绩放到了一起。

DeepSeek-V4-Flash 0731 与 Preview、V4-Pro Preview、GLM-5.2、Opus-4.8 的原始基准对比图

原始对比图;V4-Flash 0731 一列已与 DeepSeek 官方更新日志逐项核对

为了更直观地看清这次升级的幅度,我又把三个 DeepSeek 版本单独画成了一张图。

DeepSeek-V4-Flash 0731 与 Flash Preview、V4-Pro Preview 的 9 项 Agent 基准对比图

先看它和自己比。

9 项测试全部上涨。其中 DeepSWE 从 7.3 涨到 54.4,直接增加 47.1 分;CyberGym 增加 38 分;DSBench-Hard 增加 33.8 分;DSBench-FullStack 增加 31.7 分。

Terminal-Bench 2.1 也从 61.8 涨到 82.7,增加 20.9 分。

这已经不是小版本修修补补的幅度了。

再看 V4-Pro Preview。

V4-Flash 0731 在图里的 9 项测试全部领先。DeepSWE 高 41.6 分,CyberGym 高 24 分,DSBench-Hard 高 28.5 分,Terminal-Bench 2.1 也高了 10.6 分。

一个叫 Flash、每个 token 只激活 13B 参数的型号,把自家的 Pro Preview 全线给秒了。

更夸张的是,模型架构和尺寸都没变。

官方明确写了,V4-Flash-0731 与 Preview 使用同一套架构,仍是 284B 总参数、13B 激活参数,这次只做了后训练。

image-20260731150807359

说白了,DeepSeek 没有靠堆一个更大的底座交成绩。它把训练重点压到了 Agent 执行、工具调用和长任务上。

只和旧版本比,当然不够。

我又查了 GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM-5.2 和 MiniMax M3 的公开数据。

先说结论:V4-Flash 已经进了第一梯队的讨论范围,但还没有把最强的几个模型干下去

下面挑 5 个重合度最高的 Agent 基准。

DeepSeek-V4-Flash 0731 与 GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM-5.2、MiniMax M3 的 Agent 基准对比图

图里的 GPT-5.6 Sol 和 Kimi K3 采用 Kimi K3 官方模型卡里的同名测试结果;Opus 5 采用 Anthropic 系统卡;MiniMax M3 采用 MiniMax 和 GLM-5.2 的官方材料。

不同公司用的 Agent harness、reasoning effort、超时设置和上下文长度并不完全一致。

AutomationBench 还有 Public 与私有测试集之分。Kimi K3 的官方模型卡也说过,Terminal-Bench 里的 Kimi 用 Kimi Code,GPT 用 Codex,GLM 用 Claude Code。

Terminal-Bench 2.1 上,GPT-5.6 Sol 和 Kimi K3 仍领先 V4-Flash 5~6 分。DeepSWE 上的差距更明显,Sol 高 18.6 分,Opus 5 高 14.4 分,Kimi K3 高 13.1 分。

到了 Toolathlon-Verified,V4-Flash 的 70.3 已经超过 GLM-5.2,距离 Kimi K3 只差 6.2 分,不过 Opus 5 的 80.6 仍然更强。

Agents' Last Exam 和 AutomationBench 也差不多。V4-Flash 已经能仅仅咬住了前面的模型,但还没拿到第一。

不过没关系,DeepSeek 还有杀手锏没用,DeepSeek-V4-Pro 正式版。

所以暂且可以这么认为,最难的长链条工程任务,GPT-5.6 Sol、Opus 5 和 Kimi K3 依然首选;

大批量跑代码检查、仓库分析、工具调用和 sub-agent,V4-Flash 开始变得非常有吸引力。

能力大涨,价格一分没涨

看完分数,再看价格。

DeepSeek-V4-Flash 0731 当前每百万 token 的常规价格是:缓存未命中输入 0.14 美元、缓存命中输入 0.0028 美元、输出 0.28 美元。

DeepSeek-V4-Flash 0731、V4-Flash Preview 与 GPT-5.6 Luna 的每百万 token API 价格对比图

能力涨了这么多,一分钱没加。

再拿 OpenAI 最便宜的 GPT-5.6 Luna 对比。

按 OpenAI 当前模型页的标准价格,Luna 是 0.20 美元输入、0.02 美元缓存输入、1.20 美元输出。

V4-Flash 的缓存未命中输入便宜 30%,缓存命中输入便宜 86%,输出便宜接近 77%。单看输出价,大约只有 Luna 的 1/4.3。

但是感觉,这次的 V4-Flash 应该会比 Luna 更强。

资料来源:


模拟博客金城武