刚刚,DeepSeek 推出了 V4.1 Flash,这是一款全新架构的模型,具备视觉理解的原生支持,同时也是该系列中最精简的一款。其总参数为 550B,输入激活为 8B,输出激活为 16B(确实是输入与输出使用不同的激活规模)。新设计的目标是提高能力上限、加速推理速度、增强吞吐量,并能够扩展至更大参数模型。此外,与之配套的 DeepSeek Harness 也更新到 v0.1.5,此次更新针对不同的运行配置进行了专门的训练。新的 API 中,V4.1 Flash 接替了先前的 Pro 版本,相关请求将转向新的模型,费用也将按照新定价计算。
V4.1 Flash 在 Agent 任务上的性能有显著提升。与 V4 Pro 比较,DeepSWE v1.1 得分从 62.7 提升到了 74.2,Terminal-Bench 3.0 从 11.8 增至 30.0,Automation-Bench 从 43.2 上升到 54.8,CyberGym 则从 83.3 提升到 88.1。在官方的对比测试中,V4.1 Flash 在 DeepSWE v1.1、CyberGym 和 Automation-Bench 三项测试中表现最高,超越了 Kimi K3、GLM 5.3、Opus 5 和 GPT 5.6-Sol。
尽管有所提升,V4.1 Flash 并不是在所有方面都领先。例如,它在 GPQA Diamond 上的得分仍低于 V4 Pro,而在 Terminal-Bench 3.0 的一些测试上也未能超越其他竞争对手。可以说,它在多个 Agent 测试中超越了旧版,但在部分关键成绩上依然有提升空间。 球友会
V4.1 Flash 采用 MoE 结构,总参数为 550B,输入阶段激活 8B,输出阶段激活 16B,新颖的结构将输入处理和输出生成分为两个不对称部分,旨在提升能力上限的同时降低推理成本、提升速度和吞吐量,此版本是该系列中最小的,并且应用了新的预训练方式和大规模强化学习后训练。另一个显著变化是缓存机制,模型处理的上下文可以通过 KV Cache 保存部分中间计算结果。在后续请求中,如果命中缓存,将能够复用这些计算,避免重复计算。
根据 DeepSeek 的公布,V4.1 Flash 每个 Token 的 KV Cache 从前一代的 3514 字节降至 890 字节,约为原来的四分之一,和初代 DeepSeek V1 相比,减少了约 1/437。此外,缓存所需的 HBM 与 SSD 资源大幅下降,缓存需求分别降至 1/4 和 1/8。更新后的 Harness 也支持在更新系统提示时保留已有的 KV Cache。
这些成本变动将在 API 定价上体现,新定价将于北京时间 2026 年 9 月 10 日 12:00 生效,仍遵循峰谷定价,闲时价格为高峰时段的一半。单位为人民币元/百万 Token。在闲时,输入、输出的缓存命中和未命中价格分别是 0.02 元、1 元和 4 元;在高峰时,这些价格分别是 0.04 元、2 元和 8 元。而高峰时段为工作日的 9:00—12:00 和 14:00—18:00,其余时间为闲时,包括周末。 球友会
例如,假设任务产生了 1 亿个缓存命中的输入 Token、100 万个未命中的输入 Token 和 10 万个输出 Token,并全在闲时处理,那么费用为 2+1+0.4=3.4 元;如果在高峰时处理,同样的量将费用上升至 6.8 元。