找工位
空间入驻
小程序

552B参数却吊打旗舰!DeepSeek V4.1 Flash发布,价格直接腰斩

2026-09-11 10:58:12

你有没有这种感觉?AI工具越用越多,账单却越来越看不懂。

尤其是跑Agent任务的时候,缓存费用像个无底洞,一轮对话下来钱包悄悄瘪了。

但就在9月10日,DeepSeek抛出了一颗重磅炸弹——V4.1 Flash正式发布,最小的尺寸,却把自家旗舰按在地上摩擦!

01 这次豆包真被"以下犯上"了?

🚀 552B参数的"小个子",凭啥反超旗舰?

先看来头。V4.1 Flash是一款552B参数的MoE模型,在整个V4全新架构家族里,它是尺寸最小的那个。

但就是这个小个子,性能超越了包括DeepSeek V4 Pro在内的一众旗舰模型!

Agentic Benchmark等基准测试中,它把V4 ProGLM5.3Kimi-K3等前沿选手统统甩在身后。

凭什么?靠的是全新的Causal-Encoder-Decoder架构。

输入和输出不对称设计,输入激活参数只有8B,输出激活为16B,成本显著低于同尺寸模型。

再加上新的预训练方式和更大规模强化学习后训练,这个"小弟"硬是把"大哥"拍在了沙滩上。

⚠️ 定价下调,闲时价格直接砍半

更让人心动的是价格。

得益于架构创新,DeepSeek直接下调了V4.1 Flash的定价,峰谷定价机制保留——闲时价格是高峰时段的一半!

具体来看:闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元;高峰时段输入(缓存命中)0.04元,未命中2.0元,输出8.0元。

新价格已于2026年9月10日12:00正式生效。

官方还贴心鼓励用户根据实际使用情况调整任务时间,把活儿挪到闲时跑,省下来的可都是真金白银。

02 账单要变天了!缓存压缩有多狠?

💡 KV Cache压缩437倍,这是什么概念?

如果说性能反超是面子,那缓存压缩就是里子,直接关系到你的钱包。

V4 Flash相比,V4.1 Flash对HBM的需求减少到1/4,对SSD的需求减少到1/8。

更夸张的是,官方称初代DeepSeek V1的KV Cache是V4.1 Flash的437倍!

这次压缩由架构、缓存精度和部署策略三方协同完成。

架构上,新模型采用CSA2(压缩稀疏注意力2)机制,把全局KV缓存和Top-K索引跨层复用,每层只保留自己的查询向量和局部注意力缓存,重复存储被大幅砍掉。

缓存精度方面,模型从训练阶段就直接用FP4格式存储全局KV缓存,官方称性能损失几乎可以忽略。

部署一侧,新增SWA有界重放机制,只需重放最近的n个token就能近似重建滑动窗口注意力状态,SWA缓存不必再写入SSD。

🌟 上下文拉长到1M,解码成本几乎不涨

这些设计叠加起来,效果有多猛?

上下文从4K拉长到1M,单token解码FLOPs只增加约四分之一,解码成本几乎不随上下文长度增长。

对需要长上下文、多轮调用的Agent工作流来说,同样的预算能跑更多的任务。

在Agent使用场景中,缓存命中的费用往往占比较高,KV Cache的压缩大幅降低了Agent类任务的使用成本。

这笔账,高频用户一算就懂。

⚠️ V4 Pro即将退场,旧模型请求自动路由

目前,V4.1 Flash已同步上线DeepSeek API,用户将模型名称改为deepseek-flash即可调用。

旧版本模型V4 FlashV4 Flash Vision Exp现已下线,模型名deepseek-v4-flashdeepseek-v4-flash-vision-exp将被暂时路由到V4.1 Flash

更重磅的是,由于多方测试中V4.1 Flash各项指标全面超越V4 ProDeepSeek将从北京时间9月14日12:00起有序下线V4 Pro

所有deepseek-v4-pro的请求都将被路由到新模型,按V4.1 Flash单价计费。

App端也已完成全新升级,整合了快速、专家和识图模式,网页端应该也已同步上新。

03 开源+生态双管齐下,腾讯、OpenCode全量接入

💡 全力支持开源,大规模部署可联系官方

除了模型能力,DeepSeek在开源和生态方面也动作频频。

官方宣布将全力支持开源社区进行新模型的推理适配,并尝试通过各种方式扩大部署范围。

如果你有大规模部署需求且具备相应资源(2k卡GPU、有存储集群),可以直接与DeepSeek联系。

同期开源的还有DeepJIT,一个轻量级的xPU内核JIT编译库,同时支持NVIDIA CUDA GPU华为昇腾NPU两大后端,为推理侧的内核编译提供统一接口和跨节点共享缓存能力。

🌟 腾讯WorkBuddy、OpenCode全量接入

生态侧的好消息也不少。

腾讯(WorkBuddyCodeBuddy等)和OpenCode作为官方合作伙伴,现已全量接入DeepSeek V4.1 FlashOpenCode Go套餐还提供了4倍使用额度。

WorkBuddy中同样提供限时两周的独家优惠,腾讯云TokenHubimaMarvisCodeBuddy同步接入。

另外,DeepSeek Harness v0.1.5版本同步上线,V4.1 Flash针对Harness进行了专项训练和优化,新版本还支持在保留已有KV Cache的情况下更新系统提示词。

写在最后

从更长的时间线看,官方宣称新架构可扩展到更大参数的模型,我们或可期待即将到来的DeepSeek全新旗舰。

V4 Pro的有序下线只是这次更替的开始,后续更大参数的模型能把前沿模型的性价比推到什么程度,值得期待。

真正的好技术,不是让你多花钱,而是让你花更少的钱,办更多的事。

你平时用AI跑Agent任务,一个月大概花多少钱?欢迎在评论区聊聊你的账单!

如果觉得这篇文章对你有帮助,别忘了点赞、在看、转发三连,让更多人看到这个好消息!