

你有没有这种感觉?AI工具越用越多,账单却越来越看不懂。
尤其是跑Agent任务的时候,缓存费用像个无底洞,一轮对话下来钱包悄悄瘪了。
但就在9月10日,DeepSeek抛出了一颗重磅炸弹——V4.1 Flash正式发布,最小的尺寸,却把自家旗舰按在地上摩擦!
先看来头。V4.1 Flash是一款552B参数的MoE模型,在整个V4全新架构家族里,它是尺寸最小的那个。
但就是这个小个子,性能超越了包括DeepSeek V4 Pro在内的一众旗舰模型!
在Agentic Benchmark等基准测试中,它把V4 Pro、GLM5.3、Kimi-K3等前沿选手统统甩在身后。
凭什么?靠的是全新的Causal-Encoder-Decoder架构。
输入和输出不对称设计,输入激活参数只有8B,输出激活为16B,成本显著低于同尺寸模型。
再加上新的预训练方式和更大规模强化学习后训练,这个"小弟"硬是把"大哥"拍在了沙滩上。
更让人心动的是价格。
得益于架构创新,DeepSeek直接下调了V4.1 Flash的定价,峰谷定价机制保留——闲时价格是高峰时段的一半!
具体来看:闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元;高峰时段输入(缓存命中)0.04元,未命中2.0元,输出8.0元。
新价格已于2026年9月10日12:00正式生效。
官方还贴心鼓励用户根据实际使用情况调整任务时间,把活儿挪到闲时跑,省下来的可都是真金白银。
如果说性能反超是面子,那缓存压缩就是里子,直接关系到你的钱包。
与V4 Flash相比,V4.1 Flash对HBM的需求减少到1/4,对SSD的需求减少到1/8。
更夸张的是,官方称初代DeepSeek V1的KV Cache是V4.1 Flash的437倍!
这次压缩由架构、缓存精度和部署策略三方协同完成。
架构上,新模型采用CSA2(压缩稀疏注意力2)机制,把全局KV缓存和Top-K索引跨层复用,每层只保留自己的查询向量和局部注意力缓存,重复存储被大幅砍掉。
缓存精度方面,模型从训练阶段就直接用FP4格式存储全局KV缓存,官方称性能损失几乎可以忽略。
部署一侧,新增SWA有界重放机制,只需重放最近的n个token就能近似重建滑动窗口注意力状态,SWA缓存不必再写入SSD。
这些设计叠加起来,效果有多猛?
上下文从4K拉长到1M,单token解码FLOPs只增加约四分之一,解码成本几乎不随上下文长度增长。
对需要长上下文、多轮调用的Agent工作流来说,同样的预算能跑更多的任务。
在Agent使用场景中,缓存命中的费用往往占比较高,KV Cache的压缩大幅降低了Agent类任务的使用成本。
这笔账,高频用户一算就懂。
目前,V4.1 Flash已同步上线DeepSeek API,用户将模型名称改为deepseek-flash即可调用。
旧版本模型V4 Flash与V4 Flash Vision Exp现已下线,模型名deepseek-v4-flash、deepseek-v4-flash-vision-exp将被暂时路由到V4.1 Flash。
更重磅的是,由于多方测试中V4.1 Flash各项指标全面超越V4 Pro,DeepSeek将从北京时间9月14日12:00起有序下线V4 Pro。
所有deepseek-v4-pro的请求都将被路由到新模型,按V4.1 Flash单价计费。
App端也已完成全新升级,整合了快速、专家和识图模式,网页端应该也已同步上新。
除了模型能力,DeepSeek在开源和生态方面也动作频频。
官方宣布将全力支持开源社区进行新模型的推理适配,并尝试通过各种方式扩大部署范围。
如果你有大规模部署需求且具备相应资源(2k卡GPU、有存储集群),可以直接与DeepSeek联系。
同期开源的还有DeepJIT,一个轻量级的xPU内核JIT编译库,同时支持NVIDIA CUDA GPU和华为昇腾NPU两大后端,为推理侧的内核编译提供统一接口和跨节点共享缓存能力。
生态侧的好消息也不少。
腾讯(WorkBuddy、CodeBuddy等)和OpenCode作为官方合作伙伴,现已全量接入DeepSeek V4.1 Flash,OpenCode Go套餐还提供了4倍使用额度。
WorkBuddy中同样提供限时两周的独家优惠,腾讯云TokenHub、ima、Marvis、CodeBuddy同步接入。
另外,DeepSeek Harness v0.1.5版本同步上线,V4.1 Flash针对Harness进行了专项训练和优化,新版本还支持在保留已有KV Cache的情况下更新系统提示词。
从更长的时间线看,官方宣称新架构可扩展到更大参数的模型,我们或可期待即将到来的DeepSeek全新旗舰。
V4 Pro的有序下线只是这次更替的开始,后续更大参数的模型能把前沿模型的性价比推到什么程度,值得期待。
真正的好技术,不是让你多花钱,而是让你花更少的钱,办更多的事。
你平时用AI跑Agent任务,一个月大概花多少钱?欢迎在评论区聊聊你的账单!
如果觉得这篇文章对你有帮助,别忘了点赞、在看、转发三连,让更多人看到这个好消息!