9月10日,DeepSeek交出一份新答卷
9月10日,DeepSeek正式发布并开源新模型DeepSeek V4.1 Flash:一款552B参数的多模态MoE模型,采用全新的Causal-Encoder-Decoder非对称结构,输入激活仅8B、输出激活16B,原生支持图文输入,上下文长度达到100万token。模型权重已在Hugging Face与魔搭社区开放下载,技术报告同步公开。按照官方口径,新模型在多项基准测试中超越了包括DeepSeek V4 Pro在内的旗舰模型;第三方评测机构Artificial Analysis的智能指数v4.3给出40分,超过GPT-5.6 Luna(该结果为第三方评测口径)。
事件背景:更便宜的不只是模型本身
这次发布真正的看点在成本侧。V4.1 Flash对KV Cache做了大幅压缩:与上一代相比,显存需求降至四分之一,SSD存储需求降至八分之一,每token全局KV缓存降到890字节,相对初代模型累计缩小437倍。KV Cache是大模型服务上下文的缓存机制,在智能体长时间运行、反复读取长文档的场景里,缓存命中的费用往往占API账单的相当比例。缓存变小,智能体类任务的成本随之下降。
价格同步调整。新定价自9月10日起生效,延续峰谷定价机制,闲时价格为高峰时段的一半。更大的动作是对旧旗舰的处理:北京时间9月14日12时之后,至V4.1 Pro上线之前,所有deepseek-v4-pro请求将直接路由到V4.1 Flash,并按V4.1 Flash单价计费——官方明确表示,经多方测试,新模型在性能、费用、速度与总用时上已全面超越V4 Pro,因此对其有序下线。
深度分析:非对称结构为什么能省钱
过去大模型处理输入和输出大多共用一套参数路径,而智能体场景的特征是输入远重于输出:一次深度检索可能读取几十万字资料,产出只有几百字结论。Causal-Encoder-Decoder结构把两个阶段拆开处理,预填充阶段每个token只激活8B参数,解码阶段才激活16B,对输入占主导的检索、分析类任务,同等算力能服务的请求量明显提升。配合量化的主KV缓存与跨层稀疏注意力等设计,长上下文的存储与计算开销被同时压了下来。
这类架构优化的外溢效应值得关注:当运行智能体的单位成本下降,企业部署AI检索、自动问答、内容核验类应用的门槛也随之降低。官方合作伙伴腾讯WorkBuddy、CodeBuddy与OpenCode已全量接入新模型。
企业视角:推理降价,AI检索的用量会上来
对做GEO(生成式引擎优化)的企业,这条消息的启示不在模型分数,而在使用量。推理成本每降一档,AI搜索与智能体的调用频次就涨一截,企业内容被读取、被引用的基数随之扩大。三件事值得现在就做。
- 检查内容能否支撑智能体式读取:结构清晰的标题层级、完整的参数与结论表述,比排版花哨更利于机器摘取;
- 关注抓取节奏的变化:推理成本下降后,引擎对企业站点的抓取与复核频率可能提高,内容更新要及时、口径要稳定;
- 把峰谷定价的思路用到自有部署评估上:若企业自建模型服务,错峰运行批量任务可以直接省下预算。
极欧互联(jiougeo.com)在为客户做GEO诊断时,会同步评估目标引擎背后模型的成本曲线——成本下降通常伴随检索生态扩张,正是企业内容布局的窗口期。
趋势研判:成本曲线决定AI检索的渗透速度
从年初到现在,大模型行业的主线之一是把智能的单位价格打下来:架构压缩、缓存优化、峰谷计价,路径各不相同,方向高度一致。推理成本越低,AI搜索与智能体接入的业务场景越多,企业信息被AI读取的机会与频次同步上升。可以预期,围绕"被机器高效读取"的内容工程——清晰的结构、可验证的事实、稳定的口径——会从可选项变成企业官网的标配。
信息来源
- DeepSeek官方公告,《DeepSeek V4.1 Flash:更强、更快、更普惠》,2026-09-10,https://www.deepseek.com/news/deepseek-v4-1-flash/
- GIGAZINE,《DeepSeek-V4.1-Flash发布,多项测试超越Claude Opus 5与GPT-5.6 Sol》,2026-09-11,https://gigazine.net/gsc_news/en/20260911-deepseek-v4-1-flash
- 搜狐号·腾讯研究院AI速递,2026-09-11,https://www.sohu.com/a/1074463759_455313

