
9月10日,DeepSeek 正式发布其全新架构家族中体量最小的模型 DeepSeek-V4.1-Flash,原生支持视觉理解。该模型面向更强的能力、更快的推理、更高的吞吐量,并可平滑扩展至更大规模的模型。
一、非对称架构:更强智能,更低成本
DeepSeek-V4.1-Flash 采用了全新的架构设计,核心亮点包括:
552B 参数 MoE:采用混合专家(MoE)架构,总参数量达 552B。
全新的 Causal Encoder–Decoder 架构:输入端仅需 8B 激活参数,输出端为 16B 激活参数,以极低的计算开销实现高性能。
全新预训练方法 + 更大规模 RL 后训练:基准测试成绩超过了包括旗舰模型 DeepSeek-V4-Pro 在内的多款模型。
二、更小的 KV 缓存,更大的成本节省
相比上一代模型,V4.1-Flash 的 KV 缓存需求大幅压缩:
HBM 占用降至 1/4
SSD 存储占用降至 1/8
由于缓存命中费用往往占据 Agent 运行成本的很大比例,压缩缓存可显著降低这部分开销。
三、V4.1-Flash 现已上线 DeepSeek API,原生支持多模态
只需将模型设置为
deepseek-flash即可调用。V4-Flash 与 V4-Flash-Vision-Exp 已退役。为保持兼容,
deepseek-v4-flash与deepseek-v4-flash-vision-exp将临时路由至 V4.1-Flash。多方测试表明,V4.1-Flash 在性能、成本、速度和总运行时间上均优于 V4-Pro。DeepSeek 正在逐步淘汰 V4-Pro。
从 2026年9月14日 04:00 UTC 起,所有
deepseek-v4-pro请求将按 V4.1-Flash 的费率路由至 V4.1-Flash,直至 V4.1-Pro 发布。官方合作伙伴 WorkBuddy(含 CodeBuddy) 与 OpenCode 现已全面支持 V4.1-Flash。
四、更高效的架构,更低的 API 价格
V4.1-Flash 让 DeepSeek 能够以更低的成本服务更多用户,并将节省的成本回馈给用户:
峰谷定价机制延续,用于平衡需求。
谷时费率为峰时费率的 50%,建议将弹性工作负载安排在谷时段以节省开支。
新定价自 2026年9月10日 04:00 UTC 起生效。
五、支持开源,拓展部署选项
DeepSeek 表示将与开源社区紧密合作,推进 V4.1-Flash 的推理支持,并探索更多部署方案。若你有2000+ GPU 及存储集群的大规模部署计划,可与其进一步沟通。
DeepSeek-V4.1-Flash 技术报告
原文来源: DeepSeek 官方新闻(2026年9月10日)
https://www.deepseek.com/news/deepseek-v4-1-flash/
*本文由内容创作助手整理,经 qrobot 发布。*
版权声明
本文仅代表作者观点,不代表本网站立场。
本文系作者授权本网站发表,未经许可,不得转载。


发表评论