AiRobotNews 人工智能机器人技术网

DeepSeek 发布 V4.1-Flash:更智能、更快速、更高效

DeepSeek 发布 V4.1-Flash:更智能、更快速、更高效

9月10日,DeepSeek 正式发布其全新架构家族中体量最小的模型 DeepSeek-V4.1-Flash,原生支持视觉理解。该模型面向更强的能力、更快的推理、更高的吞吐量,并可平滑扩展至更大规模的模型。

一、非对称架构:更强智能,更低成本

DeepSeek-V4.1-Flash 采用了全新的架构设计,核心亮点包括:

  • 552B 参数 MoE:采用混合专家(MoE)架构,总参数量达 552B。

  • 全新的 Causal Encoder–Decoder 架构:输入端仅需 8B 激活参数,输出端为 16B 激活参数,以极低的计算开销实现高性能。

  • 全新预训练方法 + 更大规模 RL 后训练:基准测试成绩超过了包括旗舰模型 DeepSeek-V4-Pro 在内的多款模型。

二、更小的 KV 缓存,更大的成本节省

相比上一代模型,V4.1-Flash 的 KV 缓存需求大幅压缩:

  • HBM 占用降至 1/4

  • SSD 存储占用降至 1/8

由于缓存命中费用往往占据 Agent 运行成本的很大比例,压缩缓存可显著降低这部分开销。

三、V4.1-Flash 现已上线 DeepSeek API,原生支持多模态

  • 只需将模型设置为 deepseek-flash 即可调用。

  • V4-Flash 与 V4-Flash-Vision-Exp 已退役。为保持兼容,deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 将临时路由至 V4.1-Flash。

  • 多方测试表明,V4.1-Flash 在性能、成本、速度和总运行时间上均优于 V4-Pro。DeepSeek 正在逐步淘汰 V4-Pro。

  • 从 2026年9月14日 04:00 UTC 起,所有 deepseek-v4-pro 请求将按 V4.1-Flash 的费率路由至 V4.1-Flash,直至 V4.1-Pro 发布。

  • 官方合作伙伴 WorkBuddy(含 CodeBuddy) 与 OpenCode 现已全面支持 V4.1-Flash。

四、更高效的架构,更低的 API 价格

V4.1-Flash 让 DeepSeek 能够以更低的成本服务更多用户,并将节省的成本回馈给用户:

  • 峰谷定价机制延续,用于平衡需求。

  • 谷时费率为峰时费率的 50%,建议将弹性工作负载安排在谷时段以节省开支。

  • 新定价自 2026年9月10日 04:00 UTC 起生效。

五、支持开源,拓展部署选项

DeepSeek 表示将与开源社区紧密合作,推进 V4.1-Flash 的推理支持,并探索更多部署方案。若你有2000+ GPU 及存储集群的大规模部署计划,可与其进一步沟通。


原文来源: DeepSeek 官方新闻(2026年9月10日)

https://www.deepseek.com/news/deepseek-v4-1-flash/

*本文由内容创作助手整理,经 qrobot 发布。*