中金发布研报称,DeepSeek V4.1 Flash的核心意义,是通过架构和推理系统优化,以更低的计算、存储和访存成本,实现更高的任务完成效率与单位GPU产出。以V4.1 Flash的优化逻辑推演,该行看到原本需在NVIDIA Blackwell系列64卡系统承载的10T模型,有望在64卡Hopper系列系统完成部署,即2026-2027年主流性能的国产算力芯片有望支持国产模型向10T-20T参数量平台持续扩张,国产算力需求的逻辑闭环再一次被印证。
降本:V4.1 Flash并非简单缩小模型,而是系统性减少长上下文推理中的重复计算、存储和数据搬运
增效:V4.1 Flash通过更小动态计算、外置记忆和更高Decode吞吐,以更低单位资源消耗获得更高任务完成效率
其Prefill和Decode阶段每Token分别仅激活约8B和16B参数;Engram将部分静态知识从主干动态计算中剥离并按需检索;DSpark则通过轻量Draft、置信度预测和动态调度提升Decode效率。










