中信证券发布研报称,DeepSeek-V4.1-Flash发布,在实现Coding与Agent能力提升的同时强化多模态理解能力。模型创新采用CED架构,结合CSA2跨层缓存共享、索引复用及FP4量化,全局KV Cache降至V4-Flash的约1/4。架构优化释放推理降本空间,DeepSeek宣布继续下调API价格。国产模型将沿高性价比与前沿智能两条路径继续展开竞争,DeepSeek深度适配下国产算力基础设施与国产模型同步受益,同时高性价比推理将加速FDE及企业级Agent落地。
2026年9月10日,DeepSeek发布DeepSeek-V4.1-Flash,采用全新“因果编码器-解码器”架构,具备多模态理解能力,支持百万Token上下文,并同步开放API及模型权重。模型主干参数5520亿,预填充与解码阶段每Token分别激活80亿、160亿参数,进一步降低长上下文与Agent场景的推理开销。据DeepSeek官方
1)创新“因果编码器-解码器”架构,全局KV Cache占用降至V4-Flash的约1/4。模型的40层Transformer网络被划分为前20层因果编码器和后20层解码器,由编码器末层输出直接投影生成解码器所需的全局 KV,无需依赖解码器各层的隐藏状态逐层生成,因此大多数输入token仅需完成编码器计算。为保留局部信息,解码器额外处理提示末尾128个token,近似重建各层滑动窗口注意力缓存,使长输入场景下的预填充计算量接近减半,参考DeepSeek官方技术报告,预填充阶段每token激活参数由解码阶段的160亿降至80亿。缓存精度方面,模型将全局主KV Cache由前代FP8降至FP4,并在后训练中引入量化感知训练控制精度损失,使该部分存储占用接近减半,SWA KV则保留FP8。模型架构创新结合CSA2的跨层缓存共享机制,全局KV Cache占用降至V4-Flash的约1/4,同步带动新模型对HBM的需求减少到V4-Flash的1/4,对SSD需求减少到1/8。
2)CSA2通过分层共享KV及复用Top-K token检索结果,同步压低缓存占用与浮点运算量。模型前两层仅使用SWA,其余层采用压缩稀疏注意力CSA2,并配置Full、Reindex、Reuse三种模式:Full模式下模型通过计算生成全局主KV与索引键,并筛选Top-K历史位置;Reindex在下一层共享上一层Full模式下的KV,但重新计算相关性更新Top-K token;Reuse同时共享KV与Top-K结果,省去重复缓存生成及索引计算。具体而言,编码器其除了2层SWA外的其余18层按每6层一组配置“1层Full+5层Reuse”;解码器20层分为5组,首组为“1层Full+3层Reuse”,后4组为“1层Reindex+3层Reuse”,使后20层共享首个Full层生成的全局KV。上述设计将减少KV Cache与减少Indexer检索计算相结合,据DeepSeek官方技术论文,模型上下文由4K扩展至1M时,单Token解码FLOPs仅增加约25%,体现出长上下文推理效率的显著改善。
据DeepSeek官方定价,V4.1-Flash每百万Token闲时缓存命中输入、未命中输入及输出价格分别为0.02元、1元、4元,较前代0.05元、1.5元、4.5元分别下降60.0%、33.3%、11.1%,高峰时段价格为闲时的两倍。
模型在编程、Agent和多模态能力提升的同时继续降低调用价格,有望减轻企业级Agent的多轮工具调用、长上下文处理的成本负担,推动FDE加速落地。同时,具备行业知识积累、深度嵌入企业业务流程,或拥有垂直私域数据壁垒、能够在强监管场景交付可靠结果的专业软件公司,有望率先将模型能力转化为产品价值与商业化增量。
3)模型原厂:一方面,架构创新持续释放推理提效降本空间。近2个月内发布的DeepSeek-V4.1-Flash、GLM-5.3-Flash、Qwen3.8-Flash均通过架构优化显著降低长上下文推理开销,验证了架构升级仍具备进一步降本潜力。另一方面,国产模型将围绕高性价比与前沿智能水平两条路径继续展开竞争。Flash系列以较低激活参数量和调用成本覆盖日常编程、办公及通用Agent需求,大参数量旗舰模型则有望继续提升复杂推理、专业知识及长程任务能力上限。
30楼窗外突现一陌生男子,自称在修空调,却没穿工装、没系安全绳;业主起疑报警,民警抓获后搜出100余克黄金首饰3000多元现金;已被刑拘
广东佛山一男子高空作业从30楼下到2楼,发现绳子被2楼老人剪断,当事人:老人不知是高空作业,想当晾衣绳用,已赔偿费用
“免费的最贵”!深圳二年级学生家长吐槽,无人机社团不收学费,却把5000元设备费变成入社硬门槛
刘涛真是美人命苦:替老公还完数亿债务,结果2025年他又亏了12亿,甚至她说,你有外遇了我也不会离开










