阿里通义千问团队今晚正式发布了 Qwen3.8-Flash,这是一款基于下一代 Qwen4 架构的多模态 MoE模型。
在 Residual 方面,引入 Gated Residual机制,将残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写。残差状态支持 FP8 存储,大幅降低访存开销。
在 Optimization 方面,采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。针对新架构重新拟合了 Scaling Law。
阿里通义千问团队今晚正式发布了 Qwen3.8-Flash,这是一款基于下一代 Qwen4 架构的多模态 MoE模型。
在 Residual 方面,引入 Gated Residual机制,将残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写。残差状态支持 FP8 存储,大幅降低访存开销。
在 Optimization 方面,采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。针对新架构重新拟合了 Scaling Law。