阿里通义Qwen3.8-Flash发布:125B参数MoE模型,每token仅激活6B

发布时间:2026-08-26 22:04

  阿里通义千问团队今晚正式发布了 Qwen3.8-Flash,这是一款基于下一代 Qwen4 架构的多模态 MoE模型。

  在 Residual 方面,引入 Gated Residual机制,将残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写。残差状态支持 FP8 存储,大幅降低访存开销。

  在 Optimization 方面,采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。针对新架构重新拟合了 Scaling Law。

排行

精选