AMD最强开源混合专家模型:Instella-MoE系列AI登场

发布时间:2026-07-28 16:37

  AMD 于 7 月 24 日发布博文,宣布推出 Instella-MoE 系列模型,总参数量为 16B,激活参数量为 2.8B,采用 27 层解码器架构,使用 AMD 自研的 GPU 和软件开发而成。

  援引博文介绍,AMD 本次推出的 Instella-MoE 系列模型共有 6 个版本:

  性能方面,下图为 Instella-MoE-16B-A3B-Base 模型和其它模型的对比,横轴代表活跃参数量,而纵轴代表各种跑分测试,可以看到该模型跑分要低 Qwen3.5-4B-Base,不过高于其它模型。

  该模型训练完全基于 AMD ROCm™ 软件栈,以 Primus 训练和 Miles RL 框架为基础,融合了包括门控多头潜在注意力在内尖端的架构和系统创新,让 AMD 硬件上高效地进行大规模训练和推理。

  在预训练阶段,FarSkip-Collective 通过专家并行带来的通信重叠,将模型预训练速度提升了 12.7%。

  在推理阶段,我们使用 SGLang 推理框架实现了 Instella-MoE。通过将通信与计算重叠,当模型采用专家并行服务时,该实现可将首次 Token 响应时间 最多缩短 39.2%。

  特别

  普京自曝爱网上冲浪:会上网看俄乌冲突分析帖子,并为他们“说到点子上”而高兴,会从网络论坛、博主那里了解战场情况

  桑多河谷冲突中,第13、21、54军已蓄势待发,本打算一役了结中印争端,为何最终取消了作战任务?

  860元一晚的酒店晚上关空调,导致消费者被热醒,酒店致歉:系统自动关停,将反馈并改进空调供冷问题

排行

精选