7月28日,AMD宣布推出Instella-MoE系列模型,这是一系列总参数量达到16B的混合专家语言模型。这些模型基于AMD自研的GPU和软件开发,采用27层解码器架构,激活参数量为2.8B。Instella-MoE系列包含6个不同阶段的模型,从预训练到长上下文训练、SFT、DPO和RL训练,旨在提升模型在处理长序列和复杂任务方面的能力。
Instella-MoE-16B-A3B-Base模型在性能测试中表现突出,其跑分低于Qwen3.5-4B-Base,但高于其他模型。与Gemma-4-E4B-it相比,Instella-MoE-16B-A3B-Think在启用参数更少的情况下获得了更高的分数。该系列模型在AMDInstinct™MI300X和MI325XGPU上从头开始训练,完全基于AMDROCm™软件栈,融合了尖端架构和系统创新,如门控多头潜在注意力(GatedMLA),以实现在AMD硬件上的高效大规模训练和推理。
在预训练阶段,FarSkip-Collective通过专家并行带来的通信重叠,将模型预训练速度提升了12.7%。在推理阶段,SGLang推理框架实现了Instella-MoE,通过将通信与计算重叠,当模型采用专家并行服务时,该实现可将首次Token响应时间(TTFT)最多缩短39.2%。
Instella-MoE-16B-A3B-Base模型在性能测试中表现突出,其跑分低于Qwen3.5-4B-Base,但高于其他模型。与Gemma-4-E4B-it相比,Instella-MoE-16B-A3B-Think在启用参数更少的情况下获得了更高的分数。该系列模型在AMDInstinct™MI300X和MI325XGPU上从头开始训练,完全基于AMDROCm™软件栈,融合了尖端架构和系统创新,如门控多头潜在注意力(GatedMLA),以实现在AMD硬件上的高效大规模训练和推理。
在预训练阶段,FarSkip-Collective通过专家并行带来的通信重叠,将模型预训练速度提升了12.7%。在推理阶段,SGLang推理框架实现了Instella-MoE,通过将通信与计算重叠,当模型采用专家并行服务时,该实现可将首次Token响应时间(TTFT)最多缩短39.2%。



来源:一电快讯
以上内容由AI创作,如有问题请联系admin#d1ev.com(#替换成@)沟通,AI创作内容并不代表第一电动网(www.d1ev.com)立场。
文中图片源自互联网或AI创作,如有侵权请联系邮件删除。







