值得信赖的区块链资讯!
比推数据  |  比推终端  |  比推英文  |  比推 APP  | 

下载比推 APP

值得信赖的区块链资讯!
iPhone
Android

AMD 发布全开源 MoE 大模型 Instella-MoE,16B 参数规模挑战主流开源模型

比推消息,AMD 宣布推出全开源混合专家模型(MoE)Instella-MoE,该模型拥有 160 亿总参数,每个 Token 激活 28 亿参数,号称在同规模开源语言模型中具备领先性能。

AMD 表示,Instella-MoE 完全基于自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 软件栈从零训练完成,并采用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架构创新,以提升训练和推理效率。

性能测试显示,Instella-MoE-16B-A3B 基础模型平均得分达到 76.7 分,在全开源模型中排名领先,超过 SmolLM3-3B、OLMo-3-7B 等模型,并在仅激活 28 亿参数的情况下,与更大规模模型竞争。

此外,该模型支持 64K Token 长上下文处理,并完成预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)以及强化学习(RL)等完整训练流程。

AMD 此次同步公开 Instella-MoE 全部模型权重、训练配置、数据配比、中间检查点及推理代码,推动开放 AI 模型研究与复现。

AMD 表示,Instella-MoE 展示了基于 AMD 硬件和开放软件生态进行大规模 MoE 模型训练的能力,未来将继续推进更大规模、更强推理能力和更高效率的开源语言模型研发。

说明: 比推所有文章只代表作者观点,不构成投资建议

比推快讯

更多 >>

下载比推 APP

24 小时追踪区块链行业资讯、热点头条、事实报道、深度洞察。

邮件订阅

金融科技决策者们都在看的区块链简报与深度分析,「比推」帮你划重点。