$AMD 发布了一款最先进的全开源模型,使用 ROCm,在完全由 MI300X 和 MI325X GPU 训练的基础上构建


Instella-MoE 是一个 6.4万参数的混合专家模型,每个 token 只激活 28 亿参数,从而在保持与具有相似或更大激活参数数量的稠密模型和 MoE 模型竞争力的同时降低推理成本
它支持 64K 上下文窗口,并通过六个阶段训练完成,从预训练到强化学习
AMD 也引入了两项新的效率技术:
- 受门控的多头潜在注意力,它会过滤低价值的注意力输出。
- FarSkip-Collective,它将通信与计算重叠,提高预训练速度 12.7%,并将首 token 时间最多降低 39.2%。
AMD-3.29%
查看原文
post-image
此页面可能包含第三方内容,仅供参考(非陈述/保证),不应被视为 Gate 认可其观点表述,也不得被视为财务或专业建议。详见声明
  • 赞赏
  • 2
  • 转发
  • 分享
评论
请输入评论内容
请输入评论内容
GateUser-17ba047d
· 1小时前
区块链技术是如何工作的
查看原文回复0
mehedi667
· 1小时前
😉🔥 😉🔥
查看原文回复0