Instella-MoE是什么
Instella-MoE 是 AMD 开源的混合专家语言模型系列,总参数量 16B、激活参数量 2.8B,采用 27 层解码器架构。模型基于 AMD Instinct MI300X / MI325X GPU 及 ROCm 软件栈从头训练,提供预训练、长上下文 Base、SFT、DPO 和 RL 优化共 6 个全开源版本,在 AMD 硬件上实现训练与推理的高效协同。
阅读目录

Instella-MoE的主要功能
-
多阶段模型系列:提供预训练、Mid-training、长上下文 Base、SFT、DPO 及 RL 优化共 6 个版本,覆盖从基座到对话的全链路需求。
-
高效 MoE 推理:仅激活 2.8B 参数即可完成推理,在保持较小计算开销的同时获得接近更大稠密模型的性能。
-
长上下文支持:Base 版本支持 64K 上下文长度,可处理长文档理解与推理任务。
-
指令遵循与思维链:SFT 版本实现指令跟踪与链式推理,Think 版本通过强化学习进一步提升响应质量。
-
AMD 原生优化:基于 ROCm 生态和 SGLang 推理框架深度优化,在 AMD 硬件上实现高效训练与推理。
Instella-MoE的技术原理
- MoE 架构与注意力机制:模型采用混合专家架构,总参数量 16B 中每次前向传播仅激活 2.8B 参数,通过门控路由机制动态分配 token 到不同专家网络,实现大容量与低推理成本的解耦。同时引入门控多头潜在注意力,在潜在注意力空间中增加门控控制,增强长序列建模能力并降低 KV 缓存开销。
- AMD 原生训练系统:训练完全基于 AMD ROCm™ 软件栈,底层采用 Primus 训练框架 与 Miles RL 框架。预训练阶段使用 FarSkip-Collective 技术实现专家并行下的通信与计算重叠,将预训练速度提升 12.7%。模型在 AMD Instinct MI300X / MI325X GPU 上从头训练,充分发挥了 AMD 硬件的互联带宽优势。
- 后训练与强化学习:后训练采用四阶段流水线:SFT→ DPO→ 两阶段 RL。RL 阶段分为:Stage 1 进行指令遵循专项强化学习;Stage 2 采用 MOPD,通过 Domain Router 将 IF Prompts 路由至 IF-RL Teacher、其他 Prompts 路由至 DPO Teacher,以 Token 级反向 KL 散度约束学生模型策略更新,在保持通用能力的同时强化指令遵循与推理质量。

微信关注回复“开源”,加入AI开源项目交流群
如何使用Instella-MoE
- 获取模型权重:访问 Hugging Face 模型集合(
amd/instella-moe)或 GitHub 仓库下载所需版本(Base / SFT / DPO / Think)。 - 环境准备:安装 AMD ROCm 驱动及 PyTorch for ROCm,或直接使用支持 ROCm 的 Docker 镜像。
- 加载模型:用 Transformers 库或 SGLang 推理框架加载模型权重,SGLang 可充分发挥 AMD 硬件的推理加速能力。
- 执行推理:根据任务类型选择对应版本——Base 用于文本续写与嵌入,SFT / DPO / Think 用于对话与指令任务。
- 微调与部署:基于 Base 模型使用自有数据继续训练,或通过 vLLM / SGLang 部署为 API 服务。
Instella-MoE的核心优势
-
全链路开源透明:从预训练到 RL 的 6 个阶段模型全部开源,训练数据与代码透明可查。
-
AMD 生态原生适配:基于 ROCm 和自研 GPU 训练,在 AMD Instinct 系列硬件上推理效率最优,TTFT 最高可降低 39.2%。
-
激活参数高效:16B 总参数仅激活 2.8B,推理成本显著低于同性能稠密模型。
-
后训练技术先进:MOPD 多教师蒸馏结合 Token 级反向 KL,在指令遵循和数学推理上表现突出。
-
通信计算深度重叠:FarSkip-Collective 与 SGLang 专家并行实现通信隐藏,训练与推理效率双优。
Instella-MoE的项目地址
- 项目官网:https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html
- GitHub仓库:https://github.com/AMD-AGI/Instella-MoE
- HuggingFace模型库:https://huggingface.co/collections/amd/instella-moe
Instella-MoE的同类竞品对比
| 维度 | Instella-MoE-16B-A3B | Qwen3.5-4B-Base |
|---|---|---|
| 推出方 | AMD(2026.07) | 阿里巴巴通义千问 |
| 总参数量 | 16B | 4B |
| 激活参数量 | 2.8B | 4B(稠密,全参数激活) |
| 架构类型 | MoE(混合专家) | 稠密 Transformer |
| 开源程度 | 6 个阶段权重 + 代码全开源 | 权重开源 |
| 上下文长度 | 64K | 128K |
| Base 平均性能 | 76.7% | 79.5% |
Instella-MoE的应用场景
-
企业私有化部署:基于 AMD ROCm 生态在本地 GPU 集群部署对话与推理服务,满足数据合规需求。
-
长文档分析:用 64K 长上下文能力处理法律合同、科研论文、财报等长文本理解与摘要任务。
-
代码辅助生成:SFT / Think 版本支持编程指令遵循,可用于 IDE 插件或代码审查工具。
-
科研与教学:全开源链路适合学术界进行 MoE 架构研究、训练方法复现及大模型课程教学。
-
边缘与混合云推理:低激活参数量适合在资源受限环境中进行高效推理,或作为混合云 AI 服务的基座模型。
