Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Instella-MoE – AMD 开源的混合专家语言模型系列
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Instella-MoE – AMD 开源的混合专家语言模型系列
AIGC 资讯

Instella-MoE – AMD 开源的混合专家语言模型系列

站外新闻
最近更新: 2026年7月29日 下午2:41
SHARE

Instella-MoE是什么

Instella-MoE 是 AMD 开源的混合专家语言模型系列,总参数量 16B、激活参数量 2.8B,采用 27 层解码器架构。模型基于 AMD Instinct MI300X / MI325X GPU 及 ROCm 软件栈从头训练,提供预训练、长上下文 Base、SFT、DPO 和 RL 优化共 6 个全开源版本,在 AMD 硬件上实现训练与推理的高效协同。

阅读目录
  • Instella-MoE是什么
  • Instella-MoE的主要功能
  • Instella-MoE的技术原理
  • 如何使用Instella-MoE
  • Instella-MoE的核心优势
  • Instella-MoE的项目地址
  • Instella-MoE的同类竞品对比
  • Instella-MoE的应用场景

Instella-MoE

Instella-MoE的主要功能

  • 多阶段模型系列:提供预训练、Mid-training、长上下文 Base、SFT、DPO 及 RL 优化共 6 个版本,覆盖从基座到对话的全链路需求。
  • 高效 MoE 推理:仅激活 2.8B 参数即可完成推理,在保持较小计算开销的同时获得接近更大稠密模型的性能。
  • 长上下文支持:Base 版本支持 64K 上下文长度,可处理长文档理解与推理任务。
  • 指令遵循与思维链:SFT 版本实现指令跟踪与链式推理,Think 版本通过强化学习进一步提升响应质量。
  • AMD 原生优化:基于 ROCm 生态和 SGLang 推理框架深度优化,在 AMD 硬件上实现高效训练与推理。

Instella-MoE的技术原理

  • MoE 架构与注意力机制:模型采用混合专家架构,总参数量 16B 中每次前向传播仅激活 2.8B 参数,通过门控路由机制动态分配 token 到不同专家网络,实现大容量与低推理成本的解耦。同时引入门控多头潜在注意力,在潜在注意力空间中增加门控控制,增强长序列建模能力并降低 KV 缓存开销。
  • AMD 原生训练系统:训练完全基于 AMD ROCm™ 软件栈,底层采用 Primus 训练框架 与 Miles RL 框架。预训练阶段使用 FarSkip-Collective 技术实现专家并行下的通信与计算重叠,将预训练速度提升 12.7%。模型在 AMD Instinct MI300X / MI325X GPU 上从头训练,充分发挥了 AMD 硬件的互联带宽优势。
  • 后训练与强化学习:后训练采用四阶段流水线:SFT→ DPO→ 两阶段 RL。RL 阶段分为:Stage 1 进行指令遵循专项强化学习;Stage 2 采用 MOPD,通过 Domain Router 将 IF Prompts 路由至 IF-RL Teacher、其他 Prompts 路由至 DPO Teacher,以 Token 级反向 KL 散度约束学生模型策略更新,在保持通用能力的同时强化指令遵循与推理质量。

挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用Instella-MoE

  • 获取模型权重:访问 Hugging Face 模型集合(amd/instella-moe)或 GitHub 仓库下载所需版本(Base / SFT / DPO / Think)。
  • 环境准备:安装 AMD ROCm 驱动及 PyTorch for ROCm,或直接使用支持 ROCm 的 Docker 镜像。
  • 加载模型:用 Transformers 库或 SGLang 推理框架加载模型权重,SGLang 可充分发挥 AMD 硬件的推理加速能力。
  • 执行推理:根据任务类型选择对应版本——Base 用于文本续写与嵌入,SFT / DPO / Think 用于对话与指令任务。
  • 微调与部署:基于 Base 模型使用自有数据继续训练,或通过 vLLM / SGLang 部署为 API 服务。

Instella-MoE的核心优势

  • 全链路开源透明:从预训练到 RL 的 6 个阶段模型全部开源,训练数据与代码透明可查。
  • AMD 生态原生适配:基于 ROCm 和自研 GPU 训练,在 AMD Instinct 系列硬件上推理效率最优,TTFT 最高可降低 39.2%。
  • 激活参数高效:16B 总参数仅激活 2.8B,推理成本显著低于同性能稠密模型。
  • 后训练技术先进:MOPD 多教师蒸馏结合 Token 级反向 KL,在指令遵循和数学推理上表现突出。
  • 通信计算深度重叠:FarSkip-Collective 与 SGLang 专家并行实现通信隐藏,训练与推理效率双优。

Instella-MoE的项目地址

  • 项目官网:https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html
  • GitHub仓库:https://github.com/AMD-AGI/Instella-MoE
  • HuggingFace模型库:https://huggingface.co/collections/amd/instella-moe

Instella-MoE的同类竞品对比

维度 Instella-MoE-16B-A3B Qwen3.5-4B-Base
推出方 AMD(2026.07) 阿里巴巴通义千问
总参数量 16B 4B
激活参数量 2.8B 4B(稠密,全参数激活)
架构类型 MoE(混合专家) 稠密 Transformer
开源程度 6 个阶段权重 + 代码全开源 权重开源
上下文长度 64K 128K
Base 平均性能 76.7% 79.5%

Instella-MoE的应用场景

  • 企业私有化部署:基于 AMD ROCm 生态在本地 GPU 集群部署对话与推理服务,满足数据合规需求。
  • 长文档分析:用 64K 长上下文能力处理法律合同、科研论文、财报等长文本理解与摘要任务。
  • 代码辅助生成:SFT / Think 版本支持编程指令遵循,可用于 IDE 插件或代码审查工具。
  • 科研与教学:全开源链路适合学术界进行 MoE 架构研究、训练方法复现及大模型课程教学。
  • 边缘与混合云推理:低激活参数量适合在资源受限环境中进行高效推理,或作为混合云 AI 服务的基座模型。
OpenAI发布GPT-5.6,深绑微软Copilot365破除“分道扬镳”传闻
Wren AI – 开源文本驱动的SQL数据库查询解决方案
PersonaCraft – 首尔国立大学推出的单参考图像生成多身份全身图像技术
BAG – 港中文联合腾讯推出的3D可穿戴资产生成技术
字节&浙大联手:InfinityHuman如何用AI数字人技术彻底改变虚拟主播、教育和客服?
分享
Email 复制链接 打印
Share
上一篇 JiuwenSwarm – 华为开源的 AI Agent 统一工作平台
下一篇 ChatGPT 悄悄给文笔设了道墙:不再模仿在世作家文笔
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

ChatGPT 悄悄给文笔设了道墙:不再模仿在世作家文笔
AIGC 资讯
JiuwenSwarm – 华为开源的 AI Agent 统一工作平台
AIGC 资讯
Urban Smoothie Juice Ad Poster
AI 生图 Prompt
1100 多名 AI 员工联名呼吁美国政府踩刹车,奥尔特曼罕见表态支持
AIGC 资讯

相关推荐

AIGC 资讯

Screenshot to Code – AI将截图转换为网页代码的开源项目

站外新闻
AIGC 资讯

Browser Use – AI 浏览器助手,自动执行网页中的交互任务

站外新闻
AIGC 资讯

腾讯混元发布 HyOCR-1.5:仅 1B 参数 推理提速 6.37 倍

站外新闻
AIGC 资讯

MVGenMaster – 复旦联合阿里等实验室推出的多视图扩散模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 写实人像 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.