Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: AngelSpec – 腾讯混元团队开源的端到端推测解码训练框架
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > AngelSpec – 腾讯混元团队开源的端到端推测解码训练框架
AIGC 资讯

AngelSpec – 腾讯混元团队开源的端到端推测解码训练框架

站外新闻
最近更新: 2026年7月30日 下午3:47
SHARE

AngelSpec是什么

AngelSpec 是腾讯混元团队开源的端到端推测解码训练框架,基于 TorchSpec 构建,支持 MTP 自回归与 DFly 块并行共 6 种草稿架构。推理与训练解耦,推理引擎经 Mooncake/RDMA 向训练工作器流式传输隐藏状态。在 Hy3-A21B 上,DFly 实现 1.98–2.40 倍端到端加速,吞吐较 DFlash 提升 10.5–11.8%。

阅读目录
  • AngelSpec是什么
  • AngelSpec的主要功能
  • AngelSpec的技术原理
  • 如何使用AngelSpec
  • AngelSpec的核心优势
  • AngelSpec的项目地址
  • AngelSpec的同类竞品对比
  • AngelSpec的应用场景

AngelSpec

AngelSpec的主要功能

  • 六种草稿架构统一训练:DFly、DFlash、DFlare、Eagle3、DSpark、MTP 共享一条训练流水线,切换仅需改配置。
  • MTP 训练与 TTT 展开:支持多深度自回归展开训练,内存接近单次因果前向,通过 Ulysses 序列并行支持最长 128k 上下文。
  • 接受率对齐目标函数:支持 CE、top-k KL、LK Loss、D-PACE 加权及端到端 TV 损失,可通过配置自由组合。
  • 文档感知序列打包:Megatron 风格固定长度打包,严格跨文档隔离,同时覆盖 DFlash 与 MTP 路径。
  • 在线真实评估:训练期间通过 vLLM 等引擎执行真实推测解码,实时报告平均接受长度与逐位接受率。
  • 多推理后端支持:兼容 vLLM、SGLang、HuggingFace 等主流推理引擎。

AngelSpec的技术原理

  • 推测解码基础:AngelSpec 建立在推测解码机制之上:一个轻量草稿模型并行提出多个未来 token,目标大模型通过一次前向传播使用拒绝采样完成批量验证,在不改变目标分布的前提下将单步解码扩展为多步推进。其核心挑战在于草稿接受率与验证开销之间的权衡,而 AngelSpec 从训练、架构与推理三个层面系统性解决这一问题。
  • 工作负载异构性建模:AngelSpec 将真实世界的工作负载异构性作为首要设计考量。在线请求横跨开放式对话、代码生成、数学推理与工具调用,其条件熵与延续结构差异显著:高熵对话场景下接受率随深度快速衰减,适合短序列自回归草稿;代码与数学场景存在长可预测跨度,适合块并行扩散草稿。因此 AngelSpec 训练互补的专用草稿器——MTP 面向对话数据,DFly 面向代码与数学数据——而非追求单一通用模型。
  • 共享参数多深度 MTP 训练:MTP 草稿器采用共享参数的多深度训练方案。所有逻辑预测深度复用同一物理 MTP 模块,在训练时自回归展开:深度 k+1 接收深度 k 的 argmax 预测,同时维护逐层增长的草稿 KV 缓存与对角线注意力掩码。Training-Time Test(TTT)机制使草稿器暴露于推理时遇到的自生成轨迹分布,消除教师强制带来的暴露偏差,显著改善第二、第三草稿位的接受率。

挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用AngelSpec

  • 环境安装:执行 pip install -e ".[vllm]" 与 pip install mooncake-transfer-engine 安装框架及 vLLM 后端。
  • 单节点快速启动:8 张 GPU 划分 4 张推理 + 4 张训练,运行 ./examples/qwen3-8b-dfly/run.sh 即可启动完整流水线。
  • 配置覆盖:通过 CLI 直接覆盖 YAML 配置项,如 training.learning_rate=5e-5 training.num_train_steps=500。
  • Conda 环境搭建:运行 ./tools/build_conda.sh 1 vllm 一键构建含 mooncake 的隔离环境,激活后即可使用。
  • 多节点部署:通过 Inference Controller 与 Training Controller 经 Ray 调度,结合 Mooncake 隐藏状态存储实现跨节点解耦训练。

AngelSpec的核心优势

  • 工作负载专业化:MTP 针对高熵对话场景优化,DFly 针对代码与数学等长可预测跨度场景强化,避免单一草稿模型在所有领域表现平庸。
  • DFly 架构创新:混合目标条件主干结合逐层目标视图,配合前驱条件自回归头,在保留并行生成能力的同时提升块内依赖建模。
  • D-Cut 动态验证:将目标验证视为共享批次级资源,根据前缀置信度与运行时成本模型自适应调整验证深度,在高并发下持续转化额外负载为吞吐。
  • 分离式独立扩展:推理与训练 GPU 池通过 Mooncake 存储解耦,双方可按各自负载独立扩缩容,避免统一并行策略的次优问题。
  • 开源完整套件:同步释放框架代码、Hy3-A21B/Qwen3-8B 的 MTP 与 DFly 草稿权重、训练配置及技术报告,实现开箱即用。

AngelSpec的项目地址

  • 项目官网:https://angelspec.readthedocs.io/
  • GitHub仓库:https://github.com/Tencent/AngelSpec
  • HuggingFace模型库:https://huggingface.co/collections/AngelSlim/angelspec
  • arXiv技术论文:https://arxiv.org/pdf/2607.25852

AngelSpec的同类竞品对比

对比维度 AngelSpec SpecForge
出品方 腾讯混元团队 SGLang / 美团等社区团队
核心定位 统一 MTP + 块并行推测解码训练框架 面向 EAGLE-3 的生产级训练框架
草稿架构 6 种(DFly、DFlash、DFlare、Eagle3、DSpark、MTP) 以 EAGLE-3 为主,支持主流开源模型
架构特色 DFly 混合目标条件 + 前驱自回归头 + D-Cut 动态验证 目标-草稿解耦混合并行 + TTT 稀疏树注意力优化
分离设计 推理/训练完全解耦,经 Mooncake/RDMA 流传输隐藏状态 支持同机共存与跨节点分离,通过 SGLang 后端集成
训练优化 接受率对齐目标(TV/LK/D-PACE)+ 文档感知打包 FlexAttention 稀疏掩码 + 原地梯度内核,内存降 93.5%
开源模型 Hy3-A21B、Qwen3-8B 的 MTP/DFly 权重 SpecBundle(Llama、Qwen、Kimi、DeepSeek 等 EAGLE-3 草稿)
性能数据 Hy3-A21B 上 1.98–2.40× 加速,较 DFlash 高 10.5–11.8% Qwen3-235B 训练加速 9.99×,推理最高 4.48× 加速
推理后端 vLLM、SGLang、HuggingFace SGLang、HuggingFace、自定义后端

AngelSpec的应用场景

  • 大模型在线推理加速:为混元 Hy3、Qwen3 等 MoE/稠密模型部署推测解码草稿,降低自回归解码延迟。
  • 高并发对话服务:利用 D-Cut 动态资源分配,在并发 4–64 范围内维持最高平均吞吐,适配客服与助手场景。
  • 代码生成与数学推理:通过 DFly 块并行草稿捕获长可预测跨度,加速 IDE 补全、解题引擎等结构化输出任务。
  • 长上下文训练与推理:借助 Ulysses 序列并行支持 128k 上下文,适配文档分析、代码库检索等长序列场景。
DiT – 基于Transfomer架构的扩散模型
Hallo2 – 复旦、百度和南大共同推出的音频驱动视频生成模型
高德发布全球首个3D原生城市世界模型ABot-Earth0.5,已开放内测
​OpenAI模型突破隔离发动黑客攻击,美国会议员紧急提出AI”终止开关”法案
字节跳动Depth Anything 3发布:单一Transformer架构突破三维空间重建,精度与速度双领先
分享
Email 复制链接 打印
Share
上一篇 Grok Voice Think Fast 2.0 – SpaceXAI 推出的语音模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

Grok Voice Think Fast 2.0 – SpaceXAI 推出的语音模型
AIGC 资讯
全息流体渐变通用占位特色图
打造会学习的AI客服:Encore AI获 3000 万美元A轮融资,掘金企业对话数据
AIGC 资讯
Japanese Neon Marketing Thumbnail
AI 生图 Prompt
微软确认开发Copilot AI超级应用,整合聊天、编程与智能代理能力
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

Claude Sonnet 4.5 来了:Anthropic最强编程AI模型,连续工作超30小时,性能全面碾压

站外新闻
AI编程模型 Anthropic Claude Sonnet 4.5
AIGC 资讯

AnyCharV – 港中文联合清华等机构推出的角色可控视频生成框架

站外新闻
量子芯片科技感占位特色图
AI 工具AIGC 资讯最新趋势

谷歌CEO皮查伊罕见坦承:编程领域暂落后于竞品,AI搜索将稳健转型而非激进颠覆

站外新闻
AGI AI搜索 Gemini 皮查伊 谷歌
流光脑波AI大脑占位特色图
AIGC 资讯最新趋势

DeepSeek V4永久降价75%:碾压GPT-5.5与Claude Opus,登顶全球AI性价比之王

站外新闻
AI性价比 DeepSeek V4 人工智能 开源模型
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt GPT Image 2 AI Agent 多模态大模型 EvoLink灵感 AI绘画 字节跳动 写实人像 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 时尚大片 阿里通义 杂志排版 强化学习 产品设计 商业海报 皮克斯风格 3D动画 色彩分析 AI生图 腾讯混元 MoE架构 多模态AI
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.