AngelSpec是什么
AngelSpec 是腾讯混元团队开源的端到端推测解码训练框架,基于 TorchSpec 构建,支持 MTP 自回归与 DFly 块并行共 6 种草稿架构。推理与训练解耦,推理引擎经 Mooncake/RDMA 向训练工作器流式传输隐藏状态。在 Hy3-A21B 上,DFly 实现 1.98–2.40 倍端到端加速,吞吐较 DFlash 提升 10.5–11.8%。
阅读目录

AngelSpec的主要功能
- 六种草稿架构统一训练:DFly、DFlash、DFlare、Eagle3、DSpark、MTP 共享一条训练流水线,切换仅需改配置。
- MTP 训练与 TTT 展开:支持多深度自回归展开训练,内存接近单次因果前向,通过 Ulysses 序列并行支持最长 128k 上下文。
- 接受率对齐目标函数:支持 CE、top-k KL、LK Loss、D-PACE 加权及端到端 TV 损失,可通过配置自由组合。
- 文档感知序列打包:Megatron 风格固定长度打包,严格跨文档隔离,同时覆盖 DFlash 与 MTP 路径。
- 在线真实评估:训练期间通过 vLLM 等引擎执行真实推测解码,实时报告平均接受长度与逐位接受率。
- 多推理后端支持:兼容 vLLM、SGLang、HuggingFace 等主流推理引擎。
AngelSpec的技术原理
- 推测解码基础:AngelSpec 建立在推测解码机制之上:一个轻量草稿模型并行提出多个未来 token,目标大模型通过一次前向传播使用拒绝采样完成批量验证,在不改变目标分布的前提下将单步解码扩展为多步推进。其核心挑战在于草稿接受率与验证开销之间的权衡,而 AngelSpec 从训练、架构与推理三个层面系统性解决这一问题。
- 工作负载异构性建模:AngelSpec 将真实世界的工作负载异构性作为首要设计考量。在线请求横跨开放式对话、代码生成、数学推理与工具调用,其条件熵与延续结构差异显著:高熵对话场景下接受率随深度快速衰减,适合短序列自回归草稿;代码与数学场景存在长可预测跨度,适合块并行扩散草稿。因此 AngelSpec 训练互补的专用草稿器——MTP 面向对话数据,DFly 面向代码与数学数据——而非追求单一通用模型。
- 共享参数多深度 MTP 训练:MTP 草稿器采用共享参数的多深度训练方案。所有逻辑预测深度复用同一物理 MTP 模块,在训练时自回归展开:深度 k+1 接收深度 k 的 argmax 预测,同时维护逐层增长的草稿 KV 缓存与对角线注意力掩码。Training-Time Test(TTT)机制使草稿器暴露于推理时遇到的自生成轨迹分布,消除教师强制带来的暴露偏差,显著改善第二、第三草稿位的接受率。

微信关注回复“开源”,加入AI开源项目交流群
如何使用AngelSpec
- 环境安装:执行
pip install -e ".[vllm]"与pip install mooncake-transfer-engine安装框架及 vLLM 后端。 - 单节点快速启动:8 张 GPU 划分 4 张推理 + 4 张训练,运行
./examples/qwen3-8b-dfly/run.sh即可启动完整流水线。 - 配置覆盖:通过 CLI 直接覆盖 YAML 配置项,如
training.learning_rate=5e-5 training.num_train_steps=500。 - Conda 环境搭建:运行
./tools/build_conda.sh 1 vllm一键构建含 mooncake 的隔离环境,激活后即可使用。 - 多节点部署:通过 Inference Controller 与 Training Controller 经 Ray 调度,结合 Mooncake 隐藏状态存储实现跨节点解耦训练。
AngelSpec的核心优势
- 工作负载专业化:MTP 针对高熵对话场景优化,DFly 针对代码与数学等长可预测跨度场景强化,避免单一草稿模型在所有领域表现平庸。
- DFly 架构创新:混合目标条件主干结合逐层目标视图,配合前驱条件自回归头,在保留并行生成能力的同时提升块内依赖建模。
- D-Cut 动态验证:将目标验证视为共享批次级资源,根据前缀置信度与运行时成本模型自适应调整验证深度,在高并发下持续转化额外负载为吞吐。
- 分离式独立扩展:推理与训练 GPU 池通过 Mooncake 存储解耦,双方可按各自负载独立扩缩容,避免统一并行策略的次优问题。
- 开源完整套件:同步释放框架代码、Hy3-A21B/Qwen3-8B 的 MTP 与 DFly 草稿权重、训练配置及技术报告,实现开箱即用。
AngelSpec的项目地址
- 项目官网:https://angelspec.readthedocs.io/
- GitHub仓库:https://github.com/Tencent/AngelSpec
- HuggingFace模型库:https://huggingface.co/collections/AngelSlim/angelspec
- arXiv技术论文:https://arxiv.org/pdf/2607.25852
AngelSpec的同类竞品对比
| 对比维度 | AngelSpec | SpecForge |
|---|---|---|
| 出品方 | 腾讯混元团队 | SGLang / 美团等社区团队 |
| 核心定位 | 统一 MTP + 块并行推测解码训练框架 | 面向 EAGLE-3 的生产级训练框架 |
| 草稿架构 | 6 种(DFly、DFlash、DFlare、Eagle3、DSpark、MTP) | 以 EAGLE-3 为主,支持主流开源模型 |
| 架构特色 | DFly 混合目标条件 + 前驱自回归头 + D-Cut 动态验证 | 目标-草稿解耦混合并行 + TTT 稀疏树注意力优化 |
| 分离设计 | 推理/训练完全解耦,经 Mooncake/RDMA 流传输隐藏状态 | 支持同机共存与跨节点分离,通过 SGLang 后端集成 |
| 训练优化 | 接受率对齐目标(TV/LK/D-PACE)+ 文档感知打包 | FlexAttention 稀疏掩码 + 原地梯度内核,内存降 93.5% |
| 开源模型 | Hy3-A21B、Qwen3-8B 的 MTP/DFly 权重 | SpecBundle(Llama、Qwen、Kimi、DeepSeek 等 EAGLE-3 草稿) |
| 性能数据 | Hy3-A21B 上 1.98–2.40× 加速,较 DFlash 高 10.5–11.8% | Qwen3-235B 训练加速 9.99×,推理最高 4.48× 加速 |
| 推理后端 | vLLM、SGLang、HuggingFace | SGLang、HuggingFace、自定义后端 |
AngelSpec的应用场景
-
大模型在线推理加速:为混元 Hy3、Qwen3 等 MoE/稠密模型部署推测解码草稿,降低自回归解码延迟。
-
高并发对话服务:利用 D-Cut 动态资源分配,在并发 4–64 范围内维持最高平均吞吐,适配客服与助手场景。
-
代码生成与数学推理:通过 DFly 块并行草稿捕获长可预测跨度,加速 IDE 补全、解题引擎等结构化输出任务。
-
长上下文训练与推理:借助 Ulysses 序列并行支持 128k 上下文,适配文档分析、代码库检索等长序列场景。
