Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: MHA2MLA – 复旦、上海AI Lab等推出优化LLM推理效率的方法
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > MHA2MLA – 复旦、上海AI Lab等推出优化LLM推理效率的方法
AIGC 资讯

MHA2MLA – 复旦、上海AI Lab等推出优化LLM推理效率的方法

站外新闻
最近更新: 2026年6月8日 下午5:18
SHARE

MHA2MLA是什么

MHA2MLA是复旦大学、华东师范大学、上海AI Lab等机构联合推出的数据高效的微调方法,基于引入DeepSeek的多头潜在注意力机制(MLA),优化任何基于Transformer的LLM的推理效率,降低推理成本。MHA2MLA基于两个关键策略实现:一是partial-RoPE,移除对注意力分数贡献较小的查询和键的旋转位置编码(RoPE)维度;二是低秩近似,基于联合奇异值分解(SVD)对键和值进行压缩,减少KV缓存的内存占用。MHA2MLA仅需使用原始数据的0.3%到0.6%进行微调,能在大幅减少KV缓存(如92.19%)的同时,将性能损失控制在极小范围内(如LongBench性能仅下降0.5%)。

阅读目录
  • MHA2MLA是什么
  • MHA2MLA的主要功能
  • MHA2MLA的技术原理
  • MHA2MLA的项目地址
  • MHA2MLA的应用场景

MHA2MLA

MHA2MLA的主要功能

  • 显著减少KV缓存:基于低秩压缩技术,将KV缓存的大小大幅减少(最高可达96.87%),降低推理时的内存占用。
  • 保持模型性能:在极低的数据量(0.3%到0.6%的原始训练数据)下进行微调,将性能损失控制在极小范围内(如LongBench性能仅下降0.5%)。
  • 与现有技术兼容:与量化技术(如4-bit量化)结合使用,进一步提升推理效率。
  • 数据高效性:仅需少量数据即可完成从MHA到MLA的架构转换,适合在资源受限的环境中快速部署。

MHA2MLA的技术原理

  • Partial-RoPE(部分旋转位置编码):在MHA中,旋转位置编码(RoPE)基于旋转操作将位置信息融入查询向量(Q)和键向量(K),帮助模型捕捉序列中的位置关系。基于计算每个维度对注意力分数的贡献,移除贡献较小的RoPE维度(即“不重要的”维度),减少计算量和内存占用。这一过程称为“部分RoPE”,在保留关键位置信息的同时,为低秩压缩腾出空间。
  • 低秩近似(Low-Rank Approximation):MLA基于低秩联合压缩键值(KV)减少内存占用。MHA2MLA借鉴这一思想,对MHA中的键和值参数矩阵进行奇异值分解(SVD)。将键和值矩阵分解为低秩矩阵的乘积,用更少的参数近似原始矩阵。为更好地保留键和值之间的交互信息,MHA2MLA联合SVD(SVDjoint)策略,对键和值矩阵进行联合分解,而不是分别处理。

MHA2MLA的项目地址

  • GitHub仓库:https://github.com/JT-Ushio/MHA2MLA
  • arXiv技术论文:https://arxiv.org/pdf/2502.14837

MHA2MLA的应用场景

  • 边缘设备部署:降低模型内存占用,使其适配资源受限的智能终端和物联网设备。
  • 大规模模型推理:减少KV缓存,提升推理效率,降低硬件成本和能耗。
  • 结合量化技术:与量化技术结合,进一步优化推理性能,适用于实时对话和在线翻译等场景。
  • 长文本处理:降低长文本任务的内存瓶颈,高效处理长文档摘要和长篇生成。
  • 快速模型迁移:仅需少量数据微调,快速将MHA模型转换为MLA架构,降低迁移成本。
Outfit Anyone – 阿里开源的一键换衣虚拟试穿项目
AI Scientist – Sakana AI推出的全自动科学发现AI系统
华为开源5050亿参数openPangu-2.0-Pro模型,权重与推理代码同步开放
Edicho – 蚂蚁集团联合港科大等高校推出的多图像一致性编辑方法
Kairos 3.0: 大晓机器人开源商业级世界模型,用物理AI加速具身智能落地
分享
Email 复制链接 打印
Share
上一篇 LangManus – AI自动化框架,多智能体协同完成复杂任务
下一篇 子曰-o1 – 网易有道推出国内首个输出分步式讲解的推理模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

阿里通义百聆重磅发布:企业级语音基座大模型,融合识别与合成,大幅降低幻觉率,赋能多行业应用

站外新闻
Fun-ASR Fun-CosyVoice 企业级AI 语音大模型 通义百聆
全息流体渐变通用占位特色图
AIGC 资讯

抖音升级未成年人模式引擎,把多模态大语言模型请进了适龄推荐

站外新闻
AIGC 资讯

Wan-Dancer – 阿里通义开源的人像舞蹈视频生成模型

站外新闻
AIGC 资讯

PixelWave Flux – AI图像生成模型,基于FLUX.1-dev模型微调版本

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.