iDP3 – 斯坦福大学联合多所高校推出的改进型3D视觉运动策略
iDP3是什么 iDP3(Improved 3D Diffusion Policy)是斯坦福大学联合多所高校推出的改进型3D视觉运动策略(如三维扩散策略),提升人形机器人…
Proactive Agent – 清华联合面壁智能开源的新一代主动Agent交互范式
Proactive Agent是什么 Proactive Agent是清华大学联合面壁智能等团队推出的新一代主动Agent交互范式 ,具备主动性,能预测用户需求并在没有直…
EMOVA – 华为诺亚方舟联合多所高校共同推出的多模态全能处理模型
EMOVA是什么 EMOVA(EMotionally Omni-present Voice Assistant)是多模态全能模型,是香港科技大学、香港大学和华为诺亚方舟实…
OminiControl – AI图像生成框架,实现图像主题控制和空间精确控制
OminiControl是什么 OminiControl是高度通用且参数高效的图像生成框架,为扩散变换器模型如FLUX.1设计,实现对图像生成过程的精细控制。OminiC…
Talker-Reasoner – 谷歌DeepMind推出的双思维AI代理架构
Talker-Reasoner是什么 Talker-Reasoner是谷歌DeepMind推出的双思维AI代理架构,借鉴人类的认知理论,将代理分为两个模块:Talker和…
Diffusion Self-Distillation – 斯坦福大学推出的零样本定制图像生成技术
Diffusion Self-Distillation是什么 Diffusion Self-Distillation(扩散自蒸馏,简称DSD)是斯坦福大学吴佳俊团队推出的…
Open Materials 2024 – Meta 开源的大型开放数据集和配套预训练模型
Open Materials 2024是什么 Open Materials 2024 (OMat24) 是Meta推出的包含超过1.1亿个结构的密度泛函理论(DFT)计算…
CodeDPO – 北京大学联合字节共同推出的代码生成优化框架
CodeDPO是什么 CodeDPO是北京大学与字节跳动合作推出的代码生成优化框架,能提升代码模型在正确性和效率方面的表现。框架基于自生成和验证机制,同时构建和评估代码及…
Voice-Pro – 开源AI音频处理工具,集成转录、翻译、TTS等一站式服务
Voice-Pro是什么 Voice-Pro是开源的多功能音频处理工具,集成语音转文字(STT)、文本转语音(TTS)、实时翻译、YouTube视频下载和人声分离等多种功…
Generative Omnimatte – 谷歌联合马里兰大学等机构推出的视频分解技术
Generative Omnimatte是什么 Generative Omnimatte 是 Google DeepMind 等机构推出的视频编辑技术,能将视频智能分解为…
GLM-PC – 智谱推出的电脑智能体,基于CogAgent视觉多模态模型构建
GLM-PC是什么 GLM-PC是智谱推出的基于多模态大模型CogAgent的电脑智能体。能像人类一样“观察”和“操作”计算机,协助用户高效完成各类电脑任务,如文档处理、…
TryOffDiff – AI虚拟试穿技术,单张穿着者图片生成标准化服装图像
TryOffDiff是什么 TryOffDiff(VTOFF)是基于扩散模型的新型虚拟试穿技术,用高保真服装重建实现虚拟试穿,专注于从单张穿着者照片生成标准化的服装图像。…
GLM-Edge – 智谱开源的端侧大语言和多模态系列模型
GLM-Edge是什么 GLM-Edge是智谱开源的一系列端侧部署优化的大语言对话模型和多模态理解模型,包含GLM-Edge-1.5B-Chat、GLM-Edge-4B-…
FlagevalMM – 智源开源的多模态模型评测框架
FlagevalMM是什么 FlagEvalMM是北京智源人工智能研究院开源的多模态模型评测框架,能全面评估处理文本、图像、视频等多种模态的模型,支持多种任务和指标。框架…
Delta-CoMe – 清华联合 OpenBMB 等高校开源的新型增量压缩算法
Delta-CoMe是什么 Delta-CoMe是清华大学NLP实验室联合OpenBMB开源社区、北京大学和上海财经大学提出的新型增量压缩算法,一个80G的A100 GP…
Agent-E – 基于AutoGen代理框架构建的AI浏览器自动化系统
Agent-E是什么 Agent-E是基于AutoGen代理框架构建的智能自动化系统,专注于浏览器内的自动化操作。Agent-E基于自然语言交互,能执行填写表单、搜索排序…
