SmoothCache – Roblox 和女王大学推出用于DiT的通用推理加速技术
SmoothCache是什么 SmoothCache 是用在Diffusion Transformers (DiT)模型的通用推理加速技术,是 Roblox 和女王大学的…
AutoConsis – 美团联合复旦大学推出的UI内容一致性AI检测工具
AutoConsis是什么 AutoConsis是UI内容一致性智能检测工具,是美团技术团队与复旦大学联合推出的。工具基于深度学习和大型语言模型自动识别和提取界面中的关键…
OmniEdit – 滑铁卢大学等机构开源的通用图像编辑模型
OmniEdit是什么 OmniEdit是先进的图像编辑技术,通过结合多个专家模型的监督来训练一个通用模型,处理多种图像编辑任务。能处理不同纵横比的图像,七种不同的图像编…
In-Context LoRA – 阿里通义推出的基于DiTs的图像生成框架
In-Context LoRA是什么 In-Context LoRA是阿里巴巴通义实验室推出的基于扩散变换器(DiTs)的图像生成框架,用模型的内在上下文学习能力,最小化…
Add-it – 英伟达推出无需训练的图像编辑技术
Add-it是什么 Add-it是NVIDIA推出的无需训练的图像编辑技术,能根据文本指令在图像中添加对象。这项技术基于扩展扩散模型的注意力机制,整合场景图像、文本提示和…
DINO-X – IDEA 研究院推出的通用视觉大模型
DINO-X是什么 DINO-X是IDEA研究院推出的通用视觉大模型,具备开放世界对象检测与理解能力。支持文本、视觉和定制提示,能识别图像中的任何对象而无需用户提示。基于…
The Matrix – 阿里联合港大等多所机构推出的AI基础世界模拟器
The Matrix是什么 The Matrix是与电影同名的首个AI基础世界模拟器,是全华人团队推出的(作者分别来自阿里巴巴、香港大学、滑铁卢大学和加拿大AI研究机构V…
HyOCR-1.5 – 腾讯混元开源的轻量级端到端 OCR 专家大模型
HyOCR-1.5是什么 HyOCR-1.5 是腾讯混元开源的轻量级端到端 OCR 专家大模型,仅 1B 参数能实现文档解析、文本识别、信息抽取、拍照翻译、图表解析、古文…
DreamPolish – 智谱AI、清华、北大联合推出的文本到3D生成模型
DreamPolish是什么 DreamPolish是智谱 AI、清华大学和北京大学推出的文本到3D生成模型,基于两阶段方法改进复杂对象的精细几何结构和高质量纹理的生成。…
OmniBooth – 华为诺亚方舟联合港科大推出的图像生成框架
OmniBooth是什么 OmniBooth是华为诺亚方舟实验室和港科大研究团队共同推出的图像生成框架,支持基于文本提示或图像参考进行空间控制和实例级定制。框架用用户定义…
DynaMem – 纽约大学和Hello Robot推出的动态空间语义记忆系统
DynaMem是什么 DynaMem是纽约大学和Hello Robot推出的动态空间语义记忆系统,专为开放世界中的移动操作设计。基于维护一个特征点云作为机器人记忆,处理环…
MVPaint – 腾讯PCG联合多所高校共同推出的3D纹理生成框架
MVPaint是什么 MVPaint是腾讯PCG 、上海AI LAB、南洋理工大学S-Lab、清华大学共同推出的3D纹理生成框架,基于同步多视角扩散技术实现高分辨率、无缝…
LTX Video – Lightricks推出的开源AI视频生成模型
LTX Video是什么 LTX Video是Lightricks推出的开源AI视频生成模型,能在4秒内生成5秒的高质量视频,速度超过观看速度。基于2亿参数的DiT架构,…
Agnes-2.5-Flash – Agnes AI 推出的新一代高性能文本模型
Agnes-2.5-Flash是什么 Agnes-2.5-Flash 是 Agnes AI 推出的新一代高性能文本模型,Coding 能力位列全球第一梯队,在代码理解、工…
BALROG – 基准测试工具,用于评估LLMs和VLMs在复杂动态环境中的推理能力
BALROG是什么 BALROG是评估大型语言模型(LLMs)和视觉语言模型(VLMs)在游戏上的推理能力,特别是模型在动态环境中的规划、空间推理和探索能力。基于一系列挑…
AutoVFX – 自然语言驱动的视频特效编辑框架
AutoVFX是什么 AutoVFX是先进的物理特效框架,是伊利诺伊大学香槟分校研究团队推出的,能根据自然语言指令自动创建真实感和动态的视觉特效(VFX)视频。框架集成神…
