GLM-PC – 智谱推出的电脑智能体,基于CogAgent视觉多模态模型构建
GLM-PC是什么 GLM-PC是智谱推出的基于多模态大模型CogAgent的电脑智能体。能像人类一样“观察”和“操作”计算机,协助用户高效完成各类电脑任务,如文档处理、…
TryOffDiff – AI虚拟试穿技术,单张穿着者图片生成标准化服装图像
TryOffDiff是什么 TryOffDiff(VTOFF)是基于扩散模型的新型虚拟试穿技术,用高保真服装重建实现虚拟试穿,专注于从单张穿着者照片生成标准化的服装图像。…
GLM-Edge – 智谱开源的端侧大语言和多模态系列模型
GLM-Edge是什么 GLM-Edge是智谱开源的一系列端侧部署优化的大语言对话模型和多模态理解模型,包含GLM-Edge-1.5B-Chat、GLM-Edge-4B-…
FlagevalMM – 智源开源的多模态模型评测框架
FlagevalMM是什么 FlagEvalMM是北京智源人工智能研究院开源的多模态模型评测框架,能全面评估处理文本、图像、视频等多种模态的模型,支持多种任务和指标。框架…
Delta-CoMe – 清华联合 OpenBMB 等高校开源的新型增量压缩算法
Delta-CoMe是什么 Delta-CoMe是清华大学NLP实验室联合OpenBMB开源社区、北京大学和上海财经大学提出的新型增量压缩算法,一个80G的A100 GP…
Agent-E – 基于AutoGen代理框架构建的AI浏览器自动化系统
Agent-E是什么 Agent-E是基于AutoGen代理框架构建的智能自动化系统,专注于浏览器内的自动化操作。Agent-E基于自然语言交互,能执行填写表单、搜索排序…
Magic Copy – 开源的AI抠图工具,在浏览器中自动识别图像进行抠图
Magic Copy是什么 Magic Copy是开源的AI抠图工具,支持Chrome浏览器扩展,基于Meta的Segment Anything Model技术,从图像中…
NSFW Detector – 开源 AI 不适宜内容检测工具,支持识别图像、PDF、视频文件
NSFW Detector是什么 NSFW Detector(Not Safe For Work,简称 NSFW)是开源的检测不适宜内容工具,NSFW Detector能…
MultiFoley – Adobe 联合密歇根大学推出的音效生成系统
MultiFoley是什么 MultiFoley是Adobe Research和密歇根大学共同推出的音效生成系统,能基于文本、音频和视频的多模态控制生成Foley声音效果…
CAT4D – 谷歌和哥伦比亚大学等高校推出的单目视频创建4D场景方法
CAT4D是什么 CAT4D是Google DeepMind、哥伦比亚大学和加州大学圣地亚哥分校共同推出的,能从单目视频创建4D场景(动态3D)表示。CAT4D基于多视图…
Make-It-Animatable – 中科大联合腾讯推出的自动生成即时动画准备资产
Make-It-Animatable是什么 Make-It-Animatable是中国科学技术大学和Tencent PCG推出的数据驱动框架,能在不到一秒钟内让任何3D人…
Co-op Translator – 微软推出面向开发者的开源多语言翻译工具
Co-op Translator是什么 Co-op Translator是微软推出的开源多语言翻译工具,基于Azure AI服务实现项目文档和图像中文本的自动化多语言翻译…
AnchorCrafter – 中科院联合腾讯推出的AI虚拟主播带货视频制作技术
AnchorCrafter是什么 AnchorCrafter是基于扩散模型的智能视频制作系统,用在自动生成具有高保真度的主播风格产品推广视频。基于整合人-物交互(HOI)…
MyTimeMachine – AI个性化面部年龄转换技术,实现20至40年的时间跨度
MyTimeMachine是什么 MyTimeMachine(MyTM)是先进的个性化面部年龄转换技术,基于大约50张个人照片,跨越20至40年的时间跨度,训练一个适配器…
HiFiVFS – 腾讯联合VIVO推出的高保真视频换脸框架
HiFiVFS是什么 HiFiVFS(High Fidelity Video Face Swapping)是腾讯和VIVO公司推出的高保真视频换脸框架,HiFiVFS基于…
MVGenMaster – 复旦联合阿里等实验室推出的多视图扩散模型
MVGenMaster是什么 MVGenMaster是复旦大学、阿里巴巴达摩院和湖潘实验室共同推出的多视图扩散模型,基于增强3D先验处理多样化的新视角合成(NVS)任务。…
