NodeTool – AI工作流可视化构建器,拖放节点设计复杂工作流
NodeTool是什么 NodeTool是开源的AI工作流可视化构建器。NodeTool集成广泛的AI工具和模型,基于简单、可视化的界面,让用户无需编码即可快速原型设计和…
ORMBG – 开源的AI图像分割工具
ORMBG是什么 ORMBG是开源的AI图像分割工具,由开发者schirrmacher在GitHub上发起。ORMBG专注于从图片中准确去除背景,用先进的图像处理技术,实…
Grok-1 – 马斯克旗下xAI开源的大模型,参数量3140亿
Grok-1是什么 Grok-1 是由马斯克旗下的人工智能初创公司 xAI 开发的一款大型语言模型,是一个混合专家(MoE)模型,拥有 3140 亿参数,使其成为目前参数…
HeadGAP – 字节跳动推出的3D头像生成模型
HeadGAP是什么 HeadGAP是字节跳动和上海科技大学共同推出的3D头像生成模型,仅用少量图片快速生成逼真的3D头像。采用先验学习和个性化创建阶段的框架,基于大规模…
Eagle – 英伟达推出的多模态大模型,擅长高分辨率图像处理
Eagle是什么 Eagle是英伟达推出的多模态大模型,擅长处理高达1024×1024像素的图像,显著提升视觉问答和文档理解能力。Eagle模型采用多专家视觉编码器架构,…
Qwen2 – 阿里云开源的新一代通义千问大模型
Qwen2是什么 Qwen2是由阿里云通义千问团队开源的新一代大语言模型,该系列涵盖了从0.5B到72B不等的五个规模模型,在中文和英文基础上增加了27种语言的高质量数据…
Follow Your Pose – 开源的姿态全可控视频生成框架
Follow Your Pose是什么 Follow Your Pose是由清华大学、香港科技大学、腾讯AI Lab以及中科院的研究人员开源的一个基于文本到视频生成的框架…
VMB – 中科院联合多所高校机构推出增强多模态音乐生成的框架
VMB是什么 VMB(Visuals Music Bridge)是中国科学院信息工程研究所、中国科学院大学网络空间安全学院、上海人工智能实验室、上海交通大学等机构推出的多…
Cradle – 通用计算机控制的多模态AI Agent框架
Cradle是什么 Cradle是面向通用计算机控制(General Computer Control, GCC)的多模态AI Agent框架,由昆仑万维携手北京智源人工…
Open-Sora – 开源的类Sora架构的视频生成模型和复现方案
Open-Sora是什么 Open-Sora是由Colossal-AI团队开源的视频生成模型,旨在复现OpenAI的Sora视频生成产品。Open-Sora同样基于DiT…
LMMs-Eval – 专为多模态AI模型设计的统一评估框架
LMMs-Eval是什么 LMMs-Eval 是一个专为多模态AI模型设计的统一评估框架,提供标准化、广泛覆盖且成本效益高的模型性能评估解决方案。包含超过50个任务和10…
PGTFormer – 先进的AI视频人脸修复框架
PGTFormer是什么 PGTFormer是先进的视频人脸修复框架,通过解析引导的时间一致性变换器来恢复视频中的高保真细节,同时增强时间连贯性。该方法无需预对齐,基于语…
Follow-Your-Emoji – 腾讯等推出的基于扩散模型的人像动画框架
Follow-Your-Emoji是什么 Follow-Your-Emoji是由香港科技大学、腾讯混元和清华大学的研究人员推出的一个基于扩散模型的人像动画框架,利用扩散模…
IP-Adapter – 腾讯开源的文本到图像扩散模型适配器
IP-Adapter是什么 IP-Adapter(Image Prompt Adapter)是一种专门为预训练的文本到图像扩散模型(如Stable Diffusion)设…
Linly-Dubbing – 开源AI视频工具,支持配音、翻译、对口型
Linly-Dubbing是什么 Linly-Dubbing是一个开源AI视频翻译和配音工具,支持配音、翻译、对口型,能自动将视频内容翻译成多种语言,并生成字幕。通过Wh…
VLOGGER – 谷歌推出的图像到合成人物动态视频的模型
VLOGGER是什么 VLOGGER AI是谷歌的研究团队开发的一个多模态扩散模型,专门用于从单一输入图像和音频样本生成逼真的、连贯的人像动态视频。该模型的主要功能在于使…
