libcom – 上海交大推出开源的图像合成问题解决工具
libcom是什么 libcom 是一个由上海交通大学 (BCMI) 实验室推出的图像合成工具箱。旨在解决前景和背景之间的不一致性问题,如外观、几何和语义上的不匹配,生成…
ViewCrafter – 北大、港中文联合腾讯提出的高保真新视图合成技术
ViewCrafter是什么 ViewCrafter 是北大和港中文联合腾讯提出的一种先进的视频扩散模型,能从单个或少量图像中合成高保真的新视图。结合了视频扩散模型的生成…
Mem0 – 一款开源的大语言模型记忆增强工具
Mem0 是什么 Mem0 是一款开源的大语言模型记忆增强工具,能够让 AI 拥有长期、适应性强的记忆。通过自适应记忆系统,AI能实现跨应用记住用户的偏好和交互,提供连贯…
Llama 3.2 – Meta推出的中小型视觉语言模型和轻量级文本模型
Llama 3.2是什么 Llama 3.2是Meta公司最新推出的开源AI大模型系列,包括小型和中型视觉语言模型(11B和90B参数)以及轻量级纯文本模型(1B和3B参…
PromptWizard – 微软开源的 AI 提示词自动化优化框架
PromptWizard PromptWizard是微软推出的自动化提示优化框架,改进大型语言模型(LLMs)在特定任务中的表现。基于自我演变和自我适应机制,Prompt…
ProPainter – 南洋理工大学推出的AI视频修复项目
ProPainter是什么 ProPainter是南洋理工大学S-Lab团队推出的AI视频修复项目。通过结合双域传播和蒙版引导的稀疏视频Transformer,有效提高了…
CDial-GPT – 清华推出的大型中文短文本对话数据集和对话生成模型
CDial-GPT是什么 CDial-GPT是清华大学研究团队推出的大型中文短文本对话数据集LCCC及基于数据集的预训练对话生成模型。LCCC数据集经过严格的清洗流程,包…
PoseTalk – 文本和音频驱动的生成会说话的头部动画开源项目
PoseTalk是什么 PoseTalk 是基于文本和音频的姿势控制和运动细化方法的开源项目,用于一次性生成会说话的头部视频。从图像、驱动音频和驱动姿势合成说话人脸视频,…
Qwen2-VL – 阿里巴巴达摩院开源的视觉多模态AI模型
Qwen2-VL是什么 Qwen2-VL是阿里巴巴达摩院开源的视觉多模态AI模型,具备高级图像和视频理解能力。Qwen2-VL支持多种语言,能处理不同分辨率和长宽比的图片…
F5-TTS – 上海交大推出开源的文本到语音(TTS)合成系统
F5-TTS是什么 F5-TTS是由上海交通大学开源的一款高性能文本到语音(TTS)系统,基于流匹配的非自回归生成方法,结合扩散变换器(DiT)技术。系统在没有额外监督的…
FluxMusic – 开源的AI音乐生成模型,通过文本描述创造音乐
FluxMusic是什么 FluxMusic 是一个开源的音乐生成模型,基于扩散模型和 Transformer 架构将文本描述转换成音乐。模型能处理复杂的文本指令,生成具…
STORM AI – 斯坦福大学推出的开源AI写作工具
STORM AI 是什么 STORM AI 是斯坦福大学推出的开源AI写作工具,可在几秒钟内将一个主题转换为长篇文章/研究论文,完全免费,是 Perplexity Pag…
MIMO – 阿里智能研究院推出的可控角色AI视频合成框架
MIMO是什么 MIMO是阿里巴巴集团智能计算研究所推出的可控角色视频合成的新型AI框架,基于空间分解建模技术,将2D视频转换为3D空间代码,实现对角色、动作和场景的精确…
INFP – 音频驱动的生成逼真面部表情和头部姿态的AI框架
INFP是什么 INFP是音频驱动的头部生成框架,专为双人对话交互设计。能自动在对话音频引导下进行角色的转换,无需手动分配角色和角色切换。INFP包括两个阶段:基于动作头…
Roop – 开源的AI视频换脸工具
Roop是什么 Roop 是开源的AI视频换脸工具,Roop支持用户通过一张图片替换视频中的面部,无需复杂的数据集或训练过程。安装和使用需要一定的技术技能,适合有一定基础…
RD-Agent – 微软亚洲研究院推出开源的自动化研究与开发工具
RD-Agent是什么 RD-Agent是一个开源的自动化研究与开发(R&D)工具,由微软亚洲研究院推出。基于AI技术推动数据驱动的AI研发过程,专注于简化模型和…
