DreamOmni – 港中文、字节等机构共同推出的统一图像生成和编辑模型
DreamOmni是什么 DreamOmni 是香港中文大学、字节跳动和香港科技大学共同推出的统一图像生成和编辑模型。模型整合文本到图像(T2I)生成和多种编辑任务,包括…
TinyVLA – 华东师范和上海大学推出面向机器人操控VLA模型
TinyVLA是什么 TinyVLA是一种面向机器人操控的视觉-语言-动作(VLA)模型,由华东师范大学和上海大学团队推出。针对现有VLA模型的不足,如推理速度慢和需要大…
书生·物华2.0(3DTopia 2.0)- 上海AI实验室联合南洋理工推出三维物体生成大模型
书生·物华2.0是什么 书生·物华2.0(3DTopia 2.0)是由上海人工智能实验室与南洋理工大学联合开发的三维物体生成大模型。模型采用创新的原语(primitive…
Hallo2 – 复旦、百度和南大共同推出的音频驱动视频生成模型
Hallo2是什么 Hallo2是复旦大学、百度公司和南京大学共同推出的音频驱动视频生成模型。能将单张参考图片和持续几分钟的音频输入结合起来,基于可选的文本提示调节肖像表…
HouseCrafter – 东北大学和 Stability AI推出2D转换3D室内场景的技术
HouseCrafter是什么 HouseCrafter 是由东北大学和 Stability AI 推出的先进技术,将二维平面图自动转换成三维室内场景。基于一个网络规模图…
QVQ – 阿里通义开源的视觉推理模型
QVQ是什么 QVQ是阿里基于Qwen2-VL-72B构建的开源多模态推理模型,结合视觉理解和复杂问题解决能力,提升人工智能的认知能力。QVQ在视觉推理任务中展现出增强的…
Inverse Painting – 华盛顿大学推出逆向重现绘画过程的AI技术
Inverse Painting是什么 Inverse Painting 是一种AI技术,由华盛顿大学的研究人员推出,能逆向重现绘画过程。通过分析艺术家的绘画视频,学习绘…
StoryMaker – 小红书开源的文本到图像实现角色一致的生成模型
StoryMaker是什么 StoryMaker 是小红书开源的一款文本到图像生成工具,专注于帮助创作者在连续图像内容中保持角色的一致性。基于 Stable Diffus…
模型判官 – 在线AI模型评测平台,三个模型生成回答,第四个模型进行评判
模型判官是什么 模型判官是一个基于 Next.js 构建的在线AI模型评测平台,用户输入问题并选择多个AI模型进行测试,帮助用户快速识别出最适于需求的AI模型。平台的特色…
AMD-135M – AMD推出的首款小型语言模型
AMD-135M是什么 AMD-135M是AMD推出的首款小型语言模型(SLM),为特定用例提供性能与资源消耗之间的平衡。基于LLaMA2模型架构,在AMD Instin…
Open Notebook – 开源 AI 笔记工具,自动将多格式笔记转换成博客
Open Notebook是什么 Open Notebook是开源、注重隐私的谷歌NotebookLM替代工具,能帮助用户管理研究工作流程,生成AI辅助笔记,并与内容互动…
Playground v3 – Playground Research推出超越人类设计师的文本到图像模型
Playground v3是什么 Playground v3(PGv3)是由Playground Research推出的最新文本到图像模型,基于深度融合的大型语言模型(L…
CogVideoX-Fun – 基于CogVideoX的整合包,支持生成无限长度的视频
CogVideoX-Fun是什么 CogVideoX-Fun是一个基于CogVideoX结合EasyAnimate修改的AI视频生成整合包,提供了更自由的生成条件,支持文…
AgentStack – 开发者快速构建AI代理的开源项目
AgentStack是什么 AgentStack是一个开源工具,旨在帮助开发者快速构建AI代理项目。基于提供一个预配置的模板和集成流行的代理框架及大型语言模型(LLM)提…
JoyHallo – 京东推出的音频驱动视频生成AI数字人模型
JoyHallo是什么 JoyHallo 是京东开源的AI数字人模型,专为普通话设计,能根据音频生成逼真的说话视频。特别适合处理普通话的复杂口型和语调,具有跨语言生成视频…
PC Agent – 上海交大联合 GAIR 推出的电脑智能体AI系统
PC Agent是什么 PC Agent是上海交通大学和Generative AI Research Lab (GAIR)联合推出的先进AI系统。系统基于模拟人类认知过程…
