FantasyID – 阿里联合北邮大学推出的身份保持视频生成框架
FantasyID是什么 FantasyID 是阿里巴巴集团和北京邮电大学推出新型的身份保持视频生成(IPT2V)框架,基于增强人脸知识生成高质量的身份一致视频。Fant…
AutoRAG – 中科院开源的自主迭代检索模型
AutoRAG是什么 AutoRAG是中国科学院计算技术研究所(ICT/CAS)、中国科学院的人工智能安全重点实验室及中国科学院大学的研究人员共同推出的新型自主迭代检索模…
LIGER – Meta AI 等机构推出的混合检索模型
LIGER是什么 LIGER是Meta AI等机构推出的混合检索模型,结合生成式检索和密集检索的优点。LIGER用生成式检索模块生成有限的候选项目集,基于密集检索对候选项…
AnyCharV – 港中文联合清华等机构推出的角色可控视频生成框架
AnyCharV是什么 AnyCharV是香港中文大学、清华大学深圳国际研究生院、香港大学联合推出的角色可控视频生成框架,能将任意参考角色图像与目标驱动视频相结合,生成高…
ToddlerBot – 斯坦福大学开源的机器学习与人形机器人平台
ToddlerBot是什么 ToddlerBot是斯坦福大学开源的用在运动操作的开源机器学习与人形机器人平台,为高效收集大规模、高质量的训练数据设计。ToddlerBot…
混元图生视频 – 腾讯混元开源的图生视频模型
混元图生视频是什么 混元图生视频是腾讯混元推出的开源图生视频模型,用户可以通过上传一张图片进行简短描述,让图片动起来生成5秒的短视频。模型支持对口型、动作驱动和背景音效自…
MedRAX – AI医学推理Agent,用于胸部X光检查和解决复杂医学问题
MedRAX是什么 MedRAX(Medical Reasoning Agent for Chest X-ray)是专门用于胸部X光检查的医学推理AI代理。通过整合最先进…
SynCD – Meta和卡内基梅隆大学开源的文生图合成训练数据集
SynCD是什么 SynCD(Synthetic Customization Dataset)是卡内基梅隆大学和Meta推出的高质量合成训练数据集,用在提升文本到图像模型…
story-flicks – AI视频生成工具,一键生成高清故事短视频
story-flicks是什么 story-flicks 是基于AI大模型的项目,支持一键生成高清故事短视频。用户输入故事主题后,系统基于AI技术生成包含图像、文本、音频…
Janus-Pro – DeepSeek 开源的统一多模态模型
Janus-Pro是什么 Janus-Pro是 DeepSeek 推出的开源AI模型,支持图像理解和图像生成,提供 1B 和 7B 两种规模,适配多元应用场景。通过改进的…
Step-2 mini – 阶跃星辰推出的轻量级极速大模型
Step-2 mini是什么 Step-2 mini 是阶跃星辰推出的轻量级极速大模型,基于新一代自研 Attention 架构 MFA 开发。仅用 3% 的参数量就保留…
MinMo – 阿里通义实验室推出的多模态语音交互大模型
MinMo是什么 MinMo是阿里巴巴通义实验室FunAudioLLM团队推出的多模态大模型,专注于实现无缝语音交互。MinMo拥有约80亿参数,基于多阶段训练,在140…
SigStyle – 吉大联合 Adobe 等机构推出的风格迁移框架
SigStyle是什么 SigStyle 是吉林大学、南京大学智能科学与技术学院及Adobe推出的新型签名风格迁移框架,支持将单张风格图像中独特的视觉特征(如几何结构、色…
MarS – 微软亚洲研究院开源的金融市场模拟预测引擎
MarS是什么 MARS(Market Simulation)是微软亚洲研究院推出的金融市场模拟预测引擎,基于生成型基础模型LMM(Large Market Model)…
SeedVR – 南洋理工和字节跳动推出的扩散变换器模型,实现通用视频修复
SeedVR是什么 SeedVR是南洋理工大学和字节跳动推出的扩散变换器模型,能实现高质量的通用视频修复。SeedVR基于引入移位窗口注意力机制,采用大尺寸(64×64)…
NobodyWho – AI游戏引擎插件,本地运行 LLM 实现互动小说创作
NobodyWho是什么 NobodyWho是为 Godot 游戏引擎设计的插件,通过本地运行的大型语言模型(LLM)实现互动小说创作。支持 Windows、Linux …
