Large Action Models – 微软推出的行动大模型开发框架
Large Action Models是什么 Large Action Models(LAMs)是微软推出大型行动模型的开发框架,能执行真实世界行动的智能系统,LAMs超…
MagicPose – AI视频生成模型,能生成逼真的人体动作和面部表情
MagicPose是什么 MagicPose是南加州大学和字节跳动联合研发的AI视频生成模型,无需任何微调,直接生成逼真的人类动作和面部表情视频。MagicPose通过一…
Moondream – 开源的轻量级AI视觉语言模型,可在本地快速运行
git clone https://github.com/vikhyat/moondream.git cd moondream pip install -r requir…
StyleShot – 开源的AI图像风格迁移模型
StyleShot是什么 StyleShot 是开源的AI图像风格迁移模型,无需额外训练即可实现任意风格到任意内容的迁移。通过风格感知编码器提取风格特征,基于内容融合编码…
混元DiT – 腾讯混元开源的文生图扩散模型Hunyuan-DiT
混元DiT是什么 混元DiT(Hunyuan-DiT)是由腾讯混元团队开源的一款高性能的文本到图像的扩散Transformer模型,具备细粒度的中英文理解能力,能够根据文…
Screenshot to Code – AI将截图转换为网页代码的开源项目
Screenshot to Code是什么 Sscreenshot to Code是一个开源的项目,利用人工智能技术(GPT-4V 和 DALL-E 3)将用户的屏幕截图…
Leffa – Meta 开源的图像生成框架,精确控制人物的外观和姿势
Leffa是什么 Leffa(Learning Flow Fields in Attention)是 Meta AI推出的用在可控人物图像生成框架,基于在注意力机制中引入…
Agent Q – MultiOn公司推出的AI智能体,可以自我学习进化
Agent Q 是什么 Agent Q是MultiOn公司联合斯坦福大学推出的自监督代理推理和搜索框架。Agent Q融合了引导式蒙特卡洛树搜索(MCTS)、AI自我批评…
PixArt-Σ – 华为推出的可生成4K高清图像的文生图模型
PixArt-Σ是什么 PixArt-Σ是由来自华为诺亚方舟实验室、大连理工大学和香港大学的研究人员推出的一个基于扩散Transformer架构(DiT)的文生图模型,专…
IMAGDressing – 华为联合腾讯推出的AI换衣工具
IMAGDressing是什么 IMAGDressing是华为联合腾讯推出的AI换衣工具,IMAGDressing支持用户通过模块化的方式生成服装,并在虚拟环境中进行试穿…
Veo – 谷歌推出的可生成1分钟1080P的视频模型
Veo是什么 Veo是由Google DeepMind开发的一款视频生成模型,用户可以通过文本、图像或视频提示来指导其生成所需的视频内容,能够生成时长超过一分钟1080P…
DDColor – 阿里推出的AI图像上色框架,将黑白图片变彩色
DDColor是什么 DDColor是阿里达摩院的研究人员推出的一个开源的AI图像着色框架,可以一键将黑白图片上色变为全彩图像。该方法通过使用双解码器架构(像素解码器和颜…
LatentLM – 微软联合清华推出的多模态生成模型
LatentLM是什么 LatentLM是微软研究院和清华大学共同推出的多模态生成模型,能统一处理离散数据(如文本)和连续数据(如图像、音频)。模型用变分自编码器(VAE…
UniPortrait – 阿里推出的AI人像图像个性化编辑工具
UniPortrait是什么 UniPortrait是阿里巴巴推出的AI图像个性化编辑工具,能将照片转换为动漫风格,支持多人合照和换脸技术。UniPortrait通过先进…
ELLA – 腾讯推出的扩散模型适配器,可增强语义对齐
ELLA是什么 ELLA(Efficient Large Language Model Adapter,高效的大模型适配器)是由腾讯的研究人员推出的一种新型方法,旨在提升…
NextChat – 一键搭建私人ChatGPT网页应用的开源项目
NextChat是什么 NextChat是一个基于 Next.js 和 Vercel 的开源项目,支持用户将 ChatGPT 等 AI 大模型集成到自己的网页应用中。Ne…
