混元DiT – 腾讯混元开源的文生图扩散模型Hunyuan-DiT
混元DiT是什么 混元DiT(Hunyuan-DiT)是由腾讯混元团队开源的一款高性能的文本到图像的扩散Transformer模型,具备细粒度的中英文理解能力,能够根据文…
Screenshot to Code – AI将截图转换为网页代码的开源项目
Screenshot to Code是什么 Sscreenshot to Code是一个开源的项目,利用人工智能技术(GPT-4V 和 DALL-E 3)将用户的屏幕截图…
Leffa – Meta 开源的图像生成框架,精确控制人物的外观和姿势
Leffa是什么 Leffa(Learning Flow Fields in Attention)是 Meta AI推出的用在可控人物图像生成框架,基于在注意力机制中引入…
Agent Q – MultiOn公司推出的AI智能体,可以自我学习进化
Agent Q 是什么 Agent Q是MultiOn公司联合斯坦福大学推出的自监督代理推理和搜索框架。Agent Q融合了引导式蒙特卡洛树搜索(MCTS)、AI自我批评…
PixArt-Σ – 华为推出的可生成4K高清图像的文生图模型
PixArt-Σ是什么 PixArt-Σ是由来自华为诺亚方舟实验室、大连理工大学和香港大学的研究人员推出的一个基于扩散Transformer架构(DiT)的文生图模型,专…
IMAGDressing – 华为联合腾讯推出的AI换衣工具
IMAGDressing是什么 IMAGDressing是华为联合腾讯推出的AI换衣工具,IMAGDressing支持用户通过模块化的方式生成服装,并在虚拟环境中进行试穿…
Veo – 谷歌推出的可生成1分钟1080P的视频模型
Veo是什么 Veo是由Google DeepMind开发的一款视频生成模型,用户可以通过文本、图像或视频提示来指导其生成所需的视频内容,能够生成时长超过一分钟1080P…
DDColor – 阿里推出的AI图像上色框架,将黑白图片变彩色
DDColor是什么 DDColor是阿里达摩院的研究人员推出的一个开源的AI图像着色框架,可以一键将黑白图片上色变为全彩图像。该方法通过使用双解码器架构(像素解码器和颜…
LatentLM – 微软联合清华推出的多模态生成模型
LatentLM是什么 LatentLM是微软研究院和清华大学共同推出的多模态生成模型,能统一处理离散数据(如文本)和连续数据(如图像、音频)。模型用变分自编码器(VAE…
UniPortrait – 阿里推出的AI人像图像个性化编辑工具
UniPortrait是什么 UniPortrait是阿里巴巴推出的AI图像个性化编辑工具,能将照片转换为动漫风格,支持多人合照和换脸技术。UniPortrait通过先进…
ELLA – 腾讯推出的扩散模型适配器,可增强语义对齐
ELLA是什么 ELLA(Efficient Large Language Model Adapter,高效的大模型适配器)是由腾讯的研究人员推出的一种新型方法,旨在提升…
NextChat – 一键搭建私人ChatGPT网页应用的开源项目
NextChat是什么 NextChat是一个基于 Next.js 和 Vercel 的开源项目,支持用户将 ChatGPT 等 AI 大模型集成到自己的网页应用中。Ne…
CogVLM2 – 智谱AI推出的新一代多模态大模型
CogVLM2是什么 CogVLM2是由智谱AI推出的新一代多模态大模型,在视觉和语言理解方面实现了显著的性能提升,支持高达8K的文本长度和1344*1344分辨率的图像…
Real-ESRGAN:腾讯推出的开源图像分辨率提升模型
Real-ESRGAN是什么 Real-ESRGAN(Real-World Blind Super-Resolution with Pure Synthetic Data…
Lyra – SmartMore联合多所高校推出的增强多模态交互能力
Lyra是什么 Lyra是香港中文大学、SmartMore和香港科技大学推出的高效多模态大型语言模型(MLLM),专注于提升语音、视觉和语言模态的交互能力。Lyra基于开…
LabelU – 开源的多模态数据标注工具
LabelU是什么 LabelU 是一款开源的多模态数据标注工具,支持图像、视频和音频的标注,具备拉框、多边形、标点、标线、分类、描述等图像标注能力,能满足目标检测、图像…
