Freestyler – 西工大联合微软和香港大学推出的说唱乐生成模型
Freestyler是什么 Freestyler是西北工业大学计算机科学学院音频、语音与语言处理小组(ASLP@NPU)、微软及香港中文大学深圳研究院大数据研究所共同推出…
StarCoder 2 – BigCode推出的第二代开源代码大模型
StarCoder 2是什么 StarCoder 2是由BigCode项目(Hugging Face和ServiceNow支持)联合Nvidia的团队开发的新一代大型代码…
Hyper-SD – 字节跳动推出的高效的图像合成框架
Hyper-SD是什么 Hyper-SD是由字节跳动的研究人员推出的一个高效的图像合成框架,旨在解决现有扩散模型在多步推理过程中计算成本高昂的问题。Hyper-SD通过轨…
ReplaceAnything – 阿里推出的AI替换图片中物体的开源框架
ReplaceAnything是由阿里巴巴智能计算研究院推出的一款开源AI图像内容替换框架,利用先进的人工智能技术,能够实现对照片或图像中物体的智能替换。用户可以通过简单…
SnapGen – Snap联合港科大等机构推出的移动端文生图模型
SnapGen是什么 SnapGen是Snap Inc、香港科技大学、墨尔本大学等机构联合推出的文本到图像(T2I)扩散模型,能在移动设备上快速生成高分辨率(1024×1…
MeloTTS – MyShell AI推出的多语言文本到语音转换工具
pip install melotts python -m unidic download python melo/app.py git clone https://gi…
Arctic – Snowflake开源的企业级AI大模型
Arctic是什么 Arctic是由云计算巨头Snowflake的AI研究团队开发的一款高效、开源的企业级大型语言模型,该大模型是一个拥有480亿(480B)的参数规模,…
Outfit Anyone – 阿里开源的一键换衣虚拟试穿项目
Outfit Anyone是由阿里巴巴智能计算研究院推出的一个高质量服装虚拟试穿的开源项目,借助该技术,用户或模特无需亲自试穿衣服即可预览上身效果。Outfit Anyo…
CosyVoice – 阿里开源的语音生成大模型
CosyVoice是什么 CosyVoice 是阿里通义实验室开源的自然语音合成大模型。模型支持中文、英文、日文、粤语、韩语五种语言,仅需3到10秒音频样本就能复刻相似音…
Snap Video – Snapchat公司推出的AI视频生成模型
Snap Video是什么 Snap Video是由Snap(社交媒体Snapchat所属的公司)研究团队开发的一个AI视频生成模型,目标是通过文本描述来合成视频,即用户…
OpenELM – 苹果开源的高效语言模型系列
OpenELM是什么 OpenELM是Apple苹果公司最新推出的系列高效开源的语言模型,包括OpenELM-270M、OpenELM-450M、OpenELM-1_1B…
PhotoMaker – 腾讯等推出的AI人物生成和图片风格化工具
PhotoMaker V2是什么 PhotoMaker V2是腾讯推出的AI图像生成框架,能在极短的时间内生成逼真的人物照片。与初代相比,V2版本在角色的一致性和可控性上…
Megrez-3B-Omni – 无问芯穹开源的端侧全模态理解模型
Megrez-3B-Omni是什么 Megrez-3B-Omni是无问芯穹推出的全球首个端侧全模态理解开源模型,能处理图像、音频和文本三种模态数据。Megrez-3B-O…
LayerDiffusion – AI生成具有透明度的图像的框架
LayerDiffusion是什么 LayerDiffusion(现已更名为LayerDiffuse)是由来自斯坦福大学的研究人员 Lvmin Zhang(即Contro…
ID-Animator – 腾讯等推出的个性化人物视频生成框架
ID-Animator是什么 ID-Animator是由来自腾讯光子工作室、中科大和中科院合肥物质科学研究院的研究人员推出的一种零样本(zero-shot)人类视频生成技…
FaceChain – 阿里推出的人物写真和个人形象生成框架
FaceChain是阿里巴巴达摩院推出的一个开源的人物写真和个人数字形象的AI生成框架(类似于免费开源版的妙鸭相机),用户仅需要提供最少一张照片即可生成独属于自己的个人形…
