Gummy – 通义推出的端到端语音翻译大模型,能实时流式生成结果
Gummy是什么 Gummy是通义实验室在2024年云栖大会上推出的端到端语音翻译大模型。模型能实时流式生成语音识别与翻译结果,支持包括中文、英语、粤语、日语、韩语、法语…
FunASR – 阿里开源的多功能语音识别工具包
FunASR是什么 FunASR是由阿里巴巴达摩院开源的语音识别工具包,提供包括语音识别(ASR)、语音活动检测(VAD)、标点恢复、语言模型、说话人验证、说话人分离及多…
Oryx – 腾讯联合清华和南洋理工大学推出的多模态大语言模型
Oryx是什么 Oryx是由清华大学、腾讯和南洋理工大学联合推出的多模态大型语言模型(MLLM),基于两项核心创新来处理视觉数据,预训练的OryxViT模型和动态压缩模块…
OmniAudio-2.6B – Nexa AI推出的端侧多模态音频语言模型
OmniAudio-2.6B是什么 OmniAudio-2.6B是Nexa AI推出的音频语言模型,专为边缘部署设计,能实现快速且高效的音频文本处理。OmniAudio-…
IFAdapter – 腾讯和新加坡国立大学联合推出的文本到图像生成模型
IFAdapter是什么 IFAdapter是一种新型的文本到图像生成模型,由腾讯和新加坡国立大学共同推出。提升生成含有多个实例的图像时的位置和特征准确性。传统模型在处理…
cogvlm2-llama3-caption – 智普AI开源的视频标注模型,生成文本描述
cogvlm2-llama3-caption是什么 cogvlm2-llama3-caption模型是一个基于CogVLM2架构的视频描述生成模型。模型用于理解视频内容,…
CleanS2S – 流式语音到语音交互智能体原型,同时进行听和说
CleanS2S是什么 CleanS2S是一个流式语音到语音(S2S)交互智能体原型,提供高质量、实时的语音交互体验。CleanS2S项目基于单文件实现,简化配置和理解过…
I2VEdit – AI视频编辑技术,基于扩散模型实现首帧编辑引导
I2VEdit是什么 I2VEdit是一个先进的视频编辑框架,通过图像到视频的扩散模型实现首帧引导的视频编辑。用户只需编辑视频的第一帧,I2VEdit能自动将编辑效果应用…
DreamOmni – 港中文、字节等机构共同推出的统一图像生成和编辑模型
DreamOmni是什么 DreamOmni 是香港中文大学、字节跳动和香港科技大学共同推出的统一图像生成和编辑模型。模型整合文本到图像(T2I)生成和多种编辑任务,包括…
TinyVLA – 华东师范和上海大学推出面向机器人操控VLA模型
TinyVLA是什么 TinyVLA是一种面向机器人操控的视觉-语言-动作(VLA)模型,由华东师范大学和上海大学团队推出。针对现有VLA模型的不足,如推理速度慢和需要大…
书生·物华2.0(3DTopia 2.0)- 上海AI实验室联合南洋理工推出三维物体生成大模型
书生·物华2.0是什么 书生·物华2.0(3DTopia 2.0)是由上海人工智能实验室与南洋理工大学联合开发的三维物体生成大模型。模型采用创新的原语(primitive…
Hallo2 – 复旦、百度和南大共同推出的音频驱动视频生成模型
Hallo2是什么 Hallo2是复旦大学、百度公司和南京大学共同推出的音频驱动视频生成模型。能将单张参考图片和持续几分钟的音频输入结合起来,基于可选的文本提示调节肖像表…
HouseCrafter – 东北大学和 Stability AI推出2D转换3D室内场景的技术
HouseCrafter是什么 HouseCrafter 是由东北大学和 Stability AI 推出的先进技术,将二维平面图自动转换成三维室内场景。基于一个网络规模图…
QVQ – 阿里通义开源的视觉推理模型
QVQ是什么 QVQ是阿里基于Qwen2-VL-72B构建的开源多模态推理模型,结合视觉理解和复杂问题解决能力,提升人工智能的认知能力。QVQ在视觉推理任务中展现出增强的…
Inverse Painting – 华盛顿大学推出逆向重现绘画过程的AI技术
Inverse Painting是什么 Inverse Painting 是一种AI技术,由华盛顿大学的研究人员推出,能逆向重现绘画过程。通过分析艺术家的绘画视频,学习绘…
StoryMaker – 小红书开源的文本到图像实现角色一致的生成模型
StoryMaker是什么 StoryMaker 是小红书开源的一款文本到图像生成工具,专注于帮助创作者在连续图像内容中保持角色的一致性。基于 Stable Diffus…
