Granite 3.1 – IBM 推出的新版语言模型
Granite 3.1是什么 Granite 3.1是IBM推出的新一代语言模型,具有强大的性能和更长的上下文处理能力。Granite 3.1模型家族有 4 种不同的尺寸…
LiveKit Agents – 创建实时与用户互动的多模态AI代理框架
LiveKit Agents是什么 LiveKit Agents 是一个强大的框架,用于创建能实时通过语音、视频和数据与用户互动的多模态AI代理。框架支持 Python …
Ovis1.6 – 阿里国际AI团队推出的多模态大模型,超过闭源GPT-4o-mini
Ovis1.6是什么 Ovis1.6是阿里国际AI团队推出的多模态大模型,在多模态权威综合评测基准OpenCompass上取得了优异的成绩,特别是在30亿参数以下的模型中…
Yi-Lightning – 零一万物最新推出的高性能高速度旗舰模型
Yi-Lightning是什么 Yi-Lightning 是零一万物公司最新发布的旗舰模型,在国际权威盲测榜单 LMSYS 上取得了显著成绩,超越了硅谷知名 OpenAI…
Skywork-Reward – 昆仑万维推出的高性能奖励模型,辅助智能体决策
Skywork-Reward是什么 Skywork-Reward 是昆仑万维推出的一系列高性能奖励模型,包括 Skywork-Reward-Gemma-2-27B 和 S…
NeMo – 英伟达推出的用于构建、定制和部署生成式AI模型
NeMo是什么 NeMo 是由 NVIDIA 提供的端到端云原生框架,用于构建、定制和部署生成式 AI 模型。支持大型语言模型(LLMs)、多模态模型、语音识别和文本转语…
Sketch2Sound – Adobe 联合西北大学推出的AI音频生成技术
Sketch2Sound是什么 Sketch2Sound是Adobe 研究院和西北大学推出的AI音频生成技术,能基于声音模仿和文本提示生成高品质音效。Sketch2Sou…
Matryoshka Diffusion Models – 苹果开源高清图像和视频生成的扩散模型
Matryoshka Diffusion Models是什么 Matryoshka Diffusion Models(MDM)是苹果公司推出的一种创新的扩散模型,主要用于…
Gummy – 通义推出的端到端语音翻译大模型,能实时流式生成结果
Gummy是什么 Gummy是通义实验室在2024年云栖大会上推出的端到端语音翻译大模型。模型能实时流式生成语音识别与翻译结果,支持包括中文、英语、粤语、日语、韩语、法语…
FunASR – 阿里开源的多功能语音识别工具包
FunASR是什么 FunASR是由阿里巴巴达摩院开源的语音识别工具包,提供包括语音识别(ASR)、语音活动检测(VAD)、标点恢复、语言模型、说话人验证、说话人分离及多…
Oryx – 腾讯联合清华和南洋理工大学推出的多模态大语言模型
Oryx是什么 Oryx是由清华大学、腾讯和南洋理工大学联合推出的多模态大型语言模型(MLLM),基于两项核心创新来处理视觉数据,预训练的OryxViT模型和动态压缩模块…
OmniAudio-2.6B – Nexa AI推出的端侧多模态音频语言模型
OmniAudio-2.6B是什么 OmniAudio-2.6B是Nexa AI推出的音频语言模型,专为边缘部署设计,能实现快速且高效的音频文本处理。OmniAudio-…
IFAdapter – 腾讯和新加坡国立大学联合推出的文本到图像生成模型
IFAdapter是什么 IFAdapter是一种新型的文本到图像生成模型,由腾讯和新加坡国立大学共同推出。提升生成含有多个实例的图像时的位置和特征准确性。传统模型在处理…
cogvlm2-llama3-caption – 智普AI开源的视频标注模型,生成文本描述
cogvlm2-llama3-caption是什么 cogvlm2-llama3-caption模型是一个基于CogVLM2架构的视频描述生成模型。模型用于理解视频内容,…
CleanS2S – 流式语音到语音交互智能体原型,同时进行听和说
CleanS2S是什么 CleanS2S是一个流式语音到语音(S2S)交互智能体原型,提供高质量、实时的语音交互体验。CleanS2S项目基于单文件实现,简化配置和理解过…
I2VEdit – AI视频编辑技术,基于扩散模型实现首帧编辑引导
I2VEdit是什么 I2VEdit是一个先进的视频编辑框架,通过图像到视频的扩散模型实现首帧引导的视频编辑。用户只需编辑视频的第一帧,I2VEdit能自动将编辑效果应用…
