DreamVideo-2 – 复旦和阿里联合多机构推出的零样本视频定制生成框架
DreamVideo-2是什么 DreamVideo-2是创新的零样本视频定制框架,复旦大学和阿里巴巴集团等机构联合推出。DreamVideo-2能根据单一图像和界定框序…
NotebookMLX – 将PDF文档转换成音频博客开源版的NotebookLM
NotebookMLX是什么 NotebookMLX是开源版本的NotebookLM,集成NotebookLlama的功能,能将PDF文档转换成易于理解和分享的音频播客形…
HOVER – 英伟达推出的通用人形机器人功能控制器1.5M小模型
HOVER是什么 HOVER是英伟达推出的1.5M小模型,全称为“Humanoid Versatile Controller”,即人形机器人的多功能全身神经通用控制器。模…
Voice Changer – Cartesia推出转换声音同时保留原始情感的变声器模型
Voice Changer是什么 Voice Changer是Cartesia推出的新模型,能将任何音频剪辑的语音转换成其他音色,且保留原始音频的情感和表达。用户从Car…
Oasis – Decart联合Etched推出首款AI实时生成的游戏系统
Oasis是什么 Oasis是世界上首款AI实时生成的游戏,由Decart和Etched联合推出。游戏能以每秒20帧的速度实时渲染交互式视频内容,无需游戏引擎,通过AI模…
夸克灵知大模型 – 夸克推出的AI学习大模型
夸克灵知大模型是什么 夸克灵知大模型是夸克公司全新推出的智能学习大模型,具备博士生级别的推理能力。基于AI技术为用户提供分步骤题目讲解,能随时回答问题。在考研数学等题目的…
OSAID 1.0 – OSI发布的全球首个开源 AI 官方标准1.0版本
OSAID 1.0是什么 OSAID 1.0(The Open Source AI Definition – 1.0)是Open Source Initiative(OS…
MobileLLM – Meta推出的适合移动端的语言模型
MobileLLM是什么 MobileLLM是Meta为移动设备用例优化设计的十亿参数以下的大型语言模型,能解决云成本上升和延迟问题。MobileLLM基于深薄架构、嵌入…
SmolLM2 – Hugging Face推出的紧凑型大语言模型
SmolLM2是什么 SmolLLM2是Hugging Face推出用在设备端应用的紧凑型大型语言模型,提供1.7B、360M、135M三个不同参数级别的模型,适应不同的…
Genmoai-smol – 对单GPU设备优化的开源AI视频生成模型
Genmoai-smol是什么 Genmoai-smol是开源视频生成模型,是Genmoai的txt2video模型的工作进展分支,专为单GPU设备优化,减少显存占用,在…
VirSci – 上海人工智能实验室推出的多智能体AI科学研究工具
VirSci是什么 VirSci(Virtual Scientists)是上海人工智能实验室推出的多智能体AI科学研究工具,基于模拟科学家团队的合作过程加速科研创新。系统…
Self-Lengthen – 阿里千问推出的提升输出长度迭代训练框架
Self-Lengthen是什么 Self-Lengthen是阿里巴巴千问团队推出的创新的迭代训练框架,能提升大型语言模型(LLMs)生成长文本的能力。框架基于两个角色,…
Amphion – 开源的全能AI音频项目,面向音频、音乐和语音生成的工具包
Amphion是什么 Amphion是开源的音频、音乐和语音生成工具包,是香港中文大学(深圳)副教授武执政团队联合上海人工智能实验室和深圳市大数据研究院共同推出的。工具包…
LongReward – 清华、中科院、智谱AI联合推出提升长文本大语言模型性能的方法
LongReward是什么 LongReward是清华大学、中国科学院、智谱AI联合推出的,基于AI反馈改进长文本大型语言模型(LLMs)性能的方法。LongReward…
Fish Agent – Fish Audio推出的端到端语音处理模型
Fish Agent是什么 Fish Agent是Fish Audio推出的创新的端到端语音处理模型,集成自动语音识别(ASR)和文本到语音(TTS)技术,无需传统的语义…
MeetingMind – AI会议助手,自动捕捉、分析和处理会议见解
MeetingMind是什么 MeetingMind是AI驱动的会议助手,基于录音和文件上传功能自动转录会议音频,从中提取关键信息,如任务、决策和问题,帮助用户轻松捕获和…
