SeedFoley – 字节推出的端到端视频音效生成模型
SeedFoley是什么 SeedFoley 是字节跳动豆包大模型语音团队开发的端到端视频音效生成模型,为视频创作提供智能音效生成服务。通过融合时空视频特征与扩散生成模型…
ICEdit – 浙江大学联合哈佛大学推出的指令式图像编辑框架
ICEdit是什么 ICEdit(In-Context Edit)是浙江大学和哈佛大学推出的指令式图像编辑框架。基于大规模扩散变换器(Diffusion Transfor…
Cosmos-Reason1 – NVIDIA推出的系列多模态大语言模型
Cosmos-Reason1是什么 Cosmos-Reason1 是NVIDIA推出的系列多模态大语言模型,模型能生成基于物理现实的响应。Cosmos-Reason1 包…
Data Formulator – 微软研究院开源的 AI 数据可视化工具
Data Formulator是什么 Data Formulator是微软研究院推出的开源 AI 驱动的数据可视化工具,帮助用户通过简单交互和指令快速创建丰富的数据可视化…
AutoRAG – Cloudflare 推出的全托管检索增强生成服务
AutoRAG是什么 AutoRAG 是Cloudflare推出的全托管的检索增强生成(RAG)管道,帮助开发者轻松将上下文感知的 AI 集成到应用程序中,无需管理基础设…
Proxy Lite – 开源视觉语言模型,支持自动化网页任务
Proxy Lite是什么 Proxy Lite 是开源的轻量级视觉语言模型(VLM),参数量为3B,支持自动化网页任务。Proxy Lite 能像人类一样操作浏览器,完…
Reka Flash 3 – Reka AI 推出的开源推理模型
Reka Flash 3是什么 Reka Flash 3 是 Reka AI 推出的开源推理模型,拥有 21 亿参数。支持多模态输入,包括文本、图像、视频和音频,可处理最…
Instella – AMD开源的30亿参数系列语言模型
Instella是什么 Instella是AMD推出的系列30亿参数的开源语言模型。模型完全从零开始在AMD Instinct™ MI300X GPU上训练而成,基于自回…
Concept Lancet – 宾夕法尼亚大学推出的图像编辑框架
Concept Lancet是什么 Concept Lancet(CoLan)是宾夕法尼亚大学的研究团队推出的零样本、即插即用的图像编辑框架。Concept Lancet…
NLWeb – 微软推出支持自然语言与任何网站交互的开源项目
NLWeb是什么 NLWeb 是微软推出的开源项目,基于简化网站自然语言界面的创建,让任何网站都能变成 AI 驱动的应用程序。NLWeb用 Schema.org、RSS …
Cua – 专为 MacOS 推出的开源 AI Agent项目
Cua是什么 Cua 是 trycua 团队推出的开源AI Agent项目,为 macOS 用户提供高性能的虚拟化和 AI 代理功能。Cua基于苹果的 Virtualiz…
SongGen – 上海 AI Lab 和北航、港中文推出的歌曲生成模型
SongGen是什么 SongGen是上海AI Lab、北京航空航天大学和香港中文大学推出的单阶段自回归Transformer模型,用在从文本生成歌曲。SongGen基于…
Kimi Latest – Kimi推出的实时更新AI模型,与Kimi智能助手同步
Kimi Latest是什么 Kimi Latest是月之暗面Kimi推出的实时更新AI模型,为用户提供同步对标Kimi智能助手的模型体验。支持128k上下文长度,可根据…
MineWorld – 微软研究院开源的实时交互式世界模型
MineWorld是什么 MineWorld是微软研究院开源的基于《我的世界》(Minecraft)的实时交互式世界模型,基于视觉-动作自回归Transformer架构,…
AvatarGO – 南洋理工联合上海 AI Lab 等推出的4D人体与物体交互生成框架
AvatarGO是什么 AvatarGO 是南洋理工大学S-Lab、上海 AI Lab,香港大学联合推出的新型框架,用在从文本输入直接生成可动画化的 4D 人体与物体交互…
R1-Omni – 阿里通义开源的全模态大语言模型
R1-Omni是什么 R1-Omni 是阿里通义推出的基于强化学习(RLVR)的全模态大语言模型,专注于情感识别任务。通过结合视觉和音频信息,能清晰地解释情感识别的推理过…
