DAM-3B – 英伟达推出的多模态大语言模型
DAM-3B是什么 DAM-3B(Describe Anything 3B)是英伟达推出的多模态大语言模型,专为生成图像和视频中特定区域的详细描述设计。模型通过点、边界框…
LegoGPT – 卡内基梅隆大学推出的乐高积木设计模型
LegoGPT是什么 LegoGPT 是卡内基梅隆大学推出的乐高积木设计模型,支持基于文本提示生成物理稳定且能构建的乐高积木模型。LegoGPT 基于自回归语言模型和大规…
HoloTime – 北大联合鹏城实验室推出的全景4D场景生成框架
HoloTime是什么 HoloTime 是北京大学深圳研究生院和鹏城实验室推出的全景 4D 场景生成框架,基于视频扩散模型将单张全景图像转化为具有真实动态效果的全景视频…
Command A+ – Cohere Labs 开源的多模态大模型
Command A+是什么 Command A+ 是 Cohere Labs 推出的开源多模态大模型,采用混合专家架构,总参数量 218B、激活参数仅 25B,兼顾强大性…
Cooragent – 清华 LeapLab 开源的 AI Agent 协作框架
Cooragent是什么 Cooragent是由清华大学LeapLab团队推出的开源AI Agent协作框架。用户基于简单的一句话描述快速创建Agent,支持Agent之…
BILIVE – 开源AI录播工具,一站式自动直播录制与处理
git clone --recurse-submodules https://github.com/timerring/bilive.git cd bilive pip …
T2I-R1 – 港中文联合上海AI Lab推出文生图模型
T2I-R1是什么 T2I-R1 是香港中文大学和上海AI Lab联合推出的新型文本生成图像模型。基于引入双层推理机制,语义级链式思维(CoT)和 Token 级 CoT…
FreeLLMAPI – 开源 AI 模型聚合平台,统一OpenAI兼容格式
FreeLLMAPI是什么 FreeLLMAPI 是开源的 OpenAI 兼容代理服务,可将约 14 家 AI 服务商的免费额度聚合为单一 API 端点,每月总计约 13…
LTXV-13B – Lightricks开源的最新视频生成模型
LTXV-13B是什么 LTXV-13B 是Lightricks推出的开源 AI 视频生成模型,拥有 130 亿参数。具备极高的生成速度,比同类产品快 30 倍,能在普通…
Cobra – 清华、港中文和腾讯开源的漫画线稿上色框架
Cobra是什么 Cobra(Efficient Line Art COlorization with BRoAder References)是清华大学、香港中文大学和腾…
PilotDeck – 清华联合面壁智能开源的 Agent 操作系统
PilotDeck是什么 PilotDeck 是清华大学THUNLP实验室、面壁智能、OpenBMB与AI9stars联合开源的智能体操作系统。PilotDeck以Wor…
PixelHacker – 华中科技联合VIVO推出的图像修复模型
PixelHacker是什么 PixelHacker 是华中科技大学和 VIVO AI Lab联合推出的图像修复(Image Inpainting)模型。基于引入潜在类别…
KeySync – 帝国理工联合弗罗茨瓦夫大学推出的口型同步框架
KeySync是什么 KeySync 是帝国理工学院和弗罗茨瓦夫大学推出的用在高分辨率口型同步框架,支持将输入音频与视频中的口型动作对齐。KeySync 基于两阶段框架实…
Polar – 英伟达开源的智能体强化学习训练框架
Polar是什么 Polar 是英伟达推出的开源智能体强化学习(Agentic RL)训练框架,核心创新在于无需修改现有智能体框架内部代码,可将其接入 GRPO 等 RL…
ZenCtrl – Fotographer AI 推出的商品图生成AI工具
ZenCtrl是什么 ZenCtrl 是 Fotographer AI 推出的 AI 图像生成工具,支持从单张图像生成高质量、多视角和多样化场景的图像,无需额外训练数据。…
MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型
MAI Transcribe-1.5是什么 MAI-Transcribe-1.5 是 微软 AI 团队自研的语音转文本模型,支持 43 种语言,具备上下文感知的关键词偏置…
