VideoGameBunny – 专为视频游戏设计的开源多模态大模型
VideoGameBunny是什么 VideoGameBunny(VGB)是一个专为视频游戏设计的开源大型多模态模型,由加拿大阿尔伯塔大学研究团队开发。它能理解和生成多种…
Unique3D – 清华大学团队开源的图像到3D生成模型
Unique3D是什么 Unique3D是清华大学团队开源的一个单张图像到3D模型转换的框架,通过结合多视图扩散模型和法线扩散模型,以及一种高效的多级上采样策略,能够从单…
MotionCtrl – 腾讯等推出的视频生成模型的运动控制器
MotionCtrl是什么 MotionCtrl是由来自腾讯、香港大学、上海AI实验室、清华大学、广东工业大学等机构的研究人员推出的一个为视频生成模型设计的统一且灵活的运…
亚马逊被爆开发AI智能体“Moonraker”:Alexa将支持多步复杂任务串联
据科技媒体爆料,亚马逊正在秘密推进一项代号为“Moonraker”的先进人工智能智能体(AI Agent)项目,旨在赋予智能语音助手 Alexa 串联执行复杂任务的能力。…
AI”按量计费”吓退企业高管:近三分之一承认不懂经济账,算力账单成了黑箱
据外媒The Register报道,"四大"会计师事务所毕马威的一项最新调查显示,不少企业高管正被AI新的按量计费模式"吓"到。过去企业可以通过固定价格合同让AI公司补贴…
豆包3D生成模型 – 豆包推出3D生成模型,自然语言交互实时生成3D场景图
豆包3D生成模型是什么 豆包3D生成模型是豆包推出的3D生成模型,属于豆包大模型家族。模型基于3D-DiT 架构,能生成高质量 3D 模块。与火山引擎数字孪生平台 veO…
MovieDreamer – 专为长视频研发的AI视频生成框架
MovieDreamer是什么 MovieDreamer是浙江大学联合阿里巴巴专为长视频研发的AI视频生成框架。结合自回归模型和扩散渲染技术,能生成具有复杂情节和高视觉质…
PyVideoTrans – 开源的视频翻译和配音工具,支持多种语言
PyVideoTrans是什么 PyVideoTrans 是开源的视频翻译配音工具,将视频内容从一种语言自动翻译成另一种语言,并添加相应的字幕和配音。PyVideoTra…
LATTE3D – 英伟达推出的文本快速生成3D对象的模型
LATTE3D是什么 LATTE3D是由英伟达的多伦多AI实验室的研究人员推出的一个文本生成3D对象的模型,能够从文本提示描述快速生成高质量的3D内容(仅需400毫秒)。…
Sapiens – Meta推出的AI视觉模型,能理解图片和视频中的人类动作
Sapiens是什么 Sapiens是Meta实验室推出的AI视觉模型,专为理解图片和视频中的人类动作设计。支持二维姿势预估、身体部位分割、深度估计和表面法线预测等任务,…
LanceDB – 为AI应用设计的无服务器向量数据库,降低运维成本
LanceDB是什么 LanceDB 是一款专为人工智能应用设计的无服务器向量数据库,支持向量搜索、全文搜索和SQL查询,优化了多模态数据处理。它采用向量索引技术,实现高…
琴乐大模型 – 腾讯推出的AI音乐创作大模型
琴乐大模型是什么 琴乐大模型是由腾讯AI Lab与腾讯TME天琴实验室共同研发的人工智能音乐创作大模型,该模型通过输入中英文关键词、描述性语句或音频,能够直接生成立体声音…
AnimateDiff – 扩展文生图模型生成动画的框架
AnimateDiff是什么? AnimateDiff是由上海人工智能实验室、香港中文大学和斯坦福大学的研究人员推出的一款将个性化的文本到图像模型扩展为动画生成器的框架,…
一个普通摄像头就能自主导航:Mistral发布8B模型Robostral Navigate,性能碾压多摄像头方案
法国AI企业Mistral发布首款面向机器人导航的AI模型Robostral Navigate,总参数量仅8B。这款模型让机器人仅凭单个普通RGB摄像头,就能在复杂环境中…
MV-Adapter – 北航联合 VAST 等开源的多视图一致图像生成模型
MV-Adapter是什么 MV-Adapter是多视图一致图像生成模型,是北京航空航天大学、VAST和上海交通大学的研究团队推出的。MV-Adapter能将预训练的文本…
Glyph-ByT5 – 多语言视觉文本渲染项目
Glyph-ByT5是什么 Glyph-ByT5-v2由微软亚洲研究院、清华大学、北京大学和利物浦大学联合开发的多语言视觉文本渲染项目。Glyph-ByT5-v2支持10…
