Google Vids引入Gemini Omni模型 上传自拍+音频就能定制专属数字分身
哪怕OpenAI的Sora可能已经退场,谷歌依旧认定,用户想在AI视频里亲自出镜的那股执念并没有降温。本周四,这家科技巨头给Google Vids甩出一套重磅更新:你只需…
DoorDash推出AI命令行工具dd-cli,可通过智能助手直接点餐
DoorDash推出AI命令行工具 DoorDash CLI(dd-cli)限量测试版,允许开发者通过AI智能助手直接完成外卖订购,包括搜索商家、查找优惠和完成结账等操作…
MimicTalk – 字节联合浙大推出的开源3D数字人头项目
MimicTalk是什么 MimicTalk是浙江大学和字节跳动共同研发推出基于NeRF(神经辐射场)技术,能在极短的时间内,仅需15分钟训练出个性化和富有表现力的3D说…
Wonder Animation – 视频序列转换成3D动画场景的AI解决方案
Wonder Animation是什么 Wonder Animation 是 Autodesk 旗下 Wonder Dynamics 推出的创新 AI 技术,Wonder…
TimeSuite – 上海AI Lab推出的提升MLLMs在长视频理解处理的设计框架
TimeSuite是什么 TimeSuite是上海AI Lab推出的新型框架,能提升多模态大型语言模型(MLLMs)在长视频理解任务中的表现。基于引入高效的长视频处理框架…
EMMA – Waymo推出的端到端自动驾驶多模态模型
EMMA是什么 EMMA是Waymo基于Gemini模型推出的端到端自动驾驶多模态模型,能将原始相机传感器数据直接映射到驾驶特定输出,如规划轨迹、感知对象和道路图元素。E…
DreamVideo-2 – 复旦和阿里联合多机构推出的零样本视频定制生成框架
DreamVideo-2是什么 DreamVideo-2是创新的零样本视频定制框架,复旦大学和阿里巴巴集团等机构联合推出。DreamVideo-2能根据单一图像和界定框序…
NotebookMLX – 将PDF文档转换成音频博客开源版的NotebookLM
NotebookMLX是什么 NotebookMLX是开源版本的NotebookLM,集成NotebookLlama的功能,能将PDF文档转换成易于理解和分享的音频播客形…
HOVER – 英伟达推出的通用人形机器人功能控制器1.5M小模型
HOVER是什么 HOVER是英伟达推出的1.5M小模型,全称为“Humanoid Versatile Controller”,即人形机器人的多功能全身神经通用控制器。模…
Voice Changer – Cartesia推出转换声音同时保留原始情感的变声器模型
Voice Changer是什么 Voice Changer是Cartesia推出的新模型,能将任何音频剪辑的语音转换成其他音色,且保留原始音频的情感和表达。用户从Car…
Oasis – Decart联合Etched推出首款AI实时生成的游戏系统
Oasis是什么 Oasis是世界上首款AI实时生成的游戏,由Decart和Etched联合推出。游戏能以每秒20帧的速度实时渲染交互式视频内容,无需游戏引擎,通过AI模…
夸克灵知大模型 – 夸克推出的AI学习大模型
夸克灵知大模型是什么 夸克灵知大模型是夸克公司全新推出的智能学习大模型,具备博士生级别的推理能力。基于AI技术为用户提供分步骤题目讲解,能随时回答问题。在考研数学等题目的…
OSAID 1.0 – OSI发布的全球首个开源 AI 官方标准1.0版本
OSAID 1.0是什么 OSAID 1.0(The Open Source AI Definition – 1.0)是Open Source Initiative(OS…
MobileLLM – Meta推出的适合移动端的语言模型
MobileLLM是什么 MobileLLM是Meta为移动设备用例优化设计的十亿参数以下的大型语言模型,能解决云成本上升和延迟问题。MobileLLM基于深薄架构、嵌入…
SmolLM2 – Hugging Face推出的紧凑型大语言模型
SmolLM2是什么 SmolLLM2是Hugging Face推出用在设备端应用的紧凑型大型语言模型,提供1.7B、360M、135M三个不同参数级别的模型,适应不同的…
Genmoai-smol – 对单GPU设备优化的开源AI视频生成模型
Genmoai-smol是什么 Genmoai-smol是开源视频生成模型,是Genmoai的txt2video模型的工作进展分支,专为单GPU设备优化,减少显存占用,在…
