TEN Agent – 开源的实时多模态 AI 代理框架
TEN Agent是什么 TEN Agent是集成OpenAI Realtime API和RTC技术的开源实时多模态AI代理框架。TEN Agent能实现语音、文本、图像…
FLOAT – 基于流匹配的音频驱动说话人头像生成模型
FLOAT是什么 FLOAT是DeepBrain AI 和韩国先进科技研究院推出的音频驱动说话人头像生成模型,基于流匹配生成模型,学习运动潜在空间实现高效的时间一致性运动…
谷歌发布LiteRT.js:浏览器跑AI推理最高快 3 倍,WebAssembly硬核加速
谷歌正式发布全新Web端AI推理加速库LiteRT.js。该库采用WebAssembly技术,并深度结合WebGPU与WebNN等硬件加速能力,旨在替代TensorFlo…
SensorFM – 谷歌推出面向可穿戴健康数据的通用基础模型
SensorFM是什么 SensorFM 是 Google Research 推出的面向可穿戴健康数据的大型传感器基础模型,基于 500 万参与者、超 1 万亿分钟无标签…
SynCamMaster – 快手联合浙大、清华等机构推出的多视角视频生成模型
SynCamMaster是什么 SynCamMaster是浙江大学、快手科技、清华大学和香港中文大学的研究人员共同合作推出的全球首个多视角视频生成模型,能结合6自由度相机…
STIV – 苹果公司推出的视频生成大模型
STIV是什么 STIV(Scalable Text and Image Conditioned Video Generation)是苹果公司推出的视频生成大模型。STI…
DiffSensei – AI 漫画生成框架,能生成可控的黑白漫画面板
DiffSensei是什么 DiffSensei是北京大学、上海AI实验室及南洋理工大学的研究人员共同推出的漫画生成框架,能生成可控的黑白漫画面板。DiffSensei整…
Maya – 开源多语言多模态模型,能处理和理解八种不同语言
Maya是什么 Maya是开源的多语言多模态模型,基于指令微调扩展模型在多种语言和文化背景下的能力。Maya基于LLaVA框架,包含新创建的包含八种语言的预训练数据集,提…
千影 QianYing – 巨人网络推出的有声游戏生成大模型
千影 QianYing是什么 千影 QianYing是巨人网络推出的有声游戏生成大模型,包含游戏视频生成大模型YingGame和视频配音大模型YingSound。Ying…
GPT-5. 6 今日全量开放:三档定价碾压竞品,AI开发正式进入”性价比”新阶段
OpenAI正式向全球全量开放GPT-5. 6 系列模型,一口气推出旗舰版Sol、均衡版Terra和性价比版Luna三款产品, 24 小时内陆续覆盖ChatGPT、Cod…
马斯克公开认错”看走眼”:Anthropic才是AI老大,我不会拔它服务器
马斯克在社交平台X上罕见地公开承认自己看错了Anthropic。他不仅称赞对方"显然是目前AI领域的领导者",还明确承诺不会因竞争关系切断Anthropic的服务器服务,…
MiniMax完成160亿港元新一轮融资,创始人闫俊杰宣布零薪酬直至实现AGI
MiniMax正式宣布完成新一轮160亿港元融资。根据公告,公司拟将募集资金净额的80%投入AI基础设施及模型研究与开发,进一步夯实技术底座。同日,MiniMax创始人兼…
Promptic – 轻量级LLM应用开发框架,通过一行代码切换不同LLM
Promptic是什么 Promptic是轻量级的LLM应用开发框架,提供高效且符合Python风格的开发方式。基于LiteLLM,Promptic支持开发者能轻松切换不…
吸金 20 亿美元!MiniMax完成 160 亿港元新一轮融资,获超 7 倍超额认购
中国大模型独角兽企业 MiniMax 已于今日上午正式完成新一轮总额高达160亿港元(折合超20亿美元)的融资。本次巨额资金注入将全面补充 MiniMax 的资金储备,为…
SwiftEdit – AI文本引导图像编辑框架,0.23秒内实现高质量的图像编辑
SwiftEdit是什么 SwiftEdit是VinAI Research团队推出的文本引导的图像编辑框架,基于创新的一步扩散技术,能在0.23秒内实现快速且高质量的图像…
LingBot-VLA 2.0 – 蚂蚁灵波开源的新一代具身智能基座模型
LingBot-VLA 2.0是什么 LingBot-VLA 2.0 是蚂蚁灵波科技开源的新一代具身智能基座模型,基于6万小时预训练数据,包含5万小时真机数据与1万小时人…
