DeepSeek-V2.5 – DeepSeek开源的融合通用和代码能力的AI模型
DeepSeek-V2.5是什么 DeepSeek-V2.5 是DeepSeek推出的融合通用与代码能力的全新开源模型。保留了之前 Chat 模型的通用对话能力以及 Co…
FunAudioLLM – 阿里巴巴通义团队推出的开源语音大模型
FunAudioLLM是什么 FunAudioLLM是阿里巴巴通义实验室推出的开源语音大模型项目,包含SenseVoice和CosyVoice两个模型。SenseVoic…
全双工实时语音上线,ChatGPT彻底告别“对讲机”时代
OpenAI 近日正式向全球用户推出基于 GPT-Live 架构的全新 ChatGPT 语音体验。这不仅是语音技术路线的一次重要更迭,更标志着 AI 语音助手正从传统的“…
谷歌相册推出AI“视频混音”功能:搭载Gemini Omni,主打数秒内电影级剪辑
谷歌于7月8日宣布在Google Photos中推出全新生成式AI视频编辑工具“视频混音”(Video Remix),旨在让普通用户无需专业技能即可在数秒内完成电影级视频…
PortraitGen – 中科大推出的AI人像视频编辑工具
PortraitGen是什么 PortraitGen是中国科学技术大学研究团队推出的一款AI人像视频编辑工具。基于3D高斯溅射技术和神经高斯纹理机制,将2D人像视频转换为…
挑战OpenAI,SpaceXAI推出“Opus级”大模型Grok 4.5
本周,AI大模型赛道硝烟再起。当地时间周三,埃隆·马斯克旗下的科技公司SpaceXAI正式发布了最新一代大模型Grok4.5。这是该公司在数周前上市以来的首次重磅产品更新…
调用量火爆致算力承压,WorkBuddy 完成腾讯混元 Hy3 模型紧急扩容
WorkBuddy 与腾讯混元联合项目团队发布公告称,因平台首发搭载的混元 Hy3 大模型用户调用需求远超预期,算力资源出现高峰拥堵,项目组已火速完成算力扩容调度,保障服…
瑞典“氛围编码”初创公司Lovable拟融资3亿美元,估值或达132亿美元
瑞典“氛围编码”(Vibe-coding)人工智能初创公司Lovable正展开新一轮高达3亿美元的融资谈判。若此轮融资顺利完成,该公司估值将直接翻倍,由去年12月的66亿…
StyleStudio – 文本驱动的风格迁移模型,能将参考图像的风格与文本提示内容融合
StyleStudio是什么 StyleStudio是西湖大学AI实验室、复旦大学、南洋理工大学和香港科技大学(广州)联合推出的,文本驱动的风格迁移模型,能将参考图像的风…
MetaHuman-Stream – 实时交互流式AI数字人技术
MetaHuman-Stream是什么 MetaHuman-Stream 是一项前沿的实时交互流式AI数字人技术,集成了 ERNerf、MuseTalk、Wav2lip …
Bolt․new – AI全栈 Web 编程工具,自动写代码、运行、部署
Bolt․new是什么 Bolt․new 是一个AI全栈 Web 编程工具,自动编写代码、运行、编辑和部署应用程序。Bolt․new依托于 WebContainers 技…
M2UGen – 腾讯联合国立大学推出多模态音乐理解和生成框架
M2UGen是什么 M2UGen是先进的多模态音乐理解和生成框架,由腾讯PCG ARC实验室与新加坡国立大学联合推出。结合了大型语言模型(LLM)的能力,能处理包括文本、…
Parler-TTS – Hugging Face开源的文本转语音模型
Parler-TTS是什么 Parler-TTS是由Hugging Face推出的一款开源的文本到语音(TTS)模型,能够通过输入提示描述模仿特定说话者的风格(性别、音调…
CogView-3-Plus – 智谱AI最新推出的AI文生图模型,媲美 MJ-V6 和 FLUX
CogView-3-Plus是什么 CogView-3-Plus是智谱AI最新推出的AI文生图模型,采用Transformer架构替代传统UNet,优化了扩散模型的噪声规…
百度智能云一见 – 百度推出的AI视觉大模型平台
百度智能云一见是什么 百度智能云一见是百度智能云推出的视觉大模型平台,旨在基于领先的视觉大模型技术和丰富的场景化算法方案,实现专业级视觉AI应用的平民化。平台打通从模型生…
MLE-Agent – 工程师的AI智能助手,自动创建基线模型
MLE-Agent是什么 MLE-Agent 是一款专为机器学习工程师和研究人员设计的智能助手,通过自动化基线创建、集成最新研究资源、智能调试、文件系统和工具集成,以及交…
