BlinkShot – 开源的实时AI图像生成器,几毫秒内生成高质量图像
BlinkShot是什么 BlinkShot是实时AI图像生成器,能迅速生成高质量的图像。用户只需输入提示,BlinkShot能在几毫秒内生成图像。工具基于Togethe…
NotebookLlama – Meta推出的PDF转播客内容的开源项目
NotebookLlama是什么 NotebookLlama是Meta推出的将PDF文档转换成播客内容的开源项目。项目基于一系列自动化步骤实现,用LLaMa模型进行PDF…
WonderWorld – 斯坦福和MIT联合推出的生成多样化连贯3D场景AI框架
WonderWorld是什么 WonderWorld是斯坦福大学和麻省理工学院共同推出的创新性3D场景生成框架,能从单张图片快速生成多样化且连贯的3D虚拟世界。基于核心的…
StaffDeck – 面壁智能等开源的企业级数字员工平台
StaffDeck是什么 StaffDeck 是面壁智能联合东北大学-面壁智能数据智能联合实验室、清华大学 THUNLP 实验室、OpenBMB 与 AI9Stars 开…
Wan-Streamer v0.2 – 阿里通义推出的全模态理解与生成模型
Wan-Streamer v0.2是什么 Wan-Streamer v0.2 是阿里通义实验室推出的面向实时双工交互的端到端全模态理解与生成模型。模型将”听、看、说、演”…
Meissonic – 阿里联合多所高校推出的文本到图像合成模型
Meissonic是什么 Meissonic是由阿里巴巴集团、Skywork AI等多所大学合作推出的文本到图像合成模型。基于掩蔽图像建模技术,结合多模态和单模态Tran…
Zamba2-7B – Zyphra推出的小型语言模型
Zamba2-7B是什么 Zamba2-7B是Zyphra公司推出的小型语言模型,基于创新的架构在保持输出质量的同时实现快速的推理速度和低内存占用。模型在处理图像描述等任…
PersonaTalk – 字节跳动推出的实现高保真和个性化视觉配音框架
PersonaTalk是什么 PersonaTalk是字节跳动推出的基于注意力机制的两阶段框架,用在实现高保真度和个性化的视觉配音。PersonaTalk能在合成与目标音…
Nemotron 3 Embed – 英伟达开源的文本嵌入模型系列
Nemotron 3 Embed 是什么 Nemotron 3 Embed 是 NVIDIA 开源的文本嵌入模型系列,专为检索增强生成与智能体检索设计。模型包含 8B 和…
OpenSPG – 蚂蚁联合OpenKG开源的知识图谱引擎
OpenSPG是什么 OpenSPG是蚂蚁集团联合OpenKG社区推出的基于SPG框架的知识图谱引擎。OpenSPG融合LPG的结构性和RDF的语义性,克服RDF/OWL…
LongVU – Meta AI开源的长视频理解模型
LongVU是什么 LongVU是Meta AI团队推出的长视频理解模型,基于时空自适应压缩机制。解决处理长视频时受限于大型语言模型(LLM)上下文大小的挑战。LongV…
重庆上线“渝小健”AI就医智能体,覆盖233家公立医院
7月17日,重庆市卫生健康委员会正式上线便捷就医智能体“渝小健”,面向全市居民提供AI辅助就医服务。市民可通过支付宝App或阿福App搜索“渝小健”,使用智能导诊、云陪诊…
NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本登顶 RTEB 检索基准
NVIDIA 近日发布了 Nemotron3Embed 系列嵌入向量模型,专为生产级 RAG、智能体检索、代码检索及智能体记忆等场景设计。其中8B 版本在检索嵌入基准测试…
得物App联合千觉机器人发布AI鉴别机器人,亮相WAIC 2026
2026 世界人工智能大会(WAIC 2026)在上海开幕,得物App联合千觉机器人发布全球首个AI鉴别机器人,探索人工智能与具身智能在商品鉴别领域的应用。该机器人基于得…
SynthID Text – 谷歌DeepMind推出的AI生成文本水印技术
SynthID Text 是什么 SynthID Text 是谷歌DeepMind 推出的文本水印技术,用在识别和验证由大型语言模型(LLM)生成的文本。基于细微调整生成…
银河通用机器人创始人王鹤: 2028 年,具身智能的 “ChatGPT 时刻” 即将来临!
在 2026 世界人工智能大会上,银河通用机器人的创始人兼首席技术官王鹤分享了他的未来预测。他认为,具身智能技术将在 2028 年前迎来重大突破,届时,这种智能系统的表现…
