具身智能新突破:蚂蚁集团开源LingBot-Vision,让机器人拥有“空间感”
在具身智能领域,如何让机器人像人类一样精准感知物理空间,一直是一个核心难题。近日,蚂蚁集团旗下的具身智能公司Robbyant正式开源了LingBot-Vision模型家族…
DeepSeek V3 – DeepSeek开源的最新版 AI 模型,编程能力超越Claude
DeepSeek V3是什么 DeepSeek V3是知名私募巨头幻方量化旗下人工智能公司深度求索(DeepSeek)开源的最新版AI模型,在多语言编程能力上的进步显著。…
3DHM – 3D人体动作生成框架,单张图片生成任意视频动作
3DHM是什么 3DHM(3D Human Motions)是先进的3D人体动作生成技术,加州大学伯克利分校的研究人员推出。能从单张人物照片生成具有3D控制的动态人体视频…
Diff-Instruct – 从预训练扩散模型中迁移知识的通用框架
Diff-Instruct是什么 Diff-Instruct是先进的知识转移方法,用于从预训练的扩散模型中提取知识,指导其他生成模型的训练。它基于一种新的散度度量——积分…
VidTok – 微软开源的视频分词器,支持连续和离散分词化
VidTok是什么 VidTok(Video Tokenizer)是微软开源的先进的视频分词器,通过高效的算法将视频内容转换成一系列“视频词”。支持连续和离散分词化,具有…
美国政府松绑GPT-5.6:商务部正式放行,OpenAI本周全面推出
据Axios报道,美国商务部已正式批准OpenAI大规模发布其先进AI模型GPT-5.6,预计本周内完成最后准备工作后正式向公众推出。此前出于国家安全考量,美国政府曾要求…
Infinity – 字节跳动推出的高分辨率图像生成模型
Infinity是什么 Infinity是字节跳动推出的基于位级自回归建模的视觉生成模型,能根据语言指令生成高分辨率、逼真的图像。Infinity通过无限词汇量的标记器、…
强强联手:SpaceXAI 与 Cursor 联手打造 AI 模型,性能或直追 GPT-5.5
在人工智能领域竞争愈发激烈的背景下,科技界迎来了一次重磅合作。据悉,SpaceXAI 正与代码编辑器 Cursor 展开深度技术联手,共同开发一款全新的 AI 模型。有消…
腾讯混元多模态团队再添强援,OpenAI 前研究员田永龙被曝加入
近日,业内传出重磅人事动态:OpenAI 前研究员田永龙(Yonglong Tian)已于近期加入腾讯,或将出任腾讯混元多模态模型方向的负责人,并主导视觉语言模型(VLM…
ModernBERT – 英伟达和 HuggingFace 等机构联合开源的新一代编码器模型
ModernBERT是什么 ModernBERT是Answer.AI、LightOn、约翰斯·霍普金斯大学、英伟达和HuggingFace联合推出的现代编码器-only …
Anthropic纽约大扩军:租赁曼哈顿 16 层办公楼,员工规模翻番至 1000 人
美国人工智能公司Anthropic于当地时间 7 月 7 日宣布,将租赁位于纽约曼哈顿哈德逊街 330 号的一栋 16 层办公楼,并计划在今年将纽约员工规模扩大一倍至 1…
cobalt – 开源免费的图片、音频和视频下载工具
cobalt是什么 cobalt是开源免费的图片、音频和视频下载工具,提供纯净、简洁无广告的体验。cobalt支持全平台视频、音频和图片下载,包括主流视频网站、社交媒体和…
告别云端焦虑:本地优先的桌面 AI 助手 Rowboat 如何重塑你的工作台?
在当今 AI 工具层出不穷的时代,你是否也对云端数据隐私感到担忧,或是厌倦了每次使用都要经历繁琐的冷启动过程?最近,一款名为 Rowboat 的开源桌面 AI 助手引起了…
英伟达推出统一音频智能模型 Nemotron-Labs-Audex-30B-A3B
在多模态大模型快速迭代的今天,音频处理能力往往容易被“牺牲”——很多模型在增强音频理解的同时,却导致了文本逻辑能力的下降。近日,NVIDIA 研究团队正式发布了一款名为 …
CogAgent-9B – 智谱AI开源 GLM-PC 的基座模型
CogAgent-9B是什么 CogAgent-9B是基于 GLM-4V-9B 训练的专用Agent任务模型,仅依赖屏幕截图作为输入,无需HTML等文本表征。CogAge…
蚂蚁集团周俊:万亿参数模型从“追求数量”迈向“深耕密度”
在近日举行的 AICon 大会上,蚂蚁集团副总裁周俊发表了一场引人注目的演讲,聚焦于如何提升万亿参数模型的效率。周俊提到,现代 AI 模型的算力消耗惊人,尤其是万亿参数模…
