Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: 商汤SenseNova-MARS开源:首个多模态自主推理模型,性能超越GPT-5.2与Gemini-3-Pro
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AI 工具 > 商汤SenseNova-MARS开源:首个多模态自主推理模型,性能超越GPT-5.2与Gemini-3-Pro
AI 工具AIGC 资讯

商汤SenseNova-MARS开源:首个多模态自主推理模型,性能超越GPT-5.2与Gemini-3-Pro

站外新闻
最近更新: 2026年6月7日 下午8:06
Agentic VLM 商汤科技 多模态模型 大模型开源 自主推理
SHARE

💡 站外导读:在AI技术竞赛白热化的今天,多模态模型已从简单的图文理解进化到需要复杂推理与执行的“智能体”阶段。然而,现有模型在面对需要多步骤、多工具协作的真实任务时,往往缺乏自主规划和动态调用能力,成为制约AI从“实验室Demo”走向“生产力工具”的关键瓶颈。商汤科技开源的SenseNova-MARS,正是为解决这一痛点而生,它首次将自主Agent能力与多模态深度推理相结合,标志着多模态AI进入“执行智能”新纪元。

SenseNova-MARS是什么

SenseNova-MARS是商汤科技开源的多模态自主推理模型,提供8B和32B两种参数规模。作为首个支持动态视觉推理与图文搜索深度融合的Agentic VLM,模型能像智能体一样自主规划任务步骤,灵活调用图像裁剪、文本搜索、图像搜索三大工具,无需人工干预可完成复杂的多跳推理。模型在MMSearch、HR-MMSearch、FVQA等七大基准测试中,SenseNova-MARS-32B以69.74分的平均成绩超越Gemini-3-Pro(69.06分)和GPT-5.2(67.64分),在开源模型中达到SOTA水平,标志着AI从”能回答”向”能执行”的重要跨越。

阅读目录
  • SenseNova-MARS是什么
  • SenseNova-MARS的主要功能
  • SenseNova-MARS的技术原理
  • SenseNova-MARS的项目地址
  • SenseNova-MARS的应用场景
      • 📝 站长洞察 (Editor’s Insight)

SenseNova-MARS

SenseNova-MARS的主要功能

  • 多模态搜索推理:模型融合图像与文本进行跨模态信息检索,支持动态调用工具完成复杂知识推理。
  • 细粒度视觉分析:支持处理4K/8K超高清图像,能精准裁剪、识别占比不足5%的微小视觉细节。
  • 自主Agent执行:模型能自主规划任务步骤,无缝协作多工具形成闭环,无需人工干预解决复杂问题。

SenseNova-MARS的技术原理

  • 双阶段训练架构:第一阶段通过约3,000个高质量多轮交互轨迹进行冷启动监督微调,使模型掌握基础工具使用模式;第二阶段用BN-GSPO强化学习算法,通过组内与批次双重归一化稳定训练过程,优化多工具协同调用与推理决策能力。
  • BN-GSPO强化学习算法:针对多工具场景中轨迹长度与奖励尺度差异导致的训练不稳定问题,算法先对同组样本进行组归一化消除内部偏差,再对整个批次进行归一化平衡不同任务的学习信号,实现稳定高效的多工具策略优化。
  • 动作空间与工具设计:模型每轮可在文本搜索、图像搜索、图像裁剪及终止回答四个动作中选择,图像裁剪通过归一化边界框坐标实现精准局部放大,所有工具调用均遵循严格的JSON格式规范确保交互一致性。
  • 奖励模型机制:模型采用GPT-4o作为评判器,从答案准确性与格式合规性两个维度提供稀疏奖励,准确性奖励衡量最终答案与 ground truth 的语义匹配度,格式奖励能确保每轮输出包含合规的思考过程与工具调用结构。
  • 自动化数据合成:基于多模智能体构建数据引擎,通过细粒度视觉锚点定位、多跳深度关联检索及闭环自洽性校验三个环节,自动挖掘跨网页实体逻辑并构建高复杂度推理链路,同时过滤幻觉数据保证训练数据质量。

SenseNova-MARS的项目地址

  • GitHub仓库:https://github.com/OpenSenseNova/SenseNova-MARS
  • HuggingFace模型库:
    • https://huggingface.co/sensenova/SenseNova-MARS-32B
    • https://huggingface.co/sensenova/SenseNova-MARS-8B
  • arXiv技术论文:https://arxiv.org/pdf/2512.24330

SenseNova-MARS的应用场景

  • 体育竞技分析:模型能识别赛车服微小logo并查询相关企业及车手背景信息,自动计算时间差值辅助赛事数据核实。
  • 商业情报挖掘:从峰会照片中识别企业标志,快速搜集产品参数与融资信息,辅助分析行业竞争格局。
  • 新闻事实核查:针对高分辨率新闻图片追溯事件背景与人物身份,验证社交媒体流传信息的真实性。
  • 学术研究与教育:自动分析论文图表数据并检索相关研究背景,加速文献综述与知识整合过程。
  • 地理旅行探索:识别地标路牌等细节并实时检索历史文化信息,提供沉浸式智能导览体验。

📝 站长洞察 (Editor’s Insight)

SenseNova-MARS的发布,不仅是一次技术基准的刷新,更揭示了多模态大模型发展的关键范式转移:从“被动应答”到“主动执行”。它通过创新的BN-GSPO强化学习算法与双阶段训练架构,解决了多工具场景下训练不稳定的核心难题,让模型像人类专家一样规划、搜索、裁剪、推理,形成闭环。这背后是商汤对“Agentic VLM”路径的深刻押注——未来的AI竞争,将不再是单一模型参数的比拼,而是谁能构建更稳定、更高效的“自主推理引擎”。结合其完整的开源生态(模型、代码、论文),SenseNova-MARS正以“基础设施”姿态,为开发者提供了一把解锁复杂场景应用的钥匙,其影响将远超学术榜单,直接催化商业情报、科研自动化等领域的生产力革命。

Hallo3 – 复旦联合百度开源的高动态与真实感肖像动画生成框架
腾讯Hunyuan-GameCraft:实时交互式游戏视频生成框架,键盘鼠标精准控制,支持百万级AAA游戏场景
s1 – 斯坦福和华盛顿大学推出低成本、高性能的AI推理模型
龙猫LongCat – 美团自主研发的生成式AI大模型
历史性和解!Meta妥协规避审判,美国首例学校诉社交媒体成瘾案落幕,揭示行业司法风向
TAGGED:Agentic VLM商汤科技多模态模型大模型开源自主推理
分享
Email 复制链接 打印
Share
上一篇 MOVA:中国首个端到端开源音视频生成大模型,320亿参数实现电影级口型同步
下一篇 阿里通义开源 Qwen3-ASR 语音识别模型:支持52语种方言,1.7B版达SOTA,0.6B版吞吐提升2000倍
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

OpenAI扩大ChatGPT家长通知,青少年暴力违规将触发提醒
AIGC 资讯
GPT‑5.4 – OpenAI推出面向专业工作的旗舰AI模型
AIGC 资讯
​YouTube 收紧政策,严打低质 AI 内容
AIGC 资讯
小鹏甩出TuringViT视觉编码器:只用十分之一数据,却把SOTA基线甩在身后
AIGC 资讯

相关推荐

AIGC 资讯

ReasonGraph – 开源可视化与分析LLMs推理过程的AI工具

站外新闻
AI 工具最新趋势

Claudable:开源Next.js Web应用构建器,用自然语言快速生成生产级代码,一键部署

站外新闻
Claude Code Next.js 一键部署 开源Web应用构建器 自然语言编程
AI 工具

Strut AI

remaker
AIGC 资讯

MiniMind – 开源的AI模型训练工具,2小时训练25.8M小模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent openai 多模态大模型 AI绘画 字节跳动 开源模型 开源工具 早报 具身智能 大语言模型 MoE架构 开源大模型 强化学习 阿里通义 Anthropic 腾讯混元 多模态AI 大模型 开源框架 AI智能体 教程 chatgpt AI工具 扩散模型 AI视频生成 蚂蚁集团 开源
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.