MineExplorer是什么
MineExplorer美团LongCat团队推出的,首个基于Minecraft的开放世界分钟级长程任务评测基准。MineExplorer包含813个1-4跳人工验证实例,任务含隐藏前置条件,指令不枚举依赖图,需模型自主推断子任务。MineExplorer主动剥离游戏专有知识,仅测通用动态探索能力。配套五智能体协作数据合成与规则化里程碑自动评测框架,代码与数据集现已开源。
阅读目录

MineExplorer的主要功能
-
分钟级开放世界评测:基于Minecraft实时3D沙盒,每个任务运行1800环境步,模型需根据动态画面持续调整策略。
-
隐藏前置多跳任务:提供813个1-4跳人工验证实例,指令仅给出最终目标,隐藏前置子任务,需模型自主推断依赖图。
-
知识解耦评测:主动剥离Minecraft专有机制,仅保留依赖通用世界常识的任务。
-
规则化自动评测:将子任务转化为可自动执行的里程碑检查器,实现无需人工标注的自动评分。
-
多智能体数据合成:五Agent协作自动生成任务,包含任务选择、场景设计、里程碑设计、专家审查与验证全流程。
MineExplorer的技术原理
-
动态环境交互架构:评测环境为实时运行的物理沙盒,非静态截图问答;模型每执行一个动作,世界状态即时更新,且基于最新观测进行持续决策。
-
隐式DAG任务建模:每个复合任务定义为四元组τ=(q,s₀,Gτ,Mτ),Gτ为任务依赖图,关键设计在于指令q不枚举DAG中所有节点,智能体必须从环境中推断隐藏前置任务。
-
多智能体协作造题流程:由orchestrator控制五个专业Agent(任务选择器、场景设计师、里程碑设计师、Minecraft专家、验证器)在群聊中协作,分初始化与辩论两阶段生成初稿并修订,相比单智能体有效率提升约30%。
-
知识过滤机制:用LLM裁判对每个原子任务进行领域知识判断,区分通用世界常识与Minecraft专有机制,过滤依赖后者的高难度游戏专属任务。
-
ReAct能力拆解框架:借鉴ReAct范式,将开放世界探索能力系统拆解为感知、推理、行动三大维度共14项细粒度指标。

微信关注回复“开源”,加入AI开源项目交流群
如何使用MineExplorer
- 环境准备:克隆GitHub仓库至本地,确保已安装Python 3.9+及Minecraft相关运行环境。
- 启动评测环境:配置并启动Minecraft沙盒服务端,确保评测环境可实时运行并接收模型动作指令。
- 运行基准评测:加载MineExplorer提供的813个验证实例,将待测多模态模型接入环境,模型根据实时画面输出动作序列。
- 自动评分:评测结束后,系统自动调用规则化里程碑检查器,依据背包物品、坐标区域等量化指标计算TSR与MSR得分。
- 自定义任务生成:运行多智能体数据合成脚本,配置任务跳数,由五个协作Agent自动生成含隐藏前置条件的新任务实例。
- 训练与迭代:将生成任务作为训练数据输入模型,在Minecraft沙盒中反复执行探索-反馈循环,提升开放世界长程规划能力。
- 查看结果:评测报告自动输出各维度得分,支持按模型与难度分层对比。
MineExplorer的核心优势
-
首创分钟级开放世界评测:基于实时运行的Minecraft 3D沙盒,模型需在3分钟动态交互中持续决策。
-
隐藏前置多跳任务:指令仅给最终目标,不枚举依赖图,迫使模型自主推断隐藏子任务。
-
知识解耦设计:主动剥离Minecraft专有机制,保留通用世界常识任务。
-
多智能体高效造题:五Agent协作生成任务,相比单智能体有效率提升约30%,支持1-12跳自定义扩展。
-
规则化自动评测:将子任务转化为可自动执行的里程碑检查器,无需人工标注可量化评分,结果可复现。
MineExplorer的项目地址
- GitHub仓库:https://github.com/meituan-longcat/MineExplorer
- arXiv技术论文:https://arxiv.org/pdf/2605.30931
MineExplorer的同类竞品对比
| 对比维度 | MineExplorer | MineDojo |
|---|---|---|
| 评测目标 | 测通用开放世界探索能力,剥离游戏专有知识。 | 测具身智能体在Minecraft中的任务完成与互联网知识利用能力。 |
| 任务设计 | 1-4跳隐藏前置多跳任务,指令不枚举依赖图,需自主推断。 | 数千个程序化与创意任务,指令明确给出目标与步骤。 |
| 知识来源 | 仅依赖通用世界常识,主动过滤Minecraft Wiki机制。 | 深度整合YouTube视频、Wiki、Reddit等大规模游戏知识库。 |
| 数据合成 | 五智能体协作自动生成任务,有效率提升约30%。 | 基于互联网多模态数据自动构建任务与奖励函数。 |
| 评测方式 | 规则化里程碑自动检查器,覆盖感知/推理/行动14项指标。 | 程序化任务用模拟器状态判定,创意任务用MINECLIP视频模型评分。 |
| 开源侧重 | 评测基准+可扩展训练环境,支持1-12跳自定义任务。 | 训练框架+评测套件,强调从互联网知识中学习可泛化技能。 |
MineExplorer的应用场景
-
多模态大模型能力评测:为Claude、GPT、Gemini等顶级MLLM提供动态开放世界长程规划与推理的标准化考场。
-
Agent训练环境:作为Minecraft沙盒练兵场,支持模型在持续交互中提升感知-推理-行动闭环能力。
-
模型选型参考:为工业界提供开放世界探索能力的横向对比 leaderboard,辅助选型与能力边界评估。
-
学术研究平台:推动长程推理、隐式任务分解、视觉 grounding 与行动对齐等前沿方向研究。
-
具身智能预研验证:为机器人、自动驾驶等真实物理世界应用提供低成本的能力验证沙盒。
