Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: LoHoSearch – 美团推出的下一代搜索智能体评测基准
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > LoHoSearch – 美团推出的下一代搜索智能体评测基准
AIGC 资讯

LoHoSearch – 美团推出的下一代搜索智能体评测基准

站外新闻
最近更新: 2026年7月21日 上午12:52
SHARE

LoHoSearch是什么

LoHoSearch 是美团 LongCat 团队推出的下一代搜索智能体评测基准,基于覆盖 762 万维基百科实体、2.65 亿条关系边的知识图谱自动生成题目,替代传统人工出题模式。基准收录 544 道经人工核验的高质量题目,覆盖音乐、影视、地理等 11 个领域,通过控制搜索空间与结构复杂度双维度制造挑战。当前最强模型 GPT-5.5 准确率仅 34.74%,远低于其在 BrowseComp 上 90% 以上的表现,为长程搜索推理与上下文管理提供更具区分度的评测标准。

阅读目录
  • LoHoSearch是什么
  • LoHoSearch的主要功能
  • LoHoSearch的技术原理
  • 如何使用LoHoSearch
  • LoHoSearch的核心优势
  • LoHoSearch的项目地址
  • LoHoSearch的同类竞品对比
  • LoHoSearch的应用场景

LoHoSearch

LoHoSearch的主要功能

  • 知识图谱自动化建图:用完整英文维基百科为数据源,构建 762 万实体节点与 2.65 亿条有向边的超大规模知识图谱,每个实体标注 Wikidata 类型与入度热度,为全局视角选题提供基础。
  • 双维度难度控制:从搜索空间与结构复杂度两个维度系统调控题目难度,突破人工出题的认知天花板。
  • 树结构与图结构采样:树结构通过放大搜索空间制造难度,图结构则在巨大搜索空间之上引入环形依赖与交叉约束,进一步叠加结构复杂度。
  • 自动化 QA 生成与验证:从子图抽取维基描述改写为自然语言题目,经关系提取、子图覆盖检查、答案满足度验证三层自动筛选,再辅以人工复核确保质量。
  • 多模型性能评测:支持对主流搜索智能体进行标准化评测,输出准确率、工具调用次数、校准误差等核心指标,直观反映模型长程推理能力。

LoHoSearch的技术原理

  • 知识图谱自动化构建:用完整英文维基百科为数据源,抽取 762 万个实体页面作为节点,提取正文内 2.65 亿条超链接作为有向边,为每个实体标注 Wikidata P31 类型与入度热度,构建全局知识网络。
  • 双维度难度定义:从”搜索空间”和”结构复杂度”两个正交维度量化题目难度,突破人工出题的认知局限。
  • 树结构子图采样:通过放大搜索空间制造难度,从单一答案节点向下展开多条独立分支,每条分支对应一个高候选空间的约束条件,使排除成本指数级上升。
  • 图结构子图采样:在巨大搜索空间基础上引入环形依赖与交叉约束,多个条件节点彼此 interconnected,求解需同时满足多组咬合关系,叠加结构复杂度形成双重挑战。
  • 关系提取与自然语言生成:从采样子图中抽取各实体的维基百科描述,用大模型改写为连贯的自然语言问题,确保每个线索完整保留原始子图中的关系信息。

如何使用LoHoSearch

  • 加载数据:通过 datasets 库直接加载 meituan-longcat/LoHoSearch,获取 544 道题目与标准答案。
  • 查看结构:数据集包含题目文本、对应子图结构、领域标签及经知识图谱校验的唯一答案。
  • 接入评测:将题目输入待测搜索智能体,记录其推理轨迹与最终输出。
  • 自动判分:对照数据集提供的标准答案,验证模型输出是否满足全部约束条件并统计准确率。
  • 对比分析:用数据集附带的子图复杂度与领域标签,分维度分析模型在不同难度与主题下的表现。

LoHoSearch的核心优势

  • 突破人工出题天花板:传统人工基准受限于标注者已知实体范围,LoHoSearch 依托全局知识图谱,能系统识别高搜索空间与高结构复杂度的”真难题”。
  • 难度显著高于现有基准:同一模型在 BrowseComp 上准确率 58.84%,在 LoHoSearch 上仅 10.02%,平均工具调用从 35 次增至 61 次,挑战强度提升 74%。
  • 区分度更强:现有上下文管理策略在 BrowseComp 上提升 14.03%,在 LoHoSearch 上仅提升 6.8%,更能真实反映策略在长程复杂场景下的边际效益。
  • 结构复杂度独立可控:图结构题目准确率(8.01%)显著低于树结构(11.89%),证明结构复杂度是独立于搜索空间之外的额外难度来源,可被单独量化。

LoHoSearch的项目地址

  • HuggingFace模型库:https://huggingface.co/datasets/meituan-longcat/LoHoSearch
  • arXiv技术论文:https://arxiv.org/pdf/2606.12837

LoHoSearch的同类竞品对比

维度 LoHoSearch BrowseComp
出题方式 知识图谱自动化生成 + 人工核验 人工设计
题目数量 544 道 数百道
覆盖领域 11 个领域(音乐、影视、地理等) 未明确分领域
难度控制 搜索空间 + 结构复杂度双维度 人工主观控制
最强模型准确率 GPT-5.5:34.74% GPT-5.5 Pro:90.1%
工具调用中位数 59 次 26 次
上下文策略提升 +6.8% +14.03%
饱和状态 远未饱和,区分度高 已接近饱和
适用场景 长程搜索推理、上下文管理评测 基础搜索能力评测

LoHoSearch的应用场景

  • 搜索智能体能力评测:为具备长程推理能力的搜索 Agent 提供高难度标准化测试,精准定位模型在复杂信息检索链条中的短板。
  • 上下文管理策略验证:评估 Summary、Discard-all、Verify 等上下文压缩与验证策略在超长交互场景下的真实增益,避免在简单基准上高估策略效果。
  • 模型迭代对标:为研究团队提供未饱和的评测标准,支撑模型版本迭代时的能力边界探测与性能对比。
  • 搜索算法研究:为需要多步推理、交叉验证的复杂搜索算法研究提供可控难度的数据集与评测框架。
  • 智能体产品选型:帮助企业在选型搜索智能体方案时,通过 LoHoSearch 区分不同模型在真实复杂查询场景下的实际表现。
港大携手快手微软清华:FilMaster AI电影系统实现剧本到成片全自动,革新影视制作流程
WorldCupVoice – 开源的 AI 实时体育解说系统
高德发布全球首个3D原生城市世界模型ABot-Earth0.5,已开放内测
BAGEL – 字节跳动开源的多模态基础模型
中国科学院HYPIR图像复原大模型:1.7秒极速修复老照片,支持8K超高清与个性化文本引导
分享
Email 复制链接 打印
Share
上一篇 首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放
下一篇 MiniCPM-Robot – 面壁智能开源的具身智能 VLA 模型系列
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

阿里通义Qwen3.7-Max旗舰大模型发布:全能智能体基座,编程推理全面领先,定义AI Agent新标杆

站外新闻
AI编程 Qwen3.7-Max 大模型 智能体 阿里通义千问
AIGC 资讯

SuperEdit – 字节跳动等机构推出的图像编辑方法

站外新闻
AIGC 资讯

Collaborative Gym – 支持人与AI代理实时交互协作的评估框架

站外新闻
AI 工具AIGC 资讯

Resemble AI开源Chatterbox:0.5B参数TTS模型,5秒克隆语音+情感控制,性能叫板闭源系统

站外新闻
AIGC Chatterbox Resemble AI 文本转语音 语音克隆
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.