SearchOS是什么
SearchOS 是人大高瓴人工智能学院与蚂蚁集团联合推出的开源多智能体搜索协作框架。框架借鉴关系型数据库设计理念,将开放域信息检索抽象为动态关系模式,通过面向搜索的上下文管理、流水线并行调度与搜索工具中间层,解决长程任务中 Agent 失忆、重复查询、来源脱钩等系统级问题,支持多 Agent 共享状态、高效协作与证据追溯。
阅读目录

SearchOS的主要功能
-
关系搜索模式构建:将自然语言查询自动转化为包含表结构、主键与外键的动态关系模式,边发现实体边补全属性。
-
多智能体协作搜索:Orchestrator 统一规划调度,Explore Agent 发现候选实体,Search Agent 执行并行子任务,Writer Agent 生成结构化报告。
-
面向搜索的上下文管理(SOCM):维护 Frontier Tasks、Evidence Graph、Coverage Map、Failure Memory 四类共享状态,实现进度可视化与跨 Agent 同步。
-
搜索工具中间层:包含 Context Middleware、Sensor Middleware、Evidence Extraction Middleware,负责状态注入、循环检测与证据结构化抽取。
-
层次化技能库:预置约 280 个技能,涵盖排名检索、多跳搜索、实体消歧等策略技能,以及反爬、登录墙、动态页面等访问技能。
-
实时进度追踪:支持 CLI、全屏 TUI 与 Web 工作台,可实时查看 Schema 补全进度、Agent 任务流与逐格证据,支持中断后恢复。
SearchOS的技术原理
-
关系型搜索抽象:将信息检索任务定义为关系模式 S = ({T_m}, R),其中 T_m 为表模式(含列属性 A_m 与主键 P_m),R 为表间关系,使各类检索任务统一落到一套结构化框架上。
-
共享状态基础设施:核心判断是搜索状态应存在于系统中。SOCM 将任务状态外化为四类共享数据结构,Agent 通过查询共享状态实现协作,避免上下文压缩导致的事实丢失。
-
流水线并行调度:采用 micro-batch 思路,将 search→open→find 视为搜索流水线,多个 Search Agent 错峰进入、交叠推进;连续派发机制在 Agent 完成后立即补入新任务,提升槽位利用率与墙钟效率。
-
中间件干预机制:在模型与工具之间插入三层中间件,Context Middleware 控制上下文规模,Sensor Middleware 识别循环与停滞并触发策略切换,Evidence Extraction Middleware 完成结构化抽取、citation 锚定与证据入库。
-
动态模式演化:系统随实体发现动态调整表结构,实验表明即使预先指定最优固定结构(Oracle),效果仍低于 SearchOS 的动态模式。
如何使用SearchOS
-
环境准备:访问 GitHub 仓库克隆项目,通过配置向导完成模型服务商与 API Key 设置。
-
启动交互:选择 CLI、全屏 TUI 或 Web 研究工作台三种界面之一启动系统。
-
输入查询:在搜索框中输入自然语言问题,系统会自动识别任务类型。
-
查看进度:实时观察关系模式的构建过程、Coverage Map 的补全状态、各 Agent 的任务分配与执行流。
-
审阅结果:任务完成后查看结构化输出,每条数据均附带 citation 可回溯至原始网页与具体位置。
-
中断与恢复:长程任务支持中途退出后接续运行,可随时复盘历史搜索轨迹与证据链。
SearchOS的核心优势
-
系统级状态外化:将搜索状态从对话上下文迁移到系统基础设施,从根本上解决长程任务中的失忆与重复问题。
-
动态关系模式:随实体发现实时调整表结构,比固定模式更贴合真实检索场景的多样性,Oracle 实验验证其有效性。
-
高吞吐量调度:流水线并行与连续派发使任务完成时间降低约 24%,LLM 调用次数减少约 13%,同时提升 F1 分数。
-
全链路证据追溯:每个值均保存 citation,支持从结论回溯到网页原文具体位置,满足”尽量找全、每条都有出处”的严谨需求。
-
丰富的预置技能:约 280 个技能覆盖搜索策略与网站访问,使用技能后搜索时间缩短 36.6%,API 调用次数降低 39%-43%。
SearchOS的项目地址
- 项目官网:https://antins-labs.github.io/SearchOS/
- GitHub仓库:https://github.com/antins-labs/SearchOS
- arXiv技术论文:https://arxiv.org/pdf/2607.15257
SearchOS的同类竞品对比
| 维度 | SearchOS | Web2BigTable |
|---|---|---|
| 架构定位 | 搜索智能体操作系统,状态外化 | 多智能体表格信息收集框架 |
| 状态管理 | SOCM 四类共享状态,跨 Agent 实时同步 | 以表格为中心的状态,较简单 |
| 模式构建 | 动态关系模式,随实体发现实时演化 | 固定表格结构,灵活性受限 |
| 调度机制 | 流水线并行 + 连续派发,错峰推进 | 批处理调度,等待整批完成 |
| 中间件层 | Context / Sensor / Evidence 三层干预 | 无系统级中间件 |
| 技能体系 | 约 280 个预置层次化技能 | 依赖模型自身能力,无技能库 |
| WideSearch Item F1 | 80.3 | 73.8 |
| WideSearch Row F1 | 56.5 | 54.5 |
| GISA Set F1 | 76.5 | 56.7 |
SearchOS的应用场景
-
竞品与市场调研:系统性地收集竞品公司的融资轮次、产品功能、定价策略等信息,生成带出处的大规模对比表。
-
学术文献综述:针对特定研究方向,枚举相关论文、作者、机构、发表会议,并补全关键结论与方法摘要。
-
投研与尽职调查:追踪目标企业的股东结构、高管变动、诉讼记录、财务数据,实现多源交叉核验。
-
产品对比与选型:收集同类产品的技术参数、用户评价、价格区间,生成结构化对比报告辅助决策。
-
开放域知识枚举:如”列出 2000 年以来所有菲尔兹奖得主及其所属机构与国家”等需要高召回率的信息收集任务。
