首页
看点啥
插画图片
首页 看点啥 LoHoSearch - 美团LongCat推出搜索智能体评测基准

LoHoSearch - 美团LongCat推出搜索智能体评测基准

2026-07-24 0

LoHoSearch快速摘要

LoHoSearch是美团LongCat团队于2026年7月20日公开的搜索智能体评测基准,用于测试AI智能体在复杂信息检索、长程推理和上下文管理任务中的能力,通过知识图谱自动生成高难度问题,适用于大语言模型、AI Agent研究和搜索系统评估。

LoHoSearch – 美团LongCat推出的搜索智能体评测基准

LoHoSearch的核心优势

LoHoSearch的主要功能

LoHoSearch的技术原理

LoHoSearch与主流模型评测基准对比

对比维度LoHoSearchBrowseComp
任务生成方式知识图谱自动生成+人工审核人工设计问题
问题数量544道人工验证问题数百道任务
难度控制搜索空间+结构复杂度双控制人工经验控制
最高模型准确率GPT-5.5达到34.74%GPT-5.5 Pro约90%以上
工具调用需求平均61次调用平均35次左右
上下文策略提升最高提升6.8%最高提升14.03%

LoHoSearch与BrowseComp均用于评测搜索智能体能力,但测试重点存在差异。BrowseComp采用人工设计题目,主要衡量模型的信息检索与多步搜索能力;LoHoSearch基于覆盖762万维基百科实体的知识图谱自动生成问题,通过搜索空间和结构复杂度控制难度,更侧重长程搜索推理与上下文管理能力。据论文测试显示,GPT-5.5在LoHoSearch上的准确率为34.74%,而DeepSeek-V4-Flash在BrowseComp上的准确率为58.84%、LoHoSearch上仅为10.02%,说明LoHoSearch对复杂约束、多轮工具调用和信息整合能力提出了更高要求。

如何使用LoHoSearch

  1. 加载数据集:通过Python datasets库加载meituan-longcat/LoHoSearch数据集,获取544道人工验证问题、标准答案、领域标签和子图结构,为搜索智能体评测准备测试数据。
  2. 配置评测环境:准备支持search和browse工具的AI搜索智能体,将模型上下文设置为200K tokens左右,模拟论文中的标准测试环境,确保Agent能够完成多步骤检索任务。
  3. 执行智能体测试:将LoHoSearch问题输入待测AI Agent,让模型通过搜索、网页浏览和推理过程寻找答案,同时记录工具调用次数、推理轨迹和最终输出结果。
  4. 自动验证结果:使用评测流程检查模型答案是否满足问题中的全部关系约束,并结合标准答案计算准确率,分析模型在长程搜索任务中的实际表现。
  5. 分析评测数据:结合准确率、工具调用次数、子图复杂度和领域标签,对比不同模型在搜索空间、结构复杂度和上下文管理方面的能力差异。

LoHoSearch的局限性

  • 题目规模有限:当前LoHoSearch包含544道人工验证问题,虽然覆盖11个领域,但相比开放世界知识规模仍有限,原因在于人工审核需要成本。
  • 依赖知识图谱质量:LoHoSearch基于Wikipedia关系数据构建,部分领域知识更新可能存在延迟,原因是知识图谱来源受原始数据影响。
  • 评测环境限制:当前测试主要针对具备搜索和浏览工具的Agent,实时语音、多模态交互等能力未覆盖,原因是基准设计目标集中于搜索推理。

LoHoSearch相关资源

  • HuggingFace模型库:meituan-longcat/LoHoSearch
  • arXiv技术论文:https://arxiv.org/pdf/2606.12837

LoHoSearch的典型应用场景

  • 搜索智能体评测:用于测试AI智能体在复杂信息检索、多步推理和长程搜索任务中的综合能力。
  • 上下文管理研究:用于验证摘要、压缩、重启等策略在长链路搜索中的实际效果。
  • 模型能力对比:通过统一测试标准评估不同AI模型的搜索推理性能和能力差异。
  • 搜索算法优化:为多轮检索、工具调用和复杂约束推理算法提供实验数据支持。
  • 智能体产品测试:帮助企业评估搜索型AI智能体在复杂场景中的适用能力。

LoHoSearch常见问题

LoHoSearch怎么用?

LoHoSearch需要结合AI搜索智能体使用,通过Hugging Face加载数据集,将问题输入支持search和browse工具的Agent,再统计答案准确率。

LoHoSearch如何计费?

LoHoSearch数据集目前免费开放使用,没有公布API价格或商业计费方案。

LoHoSearch和BrowseComp哪个好?

两者定位不同,LoHoSearch更适合测试长程搜索推理能力。根据论文数据,GPT-5.5在LoHoSearch准确率34.74%,任务工具调用需求更高;BrowseComp更适合基础搜索能力测试,选择时需根据评测目标决定。

LoHoSearch支持实时搜索吗?

LoHoSearch本身不是搜索工具,不提供实时搜索功能,而是评测数据集。使用时需要连接具备搜索能力的Agent。

喜欢(0)

上一篇

金蝶的AI新物种:企业的掘金洛阳铲

金蝶的AI新物种:企业的掘金洛阳铲

下一篇

调查:76%的00后买美妆前先问AI

调查:76%的00后买美妆前先问AI
猜你喜欢