DC娱乐网

美团发布 LoHoSearch 评测基准:全球顶尖搜索智能体遇 "大考"

近日,美团LongCat团队正式推出下一代搜索智能体评测基准LoHoSearch,以高难度、高含金量的测试题,揭开了当前
近日,美团LongCat团队正式推出下一代搜索智能体评测基准LoHoSearch,以高难度、高含金量的测试题,揭开了当前 AI 搜索智能体在长链条复杂推理任务上的能力短板,为行业技术迭代提供了关键参考。

不同于现有主流评测基准,LoHoSearch 依托762 万维基百科实体知识图谱,自动生成544 道高难度题目,从搜索空间与结构复杂度双维度精准提升测试难度,直击搜索智能体的核心痛点 —— 长链条、多步骤的深度推理能力。此前行业常用的 BrowseComp 等基准,题目难度相对较低,模型容易取得高分,难以暴露真实能力上限。

本次评测结果格外引人关注:即便是当前全球公认的最强模型 GPT-5.5,在 LoHoSearch 上的准确率也仅为 34.74%,远低于其在 BrowseComp 上超 90% 的表现,差距高达 56 个百分点。其余主流模型表现更差,多数准确率不足 20%,部分甚至低于 10%,近乎随机猜测水平。这一结果清晰表明,当前搜索智能体看似 "强大",实则在需要多步关联、深度挖掘的复杂任务上存在显著瓶颈,远未达到成熟可用的水平。

从行业发展来看,LoHoSearch 的推出恰逢其时。随着 AI 从 "简单问答" 向 "复杂决策" 升级,用户需求不再是单一信息检索,而是需要整合多源信息、完成逻辑推导的深度搜索,比如跨领域知识关联、多条件复杂问题解答等。美团此次发布的评测基准,不仅为行业提供了一把 "精准标尺",更指明了未来技术突破的核心方向 —— 攻克长链条复杂推理难题,减少 AI"幻觉",提升搜索结果的准确性和可靠性。

作为国内 AI 技术落地的标杆企业,美团此次在搜索智能体评测领域的突破,也彰显了中国 AI 团队在核心技术研究上的实力。未来,随着 LoHoSearch 的开放使用,有望推动全球搜索智能体技术加速迭代,让 AI 搜索真正具备解决复杂问题的能力,更好地服务于各类实际应用场景。