近期我们关注到,搜索基础设施产品 AnySearch 在官方渠道发布了一组面向 AI Agent 场景的搜索 API 基准测评数据。测评选取三款行业内主流的搜索产品,在统一测试环境下完成准确率与延迟两项核心指标的横向验证,为 AI Agent 搜索工具选型提供了可参考的量化依据。
本次测评采用控制变量的测试方法:选取 Frames、FreshQA、WebwalkerQA 三个公开基准数据集,合计 300 道测试问题;全程使用同一款大语言模型作为推理底座,各测试组之间仅替换搜索 API 接口,其余环境与参数保持一致,保障结果的可比性。
一、三款产品的定位与赛道价值
参与测评的三款产品,分别对应不同的技术路线与场景定位,在各自的细分赛道中均属于具有代表性的产品。
AnySearch 定位为面向 AI Agent 的搜索基础设施,聚焦垂直领域结构化信息交付,主打 Agent 原生的全链路搜索能力,适配生产级智能体的多样化搜索需求;
Brave Search 依托自有独立索引运行,收录规模较大的网页资源,全程不依赖通用大厂搜索引擎路由,隐私合规属性突出。它是隐私优先场景中具有代表性的产品,适配对数据安全、合规性有严格要求的部署环境;
Parallel 主打深度研究方向的搜索能力,长链路信息整合与多轮检索能力有相应优势,能够支撑复杂的调研类任务,适配深度研究导向的 Agent 工作流。
二、核心测评结果解读
本次测评从准确率与端到端延迟两个维度展开,数据表现与三款产品的定位方向相匹配,呈现出差异化的特征。
1.准确性基准测试

评估标准
基于人工验证的真实答案,在三个基准数据集上评估答案正确率。
关键优势
在三个数据集上整体准确率最高(76.4%)—— 在 FreshQA 上以 80.0% 领先,在 WebwalkerQA 上比 Brave 高出 18.4 个百分点(65.2% vs. 46.8%),同时比 Parallel 高出 4.2 个百分点。
测试方法
在 Frames、FreshQA 和 WebwalkerQA(共 300 个问题)上进行评估,使用 z-ai/glm-5.1 作为大语言模型;各基线之间仅搜索 API 不同。
2.延迟基准测试

评估标准
单次请求的端到端延迟,定义为完成单个问答任务所需的 Agent 总运行时间(包括 LLM 推理、搜索工具调用及所有中间步骤),取三个基准数据集上的平均值。
关键优势
整体最快,仅需 47.8 秒 —— 比 Parallel 快 36%(74.4 秒),比 Brave 快 31%(68.9 秒)。在 WebwalkerQA 上,AnySearch 仅需 76.5 秒完成,而 Parallel 高达 145.6 秒、Brave 高达 133.0 秒 —— 速度几乎是两者的两倍。
测试方法
所有基线使用相同的 Agent 框架和大语言模型(z-ai/glm-5.1);每个数据点为 Agent 完整解决一个问答问题所经过的运行时间。结果基于 300 个问题取平均值,并按每个数据集分别统计。
三、AnySearch 表现背后的技术逻辑
AnySearch 在综合准确率与整体延迟上的表现,与其面向 Agent 原生设计的产品架构直接相关,核心支撑来自三项技术设计。
第一,智能意图路由机制。系统接到查询后先完成领域识别,将请求定向分发至匹配的垂直数据源,避免无差别全域检索带来的算力消耗与信息冗余,在提升信息匹配精准度的同时,也缩短了检索耗时。
第二,联邦多源搜索架构。采用通用索引补充长尾信息、垂直领域自建深度索引保障专业数据的混合架构,兼顾信息广度与专业深度,能够覆盖更多专业场景的查询需求。
第三,标准化结构化输出。检索结果经过多源融合、内容清洗后,以附带信源标注的标准化 Markdown 格式交付。Agent 获取后可用于推理链路,减少了端到端任务中的中间处理环节,也降低了 Token 消耗与信息偏差的概率。
四、场景化选型建议
三款产品分别适配不同的核心需求,不存在普适性的优劣之分,开发者可根据自身业务场景选择适配的方案。
如果业务需要同时覆盖通用搜索与多类垂直领域,追求结构化输出与较高的端到端效率,适配生产级 Agent 的全场景部署,AnySearch 是适配性较强的选项;
如果业务对隐私合规、独立索引有较高要求,Brave Search 是适配性较强的选择;
如果业务以深度研究、长链路调研为核心,Parallel 可满足对应的需求。