Mistral 推出 Agentic Search:多步检索提升 AI 系统复杂文档查询准确率
Agentic Search. More accurate and efficient results from your AI systems. The retrieval layer that helps AI systems navigate, read, and verify information inside and across even the most complex documents.
精选理由
相比一次性 RAG,五个检索工具让模型按需查证、打开和阅读原文,精度从 26.7% 升到 86%,说明检索质量开始取决于模型推理而非分块策略。
AI 摘要
Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五工具的多步检索循环,让模型在长文档与多来源中查找、定位并验证信息。
正文 · AI 翻译
Mistral Agentic Search 帮助企业从其 AI 系统中获得更好的结果,它让模型能够搜索并浏览企业最复杂的数据和文档。Agentic Search 引入了一个多步骤检索循环,用于跨数据源查找、检查和验证信息,无论数据存储在哪里。Agentic Search 通过 Mistral Search Toolkit 提供,内置于 Studio 和 Vibe 的 Libraries 中,并为你提供:
对敏感领域特定数据的支持。Mistral 的可移植、开放工具帮助你在不跨越隔离边界的情况下释放数据价值,无论是在云端还是本地部署。
**改进的搜索结果。** 你的模型可以搜索和浏览数据,而不仅仅是检索片段——无论是长篇密集文档内部,还是跨多个数据源。
访问现有索引。Agentic Search 基于你现有的搜索索引构建,使用五个工具:search、open、navigate、read 和 grep。
更高的准确性。Agentic Search 在金融申报文件上实现了高达 3 倍的准确性提升,从 26.7% 提升到 86%(基于 FinanceBench)。在 OfficeQA Pro 基准测试中,针对表格密集、多文档问题,我们测得 +45.6 个百分点的提升(从 6.3% 提升到 51.9%)。
更低的延迟和 token 消耗。定向导航使 Agentic Search 能够将 p90 延迟降低高达 39.6%。更少的重复搜索可将 token 消耗减少多达三分之一。
数据创造竞争优势
竞争优势建立在多年的实际运营之上——你的数据、你的流程、你的领域专长。专有知识既对你的成功至关重要,又高度机密,因此它存在于隔离边界、分段部署和自托管平台之后。它积累在金融申报文件、法律合同、内部资源和政府记录中——这些长篇密集文档是传统搜索方法无法有效浏览的。
能够持续学习和改进的智能体可以帮助你累积竞争优势,但这些智能体往往出于安全原因与机密数据和专有知识隔离。要从 AI 中获得真正的影响力,需要将前沿推理与能够安全触达你最敏感材料的检索工具相结合。
传统 RAG 的不足
传统的一次性 RAG 会检索一组固定的文本块,并要求模型一次性完成回答。当答案恰好出现在排名靠前的结果中时,这种方式是有效的;但当模型需要浏览长篇报告、追踪引用、对比多份文档或核实底层证据时,它就会力不从心。
在数据密集、结构复杂的文档上,这一局限更加明显。回答问题所需的信息可能分散在多份文档中,或深藏于某个表格、脚注或条款里。基于一次性 RAG 的搜索之所以无法充分发挥前沿 AI 的全部能力、无法提供可靠答案,原因有三:
**只检索、不推理:** 模型必须根据初次检索选中的文本块来作答,即使这些文本块不完整或并不相关。它无法在作答前自行判断需要换一份文档、看另一个章节或获取更多上下文,这限制了模型推理能力的发挥空间。
**受限于文本块粒度:** 关键数据往往存在于复杂的多模态文档中。当被问到“该公司第三季度的实际税率是多少?”时,索引系统或许能找到正确的文档,但无法打开它、定位到表格、阅读周边上下文或核实答案。
**无法迭代:** 许多问题需要不止一轮检索才能得到正确答案。模型可能需要优化搜索策略、查看一份有希望的文档、追踪引用、对比多个来源、记录已看过的内容,并在初次结果不足时尝试新的路径。一次性 RAG 无法支持这些后续步骤。
无 Agentic Search(一次性检索)
仅使用 1953 年所有单个日历月报告的数值,美国国防及相关活动支出(以百万名义美元计)的这些数值总和是多少?
轨迹 1 tool_call(仅搜索)
search("national defense expenditures monthly 1953") → 10 条结果:零散的月度公报(表 3),均按财年口径编制,仅覆盖 1953 年的一部分。
我找到了 1953 年 1 月至 6 月的数据。但要计算出答案,我还需要 1953 年 7 月至 12 月的月度数值。
使用 Agentic Search
仅使用1953年所有单个日历月份的已报告数值,美国国防及相关活动支出的这些数值总和是多少(以百万名义美元计)?
轨迹3 工具调用(2次搜索 → 读取)
搜索(“1953年国防支出月度数据”)→ 逐月公报(部分年份)
搜索(“…1953年11月12月 1954年至今”)→ 找到 treasury_bulletin_1954_02.pdf 第15页(表3,包含1953年全部12个月)
读取(treasury_bulletin_1954_02.pdf,第15页)→ 提取完整表3
1953年月度数值
表3,单位:百万美元
1月 2月 3月 4月 5月 6月 7月 8月 9月 10月 11月 12月
3,632 3,501 3,789 3,891 3,746 4,056 3,890 3,519 3,787 3,647 3,540 3,465
总和 = 44,463。
智能体搜索(Agentic Search)的工作原理
Mistral 搜索工具包提供开放模块,用于在云端或本地摄取、嵌入和索引关键且复杂的数据。智能体搜索在此索引基础上,为模型提供五个类似于常见文件系统操作的工具:
搜索(search)使用现有索引在整个语料库中查找相关文档。
打开(open)打开特定文档。
导航(navigate)移动到文档中的某一页、某一节或某一区域。
读取(read)检索该位置的内容。
grep 在已打开的文档中查找特定模式。
模型不是仅根据初始 top-k 结果作答,而是可以检查找到的内容、优化搜索、打开相关文档、导航到特定章节,并在回答前阅读原始材料。索引负责识别可能的来源;智能体搜索决定在来源内部及跨来源检查哪些内容。
一次性 RAG
智能体搜索
这些工具不需要微调或针对特定模型的训练。随着模型在推理和工具使用方面变得更好,检索质量也会随之提升,而无需更改基础设施。这是一个关键特性:检索质量随模型能力扩展,而不是受限于你的分块策略。
智能体搜索适用于
长文档。申报文件、合同、手册、技术规范和报告中,答案可能出现在某一特定页面或某个特定表格、条款、图表或脚注中。
跨多个来源的问题。需要模型在得出答案之前,从多份文档中查找、比较或核对证据的研究任务。
必须经过核实的答案。财务数据、法律条款、监管引用和运营数据,这些内容的回答需要能够定位到稳定且具体的文档位置进行引用。
表格和结构化文档。财务报表、政府记录和扫描版 PDF,这些内容的含义取决于行、列、页面位置或周围上下文——而不仅仅是叙述性文本。
索引检索是以下场景的正确起点:
直接查找。简短、清晰的文档,答案很可能出现在最先检索到的几个片段之一中。
高量级搜索。需要返回相关段落而无需对其推理或浏览的关键词或语义查找。
简单、可预测的问题。答案的可能来源和位置事先已知,额外的检索步骤不太可能改善结果的用例。
一次性 RAG 通常足以应对这些搜索。当问题要求模型超越初始结果、深入调查源材料时,再添加智能体搜索。在两种情况下,配置良好的索引仍然是正确的基础。
更相关的结果,更快的速度
我们使用开箱即用的 Mistral 搜索工具包(默认分块、默认排序、无调优),在两个行业标准评测上对智能体搜索进行了基准测试。这些结果是下限而非上限,意味着你可以通过针对特定用例的调优进一步提升结果质量。
在这些基准测试中,我们使用 Mistral 搜索工具包测试了两个模型:Mistral Medium 3.5(MM 3.5)和 Z.ai GLM-5.2(GLM-5.2),展示了较小模型(MM 3.5)和较大模型(GLM-5.2)的性能表现。
基准测试结果一致:智能体循环带来了实质性的质量提升,导航工具在减少浪费的 token、轮次和延迟的同时提高了准确性。我们在第一方和第三方模型上观察到相同的性能模式,这表明智能体搜索与模型无关,搜索质量应随新模型的推出而提升。
FinanceBench:368 份 SEC 文件,150 个问题
FinanceBench(Islam 等人,2023)测试基于 368 份 SEC 文件(10-K / 10-Q / 8-K)的金融问答能力,每份文件平均约 147 页,总计约 53,900 页:这些是篇幅长、表格密集的金融文档。答案由经过人工标注校准的 LLM 评判器评分。
Mistral Medium 3.5
GLM 5.2
我们发现:
仅搜索的智能体循环是最大的质量杠杆。从一次性 RAG 转向仅搜索循环,MM 3.5 的准确率提升 +47.3 个百分点,GLM-5.2 提升 +52.6 个百分点——两个模型均提升约 3 倍。由于模型可以迭代搜索,它们能从较弱的首次结果中恢复,优化查询,并将索引作为主动工具使用。
导航功能提升准确率。加入 open、navigate、read 和 grep 后准确率再次提升(MM 3.5 提升 +8.7 个百分点,GLM-5.2 提升 +6.7 个百分点)。这意味着在复杂文档中,有针对性的下钻搜索优于重复的宽泛搜索。
更好的检索工具能提升 token 和性能效率。带导航功能的完整循环在回答更多问题正确的同时,比仅搜索循环使用更少的 token(MM 3.5:token 使用量减少 -23.9%,GLM-5.2 减少 -33.7%)。检索工具并非额外开销——它们用精准导航取代了浪费的搜索重试。
延迟在关键环节显著下降。在整个 FinanceBench 上,加入导航检索工具改善了延迟:p90 从 255 秒降至 154 秒,平均延迟从 108 秒降至 71 秒。总体来看,我们看到仅搜索循环会进行重复的宽泛搜索,而导航帮助模型更快地定位证据。
OfficeQA Pro:696 份财政部公报,133 个问题
OfficeQA Pro 是一个基于历史美国财政部公报的可验证数值基准:扫描版、表格密集的政府金融 PDF,语料库包含 696 份文档、约 89,000 页。我们报告了 133 个问题的“专业版”子集的首次测试结果。
Mistral Medium 3.5
GLM 5.2
我们发现:
智能体搜索以及智能体循环 + 导航在更难、可验证的基准上表现成功。OfficeQA Pro 包含数值答案、扫描版 PDF 和深层表格查询。即使在这样的场景下,完整的智能体循环也能显著提升一次性 RAG 的准确率,GLM-5.2 达到 51.9%(+45.6 个百分点),MM 3.5 提升 +27.1 个百分点。
导航功能在降低资源消耗的同时提升了质量。使用完整闭环(智能体闭环 + 导航)可将准确率提升高达 35.6%(**+7.5 个百分点,**MM 3.5;+8.3 个百分点,19.0% GLM-5.2),同时减少 token 消耗。轮次最多可减少 7.0%(MM 3.5,GLM-5.2 为 2.3%)。
基准测试难度越高,检索闭环就越重要。OfficeQA Pro 围绕扫描件和表格密集型文档中的数字答案构建。单次 RAG 几乎无法启动,而智能体闭环则允许模型迭代搜索、检查证据,并带来显著的准确率提升。
**工具链栈对文档智能和搜索性能产生重大影响。**根据 Kimi 的研究,GLM-5.2 在 Claude Code 工具链下于 OfficeQA Pro 上得分 41.4%,而在 Mistral 工具链下得分 51.9%——同一底层模型上相差 +10.5 个百分点。
快速上手
在文档中了解更多关于 Agentic Search 的信息。您可以通过以下任一方式在云端和本地部署中开始使用:
Mistral Search Toolkit。将 Agentic Search 集成到您自己的智能体、工作流和客户部署中。
库。在 Studio 和 Vibe 中开箱即用地使用 Agentic Search,无需自行构建检索系统。
测试 Search Toolkit 最快的方式是使用 Search Starter App。它使用默认配置为您的自有语料库创建本地索引,因此您无需成为搜索专家即可试用 Agentic Search。当您准备好配置自己的用例时,您可以:
设置数据摄取。为您的数据和文件类型选择解析器、分块策略、嵌入向量模型和提取器。
调优索引和排序。管理 Vespa schema、索引行为和相关性配置。
扩展检索。在搜索管道中添加查询重写、重排序或混合检索。
原文
Original Title
Agentic Search. More accurate and efficient results from your AI systems. The retrieval layer that helps AI systems navigate, read, and verify information inside and across even the most complex documents.
Source
Mistral AI:News(网页)
Site
mistral.ai
Published
2026-08-21 00:02