返回 AI 情报
论文精选 712026-07-30 08:00HuggingFace Daily Papers(社区热门论文)

BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

精选理由

这篇论文把词法、稠密、图检索和代理搜索放在同一个尺度下对比,发现数据规模越大,BM25越强,这很反直觉,做RAG应用的选型逻辑可能要变。

AI 摘要

一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式,发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先,但约1000万语料token时BM25反超并在所有更大层级保持领先,全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。

正文 · AI 翻译

检索增强生成(RAG)涵盖词法检索与稠密检索、基于图的索引以及智能体搜索,但这些范式通常是在单一语料库规模下、基于不同基准进行评测的,导致其准确率与成本之间的权衡关系尚不清晰。为弥合这一空白,我们开展了一项受控研究:在保持问题不变、并固定一组相关文档与对抗性文档作为基石语料的前提下,将语料库规模沿 28 个严格嵌套的层级进行变化,跨度约为 450 倍。在统一的阅读器模型与统一的评判协议下,我们测算了官方准确率、构建与查询 token 数以及延迟。结果表明,存在一个随规模变化的交叉点,而非某个无条件胜出的方案。文件系统智能体(File-System Agent)在最小的共享层级上领先,但其顺序式探索在基石语料上消耗的查询 token 多达 39 倍,且随着搜索空间扩大,其效果逐渐下降。当语料库 token 数达到约 1000 万时,BM25 反超并在此后所有更大的共享层级上保持领先,在完整规模下优势接近 20 个百分点。BM25 还锚定了帕累托前沿的低成本端,且无需基于 LLM 的构建过程。稠密检索依然高效但准确率较低;基于图的 RAG 在部署规模之前便遭遇构建瓶颈,其可扩展变体在共享层级上仍低于 BM25。总体而言,语料库规模的增长越来越有利于全局候选排序:词法检索是最强的可扩展默认方案,而智能体推理在排序发现之后发挥作用效果最佳,而非取代排序发现。

原文

Original Title

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

Source

HuggingFace Daily Papers(社区热门论文)

Site

arxiv.org

Published

2026-07-30 08:00

阅读原文· arxiv.org

继续阅读