Agentic RAG 不是搜得越多越好:ACL 2026 的 AutoSearch 给过度搜索踩了刹车 系列第 9 篇 · 子领域检索增强 / RAG【来源信息】 - 类型顶会论文 - 标题AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning - 作者/机构Jingbo Sun, Wenyue Chong, Songjun Tu, Qichao Zhang, Yaocheng Zhang, Jiajun Chai, Xiaohan Wang, Wei Lin, Guojun Yin, Dongbin Zhao - 出处Findings of ACL 2026 · arXiv:2026.findings-acl.1399pages 28059–28079 - 原文https://aclanthology.org/2026.findings-acl.1399/ - 本文性质论文解读非原创研究关键结论以原文为准一句话结论Agentic RAG 为多跳问题反复检索但「无脑多搜几轮」又慢又贵。ACL 2026 的 AutoSearch 用强化学习算出最小够用的搜索深度在保住准确率的同时把过度搜索压下去——搜索不是越多越好。背景与痛点多跳、复杂问题交给 Agentic RAG如 Search-R1处理模型交错执行「搜索 / 调用工具 / 回答」多步动作。但这类迭代有两个老毛病——冗余搜索反复检索已经处理过的信息白白烧算力和延迟欠探索为省钱限制搜索深度复杂问题又搜不透。之前的方法要么固定深度省成本但欠探索要么硬搜很多轮准但贵。核心矛盾最小够用的搜索深度到底是多少核心方法讲人话AutoSearch 干了三件事先研究搜索深度与准确率的关系发现存在一个「最小够用搜索深度」由问题复杂度 模型能力共同决定定义了准确率—效率的权衡点自我回答机制每一步搜索后让模型用自己生成的中间答案来评估这一步搜得够不够强化学习奖励奖励「达到最小够用深度」惩罚「过度搜索」并加稳定机制提升复杂问题的答案质量。一句话模型自己判断「再搜一轮还值不值」够了就停。实验与数字在多个基准上AutoSearch 取得更优的准确率—效率权衡在缓解过度搜索的同时保住搜索质量论文原话achieves a superior accuracy-efficiency trade-off, alleviating over-searching while preserving search quality。机制上它把「搜到第几步停」从人工拍脑袋变成可学习的策略对复杂问题自动加深、简单问题自动收手。注具体基准百分点以原文表格为准本文不 extrapolate 未披露数字。为什么重要反直觉点RAG 检索准了回答还烂很多时候不是检索质量问题而是搜得太狠或太浅的节奏问题。Agentic RAG 的成本大头在「轮次」不是单次检索。对工程的直接启发给你的 RAG Agent 加一个「自适应停止」策略比一味堆检索轮次更划算。这也呼应了同期的 Test-Time StrategiesACL 2026加「上下文整合 去重」模块EM 提升 5.6%、平均轮次降 10.5%。复现 / 落地思路开源实现思路可参照 Search-R1 的 Qwen2.5-7B pipeline加一个「中间答案自评估」模块判断是否继续搜先用固定深度跑基线记录不同问题类型的「够用深度」再训练自适应策略配套看 SPARKLEACL 2026 long用知识图谱推理做即插即用的检索策略平均提升 9.17% / 2.85%与 AutoSearch 互补。今日可做的 3 件事给你现在的 RAG Agent 统计「每题实际搜索轮次」找出过度搜索的重灾区。加一条停止规则当连续两轮检索结果重叠度高时提前终止。用一个小模型做「中间答案自评估」替代固定深度测成本与准确率变化。下篇预告第 10 期我们读代码模型看 OpenAI 的竞赛编程报告——o3 在 Codeforces 跑到 2724 分、超过 99.8% 人类推理模型怎么把代码玩成竞技。