向量检索 Benchmark,先把相关答案标出来 向量检索 Benchmark先把相关答案标出来没有标注集的召回率就像没写答案的练习册算得再认真也不知道对不对。向量检索优化先建立查询与相关文档的对应关系再讨论索引参数。标注集要贴近任务覆盖精确实体、同义表达、长问题、无答案和权限受限查询。每条相关性判断记录规则争议样本单独保存。语料版本变化后重新评估不能沿用旧答案假装可比。一次只改一个环节分开比较切分、embedding、过滤、ANN 参数和 rerank。固定其他条件记录 RecallK、延迟、空结果、资源使用和失败样本。平均分之外要看哪些问题退步了。评审最怕数据泄漏确认测试查询没有参与调参或被直接写进提示词敏感文档不会出现在越权结果里。检索得更准但权限过滤失效不叫优化。Benchmark 的价值不是做一张漂亮表格而是让每次变化都能解释。失败样本留得越清楚下一轮调参越省时间。