为什么大多数企业 RAG 试点死在第三周
演示在几份干净的 PDF 上跑得很好,会议室里一片赞叹,然后真实文档来了:扫描件、合并单元格、十年前的合同、三种语言混在一起。多数试点就是在这里悄悄停住的。
发生了什么
我们跟踪过的落地项目里,节奏高度一致。第一周是在精选文档上做演示,第二周对接客户的身份与权限体系,第三周是有人把系统指向真正的文档库——然后答案质量崩了。
对交付团队意味着什么
问题几乎从来不在模型,而在解析:表格被拍成无法阅读的纯文本,扫描页什么都抽不出来,切分恰好把条款和它的例外条件切开了。检索于是自信地返回错误上下文,模型照做不误。
可以立刻做的事
按文档而不是按模型来做试点预算。在承诺任何时间之前,先解析 200 份真实样本文件,在这个样本上测上下文精确率,并把切分做成可查看、可修正的步骤,而不是沿用库的默认值。
可以立刻做的事
- 承诺排期前先解析 200 份真实文档
- 让切分可检查,别用库的默认值
- 测忠实度,而不是凭感觉