企业内部积累了大量的制度文档、产品资料、项目经验、培训材料,但员工查找起来费时费力,而且新人很难快速掌握。把这些知识封装成一个可调用 Skill,让员工通过自然语言提问就能得到准确、可溯源的答案,是 AI 落地的高价值场景之一。
知识库 Skill 的核心架构
一个知识库 Skill 通常包含四层:数据源层、索引层、检索层、生成层。
- 数据源层:对接企业现有的文档系统,支持 PDF、Word、网页、数据库等多种格式。
- 索引层:把文档切分成语义块,生成向量 embedding,并存入向量数据库。
- 检索层:根据用户问题召回最相关的知识片段,并进行重排序。
- 生成层:把问题和检索到的上下文一起交给大模型,生成准确、有依据的回答。
这个架构就是 RAG(Retrieval-Augmented Generation,检索增强生成)。它让大模型在回答时能够参考企业内部资料,显著降低幻觉。
文档治理:决定知识库质量的关键
再强的 RAG 技术也救不了混乱的原始文档。文档治理需要关注:
- 文档权威性:明确哪些文档是官方有效版本,避免过期或矛盾信息。
- 切分策略:按段落、按主题、按 FAQ 对等方式切分,保证语义完整。
- 元信息标注:给文档打标签(部门、版本、有效期、适用范围),方便检索时过滤。
- 更新机制:建立文档变更通知和索引更新流程,保证知识库实时有效。
建议先选 1-2 个高频使用、文档质量较好的知识领域试点,跑通后再扩展。
检索与答案生成的优化技巧
检索质量直接决定回答质量。常见优化手段包括:混合检索(关键词 + 向量)、查询重写(把口语化问题改写成更规范的检索式)、重排序(用更精细的模型对召回结果排序)、以及引用溯源(在答案中标注信息来源)。
| 优化手段 | 作用 | 适用场景 |
|---|---|---|
| 混合检索 | 兼顾字面匹配和语义匹配 | 专有名词、型号、政策条文较多的场景 |
| 查询重写 | 把用户问题改写成更适合检索的形式 | 口语化、模糊的问题 |
| 重排序 | 提升最相关片段的排名 | 召回结果多、需要精确排序的场景 |
| 引用溯源 | 让答案可验证 | 对准确性要求高的 B2B、合规场景 |
生成层则要强调「不知道就承认」,而不是编造答案。可以设置阈值:当检索结果与问题相关性不足时,直接提示用户联系人工或补充信息。
常见问题
什么是 RAG?
RAG(检索增强生成)让大模型在回答问题前先检索企业内部知识片段,再基于检索结果生成答案,降低幻觉。
知识库 Skill 最重要的是哪一步?
文档治理。原始文档质量决定检索质量和回答质量,再好的技术也救不了混乱的资料。
如何防止知识库 Skill 编造答案?
设置相关性阈值,检索不到足够相关资料时明确告知用户,而不是硬编答案;同时开启引用溯源。