一、版本混淆场景
合格的知识库必须优先识别当前有效版,展示图号、版次和生效依据,并把旧版明确标为失效参考。只按语义相似度拼接内容,可能把旧版图纸、过程草稿和正式报告混在一起,形成“专业但错误”的回答。
二、实验室知识不只存在于正文
三、建设顺序应从对象和规则开始
盘点资料并划分正式、过程、原始和敏感等级;解析正文、表格、图号、版本、项目、试样和数据通道;为项目、样件、试验、设备、文件和模型建立唯一编号;组合关键词、向量、结构化条件和对象关系索引;让回答返回来源,并按权限调用查询或计算工具;用真实问题持续测试版本、引用、权限和拒答能力。
四、RAG 解决什么,不能解决什么?
RAG 先检索外部证据,再由生成模型组织答案,可以降低完全依赖模型记忆的风险,并支持返回来源。但 RAG 不是数据库,也不是版本管理系统。检索到错误版本、切分丢失表头、权限过滤不完整或图纸解析错误时,生成结果仍会出错。
知识库应保存文档语义、状态和对象关系;结构化数据库负责数值事实;CAD、图纸解析和时序分析工具负责专业对象;大模型负责检索、解释和流程协同。把所有资料转成文本片段,不等于理解图纸和曲线。接入大模型不会自动解决版本、权限和结构化事实问题。
五、试点不要从“上传全部文件”开始
更有效的试点方式是:准备一类高频资料、10—20 个真实问题、正式与失效版本样本、权限角色表和现有系统接口清单。测试至少覆盖正式版本命中、表格定位、图纸版次判断、曲线对象关联、越权拒答和证据不足拒答。