这个品类的数据长什么样
批记录审核的数据主要来源于药品生产过程中的批生产记录、批检验记录、偏差调查报告、变更控制文件等。这些文档多以 PDF 扫描件或结构化数据表单(如 Excel、XML)形式存在。更新节奏与批次生产周期紧密相关,通常为日度或周度更新,但历史批次数据量庞大且不常变动。文档结构高度标准化,遵循 GMP 规范,包含大量固定字段,如批号、产品名称、生产日期、有效期、操作员签名、设备编号、关键工艺参数(温度、压力、时间)、物料批次、检验结果等。字段值多为数值、日期、布尔或枚举类型,单位明确且多样,例如 ℃、kPa、min、mg/L。
这些特征在「知识库检索与召回」这一环带来什么约束
批记录数据的标准化结构和明确的字段单位,使得基于字段名称或单位的精准匹配成为可能,并对召回的准确性提出高要求。文档更新频率决定了知识库索引的更新策略,历史数据的稳定性允许较低频率的全面重建索引,而新增批次的实时性则需要增量更新机制。大量数值型和枚举型数据要求知识库能处理范围查询、等值查询以及特定值与规范的符合性判断。由于文档中包含操作员签名、偏差描述等自由文本,需要兼顾语义理解能力。对召回结果的低容错性,要求在相似度计算时,对关键字段的匹配权重进行精确调整,避免“泛化”召回导致误判。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 300–500 字符 | 批记录文档中,关键信息通常集中在特定段落,过长或过短分段均不利于精确匹配。 |
召回条数 | 前 8–12 条 | 考虑到批记录的复杂性和潜在的关联信息,适当增加召回条数以提高覆盖率。 |
相似度阈值 | 0.78–0.85 | 批记录审核对准确性要求极高,高阈值有助于过滤掉不相关的召回结果。 |
重排返回条数 | 5 条 | 对初步召回结果进行二次排序,确保最相关的少数结果优先展示。 |
UPLOAD_FILE_MAX_SIZE | 200 MB | 批记录扫描件可能较大,需确保能上传大尺寸文件。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 针对大型 PDF 批记录文件的解析耗时,设置充足的超时时间。 |
容易做错的三处
- 在聊天窗口中输出问题,提示“没有选择知识库”,这通常是由于在
Agent配置中,知识库组件未被正确启用或关联。 - 知识库内没有直接匹配的条目时,模型直接拒绝回答,这可能是
相似度阈值设置过高或召回条数过少,导致无法召回足够的信息进行推理。 - 谷歌搜索插件返回结果为空,这可能与网络配置、API Key 失效或插件本身未正确集成有关,导致外部搜索能力受限。
怎么确认配好了
- 上传一批典型批记录文档,验证
UPLOAD_FILE_MAX_SIZE和PARSE_FILE_TIMEOUT_SECONDS配置下,文件解析是否成功且无超时错误。 - 针对批记录中的关键字段和操作规范,构造一系列精准查询和模糊查询,观察召回结果的
召回条数和相关性,根据业务专家判断调整相似度阈值。 - 模拟审核场景,输入包含数值范围、单位信息的查询,检查召回结果是否能准确命中相关批次数据,并验证
重排返回条数后最相关信息的排序优先级。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。