这个品类的数据长什么样
供应商审计在药物警戒领域,其核心数据通常来源于审计报告、供应商提供的质量管理体系文件、不良事件报告、纠正预防措施(CAPA)记录以及合同文件。这些数据文档格式多样,包括 PDF 格式的审计报告、Word 或 Excel 格式的质量协议与 CAPA 记录,以及扫描件。数据更新频率不一,审计报告可能每年或每两年更新一次,而不良事件报告和 CAPA 记录则可能持续产生。文档内容通常包含大量非结构化文本,例如审计发现描述、风险评估、整改计划。关键字段包括供应商名称、审计日期、发现项编号、风险等级、不良事件类型、发生时间、涉及产品、纠正措施、完成日期等,部分字段可能以自由文本形式存在。
这些特征在「模型接入与配置」这一环带来什么约束
供应商审计报告和相关文件的多样性,尤其是包含大量扫描件和非结构化文本,要求模型接入时具备强大的文档解析能力。例如,对于 PDF 格式的审计报告,需要确保模型能够准确提取文本内容,并识别表格数据。审计报告的更新频率较低,但不良事件报告和 CAPA 记录的持续性,意味着知识库需要支持增量更新和实时事件处理。字段的非标准化和自由文本描述,对模型理解上下文和提取关键信息提出了挑战,需要更精细的模型配置来提高信息抽取精度。此外,不同文档类型之间可能存在关联,例如某个不良事件报告可能追溯到某次审计发现的缺陷,这要求模型在召回和关联信息时具备一定的语义理解能力。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 审计报告和质量体系文件可能较大,确保能一次性上传。 |
分段长度 | 800 字符 | 保证单个文本段落包含足够上下文,利于模型理解审计发现和不良事件描述。 |
重叠长度 | 100 字符 | 确保上下文衔接流畅,避免关键信息被切割在段落边界。 |
相似度阈值 | 0.75 | 兼顾召回相关文档和过滤不相关内容的平衡,针对复杂审计文本。 |
PARSER_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 扫描件或复杂表格解析时,预留充足的解析时间。 |
maxContext | 32000 token | 确保在处理多份审计报告或关联事件时,模型有足够上下文容量。 |
容易做错的三处
- 文件上传失败,提示
网络错误或文件过大,原因是没有调整UPLOAD_FILE_MAX_SIZE参数以适应大型审计文档。 - 模型回答缺乏细节或关键信息遗漏,表现为对审计发现的风险等级或不良事件的根本原因描述不准确,原因可能是文档分段粒度过大或
相似度阈值设置过高导致关键上下文未被召回。 - 模型无法从扫描件中提取文本内容,导致知识库索引不全,原因是没有正确配置或启用 OCR 文本识别功能。
怎么确认配好了
- 上传典型审计报告、CAPA 记录等文档,检查知识库中是否成功生成了可检索的文本内容,特别是扫描件应能被正确识别。
- 针对审计报告中的具体发现或不良事件描述,进行问答测试,验证模型是否能准确召回相关段落并提供有价值的摘要。
- 通过 FastGPT 的调试界面,查看模型处理过程中的上下文输入和输出,确认
分段长度、重叠长度等配置是否有效影响了文本处理。 - 测试不同复杂度的查询,包括涉及多份文档关联的问题,评估模型在整合信息方面的表现,确保
maxContext配置能支撑复杂场景。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。