这个品类的数据长什么样
生物医药领域的供应商审计质量文档具有其鲜明特征。其数据主要来源于审计报告、CAPA(纠正与预防措施)记录、供应商资质文件(如 GMP 证书、生产许可证)以及以往的审计历史。这些文档通常以 PDF、Word 或扫描图片形式存在,结构化程度不高,但内部包含大量关键信息,如审计发现、风险等级、不符合项描述、整改计划及完成情况等。更新节奏通常是周期性的,例如每年一次或根据风险等级不定期进行,当有新的审计或供应商资质更新时会触发更新。字段与单位方面,常见有“审计日期”、“不符合项编号”、“风险评级(高/中/低)”、“整改截止日期”、“责任人”等,时间单位通常为年、月、日,风险评级则多为枚举值。
这些特征在「HTTP 接口与外部系统」这一环带来什么约束
供应商审计质量文档的半结构化特性,决定了在 HTTP 接口集成时,需要重点关注文档内容的抽取与解析能力。由于文档更新并非高频,接口设计应更侧重于批处理和异步上传,以应对一次性导入大量历史文档的情况,避免因单次请求过大导致超时。文档格式的多样性,要求接口能支持多种文件类型上传,并能触发后端的文件预处理流程。字段与单位的特定性,意味着在数据入库前需要进行严格的校验和标准化,例如确保日期格式统一、风险评级符合预设枚举值,这需要在接口层进行参数约束,或在数据处理层进行清洗。此外,考虑到文档可能包含敏感信息,接口的认证与授权机制必须健壮,确保数据传输的安全性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 50 MB | 审计报告和资质文件可能较大,但单份文件通常不会超过此限,平衡上传效率与服务器资源。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 针对复杂或扫描版 PDF 文档,解析耗时可能较长,预留充足时间防止解析中断。 |
maxContext | 2000 字符 | 审计发现和整改描述内容较多,保证关键信息能被有效分段和索引。 |
分段长度 | 500 字符 | 确保每个分段包含足够语义信息,便于后续检索和问答,避免过度碎片化。 |
召回条数 | 前 5 条 | 供应商审计场景对准确性要求高,召回少量最相关的文档片段提高精确度。 |
similarity_threshold | 0.75 | 筛选出高相关度的内容,排除噪声,保证检索结果的专业性。 |
容易做错的三处
- 文件上传后系统长时间无响应或报错 504 Gateway Timeout。这通常是由于
PARSE_FILE_TIMEOUT_SECONDS设置过低,面对大型或复杂 PDF 文档时,解析在接口超时前未能完成。 - 上传的文件内容无法被正确解析,导致知识库中对应文档为空或内容不完整。这可能源于文档格式不规范或包含非文本内容(如图片),而预处理服务未针对这些情况进行优化。
- 通过接口批量导入历史审计记录时,部分关键字段(如“整改截止日期”)入库后格式不统一或缺失。这通常是由于接口层缺少严格的参数校验,或数据处理层未对多样化的日期格式进行标准化处理。
怎么确认配好了
- 选取多种格式(PDF、Word、扫描件)和大小的供应商审计文档,通过 HTTP 接口逐一上传,检查知识库中对应文档的内容是否完整且可检索。
- 模拟一次性上传 100 份审计报告的批处理操作,观察系统处理时间及资源占用,确保在
PARSE_FILE_TIMEOUT_SECONDS范围内完成解析。 - 针对上传的文档,通过 FastGPT 的检索功能,使用文档中的关键字段(如“不符合项编号”、“风险评级”)进行查询,验证召回的文档片段是否准确且相关度高。
- 检查知识库中已导入的供应商审计文档的元数据,确保所有自定义字段(如审计日期、责任人)都已正确抽取并标准化存储。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。