这个品类的数据长什么样
偏差(Deviation)与纠正预防措施(CAPA)的数据主要来源于药物生产、质量控制及上市后不良事件报告流程中的内部记录系统。这些数据通常以结构化或半结构化的文档形式存在,如 PDF、Word 文档、XML 或 JSON 文件。更新频率取决于事件发生和处理的实时性要求,高风险偏差可能需要即时记录和处理,而低风险偏差或CAPA的阶段性更新则有明确的周期。文档结构通常包含事件描述、发生时间、涉及产品批次、影响范围、调查结果、根本原因分析、采取的纠正措施、预防措施、责任人以及完成时限等字段。字段可能涉及特定编码系统,例如药品批号、产品代码、ICD-10编码(用于不良事件分类),以及时间戳(RFC 3339格式)和数值型风险评分。
这些特征在「HTTP 接口与外部系统」这一环带来什么约束
偏差与 CAPA 数据的高度结构化和实时性要求,使得在 HTTP 接口集成时,需要重点关注数据模型的准确映射和传输效率。多样的文档格式要求接口具备强大的文件解析能力,以提取关键信息。例如,包含ICD-10编码的文本字段需要确保编码的正确识别与解析,避免数据丢失或误读。事件发生时间等时间戳字段,必须严格遵循统一的时间格式标准,例如 ISO 8601 或 RFC 3339,以保证跨系统时间同步的一致性。此外,由于涉及敏感的质量与安全信息,接口需要支持高并发访问和数据完整性校验机制。系统间交互时,对异常情况的精确响应和回溯能力至关重要,例如当外部系统返回非 200 状态码时,需要有明确的错误信息和重试策略。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 3000 tokens | 兼顾复杂偏差描述与性能,避免单次请求过载。 |
分段长度 | 500 字符 | 确保长文本拆分后保持语义完整性,便于索引与召回。 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 多数偏差与 CAPA文档解析可在该时限内完成,防止长时间阻塞。 |
相似度阈值 | 0.75 | 高于常规阈值,确保召回的 CAPA 建议与当前偏差高度相关。 |
HTTP_REQUEST_TIMEOUT_MS | 30000 毫秒 | 适配外部系统可能存在的响应延迟,例如大型数据库查询或复杂逻辑处理。 |
重试间隔 | 5 秒 | 面对外部系统暂时性错误,提供合理重试间隔,例如网络抖动或服务重启。 |
容易做错的三处
- HTTP 请求返回 400 或 500 状态码,但响应体中无具体错误信息,导致难以定位是请求参数格式错误还是外部服务内部异常。
- 导入的文档长期处于“索引中”状态,原因在于文档中包含大量非文本内容或复杂表格结构,超出了默认解析器的处理能力。
- 外部系统返回的数据字段为空,例如
CAPA_ID或ROOT_CAUSE字段,这通常是由于接口配置中字段映射不准确,或者外部系统的数据本身缺失。
怎么确认配好了
- 对至少 5 种典型偏差与 CAPA 文档执行导入操作,并检查其索引状态是否为“已完成”。
- 选取具有代表性的偏差数据,通过 HTTP 接口查询并核对返回结果中的
CAPA_ID、DEVIATION_TYPE和EFFECTIVE_DATE等关键字段,确保与原始数据一致。 - 模拟外部系统返回非 200 状态码和特定错误信息的场景,验证 FastGPT 是否能正确捕获并显示错误,以及是否触发了预设的重试逻辑。
- 通过 FastGPT 的检索功能,查询与已导入偏差相关的 CAPA 记录,检查召回结果的
相似度指标是否达到业务要求,以验证相似度阈值的合理性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。