这个品类的数据长什么样
偏差与 CAPA(Correction Action and Preventive Action)在药物警戒领域的数据主要来源于生产过程中的异常事件报告、质量控制检测结果、审计发现以及不良事件调查报告。这些数据通常以结构化或半结构化的文档形式存在,如 PDF 报告、Word 文档或 Excel 表格。更新频率受事件发生和调查周期的影响,通常为每周或每月批量更新,紧急事件报告可能实时录入。文档结构包含事件描述、发生时间、涉及产品批次、影响评估、根本原因分析、纠正措施计划、预防措施计划、负责人和完成时限。核心字段包括 事件编号、事件类型、产品批次、偏差等级、根本原因、CAPA计划、CAPA状态 和 完成日期。部分字段可能包含医学术语或特定行业代码。
这些特征在「工作流编排」这一环带来什么约束
偏差与 CAPA数据的高结构化与半结构化并存的特点,决定了工作流编排需要兼顾文本解析和结构化数据提取能力。事件报告中的自由文本描述需要自然语言处理技术进行关键信息抽取,而固定字段则直接映射。批次更新的频率要求工作流具备定时触发和批量处理能力,以应对周期性数据涌入。文档格式多样性,如 PDF 和扫描件,对文件预处理模块提出了要求,需要支持多种格式的文本提取和 OCR。字段中包含的医学术语和行业代码,要求模型在理解和关联时具备专业领域的知识背景,例如识别特定的药品名称或疾病代码,这会影响模型微调或提示词工程的复杂度。CAPA状态 和 完成日期 等字段的实时更新需求,意味着工作流应能支持增量数据处理和状态回写,以确保信息同步。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 50 MB | 偏差与 CAPA报告可能包含图片、图表,文件体积较大 |
maxContext | 4096 tokens | 确保能够容纳单份偏差报告的详细描述和分析内容 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 或 OCR 任务可能耗时较长 |
分段长度 | 800 字符 | 兼顾语义完整性和模型处理效率,避免长文本截断 |
召回条数 | 前 5 条 | 保证召回与偏差事件最相关的 CAPA 历史记录或标准操作流程 |
相似度阈值 | 0.75 | 确保召回内容的关联性,避免无关信息干扰 |
容易做错的三处
- 工作流日志中出现
文件解析失败错误,原因通常是上传了不支持的文件格式或文件内容损坏。 - 工作流调用后返回结果中关键字段为空,这可能由于文件上传后未正确解析提取,或者模型未能识别特定字段的表达方式。
- 工作流无法接收到后续的用户输入,原因可能是工作流配置了表单输入后才能提问,但表单数据未按预期提交或校验失败。
怎么确认配好了
- 上传不同格式(PDF、Word、扫描件)的偏差报告,检查文件是否都能被成功解析并提取出文本内容。
- 针对一份包含典型字段的偏差报告,检查工作流输出中
事件编号、产品批次、根本原因、CAPA计划等字段是否正确提取且值无误。 - 模拟紧急偏差报告的触发,检查工作流是否能实时启动并处理,以及处理后的
CAPA状态是否能正确回写或更新。 - 使用包含特定医学术语和行业代码的报告进行测试,验证模型是否能正确理解并关联这些专业词汇,例如通过提问相关专业问题来验证回答的准确性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。