这个品类的数据长什么样
CMC(化学、制造与控制)研究的注册申报资料涉及药物从研发到生产全生命周期的数据。数据来源广泛,包括实验室研究报告、中试生产记录、质量控制批次分析报告、稳定性研究数据和生产工艺验证文件。这些数据更新频率不一,研发阶段可能每周都有新数据,而稳定性研究则是按月或季度更新。文档结构高度标准化,遵循 ICH M4Q 指导原则,例如 CTD 格式。字段包括但不限于批次号、生产日期、有效期、检测项目、检测方法、检测结果、单位(如 mg/mL、ppm、`℃、%),以及复杂的数据类型如色谱图、质谱图和红外光谱图。这些数据常以 PDF、Word 文档、Excel 表格和结构化数据库记录的形式存在。
这些特征在「工作流编排」这一环带来什么约束
CMC 数据的多样性和标准化要求对工作流编排提出了特定约束。多源异构数据要求工作流具备强大的数据接入和标准化转换能力,特别是对非结构化文档内容的智能提取。更新频率的不一致性决定了工作流需要支持灵活的触发机制,既可以是定期调度,也可以是事件驱动。CTD 格式的强结构性意味着工作流在数据解析后,需要将信息精准映射到预定义的申报模板字段。色谱图、质谱图等复杂数据类型,则要求工作流能够集成图像识别和专业数据解析工具,提取关键峰面积、保留时间等数值信息。计量单位的准确性至关重要,工作流需内置单位转换和校验逻辑,避免因单位不统一导致的错误。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunkOverlap | 100 字符 | CMC 文档中表格和列表内容较多,适当重叠有助于保持语义完整性。 |
maxContext | 4000 token | 确保能处理包含多个关联 CMC 实验数据和结论的文档片段。 |
embedding_model | text-embedding-ada-002 | 兼顾成本与效果,对医药领域专业术语有较好理解。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 部分 CMC 报告(如稳定性报告)可能包含大量图表和数据,解析耗时较长。 |
召回条数 | 前 8 条 | 确保在初步召回阶段能覆盖到相关性高但分布分散的多个实验批次数据。 |
相似度阈值 | 0.78 | 针对 CMC 数据的精确性要求,提高阈值以过滤掉低相关度的技术细节。 |
容易做错的三处
- 现象:工作流执行中断,报错
ETIMEDOUT。原因:数据库连接超时,尤其是在处理大量历史批次数据时,可能因网络延迟或数据库负载过高导致。 - 现象:提取出的批次号或检测结果字段为空。原因:PDF 文档中关键信息以图片形式存在,或OCR识别未正确配置,导致文本提取失败。
- 现象:循环体处理文件时,部分文件未被处理。原因:循环层级配置不当,或未正确设置循环变量的迭代范围,导致逻辑分支未能覆盖所有待处理对象。
怎么确认配好了
- 选择一个包含典型 CMC 数据的 PDF 文档,执行工作流,检查输出的结构化数据是否完整且字段无误。
- 模拟一次稳定性研究数据更新,手动触发或等待定时触发,检查工作流是否能正确捕获并处理新增数据,并核对处理耗时。
- 对比工作流处理后的数据与原始报告,重点核查关键数值型字段(如含量、纯度)及其单位是否一致,并确认无单位转换错误。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。