这个品类的数据长什么样
CMC 研究的数据主要来源于实验报告、生产批次记录、质量控制文档以及注册申报资料。这些数据以结构化和非结构化形式并存,包括实验室 LIMS 系统导出的 CSV 文件、实验人员撰写的 PDF 报告、生产过程中的 MES 系统日志、QC 仪器生成的图像与光谱数据等。数据更新频率在项目推进的不同阶段差异显著,初期研发阶段可能每周甚至每天都有新数据生成,后期稳定性考察则可能每月或每季度更新。文档结构方面,实验报告通常遵循 GLP/GMP 规范,包含实验目的、方法、结果、结论等固定章节,但具体内容表述多样。字段与单位方面,涉及化合物纯度(%)、杂质含量(ppm)、稳定性数据(个月)、溶解度(mg/mL)、批次号、生产日期等,单位的规范性与一致性对后续分析至关重要。
这些特征在「工作流编排」这一环带来什么约束
CMC 研究数据来源的多元性与混合结构,要求工作流具备强大的文件解析与异构数据整合能力。例如,PDF 报告的非结构化内容需要高级的 OCR 与自然语言处理技术提取关键信息,而 LIMS 导出的 CSV 文件则需精确的列映射与数据类型转换。数据更新频率的不一致性,决定了工作流触发机制的灵活性。部分任务可能需要实时响应新数据上传,而另一些任务则可按周期性调度。文档遵循的 GLP/GMP 规范,意味着在信息提取时需特别关注实验方法、关键参数、批次信息等合规性字段的准确识别,以确保预筛结果的可靠性。字段与单位的规范性,直接影响到数据清洗与验证环节。工作流中必须内置单位转换与数值范围校验逻辑,避免因单位不统一或数据异常导致预筛偏差。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型实验报告 PDF 解析耗时较长,需足够超时时间 |
分段长度 | 800–1200 字符 | 兼顾语义完整性与模型处理效率 |
召回条数 | 前 10 条 | 确保覆盖相关度高的 CMC 实验结果与批次数据 |
相似度阈值 | 0.75 | 筛选出与临床试验预筛条件高度相关的 CMC 数据 |
重排返回条数 | 5 条 | 精炼最终呈现给模型的信息,减少噪声 |
maxContext | 8192 | 容纳更多 CMC 实验细节与背景信息 |
容易做错的三处
- 调用数据库工具时,使用变量传入 SQL 参数报错,而手动输入 SQL 语句执行正常。这通常是由于变量类型不匹配或 SQL 注入风险防御机制触发。
- 工作流中无法调用已配置的外部工具(例如数据库连接器或自定义 API)。这可能是因为部署环境(如 Docker)的网络配置限制了 FastGPT 访问外部服务的权限,或者工具配置中缺少必要的鉴权信息。
- 在对话过程中未能实时切换或选择知识库以响应用户查询。这通常是由于工作流设计时未将知识库选择逻辑集成到对话循环中,或者知识库选择的触发条件不够明确。
怎么确认配好了
- 上传不同格式(PDF、CSV、DOCX)的 CMC 实验报告,检查知识库中是否成功生成对应分段,并核对关键字段(如
化合物纯度、批次号)是否被准确提取。 - 针对核心的临床试验预筛条件,进行模拟查询,验证工作流能否准确召回相关的 CMC 研究文档片段,并检查召回条数与相似度分值是否符合预期。
- 使用包含变量的 SQL 语句,通过工作流的数据库连接工具查询 CMC 生产批次信息,验证变量能否正确传递并执行查询,且返回结果与预期一致。
- 在工作流中集成多个知识库,模拟用户在对话中提出不同类型的查询,确认工作流能够根据查询内容动态选择合适的知识库进行检索。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。