这个品类的数据长什么样
CMC 研究的数据主要来源于实验记录、分析报告和批次生产文档。数据更新频率通常与研发阶段和生产批次相关,从每周到每月不等。文档结构复杂,包含非结构化的实验日志、半结构化的分析结果报告(如 HPLC 图谱、质谱数据)、以及结构化的批次放行数据。字段与单位具有高度专业性,例如“纯度”可能以 % (w/w) 表示,“残留溶剂”可能以 ppm 表示,“蛋白质浓度”可能以 mg/mL 表示。数据中常包含大量图表、图片以及手写批注,这些非文本信息对自动化处理构成挑战。
这些特征在「工作流编排」这一环带来什么约束
CMC 数据的多源性和复杂性,要求工作流能够处理不同格式的文件,并进行准确的文本提取与信息结构化。低更新频率意味着知识库的索引重建无需过于频繁,但每次更新需要覆盖全面。非结构化数据中的关键信息提取,如从实验日志中识别特定化合物的批号和检测值,依赖于强大的命名实体识别(NER)能力。专业化的字段与单位,要求工作流在参数传递和结果展示时,保持单位的一致性和准确性,避免因单位不匹配导致的数据误解。大量图表和图片的存在,要求工作流能够集成图像识别能力,以获取文本以外的关键信息,例如从图谱中识别峰面积或保留时间,这增加了数据预处理的复杂性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 100 MB | CMC 报告常包含大量图像和图谱,文件体积较大。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理复杂 PDF 和图像提取,解析时间可能较长。 |
maxContext | 8000 字符 | 单个 CMC 报告篇幅较长,需要更大的上下文窗口。 |
分段长度 | 512 字符 | 确保每个分段包含足够的上下文,同时避免信息冗余。 |
相似度阈值 | 0.75 | 保证召回结果与专业术语和实验数据的高度相关性。 |
召回条数 | 前 10 条 | 确保涵盖足够多的相关实验细节和批次信息。 |
容易做错的三处
- 文件上传后,工作流无法获取文件链接并传递到后续组件,现象为“输入为空”的报错。原因在于文件上传组件的输出参数未正确映射到工作流的输入参数。
- 在处理批次间差异分析时,模型输出的结果条数与预期不符。原因通常是数据清洗或预处理环节未充分标准化不同批次报告中的字段名称和单位,导致信息匹配失败。
- 全局变量在同一对话中更新后,后续节点仍使用旧值,导致计算结果错误。这通常是由于全局变量的更新逻辑未被正确触发,或者更新后的值未及时同步到所有依赖节点。
怎么确认配好了
- 上传典型 CMC 报告文件,验证工作流是否能成功解析并提取出关键字段,如批号、纯度值。
- 模拟用户咨询,提问涉及不同批次或不同化合物的问题,确认工作流能准确召回相关文档片段。
- 通过工作流调试模式,逐节点检查参数传递和变量更新情况,确保数据流转符合预期。
- 检查日志输出,确认没有关键错误码或超时信息,特别是与文件解析和数据处理相关的日志。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。