这个品类的数据长什么样
临床前安评资料主要来源于药理毒理学研究报告,包含体外试验数据、体内动物试验数据、药代动力学数据等。数据更新频率相对较低,通常在项目里程碑节点进行归档。文档结构高度标准化,遵循 ICH M3(R2) 等指导原则,以 CTD(通用技术文件)格式呈现。报告中包含大量的表格、图谱和文字描述,涉及毒性指标(如 LD50、NOAEL)、药代参数(如 Cmax、AUC)、病理组织学描述等。字段命名常带有专业缩写和单位,例如 mg/kg、μg/mL、g/L、h。数据分布广泛,从原始数据到总结性报告,格式多样,包括 PDF、Word、Excel 等。
这些特征在「工作流编排」这一环带来什么约束
临床前安评数据的标准化和专业性,对工作流编排提出了精细化要求。首先,大量的表格和图谱需要工作流具备强大的文档解析能力,确保关键数据能够被准确识别和提取。其次,严格的法规遵循要求工作流在数据处理和信息整合过程中,能够忠实于原始报告的逻辑和结构,避免信息丢失或误读。专业字段和单位的特殊性,使得在信息抽取和校验环节,需要配置特定的模式匹配或规则引擎,以确保数据准确性。由于数据更新频率低但单次数据量大,工作流的稳定性与批处理能力至关重要,需要支持长时间运行和错误恢复机制。此外,CTD 格式的层级结构,要求工作流在资料组织和输出时,能有效映射到相应的申报模块,确保最终产出的资料符合注册要求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000 tokens | 临床前安评报告内容密集,确保模型能处理较长的文本上下文。 |
分段长度 | 500 字符 | 平衡文本语义完整性和处理效率,适应报告中段落长度。 |
召回条数 | 10 条 | 提高信息召回率,覆盖报告中分散的关键信息点。 |
相似度阈值 | 0.75 | 确保召回内容的准确性,避免无关信息干扰。 |
重排返回条数 | 3 条 | 聚焦最相关的关键信息,提高最终输出的质量。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 临床前安评报告文件较大,预留充足的解析时间。 |
容易做错的三处
- 输出变量在后续组件中为空,原因是没有正确配置代码组件的
output变量名,或正则表达式提取失败,导致数据无法传递。 - API 访问时未收到用户提示或表单输入,原因是在工作流发布后,未将
用户选择或表单输入组件正确映射到 API 请求参数中。 - 知识库 ID 变量设置报错,原因是在
知识库组件中直接传入了未经解析或格式错误的变量,导致系统无法识别目标知识库。
怎么确认配好了
- 通过模拟提交一个完整的临床前安评报告,检查工作流是否能准确解析报告中的
NOAEL值、Cmax值,并将其映射到预设的输出字段。 - 在 FastGPT 的调试界面,逐个检查工作流中各组件的输入输出,确认数据流转无误,尤其关注变量赋值和传递是否符合预期。
- 使用不同格式(PDF、Word、Excel)的临床前安评报告进行测试,验证工作流在多种文件类型下均能稳定运行,并提取到一致的结构化数据。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。