CAR-T 细胞治疗产品的工作流编排

CAR-T细胞治疗产品的数据来源多样,主要包括临床试验报告、药物说明书、监管审批文件、学术论文以及药企内部研发文档。这些数据更新频率不一,临床试验数据通常在

这个品类的数据长什么样

CAR-T 细胞治疗产品的数据来源多样,主要包括临床试验报告、药物说明书、监管审批文件、学术论文以及药企内部研发文档。这些数据更新频率不一,临床试验数据通常在试验进行中及结束后定期发布,而药物说明书和监管文件则随审批进展或版本迭代而更新。文档结构上,多数为 PDF 格式的非结构化文本,包含大量医学术语、实验数据表、图表和参考文献。关键字段包括靶点名称、细胞来源、制备工艺、适应症、不良反应、剂量方案、临床疗效数据(如 ORR、CR、PFS、OS)以及安全性指标(如 CRS 等级、ICANS 等级)。数据单位方面,涉及剂量(如 cells/kg)、时间(如 天、月)、百分比(如 %)以及各类生物学指标。

这些特征在「工作流编排」这一环带来什么约束

CAR-T 细胞治疗数据的多源性与异构性,使得工作流编排在数据预处理阶段需考虑多种文件类型和数据格式的兼容性。非结构化文本占比高,要求工作流具备强大的信息抽取能力,例如从临床试验报告中准确提取关键疗效与安全性数据。数据更新频率的不一致性,意味着工作流在设计时应支持定时触发和手动触发相结合的机制,以适应不同数据源的更新周期。特别是对于临床试验数据,其复杂的数据结构和专业术语对模型理解和信息提取的准确性提出了更高要求。此外,数据中包含的剂量、时间等单位信息,在工作流中进行数值计算或比较时,需要进行严格的单位标准化处理,避免因单位不统一导致的结果偏差。对 CRS 等级、ICANS 等级等分类指标,工作流需能准确识别并进行数值化或标签化处理。

配置怎么定

配置项建议取法这样取的依据
maxContext4000 字符多数临床试验报告或监管文件单个关键段落的长度上限,确保上下文完整性。
分段长度800 字符兼顾长文本处理效率与语义完整性,避免关键信息被截断。
召回条数5 条在高专业度语境下,增加召回数量有助于覆盖更多潜在相关但表述不一的信息点。
相似度阈值0.75考虑到医学术语的精确性要求,略高于通用阈值,减少无关信息的干扰。
重排返回条数3 条精炼最终返回结果,聚焦最相关信息,提升咨询响应的准确性和效率。
PARSE_FILE_TIMEOUT_SECONDS600 秒应对大型 PDF 文件解析可能耗时较长的情况,避免因超时导致解析失败。

容易做错的三处

  • 在处理临床试验报告时,数值型疗效指标(如 ORR 百分比)提取为空,原因是没有正确配置正则表达式或实体识别模型来处理百分号和数值间的关联。
  • 工作流调用外部 Python 函数处理数据时,函数返回错误码 500,原因是 Python 环境缺少必要的医学数据处理库,或函数参数与工作流节点输出不匹配。
  • 当一个表单输入节点作为子应用嵌套在主工作流中时,其对话框仍然显示,原因是在子应用配置中未明确设置该节点的 visible 属性为 false。

怎么确认配好了

  • 对不同来源的 CAR-T 细胞治疗文档,运行工作流并检查关键字段(如靶点、适应症、不良反应、疗效数据)的提取结果,确保字段值完整且单位正确。
  • 模拟用户提问,查询特定 CAR-T 产品的疗效或安全性信息,验证工作流返回的结果是否准确地引用了文档中的数据,并与原始文档进行比对,核对数值和描述。
  • 检查工作流的运行日志,确认在处理包含大量图表和复杂表格的文档时,没有出现解析失败或超时错误,并关注 PARSE_FILE_TIMEOUT_SECONDS 参数的生效情况。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。