CAR-T 细胞治疗临床试验预筛的工作流编排

CAR-T细胞治疗的临床试验预筛数据主要来源于患者病历、基因测序报告、流式细胞术结果、影像学报告以及既往治疗史等。这些数据通常以非结构化文本、半结构化表格和

这个品类的数据长什么样

CAR-T 细胞治疗的临床试验预筛数据主要来源于患者病历、基因测序报告、流式细胞术结果、影像学报告以及既往治疗史等。这些数据通常以非结构化文本、半结构化表格和结构化数值等多种形式存在。患者病历包含医生诊断、治疗方案、随访记录等自由文本,更新频率较高,可能每周甚至每天有新的记录。基因测序报告通常为 PDF 或 TXT 格式,包含大量的基因位点信息和变异描述。流式细胞术结果多为 FCS 文件或报告,提供细胞群体的定量数据。影像学报告则以 DICOM 图像及其解读文本为主。字段与单位方面,涉及肿瘤负荷(如 SUVmax 值)、淋巴细胞计数(如 CD3+ 细胞百分比)、基因突变类型(如 TP53 突变)等,单位多样且专业性强,例如细胞数以 cells/μL 计,基因变异描述常采用 HGVS 命名规范。

这些特征在「工作流编排」这一环带来什么约束

CAR-T 细胞治疗数据的多样性对工作流编排提出了具体要求。患者病历的非结构化特性,要求工作流具备强大的文本抽取和实体识别能力,以从自由文本中准确抓取关键医学概念,例如疾病诊断、用药剂量、不良事件等。基因测序报告的复杂结构和专业术语,使得知识库构建和检索需要高度优化的语义匹配能力,确保在预筛规则中能有效利用基因位点信息。数据更新频率高,意味着工作流设计需要考虑增量更新和实时处理机制,避免重复处理历史数据,并确保预筛结果基于最新信息。此外,不同数据源的异构性,如结构化数值与非结构化文本的混用,要求工作流能够灵活集成多种数据处理模块,例如数值比较、文本相似度计算和规则引擎判断。字段与单位的专业性,则约束了工作流中条件判断节点的准确性,需要精确定义数值范围和文本模式。

配置怎么定

配置项建议取法这样取的依据
maxContext4000 字符确保 AI 问答节点能处理较长的患者病史摘要和关键基因位点信息,同时避免超出模型处理上限。
分段长度800 字符适用于切分基因测序报告和影像学报告文本,保证每个知识库分段包含足够上下文,并能被有效检索。
召回条数5 条在知识库搜索节点中,从多个患者文档或基因数据库中召回相关信息,覆盖潜在的预筛条件。
相似度阈值0.75对于医学术语和基因变异描述,提高相似度阈值以确保召回信息的精确性,减少误判。
超时时间600 秒处理复杂基因测序数据或多份病历时,预留充足时间给文本解析、实体抽取和知识库检索等操作。
模型名称gpt-4o-mini 或 claude-3-haiku-20240307平衡处理复杂医学文本的准确性与推理速度,尤其在需要进行多轮对话以明确患者情况时。

容易做错的三处

  • AI 问答节点接收到的文本信息不完整,例如只显示了部分病史,原因是上游文本拼接节点输出的文本长度超过了 AI 问答节点配置的 maxContext 限制。
  • 工作流中的知识库搜索节点未能召回预期结果,例如无法找到某个基因突变信息,原因可能是知识库 ID 未作为参数正确传递到节点,导致搜索范围错误。
  • 调用外部模型进行流式输出时,输出内容中断或格式异常,现象是 code 运行模块返回的 res.sendStream 方法没有被正确调用或数据流处理不当,导致响应不完整。

怎么确认配好了

  • 通过模拟多组包含不同预筛条件的患者数据,观察工作流最终输出的预筛结果是否与预期一致,尤其是对边缘病例的判断。
  • 在工作流的每个关键节点,例如文本抽取、知识库搜索和条件判断后,检查其输出结果的 payload 数据,确认数据格式、字段值和完整性符合预期。
  • 使用 FastGPT 的调试功能,逐步执行工作流,检查每个节点的输入和输出,特别是关注 ai 对话节点在接收到特定问询后,能否准确引用知识库中的医学事实。
  • 针对基因测序报告等复杂文档,验证知识库搜索节点在输入特定基因位点或变异描述时,召回的知识段落是否精确且相关度高,可以通过调整 相似度阈值 来优化。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。