这个品类的数据长什么样
CAR-T 细胞治疗的临床试验预筛数据主要来源于患者病历、基因测序报告、流式细胞术结果、影像学报告以及既往治疗史等。这些数据通常以非结构化文本、半结构化表格和结构化数值等多种形式存在。患者病历包含医生诊断、治疗方案、随访记录等自由文本,更新频率较高,可能每周甚至每天有新的记录。基因测序报告通常为 PDF 或 TXT 格式,包含大量的基因位点信息和变异描述。流式细胞术结果多为 FCS 文件或报告,提供细胞群体的定量数据。影像学报告则以 DICOM 图像及其解读文本为主。字段与单位方面,涉及肿瘤负荷(如 SUVmax 值)、淋巴细胞计数(如 CD3+ 细胞百分比)、基因突变类型(如 TP53 突变)等,单位多样且专业性强,例如细胞数以 cells/μL 计,基因变异描述常采用 HGVS 命名规范。
这些特征在「工作流编排」这一环带来什么约束
CAR-T 细胞治疗数据的多样性对工作流编排提出了具体要求。患者病历的非结构化特性,要求工作流具备强大的文本抽取和实体识别能力,以从自由文本中准确抓取关键医学概念,例如疾病诊断、用药剂量、不良事件等。基因测序报告的复杂结构和专业术语,使得知识库构建和检索需要高度优化的语义匹配能力,确保在预筛规则中能有效利用基因位点信息。数据更新频率高,意味着工作流设计需要考虑增量更新和实时处理机制,避免重复处理历史数据,并确保预筛结果基于最新信息。此外,不同数据源的异构性,如结构化数值与非结构化文本的混用,要求工作流能够灵活集成多种数据处理模块,例如数值比较、文本相似度计算和规则引擎判断。字段与单位的专业性,则约束了工作流中条件判断节点的准确性,需要精确定义数值范围和文本模式。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 4000 字符 | 确保 AI 问答节点能处理较长的患者病史摘要和关键基因位点信息,同时避免超出模型处理上限。 |
分段长度 | 800 字符 | 适用于切分基因测序报告和影像学报告文本,保证每个知识库分段包含足够上下文,并能被有效检索。 |
召回条数 | 5 条 | 在知识库搜索节点中,从多个患者文档或基因数据库中召回相关信息,覆盖潜在的预筛条件。 |
相似度阈值 | 0.75 | 对于医学术语和基因变异描述,提高相似度阈值以确保召回信息的精确性,减少误判。 |
超时时间 | 600 秒 | 处理复杂基因测序数据或多份病历时,预留充足时间给文本解析、实体抽取和知识库检索等操作。 |
模型名称 | gpt-4o-mini 或 claude-3-haiku-20240307 | 平衡处理复杂医学文本的准确性与推理速度,尤其在需要进行多轮对话以明确患者情况时。 |
容易做错的三处
- AI 问答节点接收到的文本信息不完整,例如只显示了部分病史,原因是上游文本拼接节点输出的文本长度超过了 AI 问答节点配置的
maxContext限制。 - 工作流中的知识库搜索节点未能召回预期结果,例如无法找到某个基因突变信息,原因可能是知识库 ID 未作为参数正确传递到节点,导致搜索范围错误。
- 调用外部模型进行流式输出时,输出内容中断或格式异常,现象是
code运行模块返回的res.sendStream方法没有被正确调用或数据流处理不当,导致响应不完整。
怎么确认配好了
- 通过模拟多组包含不同预筛条件的患者数据,观察工作流最终输出的预筛结果是否与预期一致,尤其是对边缘病例的判断。
- 在工作流的每个关键节点,例如文本抽取、知识库搜索和条件判断后,检查其输出结果的
payload数据,确认数据格式、字段值和完整性符合预期。 - 使用 FastGPT 的调试功能,逐步执行工作流,检查每个节点的输入和输出,特别是关注
ai对话节点在接收到特定问询后,能否准确引用知识库中的医学事实。 - 针对基因测序报告等复杂文档,验证知识库搜索节点在输入特定基因位点或变异描述时,召回的知识段落是否精确且相关度高,可以通过调整
相似度阈值来优化。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。