CAR-T 细胞治疗临床试验预筛的知识库检索与召回

CAR-T细胞治疗临床试验数据主要来源于临床试验注册平台(如ClinicalTrials.gov、中国临床试验注册中心)、研究者手册、医学期刊论文以及药企内

这个品类的数据长什么样

CAR-T 细胞治疗临床试验数据主要来源于临床试验注册平台(如 ClinicalTrials.gov、中国临床试验注册中心)、研究者手册、医学期刊论文以及药企内部报告。数据更新频率较高,新试验注册、患者招募状态变更、研究结果发布等事件均会触发更新,通常以周或月为单位进行。文档结构以半结构化和非结构化数据为主。半结构化数据体现为试验方案、患者入排标准、不良事件报告等,包含明确的字段如 NCT 号、适应症、干预措施、疾病分期、既往治疗史。非结构化数据则存在于试验描述、研究背景、讨论部分。字段与单位的特殊性在于,剂量单位常涉及 细胞数/kg 或 细胞数/m²,时间单位会细化到 周、月、年,且常伴随 随访期 等概念。

这些特征在「知识库检索与召回」这一环带来什么约束

CAR-T 临床试验数据的高更新频率要求知识库具备高效的增量更新机制,以确保检索结果的时效性。半结构化数据的存在,使得传统的全文检索不足以满足精确匹配需求,需要结合结构化信息进行过滤和排序。例如,精确检索特定 疾病分期 的试验,仅依靠文本相似度难以实现。非结构化数据中的关键信息提取,如 既往治疗史 的复杂描述,对分词和实体识别提出了更高要求。剂量单位和时间单位的细化,意味着需要支持数值范围查询和单位转换,例如检索 剂量大于 5x10^6 细胞/kg 的试验。此外,患者入排标准中的多重条件组合,要求检索逻辑能够处理复杂的布尔运算和嵌套条件,以精确匹配预筛需求。

配置怎么定

配置项建议取法这样取的依据
分段长度500–800 字符临床试验文档的段落通常包含多个关键信息,过短分段易丢失上下文,过长则引入噪声。
召回条数10–15 条初步召回需要覆盖足够多的潜在相关试验,以便后续重排和过滤。
相似度阈值按实测标定针对 CAR-T 试验的专业术语和缩写,阈值需在保证召回率与精确率之间取得平衡。
重排返回条数3–5 条最终呈现给用户的结果应高度相关且精炼,避免信息过载。
最大文件大小100 MB考虑研究者手册和详细报告的体积,确保能够上传大型 PDF 文档。
嵌入模型bge-large-zh 或 text-embedding-ada-002选用在医学领域有较好表现的嵌入模型,提升专业术语的语义理解。

容易做错的三处

  • 检索结果包含大量无关试验,现象是 召回条数 很多但相关性不高。原因在于 相似度阈值 设置过低,导致大量低相关度文档被召回,或者分段策略不合理,关键信息被拆散。
  • 查询特定剂量的试验时,系统无法正确识别数值范围或单位,导致 结果为空。原因在于知识库没有针对 CAR-T 领域特有的剂量单位和数值范围进行专门的实体识别或解析配置。
  • 更新后的临床试验数据未能及时反映在检索结果中,现象是 最新状态 与实际不符。原因在于知识库的增量同步机制未有效配置或触发,导致数据新鲜度不足。

怎么确认配好了

  • 选取一批具有明确入排标准的 CAR-T 临床试验案例,构造查询语句,检查 重排返回条数 中的试验是否准确匹配。
  • 针对不同剂量范围和单位的查询,例如 CD19 CAR-T 剂量 > 5e6 细胞/kg,验证系统是否能正确召回目标试验,并检查 剂量 字段的解析精度。
  • 模拟一次 CAR-T 临床试验的状态更新(例如招募状态从 招募中 变为 已完成),在知识库更新后立即查询,确认状态变更是否已生效。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。