CAR-T 细胞治疗质量文档的知识库检索与召回

CAR-T细胞治疗的质量文档主要包括生产批记录、质量标准、检验报告、偏差处理、变更控制、验证报告、供应商审计报告和法规符合性文件等。这些文档通常以PDF、W

这个品类的数据长什么样

CAR-T 细胞治疗的质量文档主要包括生产批记录、质量标准、检验报告、偏差处理、变更控制、验证报告、供应商审计报告和法规符合性文件等。这些文档通常以 PDF、Word 或扫描件的形式存在,部分数据可能以结构化表格嵌入在非结构化文档中。更新频率受产品生命周期、法规修订和生产工艺改进等因素影响,可能在数周到数月不等。文档结构复杂,包含大量专业术语、缩写和特定格式。字段包括批次号、生产日期、有效期、检验项目、结果、单位(如 CFU/mL、ng/mL、%)、设备编号、操作人员签名等。

这些特征在「知识库检索与召回」这一环带来什么约束

CAR-T 细胞治疗质量文档的专业性与复杂性,要求知识库检索必须能准确理解生物医学术语和上下文。更新频率的不确定性,意味着知识库需要具备高效的增量更新和版本管理能力,确保检索结果的时效性。文档中混合的非结构化文本和结构化表格数据,对知识切分和嵌入策略提出了挑战,需要能够识别并有效处理表格数据,避免信息丢失。多样的文件格式和潜在的扫描件,要求系统具备强大的 OCR 能力,确保所有文本内容均可被索引。此外,严格的合规性要求,使得检索结果的溯源和可解释性成为关键,需要能清晰地指出信息来源。

配置怎么定

配置项建议取法这样取的依据
分段长度500–800 字符兼顾上下文完整性与检索粒度,避免单一分段过大或过小,影响语义理解。
重叠长度100–150 字符确保分段边界的上下文连续性,提升跨分段检索的准确性。
OCR_ENABLEtrue大量质量文档为扫描件或图像格式,启用 OCR 确保内容可索引。
TABLE_EXTRACTION_MODEsmart自动识别并提取文档中的表格数据,将其结构化后进行索引。
召回条数8–12 条在保证检索覆盖度的前提下,避免返回过多冗余结果,增加后续处理负担。
相似度阈值0.75–0.85针对专业领域语义相似度要求高,确保召回结果与查询高度相关。

容易做错的三处

  • 知识库内容更新后,检索结果未同步更新或出现旧版本信息。原因在于知识库的增量同步机制未正确配置或执行,导致索引与源数据不一致。
  • 用户查询某个批次号或检验数据时,检索结果无法精确匹配表格中的具体数值或行。原因在于知识切分策略未有效处理内嵌表格数据,导致表格内容被扁平化或丢失结构信息。
  • 检索卡片中引用知识库变量时,变量未被正确解析或返回空值。原因在于变量引用语法或配置不符,或者知识库中对应字段的元数据未正确定义。

怎么确认配好了

  • 上传包含各类格式(PDF、Word、扫描件)的质量文档,验证 OCR 功能是否正确提取所有文本,并检查表格数据是否被结构化索引。
  • 针对不同更新频率的文档,模拟内容修改并触发知识库更新流程,观察检索结果是否在合理时间内反映最新版本。
  • 使用包含专业术语、批次号和检验结果的查询语句,验证检索结果的准确性、召回条数和相似度评分是否符合预期阈值。
  • 检查知识库检索结果中,文档来源和分段信息是否清晰可溯,以满足合规性要求。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。