这个品类的数据长什么样
CAR-T 细胞治疗的质量文档数据主要来源于药企内部的研发记录、临床试验报告、生产批次记录、质检报告以及监管机构的申报资料。这些文档的更新频率不一,研发阶段可能每周都有更新,生产批次记录则随批次生成。文档形式多样,包括结构化的数据库记录、非结构化的 PDF 文件(如批生产记录、检验报告)和 Word 文档(如 SOP、工艺验证报告)。字段与单位具有高度专业性,例如细胞计数(单位:cells/mL)、病毒载体拷贝数(单位:copies/cell)、T细胞活化标志物表达率(单位:%),以及批次号、有效期、储存条件等关键信息。部分数据可能包含图表、流式细胞术数据和显微图像等非文本内容。
这些特征在「引用来源与溯源」这一环带来什么约束
CAR-T 细胞治疗的质量文档数据特性对引用来源与溯源提出了特定约束。首先,多源异构的文档形式要求知识库能够有效处理 PDF、Word 和结构化数据,确保内容被准确抽取和索引。更新频率的不一致性意味着需要灵活的增量更新机制,避免频繁的全量重建,并确保引用来源的时效性。专业化的字段和单位要求 RAG 系统在召回时能够精确匹配特定术语,避免因同义词或缩写导致的召回失败。例如,对“细胞存活率”的查询,系统不仅要识别文本中的“存活率”,还要能关联到检验报告中的具体数值。此外,由于CAR-T治疗的监管严格性,引用溯源必须精确到原始文档的具体页码或段落,以满足合规性要求。如果原始文档是扫描件,则需要 OCR 技术的支持。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800-1200 字符 | 兼顾CAR-T文档中长篇描述与表格数据的完整性,避免关键信息被切割。 |
召回条数 | 前 5-8 条 | CAR-T质量文档的专业性要求召回足够多的上下文,以确保理解完整。 |
相似度阈值 | 0.75-0.85 | 保证召回结果与CAR-T专业术语的高度相关性,减少无关信息干扰。 |
重排返回条数 | 前 3 条 | 聚焦最相关的三条结果,提升最终回答的精准度,减少模型幻觉。 |
CHUNK_OVERLAP_SIZE | 100 字符 | 确保相邻分段之间有足够的重叠,避免关键上下文在分段边界处丢失。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型CAR-T批生产记录PDF文件可能需要较长的解析时间。 |
容易做错的三处
- 知识库搜索卡片中,选择知识库后,变量引用为空,这通常是由于知识库索引未完全建立或数据抽取失败,导致无法从源文档中提取出可引用的变量。
- 查看聊天回答的知识库引用时出现报错,这可能源于原始文档路径变更、文档权限问题或索引与实际文件位置不同步,导致系统无法定位并显示正确的引用源。
- 回答问题时未能引用知识库内容,这通常是
相似度阈值设置过高或召回条数过少,导致系统未能召回相关知识片段,从而无法生成引用。
怎么确认配好了
- 上传一批典型的CAR-T质量文档(如SOP、批生产记录、质检报告),检查知识库是否能正确解析并显示文档内容,特别是表格和专业术语。
- 针对文档中的特定批次号、细胞计数、检验项目等信息进行提问,验证回答中是否包含对应的引用来源,并能点击溯源到原始文档的具体位置(如页码、段落)。
- 模拟不同程度的模糊查询,验证系统在
相似度阈值和召回条数配置下,是否能稳定召回相关的CAR-T文档片段,并将其用于生成回答。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。