这个品类的数据长什么样
CAR-T 细胞治疗研发文档的数据来源多样,主要包括临床试验方案、研究者手册、患者知情同意书、药学/非临床研究报告(如药代动力学、药效学、毒理学报告)以及法规申报资料。这些文档的更新节奏与研发阶段紧密相关,早期研究阶段更新频繁,进入临床后期则相对稳定。文档结构复杂,常包含大量非结构化文本、表格、图谱。字段与单位具有高度专业性,例如剂量单位常涉及 细胞数/kg、ug/mL,时间单位会精确到 天、周、月,同时存在大量生物学专用名词和缩写,如 DLT (剂量限制性毒性)、CR (完全缓解)。
这些特征在「引用来源与溯源」这一环带来什么约束
CAR-T 细胞治疗研发文档的复杂性对引用来源与溯源提出了特定要求。首先,文档中专业术语和缩写密集,导致模型在召回时易产生歧义,影响溯源准确性,需要更精细的文本分段策略。其次,表格和图谱中的关键数据往往是核心引用点,传统基于文本块的召回方法难以直接定位,需要增强对表格内容或图表描述的解析能力。再者,不同研发阶段的文档更新频率差异,要求知识库能够有效管理版本,确保引用的是最新或指定版本的资料。最后,严格的法规要求意味着对任何引用内容的溯源必须高度精确,能够指向原始文档的具体页码或章节,以满足审计和合规性需求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 平衡了 CAR-T 文档中长段落的上下文完整性与检索效率,避免过度截断关键信息。 |
分段重叠长度 | 100–150 字符 | 确保相邻段落间的语义连贯性,尤其在专业术语和数据描述的过渡处。 |
召回条数 | 8–12 条 | 在保证召回相关性的前提下,覆盖 CAR-T 研发文档中可能分散的关键信息点。 |
相似度阈值 | 0.78–0.85 | 兼顾了专业术语的精确匹配和语义相似度,降低无关结果干扰。 |
重排返回条数 | 3–5 条 | 聚焦于与 CAR-T 特定问题最相关的核心证据,减少冗余信息。 |
ENABLE_RAG_REFERENCE_AUTO_EXTRACT | true | 确保自动从模型回答中提取并展示引用来源,满足溯源要求。 |
容易做错的三处
- 模型回答中引用的知识库条目为空或与实际回答内容不符:原因在于知识库分段策略不当,未能有效捕获 CAR-T 研发文档中的关键信息,或召回的相似度阈值过高导致相关度不足的段落被过滤。
- 工作流工具调用后,回答中仍然显示知识库搜索的
input和response引用信息:原因在于工作流配置中的输出设置未能正确配置,未禁用或未按需调整引用展示规则,导致默认输出格式被保留。 - 特定表格或图谱中的关键数据无法被引用溯源:原因在于知识库的文档解析器未能有效识别和提取这些非文本结构的数据,导致它们在向量化和检索阶段被忽略。
怎么确认配好了
- 针对典型 CAR-T 研发问题进行提问,检查回答中的引用来源是否能精确指向原始文档中的具体章节或段落。
- 验证回答中引用的内容与原始文档中的表述是否完全一致,特别是关于剂量、时间点和临床结果等关键数据。
- 模拟文档更新后,测试知识库的回答是否能正确引用最新版本的文件,并确保旧版本引用不再出现或能被明确标识。
- 检查回答中是否未出现工作流工具调用后不应展示的
input或response引用信息,确认输出设置生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。