这个品类的数据长什么样
CAR-T 细胞治疗注册申报资料的数据来源高度专业化,主要包括临床试验报告(涉及 I-III 期数据)、非临床研究报告(药理毒理、CMC 生产工艺)、质量标准、生产批次记录以及监管机构发布的指导原则和审评意见。这些文档通常以 PDF 格式为主,内含大量图表、生物学数据、化学结构式和统计结果。数据更新频率相对较低,主要集中在临床试验数据解锁、监管政策修订或生产工艺优化后。文档结构严谨,遵循 ICH GCP/GLP/GMP 等国际规范,字段如“细胞扩增倍数”、“病毒载体滴度”、“患者入组标准”、“不良事件发生率”等具有明确的生物学或药学含义,单位涉及 细胞数/kg、病毒颗粒/mL、% 等。
这些特征在「引用来源与溯源」这一环带来什么约束
CAR-T 申报资料的专业性和规范性对引用来源与溯源提出了高要求。首先,文档中包含的复杂图表和表格数据,需要系统能够进行精准的文本提取和语义理解,确保引用的准确性。其次,低更新频率意味着知识库内容相对稳定,但在更新时必须确保新旧版本数据的有效管理和版本溯源。再次,严格的监管要求使得任何引用都必须精确到原文页码、章节或段落,以支持审评时的快速核查。此外,高度专业化的字段和单位要求系统在召回和引用时,能够区分不同上下文中的相似术语,避免误引。系统需具备处理长文档的能力,并能将引用的上下文与原始数据点紧密关联,确保追溯链条的完整。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800-1200 字符 | 确保生物学和药学概念的完整性,避免关键信息被截断 |
召回条数 | 8-12 条 | 在保证覆盖度的同时,减少不相关信息的干扰,提高召回效率 |
相似度阈值 | 0.75-0.85 | 针对专业术语和规范表述,提高召回的精准度,减少模糊匹配 |
重排返回条数 | 3-5 条 | 聚焦最相关的几个引用,便于人工核查和验证 |
引用合并策略 | 按文档来源合并 | 确保同一原始文档的引用上下文聚合展示,方便溯源 |
最大引用token | 4096 token | 适应长篇幅专业文档的引用需求,保留更多上下文信息 |
容易做错的三处
- 引用结果出现大量重复或无关内容,原因是
相似度阈值设置过低,导致泛化召回。 - 部分关键数据点无法被引用或引用不完整,原因是
分段长度过短,导致语义单元被截断。 - 工作流中对不同知识库返回结果进行合并处理后,引用的溯源路径不清晰,原因是缺少对
引用合并策略的明确配置。
怎么确认配好了
- 选取包含复杂图表和专业术语的典型申报资料片段,验证系统能否准确提取和引用其中的数据点。
- 针对一份包含修订历史的文档,核查系统在更新知识库后,是否能够区分并准确引用新旧版本的内容。
- 随机抽取多个引用结果,检查其是否能精确溯源到原始文档的页码和段落,并核对上下文是否完整。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。