这个品类的数据长什么样
基因治疗 AAV 注册申报资料主要来源于药监部门发布的指导原则、国内外学术期刊发表的临床前与临床研究数据、以及药企内部生成的药物研发报告、批生产记录、质量控制报告等。这些数据更新频率相对较低,通常随新法规出台或关键临床试验结果发布而更新。文档结构以非结构化文本为主,如 PDF 格式的法规文件、Word 格式的实验报告,以及部分结构化数据如 Excel 表格中的批次检测数据。文档中常包含大量生物学、药学专业术语,如 载体滴度、宿主细胞DNA残留、基因组完整性、体内生物分布 等,并涉及多种单位,如 vg/mL(载体基因组数/毫升)、ng/mg(纳克/毫克)、%(百分比)。
这些特征在「知识库检索与召回」这一环带来什么约束
基因治疗 AAV 资料的非结构化文本特性,要求知识库切分时需兼顾语义完整性,避免关键信息被截断。专业术语和缩写的大量存在,对召回模型的词汇理解和同义词匹配能力提出挑战。例如,AAV 可能指代腺相关病毒,也可能在特定语境下特指某种血清型。文档更新频率低,意味着知识库构建后,日常维护的重点在于新发布法规的增量更新与旧文档的修订。此外,文档中常见的图表和表格数据,在文本化处理后可能丢失原始结构信息,影响检索的准确性。某些关键指标如 纯度 或 效价 可能分散在不同段落,需要系统能关联多个知识片段进行综合判断。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800-1200 字符 | 兼顾语义完整性与召回效率,避免长段落稀释关键信息。 |
分段重叠长度 | 100-200 字符 | 确保段落间上下文联系,减少切分造成的语义割裂。 |
召回条数 | 前 10-15 条 | 覆盖更广的潜在相关知识,应对信息分散和多义性。 |
相似度阈值 | 按实测标定 | 针对 AAV 专业术语的语义相似度,需通过实际数据迭代优化。 |
重排返回条数 | 前 5 条 | 在初次召回基础上,通过重排模型聚焦最相关的少数关键信息。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF 文件或复杂 Word 文档解析可能耗时较长的情况。 |
容易做错的三处
- 知识库问答时,引用结果中未出现预期文档内容,可能是因为知识库切分粒度过大或过小,导致关键信息被稀释或截断。
- 上下文引用中的文档格式未能按 Markdown 渲染,通常是由于文件解析器未正确提取或转换文档的原始格式标记。
- 切换知识库索引时出现
60秒超时错误,往往是由于知识库文件量过大或索引重建过程中的计算资源不足。
怎么确认配好了
- 选择有明确答案的 AAV 注册申报问题,向知识库提问,核对召回的知识片段是否包含正确答案的关键信息。
- 上传包含复杂表格或图表的 AAV 相关文档,检查解析后知识片段中的关键数据和描述是否完整。
- 调整
相似度阈值参数,观察召回结果数量和相关性变化,直至找到能平衡召回率与准确性的临界点。 - 模拟高并发访问场景,测试知识库索引切换或查询的响应时间,确保在预期
超时限制内完成。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。