基因治疗 AAV注册申报资料准备的文档解析与分块

基因治疗AAV(腺相关病毒)注册申报资料的数据来源多样,主要包括临床前研究报告、临床试验报告、生产工艺与质量控制文件、非临床安全性评价文件等。这些文档通常以

这个品类的数据长什么样

基因治疗 AAV(腺相关病毒)注册申报资料的数据来源多样,主要包括临床前研究报告、临床试验报告、生产工艺与质量控制文件、非临床安全性评价文件等。这些文档通常以 PDF、Word、Excel 等格式存在,包含大量结构化与非结构化信息。更新节奏方面,随着研发进展和监管要求变化,数据会阶段性更新,尤其是在临床试验不同阶段和补充申请时。文档结构复杂,例如临床试验报告可能包含研究方案、伦理审批、受试者信息(脱敏后)、数据分析结果等多个章节。字段与单位方面,涉及基因拷贝数(GC/mL)、病毒滴度(vg/mL)、纯度(%)、宿主细胞DNA残留量(ng/mg)、蛋白含量(mg/mL)等生物学和分析化学专业术语及单位。

这些特征在「文档解析与分块」这一环带来什么约束

基因治疗 AAV 资料的复杂性对文档解析与分块提出了特定要求。首先,PDF 格式中包含的扫描图片或复杂排版,需要先进的 OCR 技术识别文本,同时保留表格和图表中的结构信息。其次,文档中大量的专业术语和缩写,要求分块时能识别并保持这些关键信息的完整性,避免因断词而丢失语义。例如,AAV9-GFP 作为一个整体,不应被拆分。此外,Excel 表格数据通常包含多层表头和复杂关联,传统按行分块可能导致语义缺失,需要考虑更智能的结构化分块策略。文档更新频率决定了知识库需要支持增量更新和版本管理,避免重复上传和解析已有的不变内容。对字段和单位的精确识别,直接影响后续 RAG 召回的准确性,要求分块策略能够识别并保持其上下文关联。

配置怎么定

配置项建议取法这样取的依据
分段长度800–1200 字符确保单个分块包含足够上下文,覆盖 AAV 相关术语和短句的语义完整性。
重叠长度100–200 字符保证分块间的平滑过渡,避免关键信息在分块边缘被截断。
解析模式智能分段适应 PDF、Word 等文档中复杂的章节、段落结构,保持语义连贯性。
OCR识别开启识别 PDF 中的扫描图片文本,捕获所有可见信息。
表格解析策略结构化解析针对 Excel 和 PDF 中的复杂表格,提取表头与单元格的对应关系,提升数据利用率。
PARSE_FILE_TIMEOUT_SECONDS300 秒应对包含大量图表、复杂排版的长篇文档解析时间。

容易做错的三处

  • 文档上传后,部分 PDF 中的表格内容未能被正确识别,导致知识库检索时无法召回相关数据。这通常是由于 PDF 文件是图片扫描件,需要开启并优化 OCR 识别功能。
  • 上传的 Excel 文件在提问时效果不佳,无法有效利用表格内的多层级数据。这可能源于默认的文本分块策略未能理解表格的结构化信息,需要选择专门的表格解析策略。
  • 知识库检索结果中,专业术语如 rAAV 或 CAP-200 被错误地拆分或与其他词语混淆,影响检索准确性。这通常是 分段长度 或 重叠长度 配置不当,未能保持专业术语的完整性。

怎么确认配好了

  • 上传具有代表性的基因治疗 AAV 注册申报资料(PDF、Word、Excel),通过知识库预览功能检查文档内容是否被完整识别,尤其是图片中的文本和表格结构。
  • 针对上传的文档内容,进行多轮提问,验证知识库是否能准确召回包含专业术语、关键数据(如 1.0E+11 vg/mL)和复杂表格信息的回答,并检查召回片段的上下文完整性。
  • 调整 分段长度 和 重叠长度 参数后,再次执行上述验证步骤,直到检索结果的准确性和相关性达到预期,特别关注长句和专业术语的语义保持情况。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。