这个品类的数据长什么样
基因治疗 AAV(腺相关病毒)制度相关的文档,主要包括国家药监局、FDA、EMA 等监管机构发布的指导原则、技术审评要求、GCP/GMP 规范,以及企业内部的质量管理体系文件、标准操作规程(SOP)、批生产记录、检验方法学验证报告等。这些文档通常以 PDF 格式为主,部分可能包含扫描件或嵌入的图片、表格。更新频率方面,监管机构的指导原则通常每年或数年修订一次,企业内部 SOP 则可能根据项目进展、技术迭代或监管要求变化,每季度到每年更新。文档结构严谨,层级分明,普遍采用章节、小节、条款编号。字段与单位具有高度专业性,例如病毒滴度(vg/mL)、纯度(%)、宿主细胞残余 DNA(pg/剂量)、内毒素(EU/mL),涉及大量生物学和药学专用名词。
这些特征在「文档解析与分块」这一环带来什么约束
基因治疗 AAV 制度文档的专业性与严谨结构,要求文档解析器能够准确识别章节、小节标题,避免将标题与正文混淆。其中包含的专业术语和缩写,对分词和语义理解提出了更高要求。PDF 文档中常嵌入的表格和图片,尤其是关键的批次数据、检测结果图谱,需要解析器具备图像文字识别(OCR)和表格结构化提取能力,以确保信息完整性。更新频率较高,意味着知识库需要支持增量更新和版本管理,避免重复摄入或遗漏最新修订内容。文档内部引用和外部法规链接较多,需要解析器能够识别并保留这些引用关系,以供后续 RAG 检索时提供上下文支持。对专业单位的识别和标准化处理,有助于确保问答结果的准确性,防止因单位混淆导致误判。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 考虑法规条款和SOP步骤的完整性,避免切断关键信息 |
重叠长度 | 100–150 字符 | 确保分块边界上下文连续,提升检索召回率 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型法规文件和SOP,防止解析超时 |
ENABLE_OCR | True | 确保扫描件和嵌入图片中的关键信息能被识别 |
TABLE_EXTRACTION_MODE | advanced | 准确提取批生产记录和检测报告中的复杂表格数据 |
maxContext | 3000 Tokens | 适应AAV制度中复杂条款和多层级逻辑的上下文需求 |
容易做错的三处
- 上传图像地址文件时解析失败,原因是文件类型检查未通过,仅支持直接上传文件内容。
- 本地部署时,知识库增强PDF解析功能无法启用,原因是 MinerU 服务未正确配置或端口不通。
- 问答结果中缺乏关键数据,现象是回答中未提及表格或图示信息,原因在于
ENABLE_OCR或TABLE_EXTRACTION_MODE未正确配置,导致解析时忽略了非文本内容。
怎么确认配好了
- 上传典型 AAV SOP 文档,检查 FastGPT 知识库中生成的分块内容,确保章节标题和正文逻辑连贯。
- 上传包含复杂表格的批生产记录 PDF,检查分块中是否包含了表格内的关键数据,并能识别专业单位。
- 上传部分扫描件或图片较多的指导原则,检查解析后内容是否包含图片中的文字信息,确认 OCR 功能正常。
- 针对特定法规条款进行提问,验证问答结果能够准确引用原文,并提供相关背景信息,评估召回与回答的准确性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。