这个品类的数据长什么样
减毒灭活疫苗相关的制度文档主要来源于国家药品监督管理局、世界卫生组织、各药典委员会发布的指导原则、技术审评要求以及疫苗生产企业的内部质量管理体系文件。这些文档更新频率相对较低,通常随法规修订或技术进步进行周期性更新,但涉及批次放行和生产记录的补充文件则可能实时生成。文档结构以规范性文本为主,常包含大量法律法规条文、技术标准、操作步骤、图表以及附录。核心字段包括但不限于批号、生产日期、有效期、检验报告、储存条件、运输要求、不良反应监测数据。计量单位严谨统一,如疫苗效价(TCID50/mL)、抗体滴度(IU/mL)、温度(℃)、湿度(%RH)、剂量(mL/剂)等,对精度要求极高。
这些特征在「文档解析与分块」这一环带来什么约束
制度文档的规范性和更新频率低决定了文档解析需要高度重视文本的完整性和上下文关联,避免断章取义。法规条文和操作步骤的逻辑严密性要求分块时不能随意切割,否则可能导致关键条款的语义丧失。图表和附录中包含的结构化数据(如批次检验结果表、不良反应统计表)需要特殊处理,以保持其数据关联性。计量单位的严格性意味着在分块后,如果涉及数字和单位的分离,后续召回和答案生成环节必须能准确重组,避免误读。例如,将“2-8℃”拆分为“2-8”和“℃”可能导致查询“储存温度”时无法准确匹配。此外,批号、生产日期等高频、关键的实体信息需要在分块时予以识别和标记,方便后续精确检索。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 确保法规条文和操作步骤的完整性,避免关键信息被切割,同时兼顾召回效率。 |
分段重叠长度 | 100–200 字符 | 保证分块间的上下文衔接,减少因分块边界导致的语义缺失,尤其是在长段落中。 |
自定义规则 | 启用 | 针对批号、效价等特定格式内容进行正则匹配,保持其完整性。 |
解析模式 | 段落解析 | 优先保持自然段落的完整,符合制度文档的结构特点。 |
OCR识别 | 启用 | 确保扫描版或图片形式的图表、批次记录等内容能被正确识别和索引。 |
知识库最大文件大小 | 200 MB | 适应包含大量图表或多页附录的制度文档,确保大型文件能顺利上传。 |
容易做错的三处
- 上传 PDF 文件后搜索不出任何信息,只显示错误。这通常是由于 PDF 文件是扫描件且未进行 OCR 处理,导致文本内容无法被 FastGPT 解析提取。
- 模型输出答案时,未能引用文档中的图片或图表信息。这是因为文档解析时未启用 OCR 识别,或者 OCR 识别后的文本与原始图片关联性差,导致图片内容未被有效索引。
- 查询特定批次或产品效价时,结果不准确或缺失。这可能源于
自定义规则未正确配置,导致批号、效价等关键实体在分块时被错误切割或未被识别为独立语义单元。
怎么确认配好了
- 上传一份包含复杂图表和长段落的制度文档,查看知识库中分块的数量和内容是否符合预期,特别是图表旁边的文本是否被正确关联。
- 使用文档中包含的特定法规条文、批号或技术参数进行搜索测试,观察召回结果是否包含完整的相关分块,并检查
相似度阈值是否能有效筛选。 - 检查 FastGPT 后台
文件解析日志,确认是否存在解析失败或超时记录,并核对PARSE_FILE_TIMEOUT_SECONDS参数是否足够。 - 针对文档中的计量单位(如
TCID50/mL、℃),进行精确查询,验证分块后这些单位与数值的关联性是否保持完好。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。