这个品类的数据长什么样
DTP 药房在注册申报资料准备过程中,涉及的数据主要来源于药品生产企业的原始研发文档、临床试验报告、药学研究报告、质量标准、说明书、以及药监部门发布的法规文件。这些资料通常以 PDF 格式为主,也包含少量 Word 文档和 Excel 表格。文档更新频率相对较低,主要集中在药品上市前申报、获批后变更或再注册时。文档结构复杂,包含大量专业术语、图表、表格、以及多级标题。字段与单位具有高度专业性,例如药品的化学结构式、含量单位(mg/片、%)、检测方法参数(HPLC、GC),以及药学批次号、有效期等。
这些特征在「文档解析与分块」这一环带来什么约束
DTP 药房注册申报资料的专业性与复杂结构,要求文档解析器能够准确识别多级标题、图表标题和表格内容,以保持知识的上下文连贯性。PDF 文档中嵌套的图片和扫描件可能导致文字识别(OCR)成为关键环节,影响后续分块的准确性。Excel 文件中的多维数据,例如不同批次药品的检测结果,需要特殊处理以避免数据丢失或上下文割裂。由于涉及大量专业术语和缩写,分块时需考虑语义完整性,避免将关键信息切断。文档更新频率低,意味着初期解析与分块的准确性至关重要,后续重复处理的成本较高。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾专业术语上下文和单块信息量,避免过长或过短导致语义割裂。 |
最大分块大小 | 1000 KB | 确保单个知识块能够承载包含图表或复杂表格的文档片段。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF 或扫描件的 OCR 处理耗时,避免因超时导致解析失败。 |
召回条数 | 前 8 条 | 注册申报资料的检索通常需要更全面的信息来支撑决策。 |
相似度阈值 | 0.75 | 高阈值确保召回的知识片段与查询意图高度相关,减少噪音。 |
重排返回条数 | 5 条 | 在高召回条数基础上,通过重排精选最相关的片段,提升最终响应质量。 |
容易做错的三处
- 解析大型 PDF 文件时,系统提示“请求超时”,原因是没有调整
PARSE_FILE_TIMEOUT_SECONDS参数,导致默认超时时间不足以完成 OCR 或复杂结构解析。 - 知识库中的 Excel 表格数据检索结果不完整,例如只返回部分批次信息,原因是默认分块策略未能有效处理表格的多行多列关联性,导致上下文丢失。
- 上传的扫描版 PDF 文件内容解析错误或缺失,原因是文档解析服务未启用或配置合适的 OCR 引擎,导致无法从图片中提取文字。
怎么确认配好了
- 随机抽取多份不同类型(纯文本、图表、表格)的注册申报资料,上传至知识库,检查每个文档的知识块数量和内容完整性,确保关键信息未被截断。
- 针对 Excel 文件,设计包含跨行、跨列信息的查询,验证检索结果是否能完整还原原始数据中的关联信息。
- 上传一份包含复杂图表和扫描件的 PDF 文档,检查解析后的知识块是否准确识别了图表标题和扫描件中的文字,并通过查询验证其可检索性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。