这个品类的数据长什么样
小分子化药的注册申报资料通常来源于药品研发与生产过程中的实验报告、检测数据、临床研究报告、质量标准、生产工艺文件等。这些文档更新频率较低,主要集中在新药申报、补充申请或定期报告时。文档结构高度规范化,遵循ICH、NMPA等监管机构的CTD(通用技术文档)格式要求。常见的文档类型包括PDF格式的化验单、图谱、研究报告,以及Word或Excel格式的申报表格。数据字段包含批次号、检测项目、检测结果、单位(如mg/mL、℃、pH值)、检测方法、判定标准等,其中图谱数据(如HPLC、NMR)以图像形式嵌入。
这些特征在「文档解析与分块」这一环带来什么约束
小分子化药申报资料的规范性要求文档解析过程需要精确识别并提取结构化信息,对表格和图谱中的关键数据尤其敏感。PDF文档中嵌入的图片(如结构式、色谱图)是核心信息载体,要求文档解析能够同时处理文本和图像内容,并从中提取可用于检索的元数据或文字描述。文档更新频率低,意味着初期解析需投入较高资源确保准确性,后续增量更新压力较小。字段与单位的标准化,要求分块时能有效关联数值与单位,避免误解。分块策略需兼顾CTD模块的逻辑完整性,确保每个分块能独立提供有意义的上下文,例如,一个分块应包含一个完整的实验方法描述或一个检测项目的全部结果。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾小分子化药实验报告的段落完整性与检索粒度,避免切断关键描述或数据表格。 |
分段重叠长度 | 100–200 字符 | 确保上下文连续性,尤其在跨页或跨段落的表格、图谱说明中。 |
是否启用图片OCR | 是 | 小分子化药申报资料中存在大量嵌入式图谱和结构式,OCR是获取这些信息文本的关键。 |
OCR语言 | 中文, 英文 | 申报资料中可能同时包含中文描述和英文专业术语、化合物名称。 |
表格解析模式 | 结构化 | 准确识别和提取化验单、稳定性数据等表格中的数值与单位,保留其结构关系。 |
召回条数 | 前 5 条 | 注册申报查询时通常需要较少但高度相关的精确结果,避免无关信息干扰。 |
容易做错的三处
- 解析结果中图片内容缺失或不完整,现象为召回结果中只有文字描述,缺少图像信息,原因是
是否启用图片OCR未开启或OCR识别率不足,导致嵌入式图谱或结构式未被转化为可检索文本。 - 查询特定数据时,返回结果包含大量无关上下文,现象为召回的分块过大或包含多个不相关主题,原因是
分段长度设置过长,未能有效将不同实验或检测项目区分开。 - 表格数据查询结果不准确,现象为数值与对应的检测项目或单位错位,原因是
表格解析模式未设置为结构化模式,导致表格内容被平面化处理,丢失了行列关联信息。
怎么确认配好了
- 选择一份包含复杂表格和嵌入图谱的典型小分子化药申报PDF文档,上传解析后,在知识库中随机选取多个分块,检查其内容是否包含图谱OCR识别出的文本及表格中的结构化数据。
- 针对特定的实验项目名称或化合物结构名称进行检索,检查召回结果的分块是否完整包含了该项目的所有描述、数据和相关图谱信息,并评估其上下文的连贯性。
- 模拟查询某个批次的特定检测结果(例如“批号 XXX 含量”),核对召回结果中该数值是否准确对应正确的检测项目和单位,并验证其来源文档的页码信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。