这个品类的数据长什么样
先导优化阶段的注册申报资料主要来源于实验室记录、体内外实验报告、药代动力学数据、毒理学研究报告以及初步的临床前研究文档。这些数据通常以PDF、扫描件、Word文档、Excel表格等多种格式存在,内容涵盖化合物结构式、实验流程图、数据图表、统计结果、文字描述和分析。文档更新频率较高,尤其是在化合物结构调整、活性筛选和安全性评估过程中。文档结构复杂,常出现多级标题、嵌套表格、图像与文字混排的情况。字段涉及化合物编号、剂量、时间点、生物指标、统计值等,单位包括纳摩尔(nM)、毫克每千克(mg/kg)、小时(h)、相对荧光单位(RFU)等。
这些特征在「文档解析与分块」这一环带来什么约束
先导优化资料的复杂文档结构和多源异构特性,对文档解析精度提出了高要求。图像中包含的化合物结构式和实验结果图,要求解析器具备强大的图像文本识别(OCR)能力和图表理解能力,以确保关键信息的提取完整性。嵌套表格和多列布局使得传统基于文本流的解析方法容易出现字段错位或数据丢失,需要专门的表格解析算法。高更新频率意味着知识库需要支持增量更新和版本管理,分块策略需考虑文档的逻辑完整性,避免关键信息被切割到不同块中,影响后续检索的准确性。生物医药特有的专业术语和计量单位,要求分块时能够识别并保持这些语义单元的完整性,避免因截断而导致上下文丧失。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾语义完整性和单次召回的信息量,避免过长导致无关信息干扰,过短导致上下文丢失。 |
分段重叠长度 | 50 字符 | 确保相邻分块间的上下文连续性,减少因分块边界造成的语义割裂。 |
ENABLE_OCR | true | 先导优化资料中含有大量图像和扫描件,必须开启OCR以识别图片中的文字内容。 |
TABLE_PARSING_STRATEGY | "advanced" | 文档中包含复杂的多列和嵌套表格,高级解析策略能更准确地提取表格数据。 |
IMAGE_EMBEDDING_MODEL | "clip-vit-base-patch32" | 提升对化合物结构图、实验结果图等图像内容的理解和表示能力。 |
MAX_FILE_SIZE_MB | 200 MB | 确保能够处理包含大量图像和复杂表格的大型PDF文档,避免文件上传失败。 |
容易做错的三处
- 解析结果中表格数据错位或缺失,通常是由于未选择合适的表格解析策略或
TABLE_PARSING_STRATEGY配置不当。 - 文档中的图片文字未被识别,导致相关信息无法检索,原因多是
ENABLE_OCR未开启或OCR模型能力不足。 - 检索结果出现大量不相关的分块,可能是
分段长度过长,导致单个分块包含过多冗余信息。
怎么确认配好了
- 上传典型文档后,检查解析后的分块内容,确认关键信息(如化合物名称、实验数据、图表标题)是否完整且无错位。
- 针对包含复杂表格的PDF,验证解析后的表格数据是否正确对应原始文档的行与列。
- 对文档中包含图片的区域,通过检索图片中的关键词,确认
ENABLE_OCR是否有效。 - 通过模拟提问,观察返回的分块是否具有良好的上下文连贯性,并据此调整
分段长度和分段重叠长度。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。