这个品类的数据长什么样
小分子化药领域的数据主要来源于各类研究报告、专利文献、药品说明书、临床试验报告和药物合成路线文档。这些文档通常以 PDF、Word 或结构化数据(如 CSV、Excel 表格)的形式存在。数据更新频率较高,新化合物、新合成方法、临床数据和药理活性报告持续发布。文档结构复杂,常包含大量专业术语、化学结构式、反应式、图表和表格。字段涵盖分子式、CAS 号、药效学参数(如 IC50、EC50)、药代动力学参数(如 T1/2、Cmax)、毒理学数据、合成步骤、纯度、批次信息等。单位多样,涉及摩尔浓度 (µM)、剂量 (mg/kg)、时间 (h)、温度 (℃)、压力 (kPa) 等。
这些特征在「文档解析与分块」这一环带来什么约束
小分子化药文档的复杂结构和专业内容对文档解析与分块提出了特殊要求。首先,大量的化学结构式和反应式在常规文本解析中容易被误识别或忽略,影响信息完整性。其次,多样的专业术语和缩写需要特定的词典支持,以确保分词的准确性。表格和图表中的关键数据是核心信息,但其解析难度较大,若处理不当会导致关键数值丢失或关联错误。此外,不同文档类型(如专利和说明书)的逻辑结构差异大,需要灵活的分块策略。高更新频率要求知识库能够快速摄取和索引新数据。字段和单位的准确识别对于后续的知识检索和推理至关重要,错误的单位解析可能导致严重的误判。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 100 MB | 应对包含大量图表和扫描件的复杂文档,确保大型报告能顺利上传。 |
分段长度 | 800–1200 字符 | 兼顾小分子化药文档中常见的冗长描述和多字段信息,避免上下文割裂。 |
分段重叠 | 100–150 字符 | 确保跨段落的化学反应步骤、药效关联性等信息不会因分段而丢失上下文。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 考虑到处理包含复杂表格、化学结构图的 PDF 文件可能耗时较长。 |
启用表格识别 | 勾选 | 大量关键药理、毒理、合成数据以表格形式呈现,表格识别是核心功能。 |
OCR_THRESHOLD | 按实测标定 | 适应扫描版专利和早期文献的图像质量差异,确保文字内容能被准确提取。 |
容易做错的三处
- 文档上传后,知识库未能提取出表格中的关键药效数据,字段显示为空。原因是
启用表格识别未勾选或表格结构过于复杂,导致解析器未能正确识别表格边界和内容。 - 上传的专利文档中,化学名称和 CAS 号被错误地分词或识别为普通文本,导致检索时无法精准匹配。原因在于没有配置或更新专业术语词典,解析器缺乏领域特定知识。
- API 上传 PDF 文件后,部分扫描版图片中的文字未能被识别,内容缺失。原因是
OCR_THRESHOLD参数设置不当,或者没有启用 OCR 功能,导致扫描件中的文字无法转化为可检索文本。
怎么确认配好了
- 上传一份包含复杂表格和化学结构图的典型小分子化药报告,检查知识库中是否正确提取并索引了表格内的所有关键数值和文本信息。
- 上传一份包含多种专业术语和 CAS 号的专利文献,通过关键词搜索验证这些专业术语和 CAS 号是否能被准确召回,且上下文语义完整。
- 上传一份扫描版的药品说明书,检查其文字内容是否被完整识别并可供检索,特别是确保页眉页脚和图注文字没有遗漏。
- 随机抽取知识库中的若干文档分块,核对
分段长度是否符合预期范围,并且分块边界没有截断关键的化学反应步骤或药理机制描述。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。