这个品类的数据长什么样
临床前安评的数据主要来源于药物研发早期的安全性评价报告,包括体内(in vivo)和体外(in vitro)毒理学研究、药代动力学(PK)和药效学(PD)研究报告等。这些文档通常以 PDF 格式为主,也包含部分 Word 文档和 Excel 表格。数据更新频率相对较低,主要在每个临床前研究阶段结束后集中生成。文档结构高度标准化,遵循 GLP(Good Laboratory Practice)规范,包含固定章节,如研究目的、材料与方法、结果、讨论和结论。报告中涉及的字段包括剂量、给药途径、受试物信息、动物品系、观察指标(如体重、脏器系数、血常规、尿常规、病理学检查结果)、不良反应描述、毒性等级等。单位种类繁多,如 mg/kg、g/kg、mmol/L、U/L、℃、% 等,且常以表格形式呈现。
这些特征在「文档解析与分块」这一环带来什么约束
临床前安评报告的标准化结构和大量表格数据,要求文档解析器具备精准的章节识别和表格内容提取能力。固定章节的存在使得基于结构化信息的解析策略更为有效,可以优先识别关键章节以提高信息抽取效率。Excel 形式的原始数据或报告中的嵌入式表格,需要解析器能准确识别表头、行与列,并将单元格内容与其对应的字段语义关联起来,防止数据错位或丢失。报告中严谨的专业术语和多样的计量单位,对分块的粒度提出了更高要求,确保每个分块包含完整的语义信息,避免因截断导致关键数据或单位与数值分离。较低的更新频率意味着初次解析质量至关重要,后续重复解析的需求较少,因此解析过程的稳定性和准确性优先于解析速度。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 临床前安评报告通常包含大量图表和图片,文件体积较大 |
分段长度 | 800–1200 字符 | 确保包含完整的观察指标、剂量、单位及不良反应描述,维持语义完整性 |
分段重叠量 | 100–200 字符 | 衔接不同观测周期或相关性描述,减少信息丢失 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF 文件和复杂表格的解析耗时,避免超时 |
表格内容提取模式 | 结构化提取 | 大量标准化表格数据,提高提取准确性 |
命名实体识别 | 启用并配置特定实体 | 识别药物名称、剂量、单位、毒性等级等关键信息 |
容易做错的三处
- 上传大型 PDF 或 Excel 文件后,长时间无响应或报错
504 Gateway Timeout。原因通常是文件体积过大或解析参数PARSE_FILE_TIMEOUT_SECONDS设置过短,导致解析过程超时。 - 知识库训练完成后,查询结果中出现数值与单位分离,或表格数据混乱。原因在于文档解析器的表格内容提取模式不当,未能正确识别表格结构,导致分块时语义不完整。
- 导入 Excel 文件后,部分行数据未被正确识别或字段为空。这可能是因为 Excel 文件结构不符合预期,或解析器未正确匹配表头与数据列。
怎么确认配好了
- 上传一份包含复杂表格和多页图表的典型安评报告 PDF,观察其解析状态是否成功,并检查知识库中该文档的 chunk 数量与内容。
- 随机抽取知识库中 5-10 个分块,核对分块内容是否包含完整的剂量、单位、观测指标和不良反应描述,确保语义完整性。
- 使用一份包含多种计量单位和专业术语的 Excel 报告进行导入,检查导入后知识库中的数据字段是否与原文件一致,单位与数值是否正确关联。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。