药物警戒产品的文档解析与分块

药物警戒领域的核心数据载体是各类报告和说明书。这些文档主要来源于药品上市许可持有人(MAH)提交的定期安全性更新报告(PSUR)、个例安全性报告(ICSR)

这个品类的数据长什么样

药物警戒领域的核心数据载体是各类报告和说明书。这些文档主要来源于药品上市许可持有人(MAH)提交的定期安全性更新报告(PSUR)、个例安全性报告(ICSR)、药品说明书、临床试验方案及报告等。数据更新频率较高,特别是上市后药品的安全性数据,会根据监管要求定期或不定期更新。文档结构通常包含标准化章节,如药品基本信息、适应症、用法用量、不良反应、禁忌症、注意事项、药理毒理等。其中,不良反应部分常以列表或表格形式呈现,涉及医学术语、疾病代码(如 MedDRA)、药物剂量、发生频率等字段。这些文档的语言专业性强,常包含大量专有名词和缩写,单位涉及剂量(mg、g)、频率(次/日)、时间(天、周、月)等。

这些特征在「文档解析与分块」这一环带来什么约束

药物警戒文档的专业性和结构化特点,对文档解析与分块提出了特定要求。首先,文档中存在大量医学专有名词和缩写,如果分块粒度过小,可能导致上下文丢失,影响语义理解和召回准确性。其次,报告中的表格数据,特别是不良反应事件的发生频率和严重程度信息,需要确保解析时能够完整保留其表格结构和数据关联性,避免数据错位或丢失。再者,文档更新频率较高,要求解析流程能够高效处理增量数据,并支持版本管理。此外,由于这些文档往往篇幅较长且包含多个层级的标题,分块时需要兼顾章节完整性与信息密度,以保证后续检索时能返回具有足够信息量的片段。

配置怎么定

配置项建议取法这样取的依据
分段长度800–1200 字符兼顾医学术语的上下文完整性与检索时的信息密度,避免过短导致语义不全。
分段重叠长度100–200 字符确保分段边界处的关键信息不会因切割而丢失,尤其是在专业术语和短句衔接处。
文件类型限制pdf, docx, txt药物警戒文档多以 PDF 格式发布,兼顾 Word 文档和纯文本报告。
PARSE_FILE_TIMEOUT_SECONDS600 秒应对大型 PSUR 或临床报告解析时间较长的情况,避免因超时导致解析失败。
召回条数前 5–7 条在保证检索结果相关性的前提下,提供足够多的上下文信息供模型分析,应对复杂查询。
相似度阈值按实测标定针对医学文本的语义相似度特点,通过测试集调整以平衡召回率与准确率。

容易做错的三处

  • 解析大型 PDF 文件时出现超时错误,这是因为 PARSE_FILE_TIMEOUT_SECONDS 参数设置过小,未能留足处理时间。
  • 上传的 PDF 文档中表格内容解析后出现错位或数据丢失,原因是没有启用或配置合适的表格解析策略,导致结构化数据被错误地当作纯文本处理。
  • 在检索时,返回的文档片段上下文不足,导致模型无法准确理解查询意图,这通常是 分段长度 设置过短,将重要的关联信息切分到了不同片段。

怎么确认配好了

  • 上传典型药物警戒报告(如 PSUR、ICSR),检查解析后知识库中的文档片段是否完整、语义连贯,特别是表格内容是否正确。
  • 针对包含特定医学术语或不良反应事件的查询,进行检索测试,检查返回的 召回条数 是否满足信息需求,且相关度在可接受范围。
  • 监控后台日志,查看是否有文件解析失败或超时的记录,并根据错误码调整 PARSE_FILE_TIMEOUT_SECONDS 等参数。
  • 使用 FastGPT 的知识库预览功能,随机抽取解析后的文档片段,人工核对其内容质量,包括分段边界的合理性。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。