这个品类的数据长什么样
小分子化药的药物警戒数据主要来源于临床试验报告、上市后监测报告(如 CIOMS I 表)、药品说明书、医学文献以及监管机构发布的安全性更新。这些文档通常以 PDF 格式为主,也包含少量 Word 或结构化数据文件。更新频率方面,临床试验报告通常在试验结束后发布,上市后监测报告则根据不良事件发生情况持续积累,监管更新具有不定期性。文档结构上,报告类文件常包含摘要、正文、图表、附录等部分,其中不良事件描述、药物剂量、用药途径、患者特征等信息分布在不同段落。字段与单位方面,涉及剂量(mg、g)、频率(次/日、QD)、时间(天、周)、不良事件术语(MedDRA 编码)、实验室指标(mmol/L、U/L)等,单位标准化程度较高。
这些特征在「文档解析与分块」这一环带来什么约束
小分子化药药物警戒文档的特性对文档解析与分块提出了具体要求。首先,PDF 格式为主且结构复杂,要求解析器能准确识别文本、表格和图片中的文字,并处理多栏布局。不良事件描述可能跨页或嵌入在长段落中,需要智能分块策略以保持语义完整性。其次,频繁更新的监测报告意味着增量解析和版本管理的重要性,避免重复处理已解析内容。字段与单位的高度标准化,使得在分块后可以利用正则表达式或命名实体识别技术,更精确地提取关键信息,例如剂量 50 mg 或事件 肝酶升高。此外,医学术语的专业性要求分块时避免切断关键短语,确保召回时能提供完整的上下文。对于表格数据,需要解析器能够将其转换为可查询的结构化文本,供后续检索使用。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 平衡上下文完整性与检索效率,避免切断关键不良事件描述。 |
分段重叠长度 | 100–200 字符 | 确保跨分段的关键信息不丢失,提升召回质量。 |
PARSE_FILE_TIMEOUT_SECONDS | 300–600 秒 | 处理大型临床报告或包含大量图表的 PDF 文件,防止解析超时。 |
maxContext | 32000 token | 适应长篇幅的医学报告,为大模型提供足够上下文理解复杂案例。 |
PDF_OCR_ENABLED | true | 确保扫描版或图片形式的报告内容也能被识别和解析。 |
CHUNK_STRATEGY | 按标题和段落 | 优先保持文档的逻辑结构,如不良事件章节、剂量信息章节。 |
容易做错的三处
- 现象:上传 PDF 文件后,部分表格内容未能正确提取,导致关键剂量或实验室数据缺失。 原因:解析器未能正确识别 PDF 中的复杂表格结构,将其内容混淆为普通文本或直接跳过。
- 现象:系统日志显示
PDF parsing failed: doc2x error,文件解析中断。 原因:PDF 文件可能存在加密、损坏或内部结构异常,导致底层解析工具无法正常处理。 - 现象:大模型在回答中未能提及某个明显存在于原文中的不良反应事件,或事件描述不完整。 原因:文档分块时,关键事件描述被不当切分,导致单个分块缺乏足够的上下文信息。
怎么确认配好了
- 选择一份包含复杂表格和多栏布局的典型小分子化药临床试验报告,上传后检查解析结果,确认表格数据是否完整且结构化。
- 选取几份不同来源(如监管机构、药企)的药物警戒报告,上传后查看分块预览,确认不良事件、剂量等关键信息是否在合理的分块内保持语义完整。
- 针对解析失败的 PDF 文件,尝试使用
PDF_OCR_ENABLED参数,并重新上传,观察解析结果是否改善。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。