这个品类的数据长什么样
药物警戒领域的数据主要来源于药品上市后监测报告、不良事件报告(ADR)、安全性更新报告(PSUR/DSUR)、风险管理计划(RMP)以及相关法规文件。这些文档的更新频率取决于药品生命周期阶段和监管要求,例如 PSUR 通常为半年或年度更新。文档结构多样,包括结构化表格、半结构化文本和自由文本描述。典型字段包括药品名称、批号、剂量、给药途径、不良事件术语(使用 MedDRA 编码)、事件发生时间、严重程度、结局、因果关系评估等,涉及的单位通常为时间单位(日、周、月)、剂量单位(mg、g、IU)以及频率(次/日)。
这些特征在「文档解析与分块」这一环带来什么约束
药物警戒文档的特性对文档解析与分块提出了特定要求。首先,药品名称、批号等关键标识符需精准提取,以确保数据关联的准确性。其次,不良事件描述常包含医学术语和临床细节,对分块的语义完整性要求高,避免因过度分块而丢失上下文。更新频率较高的报告,要求解析流程具备增量更新和版本管理能力。文档中混合的结构化表格和自由文本,使得单一解析策略难以应对,需要结合表格识别与自然语言处理技术。此外,MedDRA 编码等专业术语的存在,要求解析器能识别并保留其完整性,避免在分块时被截断或误解,影响后续的检索和分析。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾不良事件描述的完整性和检索效率,避免过短丢失上下文,过长引入无关信息。 |
分段重叠长度 | 50–100 字符 | 确保段落间上下文连续性,尤其在描述不良事件发展过程时。 |
解析模式 | 智能分段 | 适应药物警戒文档中混合的结构化与非结构化内容,提高解析准确性。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型安全性报告(如 PSUR)的解析时间,防止因文件过大而超时。 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 允许上传包含多图表、详细附录的大型研发文档。 |
PDF_PARSE_ENGINE | doc2x | 多数药物警戒文档以 PDF 格式分发,此引擎对 PDF 的表格和文本抽取效果较好。 |
容易做错的三处
- 文件上传后系统提示“解析失败,无法识别文件类型”:通常是上传了不受支持的文件格式,例如某些自定义的 XML 报告,系统默认解析器无法处理。
- 解析后的文本中关键字段(如药品批号、MedDRA 编码)缺失或不完整:可能由于分段策略过于激进,将关键术语从其上下文中断开,或解析器未针对表格内数据进行优化。
- API 调用上传文件时返回
400 Bad Request错误,提示缺少必要参数:通常是file或metadata参数未正确传递,或者请求体格式不符合 API 规范。
怎么确认配好了
- 选取不同类型(ADR、PSUR、RMP)的典型文档进行上传解析,检查解析后的文本内容是否完整、无明显截断,并核对关键信息的提取准确性。
- 针对包含复杂表格的文档,验证表格内容是否被正确识别并转换为可读文本,尤其关注剂量、频率等数值字段及单位的完整性。
- 通过 API 接口上传测试文件,检查接口响应状态码是否为
200 OK,并验证解析任务的状态是否最终变为“成功”。 - 随机抽取解析后的若干文本分块,检查其语义完整性,确保每个分块都包含独立且有意义的信息,尤其关注不良事件描述和因果关系评估部分。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。