这个品类的数据长什么样
药物警戒注册申报资料主要包括药物不良反应报告(Individual Case Safety Reports, ICSRs)、定期安全性更新报告(Periodic Safety Update Reports, PSURs/PBRERs)、风险管理计划(Risk Management Plans, RMPs)等。这些文档通常以 PDF 格式呈现,内部结构复杂,包含大量非结构化文本、半结构化表格和图表。数据来源多为全球范围内的临床试验、上市后监测、文献检索及病例报告。更新频率方面,ICSRs 报告具有实时性,PSURs/PBRERs 通常按半年或年度提交,RMPs 视情况更新。文档中涉及的字段包括患者基本信息、药品信息、不良事件描述、医学术语(如 MedDRA 编码)、剂量、用法用量、事件发生时间、结局等,单位涉及时间单位(日、周、月)、剂量单位(mg、g、ml)等,且常出现跨语言描述。
这些特征在「文档解析与分块」这一环带来什么约束
药物警戒资料的复杂文档结构和多源性对文档解析与分块提出了特定要求。首先,PDF 中嵌套的表格和图表需要专门处理,确保数据完整性,避免解析为无意义的文本块。其次,医学术语和专业缩写(例如 MedDRA 编码)的准确识别与上下文关联至关重要,它们是理解不良事件性质和严重程度的关键。多语言混杂的文本,尤其是不良事件描述,要求解析器具备多语言识别能力。此外,ICSRs 的实时性意味着解析系统需要支持快速处理和增量更新,而 PSURs/PBRERs 的定期更新则需要版本管理能力,确保不同版本间信息的准确比对。对字段和单位的精确识别,特别是剂量和时间,直接影响安全性评估的准确性,因此分块时需尽量保持相关数值与描述的紧密联系。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾语义完整性与召回效率,避免过长文本稀释关键信息或过短文本丢失上下文。 |
分段重叠长度 | 100–150 字符 | 确保分段边界处的语义连续性,尤其在表格或长句跨段时提供衔接。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PSURs/RMPs 等文档时,防止因解析耗时过长导致超时中断。 |
table_parsing_strategy | auto 或 advanced | 自动识别并结构化解析复杂表格,保留表格的行列关系,提升表格数据可用性。 |
ocr_languages | zh, en | 应对文档中可能出现的中文和英文混合内容,确保图片或扫描件中的文字被识别。 |
recall_threshold | 0.75 | 针对医学专业术语和不良事件描述,提高召回的精准度,减少无关信息的干扰。 |
容易做错的三处
- 解析结果中出现大量破碎的表格行或列,导致数据无法理解,原因在于
table_parsing_strategy未正确配置或文档表格结构过于复杂,未能有效识别边界。 - 关键医学术语或剂量单位在分块后与描述信息分离,导致检索时上下文缺失,原因在于
分段长度过小,切割了紧密关联的信息,或分段重叠长度不足。 - 上传大型 PDF 文档时系统报错
Request Timeout或504 Gateway Timeout,原因在于PARSE_FILE_TIMEOUT_SECONDS参数设置过低,未能留足处理时间。
怎么确认配好了
- 随机抽取多份不同类型的药物警戒文档,上传并查看知识库中的分段内容,检查关键信息(如 MedDRA 编码、剂量、不良事件描述)是否完整且上下文连贯。
- 针对包含复杂表格的 PDF 文件,验证解析后的分段是否能清晰展现表格内容,或表格数据是否已结构化提取,可通过检索表格中特有数据进行验证。
- 观察日志输出,确保在解析过程中没有出现明显的超时或解析失败错误,并核对
PARSE_FILE_TIMEOUT_SECONDS的实际生效情况。 - 尝试对知识库中的不良事件描述进行检索,评估召回结果的准确性和相关性,并根据实际业务需求调整
recall_threshold。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。