这个品类的数据长什么样
药物警戒(Pharmacovigilance, PV)注册申报资料主要包含不良事件报告(Individual Case Safety Report, ICSR)、定期安全性更新报告(Periodic Safety Update Report, PSUR)、风险管理计划(Risk Management Plan, RMP)等。这些文档通常以 PDF、Word 或结构化数据(如 E2B 格式的 XML 文件)形式存在。数据来源广泛,包括临床试验、上市后监测、文献回顾和医疗机构自发报告。更新频率高,尤其是 ICSR,可能每日都有新增,PSUR 通常半年或一年更新一次。文档结构复杂,包含医学术语、剂量单位、时间戳、患者特征、药品信息、事件描述和因果关系评估等字段,部分字段可能采用标准医学编码词典(如 MedDRA、WHODrug)。
这些特征在「模型接入与配置」这一环带来什么约束
药物警戒数据的复杂性和高更新频率对模型接入提出了特定要求。首先,大量非结构化文本(如事件描述)需要高效的文本解析和实体识别能力,以准确提取关键信息。其次,频繁的数据更新要求知识库具备快速增量更新机制,避免知识滞后。对 E2B XML 等结构化数据的处理,需要特定的解析器和映射规则,确保数据完整性。医学专业术语和编码体系的存在,意味着模型需要集成或预训练相关领域知识,以提升理解准确性。此外,多语言资料的出现,也对模型的语言处理能力提出挑战,例如部分不良事件报告可能来自非英语国家。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾长文本语义完整性与模型处理效率,避免信息截断或过载。 |
分段重叠长度 | 100–150 字符 | 确保上下文连续性,减少关键信息在分段边界处被割裂的风险。 |
召回条数 | 前 5–8 条 | 平衡召回精度与模型输入长度限制,确保相关性高的文档片段被检索。 |
相似度阈值 | 按实测标定,例如 0.75–0.85 | 确保检索结果与查询高度相关,避免引入噪声信息。 |
重排返回条数 | 前 3 条 | 经过重排后,进一步精选最相关的片段,提升模型回答质量。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PSUR 或 RMP 文档的解析时间,防止因超时导致处理失败。 |
容易做错的三处
- 模型在回答中遗漏关键的剂量或时间信息,这是因为文档解析时未充分识别医学计量单位和时间表达式,或者分段策略导致关键数值与上下文分离。
- 对话中出现
Unexpected end of JSON input错误,这可能与模型输出过长或包含特殊字符导致 JSON 解析失败有关,尤其在使用特定开源模型时更易发生。 - 模型对不良事件的因果关系评估结果答非所问,这通常是由于知识库中缺少对应医学术语的上下文或相关临床指南,也可能是由于文本嵌入模型未能正确捕获医学概念间的深层语义联系。
怎么确认配好了
- 上传一份包含不良事件报告、PSUR 摘要和 RMP 关键章节的混合文档,验证模型能否准确提取患者基本信息、药品名称、不良事件描述和关键日期字段。
- 针对一份 E2B XML 格式的 ICSR 文件,通过模型提问,检查是否能正确识别并报告 MedDRA 编码和 WHODrug 编码对应的信息。
- 使用包含特定医学术语和药物相互作用的查询,验证模型返回的文档片段是否涵盖了相关专业知识,并通过人工评估判断其语义相关性阈值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。