这个品类的数据长什么样
药物警戒(Pharmacovigilance)制度数据主要来源于药品上市许可持有人(MAH)提交的药物不良反应(ADR)报告、风险管理计划(RMP)、产品说明书、以及监管机构发布的指导原则和法规文件。这些文档通常以 PDF、Word 或结构化数据库的形式存在。ADR 报告具有半结构化特点,包含患者基本信息、药品信息、ADR 描述、处理措施和结局等字段。风险管理计划则更为复杂,涉及药品安全性特征、潜在风险、风险最小化措施等。法规文件和指导原则则多为纯文本,更新频率通常根据监管要求,如年度修订或特殊事件触发。字段与单位方面,ADR 报告中可能涉及剂量(mg、g)、频率(次/日)、时间(小时、天)、诊断名称(ICD 编码)等。
这些特征在「模型接入与配置」这一环带来什么约束
药物警戒数据的多样性要求模型能够处理不同格式的文档,特别是对 PDF 和 Word 文档的准确解析能力。ADR 报告中的半结构化特性,使得信息提取需要结合结构化字段识别和非结构化文本理解。风险管理计划的复杂性则对模型的长文本理解和信息关联能力提出挑战。法规文件更新的周期性,意味着知识库需要支持增量更新,并能快速识别并整合新版本内容。剂量、频率等带单位的字段,在模型处理时需要注意单位的统一性和数值的正确性解析,避免因单位不一致导致的信息误判。同时,由于药物警戒的严谨性,对模型召回的准确性和查全率要求极高,需要精细化配置召回策略和重排机制。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500-800 字符 | 兼顾长文本语义完整性与向量检索效率 |
分段重叠 | 50 字符 | 确保相邻分段上下文连续,减少语义信息丢失 |
召回条数 | 8-12 条 | 提升召回相关文档的概率,覆盖更多潜在信息点 |
相似度阈值 | 0.75-0.85 | 过滤不相关结果,确保召回内容的精准性 |
重排返回条数 | 3-5 条 | 进一步精炼召回结果,聚焦最相关内容 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF/Word 文档解析时长,防止超时失败 |
容易做错的三处
- 模型返回的药物剂量或频率数值有误:原因在于文档解析时未正确识别单位或数值,导致模型理解偏差。
- 法规更新后,模型仍然引用旧版规定:原因在于知识库未及时同步更新,或增量更新策略未能有效覆盖所有相关文档。
- 查询特定 ADR 报告时,结果中混杂大量不相关内容:原因在于
相似度阈值设置过低,或者召回条数过多,导致低相关度文档被召回。
怎么确认配好了
- 选取多个典型药物警戒查询案例,比对模型回答与原始文档内容,核查信息准确性。
- 针对近期更新的法规或指导原则,测试模型能否正确引用最新规定,并能解释其变化。
- 使用包含特定剂量、频率等数值信息的查询,检查模型是否能准确提取并理解这些数值及其单位。
- 模拟不同复杂度的 ADR 报告查询,评估模型召回结果的查全率和查准率,并根据实际需求调整
相似度阈值和重排返回条数。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。