市场准入药物警戒的引用来源与溯源

市场准入药物警戒的数据主要来源于上市许可持有人(MAH)提交的药品风险管理计划(RMP)、安全性更新报告(PSUR)、个例安全性报告(ICSR)以及监管机构

这个品类的数据长什么样

市场准入药物警戒的数据主要来源于上市许可持有人(MAH)提交的药品风险管理计划(RMP)、安全性更新报告(PSUR)、个例安全性报告(ICSR)以及监管机构发布的药品安全性通告。这些文档通常是 PDF 格式,包含大量非结构化文本、表格和图表。数据更新频率不一,PSUR 通常每半年或每年更新一次,RMP 依据风险评估结果动态调整,而 ICSR 则是持续性的实时上报。文档中涉及的字段包括药品名称、活性成分、适应症、不良事件术语(如 MedDRA 编码)、严重程度、发生日期、报告来源等。单位方面,剂量常以毫克(mg)、克(g)表示,频率以每日一次(QD)、每日两次(BID)等表示,时间单位则为天、周、月、年。

这些特征在「引用来源与溯源」这一环带来什么约束

市场准入药物警戒文档的非结构化特性和复杂性,对知识库的引用来源与溯源能力提出了挑战。PDF 文档中的表格和图表内容在文本提取时容易丢失结构信息,影响后续的语义理解和精确引用。不同文档类型和更新频率要求系统能灵活处理增量更新和版本管理,确保引用的始终是最新且权威的版本。ICSR 的实时性意味着知识库需要支持高频数据摄入和快速索引。MedDRA 编码等专业术语的存在,要求分词和语义匹配具备行业专业性,以避免因术语理解偏差导致引用不准确。此外,由于这类数据的严谨性要求,每次引用都需明确指向原始文档的具体页码或段落,以满足合规性审查的需求。

配置怎么定

配置项建议取法这样取的依据
分段长度500–800 字符平衡语义完整性与召回效率,确保单一分段包含足够上下文。
重叠长度50–100 字符保证分段间的上下文连续性,减少信息丢失。
召回条数10–15 条覆盖更广的潜在相关信息,同时控制 LLM 输入长度。
相似度阈值0.75–0.85过滤掉低相关性结果,提高引用质量,减少无关信息干扰。
maxContext3500–4000 token适应市场准入文档的详细描述,确保 LLM 能处理足够上下文。
引用来源显示原始文档名 + 页码满足法规合规性要求,提供精确溯源路径。

容易做错的三处

  • 现象:知识库回答中引用的来源文档页码缺失或不准确。原因:文档解析时未正确提取或保留页码信息,或分段逻辑导致跨页内容被拆分。
  • 现象:模型引用的内容与原始文档语义不符,或出现“幻觉”。原因:相似度阈值设置过低,导致召回了大量低相关性或有歧义的片段。
  • 现象:处理一个市场准入查询时,模型输出的引用文档数量过多,甚至超过了 LLM 的上下文限制。原因:召回条数设置过高,且未有效利用重排机制过滤冗余信息。

怎么确认配好了

  • 选择一份典型的 RMP 文档,进行提问,核对回答中引用的页码是否准确指向原文对应内容。
  • 针对一份包含复杂表格的 PSUR 文档进行查询,验证模型是否能正确理解并引用表格中的数据。
  • 随机抽取多个不良事件报告(ICSR)的引用,确认其 引用来源显示 格式一致且可追溯到原始报告。
  • 针对不同更新频率的文档(如 RMP 和 PSUR),分别进行内容更新后提问,验证知识库是否引用了最新版本的信息。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。