这个品类的数据长什么样
市场准入药物警戒的数据主要来源于上市许可持有人(MAH)提交的药品风险管理计划(RMP)、安全性更新报告(PSUR)、个例安全性报告(ICSR)以及监管机构发布的药品安全性通告。这些文档通常是 PDF 格式,包含大量非结构化文本、表格和图表。数据更新频率不一,PSUR 通常每半年或每年更新一次,RMP 依据风险评估结果动态调整,而 ICSR 则是持续性的实时上报。文档中涉及的字段包括药品名称、活性成分、适应症、不良事件术语(如 MedDRA 编码)、严重程度、发生日期、报告来源等。单位方面,剂量常以毫克(mg)、克(g)表示,频率以每日一次(QD)、每日两次(BID)等表示,时间单位则为天、周、月、年。
这些特征在「引用来源与溯源」这一环带来什么约束
市场准入药物警戒文档的非结构化特性和复杂性,对知识库的引用来源与溯源能力提出了挑战。PDF 文档中的表格和图表内容在文本提取时容易丢失结构信息,影响后续的语义理解和精确引用。不同文档类型和更新频率要求系统能灵活处理增量更新和版本管理,确保引用的始终是最新且权威的版本。ICSR 的实时性意味着知识库需要支持高频数据摄入和快速索引。MedDRA 编码等专业术语的存在,要求分词和语义匹配具备行业专业性,以避免因术语理解偏差导致引用不准确。此外,由于这类数据的严谨性要求,每次引用都需明确指向原始文档的具体页码或段落,以满足合规性审查的需求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 平衡语义完整性与召回效率,确保单一分段包含足够上下文。 |
重叠长度 | 50–100 字符 | 保证分段间的上下文连续性,减少信息丢失。 |
召回条数 | 10–15 条 | 覆盖更广的潜在相关信息,同时控制 LLM 输入长度。 |
相似度阈值 | 0.75–0.85 | 过滤掉低相关性结果,提高引用质量,减少无关信息干扰。 |
maxContext | 3500–4000 token | 适应市场准入文档的详细描述,确保 LLM 能处理足够上下文。 |
引用来源显示 | 原始文档名 + 页码 | 满足法规合规性要求,提供精确溯源路径。 |
容易做错的三处
- 现象:知识库回答中引用的来源文档页码缺失或不准确。原因:文档解析时未正确提取或保留页码信息,或分段逻辑导致跨页内容被拆分。
- 现象:模型引用的内容与原始文档语义不符,或出现“幻觉”。原因:
相似度阈值设置过低,导致召回了大量低相关性或有歧义的片段。 - 现象:处理一个市场准入查询时,模型输出的引用文档数量过多,甚至超过了 LLM 的上下文限制。原因:
召回条数设置过高,且未有效利用重排机制过滤冗余信息。
怎么确认配好了
- 选择一份典型的 RMP 文档,进行提问,核对回答中引用的页码是否准确指向原文对应内容。
- 针对一份包含复杂表格的 PSUR 文档进行查询,验证模型是否能正确理解并引用表格中的数据。
- 随机抽取多个不良事件报告(ICSR)的引用,确认其
引用来源显示格式一致且可追溯到原始报告。 - 针对不同更新频率的文档(如 RMP 和 PSUR),分别进行内容更新后提问,验证知识库是否引用了最新版本的信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。