这个品类的数据长什么样
药物警戒(Pharmacovigilance, PV)注册申报资料通常包含大量结构化与非结构化数据。数据来源广泛,包括临床试验报告、真实世界证据(RWE)、个例不良事件报告(ICSRs)、文献综述、药品说明书、风险管理计划(RMP)以及监管机构发布的指导原则。这些数据的更新频率不一,ICSRs可能每日甚至实时更新,而临床研究报告或RMP则可能按季度或年度更新。文档类型多样,涵盖PDF、Word、Excel、XML等格式。字段特异性强,例如ICSRs中会包含MedDRA编码、WHO-DD编码,剂量单位会涉及mg、μg/kg等,时间单位精确到小时、分钟,并经常涉及事件发生与报告时间差。
这些特征在「引用来源与溯源」这一环带来什么约束
药物警戒数据的多样性与更新频率对引用来源与溯源提出了明确要求。首先,多源异构的文档格式要求系统具备强大的文件解析能力,以确保信息完整提取,特别是对于PDF中的表格和图片文本。其次,高频更新的ICSRs等数据,需要RAG系统能够快速索引并保持知识库的最新状态,避免引用过时信息。MedDRA、WHO-DD等专业编码体系的存在,使得精确检索与匹配成为关键,普通关键词匹配可能导致召回不准。此外,对剂量、时间等带有单位的数值型字段,需要RAG系统能够进行上下文理解,区分不同单位下的数值差异,防止误引用或错误溯源,例如,一个剂量为“10 mg”的文献与“10 μg/kg”的文献在数值上可能相似,但实际含义截然不同。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 适应药物警戒资料中长段落描述和复杂逻辑,保证上下文完整性。 |
分段重叠 | 200 字符 | 确保跨段落的关键信息不丢失,尤其在不良事件描述中。 |
召回条数 | 前 5 条 | 平衡检索效率与覆盖度,优先获取最相关的少数高质量文献。 |
相似度阈值 | 0.75 | 药物警戒领域对引用准确性要求高,过低的阈值会引入噪声,过高则可能遗漏。 |
重排返回条数 | 前 3 条 | 进一步精炼召回结果,提升最终呈现给用户的引用质量。 |
maxContext | 4000 token | 确保能够承载药物警戒报告中详细的事件描述与背景信息。 |
容易做错的三处
- 输入中文查询后,未引用到知识库中的英文文献,原因是向量模型或检索器未能有效处理跨语言语义匹配。
- 提问内容与知识库内容关联度低,但系统仍返回不相关内容,原因可能是
相似度阈值设置过低,导致召回了大量噪声。 - 在解析复杂PDF文档时,部分表格数据或图片中的文本未能被识别,导致相关信息缺失,这通常与文件解析器对特定格式的支持不足或
PARSE_FILE_TIMEOUT_SECONDS设置过短有关。
怎么确认配好了
- 选取典型药物警戒查询语句,验证引用的文献是否包含查询关键词及相关专业术语。
- 针对包含MedDRA编码、WHO-DD编码的查询,核对系统返回的引用来源是否能准确指向包含这些编码的原文位置。
- 评估系统对数值型字段(如剂量、时间)的引用,确认其单位和数值与原文保持一致,没有出现误读或混淆。
- 检查知识库更新后,高频变动的数据(如最新ICSRs)是否能被及时索引并用于后续引用。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。