这个品类的数据长什么样
药物警戒(Pharmacovigilance, PV)注册申报资料主要包含药品不良反应(ADR)报告、安全性更新报告(PSUR/PBRER)、风险管理计划(RMP)以及上市后安全性研究(PASS)数据。数据来源多样,包括临床试验数据、真实世界数据(RWD)、文献检索结果、患者报告和医疗机构报告。更新节奏频繁,尤其是在药品上市初期,不良反应报告需按季度或年度提交,安全性更新报告通常为半年、一年或三年周期。文档结构通常遵循ICH E2B或E2C指南,多为结构化或半结构化的XML、PDF或Word文档。字段涉及患者信息(脱敏处理)、药品信息、不良反应术语(MedDRA编码)、剂量、事件发生时间、因果关系评估结果等。单位主要集中在剂量(mg、g、ml等)、时间(天、小时、年)和频率(次/日、例)。
这些特征在「多轮对话与提示词」这一环带来什么约束
药物警戒数据的多源性与复杂结构对多轮对话的准确性提出了挑战。MedDRA等专业术语的使用要求模型具备领域知识,否则容易出现语义偏差。频繁的数据更新意味着知识库需要快速同步,以确保对话基于最新信息。例如,一份新的PSUR报告发布后,模型应能立即回答其中新增的不良反应信息。半结构化文档中的关键信息抽取能力直接影响对话质量,尤其是在询问特定不良反应的发生率或因果关系时。此外,注册申报资料的严谨性要求对话结果具备高可追溯性,能够指出信息来源的具体章节或报告编号。对剂量、时间等单位的精确理解,是避免误解和确保合规性回答的关键。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 2000 字符 | 确保上下文覆盖注册申报资料中不良反应事件的详细描述和相关评估,避免关键信息丢失。 |
分段长度 | 400 字符 | 平衡文本语义完整性与召回粒度,适应不良反应报告中条目式或段落式描述。 |
召回条数 | 前 8 条 | 增加从海量注册资料中召回相关片段的概率,提高复杂查询的准确性。 |
相似度阈值 | 按实测标定 | 避免召回过多不相关信息,同时确保能捕获专业术语和同义词。 |
重排返回条数 | 前 3 条 | 经过重排后,聚焦于与用户意图最相关的少数高质量结果,提升响应效率。 |
系统提示词 | 详尽定义角色与知识边界 | 明确AI作为药物警戒资料助理的角色,限定回答范围为已有的注册申报资料,强调合规性与数据来源。 |
容易做错的三处
- 对话卡顿或无响应:往往是由于
maxContext设置过大,导致模型处理长上下文耗时过长,或上游知识库检索超时。 - AI回答中出现未提及的不良反应或错误剂量:原因在于知识库数据同步不及时,模型未能访问到最新的药物警戒报告,或抽取到的字段值不准确。
- API调用返回空值或不完整结果:通常是由于
相似度阈值设置过高,导致相关度稍低的有效信息被过滤,或召回条数太少未能覆盖全面信息。
怎么确认配好了
- 提交一系列针对特定不良反应、剂量或因果关系的查询,核对AI回答中的关键信息与原始申报资料是否一致,确保信息准确性。
- 模拟提交关于最新PSUR报告中新增不良事件的查询,验证AI能否及时提供相关信息,以确认知识库更新机制有效。
- 测试包含MedDRA术语的复杂查询,检查AI是否能正确理解并提供相关报告细节,验证领域知识的匹配度。
- 通过API调用查询,检查返回结果的字段完整性与数据类型是否符合预期,确保数据抽取和传输的正确性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。