这个品类的数据长什么样
市场准入药物警戒的数据主要来源于上市许可持有人(MAH)提交的药品风险管理计划(RMP)、安全性更新报告(PSUR)、个例安全性报告(ICSR)以及监管机构发布的药品说明书、警告函等。这些文档通常以 PDF、Word 或 XML 格式存在,内容结构化程度不一。数据更新频率较高,ICSR 报告可能是实时或周期性提交,而 RMP 和 PSUR 则有固定的报告周期。文档中包含大量医学术语、药品名称、不良事件(AE)描述、患者特征、剂量信息以及因果关系评估等字段。例如,ICSR 报告的核心字段包括 SafetyReportId、PatientAge、DrugName、AdverseEventTerm 和 Outcome。
这些特征在「多轮对话与提示词」这一环带来什么约束
市场准入药物警戒数据的复杂性与专业性对多轮对话与提示词设计提出了特定要求。首先,数据来源多样且更新频繁,要求 FastGPT 的知识库能够高效地摄入和索引不同格式的文档,并支持增量更新,以确保对话模型能获取到最新的风险信息。其次,文档中大量的医学专业术语和缩写,需要精心设计的提示词来引导模型进行准确的实体识别和关系抽取,避免误解或遗漏关键信息。例如,对 AE 的查询,模型需要区分是“不良事件”的缩写,还是其他含义。最后,多轮对话中可能涉及对特定药品在不同上市后阶段的安全性数据进行对比分析,这要求提示词能够引导模型在多个相关文档之间进行有效的信息整合和推理,例如,比较不同 PSUR 周期内某一特定不良事件的发生率变化,或追溯某一风险信号从预警到采取监管措施的全过程。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000 tokens | 应对长篇幅的 RMP 和 PSUR 文档,确保模型能一次性处理足够多的上下文信息。 |
分段长度 | 500 字符 | 兼顾内容完整性和检索效率,避免单一分段过长导致信息冗余,或过短导致语义割裂。 |
召回条数 | 10 条 | 确保能从庞大的知识库中召回足够多的相关文档片段,增加信息覆盖面。 |
相似度阈值 | 0.78 | 平衡召回的准确性和广度,过滤掉低相关性结果,保留高相关性信息。 |
重排返回条数 | 5 条 | 对初次召回的结果进行二次排序,确保最相关的核心信息优先展示,提高模型处理效率。 |
temperature | 0.3 | 保证模型输出的稳定性和准确性,降低生成式回答的随机性,符合药物警戒的严谨性要求。 |
容易做错的三处
- 对话中出现大量医学术语时,模型无法正确理解其含义或进行关联,原因为知识库中缺乏相应的术语表或实体识别训练数据。
- 用户询问特定药品的历史安全性数据变化趋势时,模型仅能提供单次报告的信息,原因为知识库摄入时未对不同时间点的同类文档进行有效关联或版本管理。
- 用户上传附件后,对话无法继续或附件内容未被识别,原因为
UPLOAD_FILE_MAX_SIZE参数设置过小或文件解析插件未适配特定文档格式。
怎么确认配好了
- 选择一个包含多份 PSUR 的药品,提问其某一特定不良事件在不同报告周期内的发生率变化,检查模型是否能整合并对比数据。
- 查询某一罕见不良事件的定义、相关药品以及监管机构采取的措施,核对模型输出的专业术语解释和信息溯源是否准确无误。
- 上传一份包含复杂表格和图表的 RMP 文档,然后提问文档中的关键风险点和风险管理措施,检查模型能否准确提取结构化和非结构化信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。