这个品类的数据长什么样
双特异性抗体药物警戒的数据主要来源于临床试验报告、真实世界研究(RWE)、上市后监测系统(如 FDA Adverse Event Reporting System, FAERS;欧洲药品管理局 EudraVigilance),以及医学文献。这些数据通常以非结构化文本(如病例报告、医生记录)、半结构化数据(如不良事件报告表单)和结构化数据(如药物名称、不良反应术语、剂量、给药途径、起止时间等)混合存在。数据更新频率较高,尤其是在新药上市初期和临床研究阶段。文档结构复杂,可能包含多中心、多语种的报告,涉及医学术语、缩写词和疾病编码(如 MedDRA 术语)。字段方面,除了常规的患者信息、药物信息、不良事件描述外,还特有靶点结合机制、抗体结构域、免疫原性检测结果等,这些特异性字段对理解不良反应的发生机制至关重要。单位则涵盖剂量(mg/kg)、时间(天、周、月)和生物标志物浓度(ng/mL)等。
这些特征在「多轮对话与提示词」这一环带来什么约束
双特异性抗体药物警戒数据的多模态特性和复杂性,对多轮对话与提示词设计提出了具体约束。非结构化文本中的不良事件描述需要强大的自然语言理解能力,以准确提取关键信息。半结构化和结构化数据中的特异性字段(如抗体结构域)要求提示词能引导模型关注这些高价值信息,并进行关联分析。高频更新的数据源意味着知识库需要快速同步和增量更新,否则对话可能基于过期信息。复杂的医学术语和编码系统,如 MedDRA 术语,要求模型能够正确解析和生成,避免歧义。多轮对话需要维持上下文连贯性,例如,当用户在一个会话中询问特定不良反应,后续对话可能需要追踪该反应的剂量依赖性或与其他药物的相互作用,这要求提示词能够有效地管理和利用历史对话信息。此外,不良反应报告中的隐私敏感信息,也要求在提示词设计中加入脱敏或匿名化处理的指令。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8192 token | 适应复杂病例文本和多轮对话上下文需求,平衡模型推理成本与效果。 |
分段长度 | 500 字符 | 确保每个分段包含足够上下文,同时避免单个分段过长稀释信息密度。 |
召回条数 | 前 10 条 | 增加相关知识召回概率,覆盖药物警戒报告中可能分散的关键信息。 |
相似度阈值 | 0.75 | 筛选出与双特异性抗体药物警戒查询高度相关的知识片段。 |
重排返回条数 | 前 5 条 | 优先展示与用户意图最相关的核心信息,提升响应效率。 |
promptTemplate | 包含 MedDRA | 明确指示模型在回答中考虑并应用 MedDRA 术语,提高专业性。 |
容易做错的三处
- 现象:AI 回答中出现非专业术语或与医学报告不符的描述。原因:提示词中未明确要求模型遵循特定医学词典或标准,导致模型自由发挥。
- 现象:多轮对话中,AI 无法记住前几轮关于特定不良事件的详细信息。原因:
maxContext参数设置过小,导致历史对话上下文被截断,模型无法获取完整信息。 - 现象:引导词或提示词在模型响应中不起作用,模型行为与预期不符。原因:模型选择与引导词的兼容性问题,或者引导词的权重在模型内部被其他因素覆盖。
怎么确认配好了
- 针对一系列典型双特异性抗体不良事件查询,核对 AI 回答是否准确引用了知识库中的药物名称、剂量和不良反应术语。
- 执行多轮对话测试,其中后几轮问题依赖于前几轮对话中提及的药物或不良反应细节,检查 AI 是否能保持上下文连贯性。
- 通过提交包含 MedDRA 编码的查询,验证 AI 回答中是否能正确解析并使用这些专业编码,或在生成时遵循其结构。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。