这个品类的数据长什么样
药物警戒的质量文档主要包括不良事件报告(ADR)、药品说明书、风险管理计划(RMP)、上市后安全性研究(PASS)报告、以及各类法规指南文件。数据来源广泛,涉及医疗机构、患者、药企内部系统和监管机构数据库。这些文档的更新频率不一,法规指南可能年度更新,而ADR报告则持续产生。文档结构通常包含结构化字段(如药品名称、批号、不良事件编码、发生时间、患者基本信息)和大量非结构化文本(如不良事件描述、因果关系评估、处理措施)。字段单位多样,例如剂量常以毫克(mg)、毫升(ml)计,时间以年/月/日或小时计。
这些特征在「模型接入与配置」这一环带来什么约束
药物警戒文档的特性对模型接入与配置提出了特定要求。首先,数据来源的多样性和非结构化文本占比高,决定了需要强大的文档解析能力和语义理解模型。其次,持续更新的ADR报告要求知识库能够频繁增量更新,避免模型回答基于过时信息。文档中包含大量专业术语和缩写,需要模型具备领域词汇的识别与理解能力,避免出现低级语义错误。结构化字段与非结构化文本的混合,意味着在模型召回时,需兼顾精确匹配结构化信息与模糊匹配文本内容。此外,药物警戒的严谨性要求模型回答必须可溯源至原始文档片段,以满足合规性审查。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunkSize | 800–1200 字符 | 平衡上下文连贯性与单次处理token限制,适应长篇文档结构 |
overlapSize | 100–200 字符 | 确保分段边界的语义连续性,避免关键信息被切割 |
maxContext | 32000 token | 适应医药领域复杂问题和多轮对话需求,提高信息覆盖度 |
embeddingModel | text-embedding-ada-002 或领域特化模型 | 提高医药专业术语和概念的向量表示准确性 |
recallNum | 前 5 条 | 在保证召回相关性的前提下,减少后续重排和模型处理的负担 |
similarityThreshold | 0.75 | 兼顾召回的广度与精度,过滤掉低相关性文档片段 |
容易做错的三处
- 模型回答中引用了不相关的报告片段,原因是
recallNum设置过大或similarityThreshold过低,导致召回了大量噪声信息。 - 多轮对话中模型丢失上下文,无法理解用户后续提问,现象是模型回答与前文无关,可能是
maxContext设置过小,导致历史对话被截断。 - 新上传的文档内容未能在模型回答中体现,原因可能是文档解析或向量化失败,检查日志可能出现
PARSE_FILE_TIMEOUT_SECONDS或embedding_error。
怎么确认配好了
- 上传一批包含新不良事件报告的文档,提问相关问题,确认模型回答中能引用到新文档内容,且引用的片段准确。
- 针对一份包含结构化字段(如药品批号)和非结构化描述的文档,分别通过批号查询和症状描述查询,验证模型都能准确召回并引用原文。
- 进行多轮对话测试,从不良事件的初步描述逐步深入询问因果关系、处理措施等,确认模型能保持上下文连贯并给出有逻辑的回答。
- 随机抽取模型引用的原文片段,对照原始文档确认引用内容与位置的准确性,确保回答的可溯源性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。