这个品类的数据长什么样
血液肿瘤药物警戒的数据主要来源于临床试验报告、真实世界研究、不良事件报告系统(如 WHO VigiBase、FDA FAERS)、医学文献以及患者病例。这些数据以非结构化文本为主,例如医生手写的病历记录、患者自述、不良事件报告表格中的自由文本字段。数据更新频率高,尤其是在新药上市后,不良反应报告会持续涌入。文档结构多样,包含症状描述、诊断结果、用药情况、伴随疾病等字段。药物剂量、给药途径、不良反应发生时间、持续时间等信息常以数值或时间戳形式出现,但描述性文本中也可能包含模糊的时间或剂量表述。例如,不良事件报告中可能出现“患者在服用 XX 药物后约一周出现皮疹”或“每日两次,每次 10 mg”等表述。
这些特征在「多轮对话与提示词」这一环带来什么约束
血液肿瘤药物警戒数据的非结构化特性,导致在多轮对话中,模型需要更强的语义理解能力来抽取出关键信息。高更新频率要求知识库具备快速同步新数据和更新旧数据的能力,以确保对话内容的准确性。多样化的文档结构和自由文本描述,使得提示词设计需要更精细,以引导模型关注特定字段或信息类型,例如要求模型区分“药物剂量”和“不良反应严重程度”。此外,在多轮对话中,患者或医生可能会使用医学术语、俚语或不规范的表达,这对模型的鲁棒性提出了挑战。例如,当用户提问“骨髓抑制的等级是多少?”时,模型需要从复杂文本中识别出“骨髓抑制”这一特定不良反应,并定位到其对应的严重程度信息。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 800–1200 字符 | 兼顾长文本理解与计算开销,避免上下文过长稀释关键信息。 |
召回条数 | 5–8 条 | 保证召回足够多的相关知识片段,覆盖潜在的复杂提问。 |
相似度阈值 | 0.75–0.85 | 在高精度要求下筛选出强相关的知识,减少无关信息干扰。 |
重排返回条数 | 前 3 条 | 精炼最终呈现给用户的知识,聚焦最核心的答案。 |
分段长度 | 300 字符 | 适应不良事件报告中较短但信息密集的文本段落。 |
QUERY_MAX_LENGTH | 200 字符 | 限制用户输入长度,避免过长查询导致语义分散。 |
容易做错的三处
- 对话中模型输出大量无关的知识库引用 ID,导致信息冗余。原因在于召回条数设置过高,且未进行有效的重排过滤。
- 模型在回答不良反应相关问题时,未能准确识别出剂量或时间等关键数值。原因可能为提示词未明确指示模型提取特定实体,或知识库分段策略导致关键数值与描述分离。
- 在接入外部平台时,对话内容中的 Markdown 格式丢失,出现
#*等特殊字符。原因通常是外部平台对 Markdown 渲染支持不足,或接口在传输过程中未正确转义特殊字符。
怎么确认配好了
- 通过测试集验证模型对不良反应名称、药物剂量、发生时间等关键字段的抽取准确率,确保其达到业务要求。
- 检查多轮对话过程中,模型能否基于上下文正确理解后续提问,并提供相关知识库引用。
- 模拟用户提问,核对模型返回的知识库引用 ID 是否与当前对话内容高度相关,且无明显无关信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。