这个品类的数据长什么样
呼吸系统药物警戒数据主要来源于国家药品不良反应监测中心、药品生产企业、医疗机构和患者自发报告。数据更新频率高,不良反应报告通常在数小时至数天内提交,严重不良反应报告有时限要求。文档结构多样,包括标准化的 CIOMS I 表格、MedWatch 表格、临床试验报告、以及非结构化的病例描述、医学文献等。字段涵盖患者基本信息、药品信息(如通用名、商品名、批号、剂型、用法用量)、不良反应描述(包括医学术语和自然语言描述)、预后、以及相关医疗事件。单位方面,剂量常用毫克 (mg)、微克 (μg),时间常用天、小时,频率常用次/日。
这些特征在「引用来源与溯源」这一环带来什么约束
高频更新和多样化的数据来源对引用来源的实时性和全面性提出要求,确保 AI 回答能够反映最新的药物警戒信息。非结构化文本的存在,尤其是患者自发报告和医学文献,要求知识库具备强大的文本解析和语义理解能力,以便准确提取不良反应事件与相关药物。原始文档分散存储于不同平台,导致直接引用时用户体验不佳,需要将原始链接作为溯源信息嵌入 AI 回答。此外,不同来源的文档可能存在信息冗余或冲突,对引用条数的限制和相似度阈值的设定至关重要,以避免在回答中呈现过多或不一致的引用。对特定字段(如药品批号、不良反应医学术语)的精准匹配与识别,是确保溯源准确性的关键。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前 5-8 条 | 平衡信息全面性与回答简洁性,避免冗余引用。 |
相似度阈值 | 0.75-0.85 | 确保召回内容的关联性,过滤不相关或弱相关信息。 |
分段长度 | 400-600 字符 | 适应呼吸系统不良反应报告中常见的中长篇幅描述。 |
重排返回条数 | 前 3 条 | 聚焦最相关和最权威的引用源,提升溯源效率。 |
引用链接模板 | https://original_source.com?doc_id={doc_id} | 确保 AI 回答中能直接提供可点击的原始文档链接。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型临床试验报告或文献解析可能耗时较长的情况。 |
容易做错的三处
- AI 回答中引用的原始文档链接无法打开,显示 404 错误。原因是知识库导入时未正确解析或存储原始文档的永久链接,或者链接模板变量
doc_id未被正确填充。 - AI 回答中出现多条引用来源,但内容存在矛盾或重复。原因可能是
相似度阈值设置过低,导致召回了大量弱相关或信息重叠的文档片段,或未对召回结果进行有效去重。 - 针对特定药品批号的不良反应查询,AI 回答未能引用到包含该批号的报告。原因可能是知识库分段策略过于粗糙,将批号信息与关键不良反应描述分离开来,影响了召回准确性。
怎么确认配好了
- 随机抽取 10-15 个呼吸系统药物不良反应查询,检查 AI 回答中引用的原始链接是否均可有效访问,并指向正确文档内容。
- 针对查询结果中包含多个引用来源的回答,人工比对各引用内容,确认信息一致性,并评估是否有冗余信息。
- 选取包含特定药品批号、严重不良反应事件或罕见不良反应的查询,验证 AI 回答是否能准确引用到包含这些关键信息的文档片段,并溯源到原始报告。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。