这个品类的数据长什么样
实体瘤药物警戒数据主要来源于临床试验报告、真实世界研究(RWE)数据、病例报告、医学文献、药品说明书以及监管机构发布的安全性更新。数据更新频率较高,临床试验数据随研究进展持续发布,监管更新则可能以季度或年度为周期。文档结构多样,包括非结构化的文本描述、半结构化的表格数据和结构化的字段记录。常见字段包括患者基本信息、诊断信息、用药史、不良事件(AE)描述、严重程度、发生时间、结局、因果关系评估及采取的措施。单位多涉及时间(天、周、月)、剂量(mg、g)、频率(次/日)等。
这些特征在「知识库检索与召回」这一环带来什么约束
实体瘤药物警戒数据的高更新频率要求知识库具备高效的增量更新机制,以确保检索结果的时效性。文档结构的多样性意味着知识库需要支持多种数据格式的摄入与解析,例如从非结构化文本中抽取出关键信息,并将其转化为可检索的结构化数据。不良事件描述的语言复杂性和医学术语的专业性,对文本分段和嵌入模型的语义理解能力提出了更高要求。因果关系评估等关键信息的检索,不仅需要关键词匹配,更依赖于上下文理解和多实体关系抽取。此外,海量数据中可能存在的重复信息和低质量数据,也对召回结果的去重和过滤机制形成挑战。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 平衡上下文完整性与检索效率,避免单个分段过长稀释主题,或过短丢失关键信息。 |
分段重叠长度 | 100–200 字符 | 确保关键信息在分段边界处不被截断,维持语义连贯性,提升召回质量。 |
相似度阈值 | 按实测标定(例如 0.75–0.85) | 根据数据集特性和期望的召回精度与查全率进行调整,防止召回不相关或遗漏关键文档。 |
召回条数 | 前 10–20 条 | 确保覆盖足够多的潜在相关信息,为后续重排和生成提供丰富上下文,同时避免冗余。 |
重排返回条数 | 前 3–5 条 | 在召回结果中进一步筛选最相关的文档,提升最终回答的精准性和效率。 |
嵌入模型 | text-embedding-ada-002 或更高版本 | 选用在医学领域表现良好的嵌入模型,提升复杂医学术语和临床描述的语义理解能力。 |
容易做错的三处
- 知识库查询返回空结果或结果数量过少,原因可能是
相似度阈值设置过高,导致严格过滤掉部分相关性稍低的文档。 - 检索到的文档内容与实际问题关联度不高,现象是关键信息缺失或出现不相关内容,原因可能在于
分段长度不当,导致重要上下文被分割或混入过多噪音。 - 工作流调用知识库搜索时出现
Invalid knowledge base ID错误,原因通常是全局变量赋值时提供了错误的知识库 ID 格式或不存在的 ID。
怎么确认配好了
- 针对不同类型的实体瘤不良事件查询,核对召回结果中是否包含关键的药物、症状、发生时间、严重程度等核心信息。
- 选取一批已知正确答案的查询,通过比对召回文档与标准答案,评估
相似度阈值是否能有效区分相关与不相关内容。 - 检查知识库管理界面,确认各知识库的
知识库 ID与工作流中调用的 ID 完全一致。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。