这个品类的数据长什么样
实体瘤相关的制度与 SOP 文档主要来源于药监部门发布的法规、指南,以及各医疗机构内部制定的诊疗规范、操作流程。这些文档更新频率相对稳定,通常在法规修订或新疗法出现时进行周期性更新,每年数次。文档结构以层级式为主,包含章节、小节、条款等,常以 PDF 或 Word 格式发布。内容涵盖疾病定义、诊断标准、治疗方案(手术、放化疗、靶向、免疫)、随访要求、药物使用指引、不良事件处理流程等。文档中涉及大量医学术语、药品名称、剂量单位(如 mg/kg)、时间单位(如周、月)、影像学指标(如 RECIST 标准)等,并且包含复杂的逻辑判断与条件分支。
这些特征在「向量模型与索引」这一环带来什么约束
实体瘤制度文档的层级结构和专业术语密度,要求向量模型能有效捕捉文本的语义关联性和专业上下文。复杂的逻辑判断和条件分支,使得简单的文本分块容易丢失关键的因果关系或流程步骤,影响召回精度。例如,一个治疗方案可能依赖于患者的分期、基因检测结果等多个前置条件。文档更新频率虽然不高,但每次更新可能涉及关键条款的修订,这就要求向量索引具备高效的增量更新能力,并能准确识别版本差异,避免查询旧版信息。大量医学专用词汇和单位的存在,对向量模型的词嵌入质量提出了更高要求,通用模型可能无法有效区分细微的语义差别。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾语义完整性和向量化效率,避免单段信息量过大或过小。 |
分段重叠 | 50–100 字符 | 保留上下文衔接,确保跨段落语义连贯性,对复杂逻辑判断尤为重要。 |
召回条数 | 8–12 条 | 在保证覆盖面的前提下,减少后续重排与大模型处理的计算负担。 |
相似度阈值 | 按实测标定 | 需根据具体向量模型和数据集进行测试,确保高相关性召回。 |
重排返回条数 | 3–5 条 | 筛选出最相关的少数结果,提高最终回答的精确性与简洁性。 |
embedding_model | DeepSeek-v2 | 针对中文医学文本优化,提高专业术语的语义捕捉能力。 |
容易做错的三处
- 现象:系统返回的答案与实际制度不符,或关键信息缺失。原因:
分段长度设置过大,导致单个向量块内语义过于分散,模型难以聚焦核心信息。 - 现象:回答中引用的溯源文档与问题相关性较弱。原因:
相似度阈值设置过低,召回了大量低相关度的向量块,污染了上下文。 - 现象:索引模型无法选择或显示加载失败。原因:
embedding_model配置错误或对应模型文件未正确部署到 FastGPT 运行环境中。
怎么确认配好了
- 核对关键条款的问答结果,检查回答是否准确引用了制度原文的条款编号或章节。
- 随机抽取多条复杂问题,验证系统回答中是否包含了所有必要的条件和限制,例如针对不同分期的治疗方案。
- 通过模拟制度更新,测试系统对新旧版本差异的识别能力,确保查询结果指向最新生效的制度内容。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。