这个品类的数据长什么样
血液肿瘤领域的制度与标准操作流程(SOP)文档,主要来源于国家卫健委、国家药监局发布的指南,以及各大医院内部制定的诊疗规范、伦理审查文件。这些文档更新频率相对较低,通常一年或数年更新一次,但涉及新药、新疗法时会快速修订。文档结构通常为严格的章节式排版,包含引言、定义、适应症、禁忌症、操作步骤、风险管理、参考文献等固定字段。其中,操作步骤常包含详细的流程图、表格,涉及具体的药物剂量、治疗周期、检测指标及单位(如 mg/kg、Gy、pg/mL)。
这些特征在「知识库检索与召回」这一环带来什么约束
血液肿瘤制度文档的低更新频率意味着知识库内容更新压力较小,但单个文档体量通常较大,且包含大量专业术语和交叉引用。严格的章节结构要求在知识切分时需保持语义完整性,避免关键步骤被拆散。文档中具体的药物剂量、治疗周期等数值型信息,对检索的精确性提出了高要求,简单的关键词匹配可能不足以召回所有相关上下文。此外,文档内部的流程图和表格内容,需要额外的解析策略以确保其信息可被有效索引和检索,不能仅依赖纯文本切分。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾单段语义完整性与召回效率,避免过长或过短导致信息丢失或冗余。 |
分段重叠度 | 100–150 字符 | 确保段落之间必要的上下文衔接,处理跨段落的关键信息。 |
召回条数 | 前 5–8 条 | 考虑到制度文档的严谨性,增加召回量以覆盖更多潜在相关内容。 |
相似度阈值 | 0.75–0.85 | 保证召回结果与查询内容的高度相关性,过滤噪声。 |
重排返回条数 | 前 3 条 | 在较高召回量基础上,通过重排提升最终返回结果的精确度与相关性。 |
trainingType | chunk | 适用于结构化文本,通过分段确保知识的颗粒度与检索效率。 |
容易做错的三处
- 知识库检索结果中,同一操作步骤的关键信息被拆分到不同段落,导致回答不完整。原因在于
分段长度设置过小或分段重叠度不足,未能保持关键语义单元的完整性。 - 上传包含复杂图表或流程图的文档后,相关查询无法召回图表中的具体数值或逻辑。原因在于文档解析器未能有效提取非文本内容,导致这些信息未被索引。
- 在查询特定药物剂量或治疗方案时,系统返回的引用段落缺少关键的数值或单位。原因在于知识切分时,数值型数据与描述性文本分离,或者索引未充分考虑单位信息。
怎么确认配好了
- 对一批包含特定药物剂量、治疗周期等精确数值的查询,检查召回结果中是否包含所有相关数值与单位。
- 选取多份包含复杂流程图或表格的制度文档,测试对这些图表内容的查询能否有效召回对应信息。
- 针对跨章节或段落描述的复杂操作步骤,核查召回的上下文是否能完整呈现该步骤的全部细节。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。