这个品类的数据长什么样
血液肿瘤领域的制度与SOP文档,主要来源于国家卫健委发布的诊疗指南、行业协会发布的共识、医院内部制定的临床路径、药物使用规范以及伦理审查文件。这些文档更新频率相对较高,通常每年或每两年修订一次,部分药物相关SOP可能随新药上市或适应症扩展而动态调整。文档结构多采用章节体,包含引言、定义、诊断标准、治疗方案、随访要求、并发症处理等。字段与单位方面,常涉及具体的医学术语、基因检测结果(如 突变频率)、药物剂量(如 mg/kg、mg/m²)、疗程(如 周期、天)、实验室检查指标(如 PLT、Hb)及其正常范围。
这些特征在「文档解析与分块」这一环带来什么约束
血液肿瘤制度文档的频繁更新要求知识库具备高效的文档版本管理和增量更新能力,以确保召回信息的时效性。其章节体结构决定了分块策略需要兼顾章节完整性与细粒度信息提取,避免关键信息被切割。复杂的医学术语、基因检测结果和药物剂量等特殊字段,对文档解析器的识别准确性提出更高要求,需要防止因格式或字符集问题导致乱码或语义丢失。此外,文档中常见的表格、图片(如流式细胞图谱、染色体核型)以及参考文献列表,在解析时需特别处理,以保留其语义信息或提供上下文链接,保障问答的完整性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾章节完整性与问答召回效率,避免单一分块过长导致信息冗余,过短则可能丢失上下文。 |
分段重叠长度 | 100 字符 | 确保相邻分块间的语义连续性,尤其在跨段落的流程描述中。 |
解析策略 | 按标题切分 结合 智能分段 | 优先尊重文档的章节结构,同时利用智能分段处理无明显标题的段落。 |
文件类型支持 | .pdf, .docx, .md | 覆盖血液肿瘤领域制度文档的主流格式,确保广泛兼容性。 |
图片OCR识别 | 启用 | 处理文档中可能包含的图表信息,如诊断流程图、细胞形态学图片,确保图像内容的语义可被检索。 |
容易做错的三处
- 上传文档后,大模型输出答案时未包含文档中的图片信息,可能是因为
图片OCR识别未启用或OCR识别结果未有效嵌入文本分块。 - 知识库返回的阅读链接点击后报错
message: "Only support .txt, .m",这通常是由于系统默认的文件类型白名单未包含血液肿瘤文档常用的.pdf或.docx格式,需要调整UPLOAD_FILE_MAX_SIZE相关的配置。 - 自定义分段规则后,大模型回答问题时出现关键医学术语被截断或语义缺失,这可能是因为
分段长度设置过短,导致包含完整概念的句子或段落被不当切分。
怎么确认配好了
- 上传典型血液肿瘤制度文档(如国家诊疗指南),检查分块预览,确保章节标题和关键段落被完整保留,无明显语义截断。
- 针对包含图表和特殊医学符号的文档,验证OCR识别结果是否正确嵌入文本分块,并尝试基于图表内容进行提问,检查召回效果。
- 选取文档中包含复杂药物剂量、基因检测结果的段落,进行问答测试,确认模型能够准确提取并回答相关信息,且未出现乱码或单位错误。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。