这个品类的数据长什么样
精神类疾病的质量文档主要来源于各级精神卫生机构的临床路径、诊疗规范、护理标准、药物管理指南及伦理审查文件。这些文档的更新频率相对较低,通常为每年或每两年一次,但涉及新药上市或重大临床研究突破时可能出现临时修订。文档结构上,PDF 和 DOCX 格式为主,常包含大量图表、流程图和复杂的嵌套列表,尤其在药物副作用、诊断标准和治疗流程部分。字段方面,文档中常出现 ICD-10/11 编码、DSM-5 诊断标准、药物剂量单位(mg/day, IU)、量表评分(如 HAMD, PANSS)及患者隐私保护相关的脱敏字段。
这些特征在「文档解析与分块」这一环带来什么约束
精神类疾病文档的复杂结构对解析准确性构成挑战。图表和流程图中的文本提取可能不完整,导致关键信息丢失。嵌套列表的解析需要保留其层级关系,以确保语义完整性。药物剂量和量表评分等特定字段,其数值与单位的关联性强,分块时需避免将数值与单位拆分。由于文档更新频率不高但修订内容重要,解析系统需要具备版本比对能力,以识别更新内容并进行增量处理。此外,文档中涉及的敏感信息字段,在解析和分块后需考虑后续的脱敏或权限控制,避免数据泄露。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 精神类疾病文档中段落语义完整性要求高,过短分段易切断诊疗逻辑;过长则增加召回噪音。 |
重叠长度 | 100–200 字符 | 确保上下文连续性,尤其在跨页或跨节的复杂描述中。 |
文件类型白名单 | pdf, docx, csv, xlsx | 覆盖常见的质量文档格式,csv 和 xlsx 用于量表数据或药物清单。 |
图片OCR识别 | 启用 | 许多流程图和扫描件中的诊断标准、剂量表需要 OCR 提取文本。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 针对大型或结构复杂的 PDF 文件,预留充足的解析时间,避免超时中断。 |
chunk_strategy | 按标题和段落 | 优先依据文档的逻辑结构分块,保持诊疗步骤、药物说明的完整性。 |
容易做错的三处
- 知识库上传 PDF 文档后,部分图表或扫描件中的文字未被识别,导致相关提问无法召回。这是因为未启用或配置合适的 OCR 识别功能,未能将图片内容转化为可检索文本。
- 上传的诊疗规范文档,关于特定疾病的诊断标准或治疗流程,问答时经常出现关键信息缺失或上下文不连贯。这通常是
分段长度设置过小,导致一个完整的逻辑单元被错误地切分到不同块中。 - 上传包含药物剂量表格的 Excel 文件后,提问药物用量时召回结果不准确或无法理解。这是因为 Excel 文件上传未选择合适的解析策略,或未针对表格数据进行结构化处理,导致数据被当作普通文本分块,丢失了行列关联信息。
怎么确认配好了
- 上传典型文档(如一份包含图表、嵌套列表的诊疗规范),检查解析后的文本内容是否完整,特别是图表和表格中的文本是否被正确提取。
- 针对上传的文档内容,进行多轮包含复杂逻辑和专业术语的提问,评估召回结果的上下文连贯性和语义完整性,确保关键信息未被截断。
- 随机抽取文档中的特定专业字段(如 ICD 编码、量表名称),通过搜索功能验证其召回能力,确认这些字段在分块后仍能被有效检索。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。