这个品类的数据长什么样
合理用药制度的数据主要来源于国家卫生健康委员会、国家药监局发布的各类法规、指南、技术规范以及医疗机构内部制定的规章制度、SOP 文档。这些文档通常以 PDF、Word 格式存在,内容结构严谨,包含大量条文、表格、图示和流程图。字段方面,涉及药品名称、剂量、用法、适应症、禁忌症、不良反应、相互作用等,并常伴有专业术语和缩写。单位以毫克(mg)、毫升(ml)、次/日、天等为主。更新频率相对稳定,国家级法规每年可能有修订,医疗机构内部制度则根据实际情况进行调整,通常为季度或年度更新。
这些特征在「文档解析与分块」这一环带来什么约束
合理用药制度文档的严谨结构和专业性对文档解析提出了高要求。大量的表格和流程图需要精确识别,以避免信息丢失或错误关联。专业术语和缩写要求分词器具备医疗领域知识,确保语义完整性。文档的更新频率决定了知识库需要支持定期增量更新,并能有效处理版本差异。条文式的文本结构需要细致的分块策略,确保每个块包含独立的知识点,避免跨条文的语义割裂。对于药品剂量、用法等关键字段,解析时需保留其数值与单位的关联性,为后续问答提供准确支持。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 合理用药文档通常较大,确保能上传完整文件。 |
分段长度 | 800–1200 字符 | 平衡上下文完整性与召回效率,适应条文式文本。 |
最大段落深度 | 5 | 适应多级标题和嵌套结构,保留文档层级关系。 |
解析表格 | 启用 | 大量用药剂量、适应症信息以表格形式呈现。 |
解析图片 | 启用 | 部分流程图和图示包含关键决策信息。 |
文本清洗规则 | 删除页眉页脚,合并短行 | 减少无关信息干扰,提升文本质量。 |
容易做错的三处
- 解析结果中表格内容缺失或错乱,原因是对表格结构识别不足或未启用表格解析功能。
- 问答时出现条文语义割裂,原因在于分段长度设置过短,导致一个完整知识点被拆分到不同块中。
- 上传文件后长时间无响应或解析失败,原因可能是文件大小超出
UPLOAD_FILE_MAX_SIZE限制,或PARSE_FILE_TIMEOUT_SECONDS设置过短。
怎么确认配好了
- 随机抽取 5 份已解析的文档,检查其在 FastGPT 知识库中的分块预览,确认表格、图片内容是否完整呈现,文本是否按语义合理分段。
- 对包含特定药品剂量和用法信息的文档,使用精确查询测试,验证是否能召回包含完整数值和单位的文本块,并检查其上下文。
- 模拟新增或更新制度文档,观察解析耗时和结果,确认增量更新机制是否正常工作,且解析时间在可接受范围内。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。