这个品类的数据长什么样
合理用药领域的数据主要来源于药品说明书、临床指南、药物相互作用数据库、不良反应报告以及医学文献。这些数据更新频率不一,药品说明书可能随批次更新,指南则按年或数年修订,不良反应报告则持续累积。文档结构上,说明书通常包含适应症、用法用量、禁忌、不良反应等固定章节;临床指南则多为结构化的条目式建议。数据中包含大量药物通用名、商品名、剂量单位(如 mg/kg)、给药途径、频率等标准化字段,但也存在非结构化的临床描述和自由文本。
这些特征在「文档解析与分块」这一环带来什么约束
合理用药数据的特点对文档解析与分块提出了特定要求。药品说明书和临床指南中的关键信息(如不良反应发生率、药物相互作用程度)常以表格或列表形式呈现,需要解析器能准确识别并保持其结构完整性,避免分块时语义割裂。剂量、单位、频率等信息必须精确提取,分块时需确保相关联的数值和单位不被拆分,否则会影响后续药物警戒的准确判断。此外,大量专业术语和缩写要求分词模型具备医学领域词汇的识别能力。非结构化不良反应报告中的自由文本描述,则需要更细粒度的分块,以捕获具体症状和用药过程。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunkSize | 800 字符 | 确保在单一分块内,药品说明书或临床指南中的完整逻辑单元(如一条不良反应描述、一段用药建议)得以保留,同时兼顾召回效率。 |
overlapSize | 150 字符 | 提供上下文衔接,减少因分块边界导致信息丢失,尤其对于描述性强的临床报告。 |
maxContext | 3200 字符 | 适应复杂药物相互作用和多因素合理用药判断,需同时考虑多个相关分块。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型药品说明书或包含复杂表格的临床指南,解析时间可能较长。 |
UPLOAD_FILE_MAX_SIZE | 100 MB | 满足单个PDF文档(如详细的药物临床试验报告)可能较大的文件体积需求。 |
分段长度(知识库配置) | 按语义或段落 | 优先保持医学文本的语义完整性,避免将关键信息(如药物剂量与对应不良反应)硬性截断。 |
容易做错的三处
- 上传大型PDF文件后长时间无响应或解析失败,现象是文件状态停滞在“处理中”或直接显示解析失败。这通常是由于
PARSE_FILE_TIMEOUT_SECONDS配置过小,导致解析器在处理复杂或大文件时超出时间限制。 - 知识库检索结果中,药物剂量或单位信息缺失,例如只返回“每日两次”,没有具体“20mg”。这源于
chunkSize设置不当,导致剂量数字和单位在分块时被拆散,影响了上下文的完整性。 - 通过API上传文件后,增强解析功能未生效,例如PDF中的表格内容没有被正确提取。这可能是API调用时未正确指定
enable_enhanced_parsing参数,或后端服务未正确配置表格解析依赖。
怎么确认配好了
- 上传典型药品说明书PDF文件,检查知识库中分块是否包含完整的适应症、用法用量、不良反应等关键章节,并通过预览核对分块内容与原文的语义一致性。
- 随机抽取临床指南中的表格数据,上传后验证知识库中对应分块是否准确提取了表格的行与列信息,确保数据结构得以保留。
- 模拟查询药物相互作用问题,检查召回结果中是否能同时获取到涉及药物的完整名称、剂量、相互作用机制及处理建议,并通过日志确认查询时
maxContext的实际使用情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。