这个品类的数据长什么样
零售连锁药店的药物警戒数据主要来源于药店日常运营中产生的销售记录、顾客咨询、用药反馈、以及内部或外部上报的不良反应事件报告。这些数据更新频率较高,销售记录实时生成,不良反应报告则随事件发生而提交。文档结构通常包括标准化的不良反应报告表单、顾客用药咨询记录(通常为自由文本或结构化字段混合)、以及药品批次追溯信息。字段方面,可能包含药品通用名、批号、生产企业、患者基本信息(脱敏处理)、不良反应描述、发生时间、处理措施等。单位方面,剂量常涉及毫克(mg)、克(g)、毫升(ml),时间单位为日期和具体时刻。
这些特征在「文档解析与分块」这一环带来什么约束
零售连锁药店数据的高更新频率要求文档解析系统具备高效的实时处理能力,以确保新数据能迅速纳入药物警戒分析。不良反应描述中的自由文本内容,因其多变性和非结构化特性,对解析的准确性和鲁棒性提出了挑战,特别是需要识别其中的药品名称、症状、事件发生时间等关键实体。此外,脱敏的患者信息要求解析过程能有效识别并保护敏感数据。文档中可能存在的药品批号和生产企业信息,对于后续的药品追溯和风险评估至关重要,解析时需确保这些字段的精确提取。多源数据(如销售记录与不良反应报告)的融合也要求解析器能够处理不同格式和结构的文档,并进行有效关联。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500-800 字符 | 兼顾不良反应描述的完整性与召回时的相关性。 |
分段重叠长度 | 100-150 字符 | 确保上下文连续,避免关键信息被切断。 |
OCR识别语言 | zh | 主要处理中文文档,提升识别准确率。 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 应对大型PDF报告或图片较多文档的解析耗时。 |
maxContext | 4000 token | 适应不良反应报告中较长的自由文本描述。 |
召回条数 | 前 8 条 | 在保证召回率的同时,控制后续处理的计算量。 |
容易做错的三处
- 日志显示
ocr error且文件解析失败,通常是由于上传的图片质量不佳或文档中存在手写字体,导致OCR引擎无法识别。 - 文件解析功能失效,但正常聊天功能可用,可能是因为文件解析依赖的特定模型或服务(例如
claude 3.7)在处理文件内容时遇到内部错误或资源限制。 - 解析JSON格式的联网搜索结果时报错,往往是由于返回的JSON结构与预期不符,导致解析器无法正确匹配字段。
怎么确认配好了
- 上传典型的不良反应报告PDF和图片文件,检查解析后的文本内容是否完整且无乱码。
- 对解析后的分块数据进行关键词搜索,确认关键实体(如药品名称、症状、时间)是否都能被准确识别和定位。
- 对比原始文档与解析结果,检查关键结构化字段(如批号、生产企业)的提取是否正确无误,并验证数据类型的一致性。
- 模拟用户提问关于特定不良反应事件,观察检索到的分块内容是否与问题高度相关,且包含支持性的原始信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。