这个品类的数据长什么样
DTP 药房在药物警戒领域的数据主要来源于患者报告、药师记录、随访记录、以及药品说明书和相关法规文件。患者报告通常以非结构化文本形式存在,包含不良反应描述、用药情况、个人健康史等。药师记录和随访记录则可能包含结构化或半结构化数据,如药品批次、用药剂量、不良反应事件分类代码等。药品说明书和法规文件是标准化的文本,更新频率较低,但内容量大,涉及药物成分、适应症、禁忌、不良反应等详细信息。患者报告和随访记录的更新频率较高,可能每日都有新增数据。字段单位多样,例如用药剂量涉及 mg、g、ml 等,不良反应发生频率可能用百分比或具体例数表示。
这些特征在「文档解析与分块」这一环带来什么约束
DTP 药房数据中,患者报告的非结构化特性要求解析器具备强大的自然语言处理能力,识别并提取关键医学实体,如药品名称、不良反应、疾病诊断等。药师记录和随访记录中的半结构化数据,需要灵活的解析规则以适应不同记录格式,例如通过正则表达式匹配特定字段值。药品说明书和法规文件的长文本特性,使得文档分块策略需兼顾信息完整性与检索效率,避免单个文档块过长或过短。数据更新频率高,尤其是患者报告,对解析和分块流程的实时性提出要求,需支持增量更新并快速索引。字段单位的多样性,例如剂量单位 mg 或 ml,要求在解析时进行标准化或单位转换,以确保后续检索和分析的准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾语义完整性与检索效率,避免单个文档块信息量过大或过小。 |
分段重叠 | 100–200 字符 | 保证上下文连续性,减少因分段导致的关键信息割裂。 |
解析模式 | 智能分段 | 适应非结构化患者报告与半结构化药师记录的混合数据类型。 |
解析超时时间 | 600 秒 | 应对大型药品说明书或复杂法规文件的解析需求。 |
自定义正则表达式 | 按实测标定 | 用于从药师记录中提取特定格式的批次号或不良反应代码。 |
清洗规则 | 移除日期、时间戳等 | 清除患者报告中可能存在的非关键信息,提升向量化质量。 |
容易做错的三处
- 文档块内容重复或缺失:原因在于分段策略不当,例如
分段重叠值设置过低导致关键信息被切断,或者分段长度过小导致同一语义单元被拆分到多个块中。 - API 创建知识库后,解析状态长时间停留在“解析中”:通常是由于
解析超时时间设置不足,遇到大型或复杂文档时,解析任务未能按时完成。 - 解析结果中特定字段值为空:可能原因是没有配置
自定义正则表达式或正则表达式编写有误,无法正确从半结构化文本中匹配并提取所需信息。
怎么确认配好了
- 上传典型文档后,检查知识库中的文档块数量和内容,确保每个文档块都包含有意义的完整语义单元。
- 通过 API 查询特定文档的解析状态,确认其从“解析中”顺利变为“就绪”,并记录解析耗时。
- 针对患者报告、药师记录等不同来源的文档,执行关键词检索,验证检索结果的准确性和相关性,例如搜索药品名称和不良反应,看是否能召回相关报告。
- 随机抽取解析后的文档块,检查其中是否包含预期的关键信息,例如药品批次、不良反应描述和剂量单位。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。