这个品类的数据长什么样
DTP 药房的药物警戒数据主要来源于药品生产企业的定期安全报告、药房日常销售与患者用药反馈记录、以及国家药品不良反应监测中心发布的公告。这些数据更新频率较高,尤其是在新药上市初期或发生群体性不良事件时。文档结构通常包括药品说明书、不良反应报告表、患者用药日志、风险管理计划等。字段方面,除了药品通用名、批号、生产企业、用法用量等基础信息,还会涉及不良反应事件描述、发生时间、严重程度、预后、干预措施、患者基础疾病、合并用药等。单位则严格遵循医学和药学规范,例如剂量单位 mg、g、IU,时间单位 小时、天、周,以及不良反应发生率百分比等。
这些特征在「知识库检索与召回」这一环带来什么约束
DTP 药房数据的高更新频率要求知识库具备快速增量索引的能力,以确保检索结果的时效性。药品说明书和不良反应报告的复杂结构,包含大量嵌套信息和专业术语,对文本切分和实体识别提出了挑战,需要更精细的分段策略。不良反应事件描述往往是自由文本,存在同义词、缩写、口语化表达等情况,影响检索的准确性,要求在召回时能处理语义相似性。患者用药日志和反馈记录中的非结构化数据,例如症状描述,需要有效的文本预处理和标准化。此外,涉及剂量、时间等数值型字段的精确匹配,需要在检索时支持多模态或结构化数据的联合查询。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 药品说明书和不良反应报告中常有较长的专业描述,保持一定长度有利于上下文完整性。 |
重叠长度 | 100 字符 | 确保关键信息在段落边界处不会被割裂,有助于提高召回精确度。 |
召回条数 | 前 10 条 | 药物警戒场景下,需要尽可能多的相关信息进行综合判断,避免遗漏。 |
相似度阈值 | 0.75–0.85 | 考虑到专业术语和自由文本的语义差异,设置相对较高的阈值以过滤不相关结果。 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 药物安全报告和风险管理计划文件可能较大,需要支持大文件上传。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 格式的药品说明书或报告,解析时间可能较长。 |
容易做错的三处
- 知识库更新后,新上传的药品说明书或不良反应报告无法被检索到。原因在于未触发知识库的重新索引或索引构建失败。
- 检索结果中出现大量与查询意图不符的文档片段。原因在于分段策略过于粗糙或相似度阈值设置过低,导致召回的噪声过多。
- 查询特定药品的不良反应发生率时,返回结果为空或不准确。原因在于知识库未能正确识别并抽取文档中的数值型字段和单位,或查询时未考虑数值范围匹配。
怎么确认配好了
- 上传一批包含最新不良反应信息的文档,然后立即进行查询,确认新信息可以被准确召回。
- 针对一份包含多种不良反应描述的药品说明书,使用不同关键词进行检索,检查返回的文档片段是否与查询意图高度相关,且覆盖了说明书中的关键信息。
- 模拟查询某个药品的剂量相关的特定不良反应,例如“服用
20mg某药后的皮疹”,检查知识库是否能识别20mg这一剂量信息,并召回对应的报告。 - 检查知识库后台的索引状态和错误日志,确认文件上传和分段解析过程无异常,且索引构建成功。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。