这个品类的数据长什么样
DTP 药房在注册申报资料准备过程中,涉及的数据主要来源于药企提供的药品说明书、临床试验报告、药学研究资料、生产工艺文件以及各类批件与注册证。这些数据通常以 PDF、Word、Excel 等格式的非结构化或半结构化文档为主。更新频率取决于药品研发进展、法规修订以及批件续期等,通常是阶段性、非连续的。文档结构严谨,遵循国家药品监督管理局(NMPA)的模板要求,例如《药品注册管理办法》附件中的申报资料项目。字段与单位具有高度专业性,如药品的通用名、商品名、适应症、用法用量、不良反应、药理毒理数据,以及毫克(mg)、毫升(ml)、℃ 等计量单位。此外,还会包含药品批次号、生产日期、有效期等批次管理信息。
这些特征在「模型接入与配置」这一环带来什么约束
DTP 药房数据的专业性和结构化要求对模型接入提出了特定约束。非结构化文档占比较高,要求选择具备优异文本解析与信息抽取能力的模型,以准确识别关键字段。数据更新的非连续性,意味着模型需要支持增量更新和版本管理,确保知识库的时效性。文档遵循 NMPA 模板,促使在模型训练和知识库构建时,需对这些模板进行预处理或结构化标注,提升模型对特定章节和内容的识别精度。专业化字段和计量单位,要求模型能够准确理解其语义,避免因单位混淆导致的数据错误。例如,剂量数据的识别需区分成人与儿童用量,并正确关联单位,这影响了 分段长度 和 召回条数 的设置,以保证上下文的完整性与相关性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 注册申报资料段落通常较长,此范围有助于保持上下文完整性,减少语义割裂。 |
召回条数 | 前 5–8 条 | 确保检索到足够多的相关资料片段,覆盖药品说明书中的多个关键信息点。 |
相似度阈值 | 0.75–0.85 | 提高检索准确性,避免无关或低相关性文档片段进入上下文,保证资料严谨性。 |
重排返回条数 | 前 3 条 | 在初次召回基础上进行二次排序,优先展示最相关、最核心的注册申报信息。 |
maxContext | 4000 tokens | 适应 DTP 药房资料的复杂性,提供足够的上下文长度供大模型理解和生成。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 或 Word 文档时,给予充足的文件解析时间,避免超时。 |
容易做错的三处
- 模型返回的药品剂量或用法与原文不符,原因是对专业术语和单位的识别不精确,或
相似度阈值设置过低导致引入噪声信息。 - 上传大型申报资料文件后,系统提示
文件解析超时,原因可能是PARSE_FILE_TIMEOUT_SECONDS参数过小,无法处理复杂或大体积文档。 - AI 对话中模型中断生成,或无法连续回答后续问题,原因是
maxContext或max_tokens参数设置不足,导致上下文溢出。
怎么确认配好了
- 上传一份典型药品说明书 PDF,验证模型是否能正确解析文档结构,并准确抽取通用名、适应症等关键字段。
- 针对某药品批号,提问其生产日期和有效期,核对模型返回信息与原始批件数据是否一致,并检查单位是否正确。
- 模拟申报资料审核场景,连续提问关于药品药理毒理、不良反应等多个问题,观察模型是否能保持上下文连贯性并给出合理回复,并与人工审核结果进行比对。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。