这个品类的数据长什么样
DTP(Direct To Patient)药房在注册申报资料准备过程中,涉及的数据主要来源于药监局官方网站、药企提供的产品说明书、临床试验报告、药品注册批件、以及药房自身的运营数据。这些数据更新频率相对较低,通常随药品批文发布或政策调整而更新。文档结构以PDF、Word和扫描件为主,包含大量非结构化文本和表格。字段方面,特指药品的适应症、用法用量、不良反应、禁忌症等,以及药房的GSP认证、冷链物流资质、药师资质等信息。单位上,剂量常以毫克(mg)、毫升(ml)计,时间单位为天、月、年。
这些特征在「多轮对话与提示词」这一环带来什么约束
DTP 药房数据文档格式多样,包含大量非结构化内容,这要求多轮对话系统在知识库构建时,需要具备强大的文档解析能力,特别是对PDF和扫描件中表格和文本的准确提取。更新频率低意味着知识库可以进行周期性批量更新,但需确保每次更新的完整性和一致性。文档中特有的医学术语和专业字段,要求提示词设计时要考虑术语的准确性与上下文的关联性,避免因术语理解偏差导致的信息误读。此外,DTP药房的运营资质等信息往往是合规性审查的重点,多轮对话需能精准定位并引用相关资质文件,对提示词的召回精确度提出了更高要求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 确保单个分段包含足够的上下文信息,同时避免过长导致语义漂移,尤其针对医学专业文档。 |
召回条数 | 前 8 条 | 考虑到DTP药房资料的复杂性和关联性,适当增加召回条数以覆盖更多潜在相关信息。 |
相似度阈值 | 0.78–0.85 | 医疗领域对信息准确性要求高,阈值设置需严格,避免召回不相关或模棱两可的内容。 |
maxContext | 8192 token | 保证多轮对话能承载足够长的上下文,以处理复杂的注册申报问题和追溯历史对话。 |
重排返回条数 | 前 3 条 | 在召回基础上进行二次排序,确保最相关的核心信息优先展示,提高效率。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | DTP药房文档可能包含大量图片和复杂表格,解析耗时较长,需要更长的超时时间。 |
容易做错的三处
- 对话返回数据间隔过长,前端交互体验不佳。原因在于流式输出的
chunk大小或传输速率未优化,导致数据包发送频率低。 - 多轮对话中引用了不相关的药品批文信息,导致申报资料出现偏差。原因在于相似度阈值设置过低,或知识库分段粒度过大,导致召回了非目标药品的相似内容。
- 对话日志中缺少关键交互记录,无法追溯问题。原因在于日志记录级别或存储策略配置不当,未能完整捕获所有用户输入和系统输出。
怎么确认配好了
- 提交包含医学术语和资质要求的复杂问题,观察系统能否在
5 秒内给出相关性高的回复,并引用正确的文档片段。 - 上传一份包含表格和扫描文本的DTP药房GSP认证文件,检查知识库分段是否准确识别了所有关键字段,如认证编号
certificate_no和有效期valid_until。 - 模拟用户进行多轮追问,例如先询问“某药品的适应症”,再问“该药品的禁忌症”,核对系统能否在后续对话中保持对前一轮药品信息的上下文关联。
- 检查对话日志中是否完整记录了每次用户提问、系统检索过程以及最终回复内容,确保
dialog_id和turn_id字段的连续性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。