这个品类的数据长什么样
DTP 药房的制度与 SOP 数据主要来源于企业内部的规章制度文档、操作流程手册、培训材料及合规性文件。这些数据通常以 PDF、Word 或扫描件的形式存在,更新频率相对固定,通常为季度或年度修订,遇政策变动或业务流程调整时会进行额外更新。文档结构严谨,包含目录、章节标题、条款编号和详细说明。字段与单位方面,常涉及药品批号、有效期、存储条件(如 2-8℃)、操作步骤编号(如 SOP-001-01)、责任人、审核日期等,这些信息往往是文本与结构化数据的混合。
这些特征在「多轮对话与提示词」这一环带来什么约束
DTP 药房制度数据的更新周期相对固定,对即时性要求不高,但对准确性和合规性有极高要求。这意味着在知识库构建时,需特别关注文档解析的完整性和内容的忠实还原,以避免误解或遗漏关键条款。文档中包含大量编号、温湿度等结构化信息,要求分段策略能有效保持这些信息的上下文关联,防止在切片时破坏关键数据对。多轮对话中,用户可能频繁追问特定条款的细节或不同制度间的交叉影响,要求系统能精准理解并从多个相关知识块中提取信息进行综合回答。提示词设计需要兼顾通用性与特定性,既能处理日常查询,也能应对合规性审查等高风险场景。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 保留制度条款的完整语义单元,避免关键信息被切割,同时兼顾召回效率。 |
分段重叠长度 | 100 字符 | 确保相邻分段之间有足够的上下文衔接,便于多轮对话中的语义连贯。 |
召回条数 | 前 5 条 | DTP 制度查询通常需要较多上下文来支撑决策,增加召回量有助于全面性。 |
相似度阈值 | 0.78 | 确保召回内容的精准度,减少不相关条款的干扰,避免合规性风险。 |
maxContext | 6000 tokens | 适应多轮对话中累积的对话历史和召回内容,保障模型理解能力。 |
重排返回条数 | 前 3 条 | 进一步筛选出与用户意图最相关的条款,提高回答的精确性和效率。 |
容易做错的三处
- 对话中出现关于某个制度的回答不完整或缺失关键步骤,原因在于
分段长度过小,导致制度条款被不当切分,关键信息分散。 - 用户询问不同制度间的关联影响时,系统无法给出综合性回答,原因是知识召回时
召回条数不足,未能覆盖所有相关条款。 - AI 回答中出现批号或温度单位错误,原因是原始文档解析时未能正确识别并抽取结构化字段,或在
相似度阈值设置过低时召回了不准确的文本片段。
怎么确认配好了
- 针对关键制度条款进行多轮提问,核对 AI 回答是否完整覆盖了原始文档中的所有必要信息。
- 模拟用户在复杂场景下,如交叉引用不同制度进行提问,观察 AI 能否准确联结并给出逻辑清晰的回答。
- 抽取包含特定字段(如药品批号、存储温度
2-8℃)的文档进行测试,验证 AI 在回答中是否能准确引用这些结构化信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。