这个品类的数据长什么样
实体瘤相关的制度与标准操作流程 (SOP) 文档,其数据来源主要为国家药监局、临床试验机构、医院伦理委员会发布的规章制度,以及药企内部质量管理体系文件。这些文档更新频率相对稳定,通常以年度修订或根据政策变动进行不定期更新。文档结构多为层级分明的 PDF 或 Word 格式,包含大量的定义、条款、流程图和附件。字段方面,常涉及疾病编码 ICD-O-3、药物批号、临床阶段、不良事件等级 CTCAE v5.0 等专业术语,单位则涵盖剂量(mg/kg)、时间(小时、天)、百分比(%)。文档篇幅普遍较长,单份文件可能超过百页。
这些特征在「多轮对话与提示词」这一环带来什么约束
实体瘤制度文档的层级结构和专业术语,要求多轮对话系统在理解用户查询时,具备上下文感知能力和术语解析精度。例如,当用户询问“某个药物在 III 期临床试验中的不良反应处理流程”时,系统需要准确识别“III 期临床试验”这一阶段信息,并关联到具体药物的不良反应管理 SOP。文档更新的周期性,使得知识库需要定期同步最新版本,以确保问答结果的时效性。长篇幅文档对分段策略提出挑战,过短的分段可能丢失上下文,过长的分段则增加检索噪声。此外,字段与单位的标准化,要求提示词设计能有效引导模型提取并呈现带有具体数值和单位的信息,如“该方案的推荐剂量是多少 mg/kg?”。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾上下文完整性与检索效率,避免单一分段过长或过短 |
召回条数 | 前 5–8 条 | 覆盖相关性高的文档片段,减少无关信息干扰 |
相似度阈值 | 0.75–0.85 | 在保证召回准确性的前提下,过滤掉低相关度的结果 |
maxContext | 3500–4000 token | 确保模型能处理较长的历史对话和检索到的文档内容 |
重排返回条数 | 3 条 | 对召回结果进行二次精选,提升最终答案的相关性 |
对话历史条数 | 4–6 轮 | 维持多轮对话的连贯性,避免遗忘早期关键信息 |
容易做错的三处
- 现象:用户提问后,系统返回“未找到相关信息”或给出不准确的通用回答。原因:
相似度阈值设置过高,导致相关文档片段无法被召回,或者文档分段策略不合理,关键信息被切割。 - 现象:在多轮对话中,模型无法理解用户后续问题与前文的关联,回答出现偏差。原因:
对话历史条数设置过少,模型在生成回复时丢失了历史对话的上下文信息。 - 现象:上传文档后,系统提示“文件解析失败,状态码 500”。原因:上传的 PDF 或 Word 文档格式复杂,包含大量图片或特殊字体,导致
PARSE_FILE_TIMEOUT_SECONDS超时或解析器无法正确提取文本内容。
怎么确认配好了
- 选取多个具有代表性的实体瘤制度问题,包括单轮问答和多轮追问,检查系统返回答案的准确性和连贯性,并与原始文档进行比对。
- 在对话日志中观察每次检索的
召回条数和相似度分数,确保召回结果能覆盖用户问题的关键信息,且相似度处于合理区间。 - 测试系统对不同格式、不同篇幅的实体瘤制度文档的上传和解析能力,检查是否有解析失败或内容缺失的情况,并确认
分段长度是否适用于这些文档。 - 针对核心制度条款,设计包含专业术语和缩写的提问,核实模型是否能正确理解并引用文档中的具体字段值和单位。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。