这个品类的数据长什么样
CAR-T 细胞治疗作为一种高度专业化的新型疗法,其制度与 SOP 文档具有显著特点。数据来源主要是药监部门发布的法规、指南、临床试验方案、医院内部制定的操作规程以及药企提供的产品说明书。这些文档更新频率相对较低,通常随政策调整或技术进步而修订。文档结构复杂,常包含大量专业术语、流程图、表格和引用文献。字段包括但不限于:细胞制备标准、患者筛选条件、给药流程、不良反应管理、随访要求等。单位涉及剂量(如 cells/kg)、时间(如 小时、天)、温度(如 ℃)等,且对精度要求极高。
这些特征在「多轮对话与提示词」这一环带来什么约束
CAR-T 细胞治疗制度文档的专业性、复杂性和对准确性的高要求,对多轮对话与提示词设计提出了严格约束。首先,多轮对话需要准确理解用户查询中包含的专业术语,避免因语义偏差导致误答。其次,SOP 中流程性强的信息,要求模型能够理解步骤间的逻辑关系,支持用户在多轮交互中逐步深入查询。文档更新频率低意味着历史数据相对稳定,但一旦更新,需确保知识库同步刷新,避免提供过时信息。对字段和单位的精度要求,则需要提示词设计时,引导模型关注数值细节,并在回复中精准呈现,例如在涉及剂量时,必须明确单位。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 2048 tokens | 兼顾长对话历史和模型处理能力,避免单轮对话上下文溢出。 |
temperature | 0.1 | 确保回复的严谨性和准确性,降低幻觉风险,符合制度问答的特点。 |
top_p | 0.3 | 进一步限制模型生成的多样性,聚焦于事实性内容。 |
分段长度 | 500–700 字符 | 适应制度文档的段落长度,保证语义完整性,减少上下文丢失。 |
召回条数 | 前 5 条 | 综合考虑召回效率和相关性,覆盖核心信息点。 |
相似度阈值 | 0.85 | 提高召回结果的精确度,确保只有高度相关的文档片段被检索。 |
容易做错的三处
- 模型在多轮对话中对专业术语的理解出现偏差,导致回复不准确。这通常是由于知识库中术语定义不完善或提示词未充分引导模型聚焦专业语义造成的。
- 用户在第二轮或后续轮次提问时,模型未能正确关联前文语境,回复内容脱节。这可能是因为
maxContext配置过低,导致早期对话历史被截断,未能有效传递上下文信息。 - 回复中涉及剂量、时间等数值信息时,单位缺失或数值精度不符。这往往是提示词中未明确要求模型关注并输出完整数值和单位,或者知识库原文中数值表示不规范。
怎么确认配好了
- 针对核心制度条款,进行多轮对话测试,验证模型是否能准确理解并连贯回答上下游问题。
- 随机抽取文档中的专业术语,在多轮对话中进行提问和追问,确认模型对术语的理解和使用无误。
- 选取包含具体数值和单位的流程性问题,测试模型回复中数值和单位的完整性和准确性,例如询问“某药品给药剂量”时,模型应给出带单位的数值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。