这个品类的数据长什么样
稳定性研究数据主要来源于药品研发阶段的长期试验、加速试验和中间试验报告。这些报告通常以 PDF 或 Word 文档形式存在,包含详细的批次信息、考察时间点、温度/湿度条件、检测项目、检测结果和判定标准。数据更新频率较低,通常在药品上市前完成,后续如有重大变更或特殊情况会进行补充研究。文档结构通常包括前言、试验方案、试验结果(多以表格形式呈现,包含特定字段如 批号、考察时间、温度、湿度、含量、有关物质、pH值 等)、数据分析和结论。含量单位常为 % 或 mg/g,有关物质单位为 %,pH 值无单位。
这些特征在「多轮对话与提示词」这一环带来什么约束
稳定性研究数据的文档化特性,决定了多轮对话需要侧重于对结构化和半结构化信息的精准抽取与理解。由于数据更新频率低,知识库的构建和维护可以采用周期性全量更新,召回条数 设定需要覆盖足够的时间点和批次信息。多轮对话中,用户可能会追问特定批次在不同时间点的变化趋势,或在特定条件下含量降解的详情,这要求系统能够准确关联不同文档中的相关数据。同时,数据中的专业术语和单位(如 降解产物、峰面积、相对标准偏差)对 提示词 的设计提出了更高要求,需要确保模型能够正确识别并解释这些专业内容。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 稳定性报告中,单个检测结果或批次信息段落长度适中,过长容易引入无关信息,过短可能切断关键上下文。 |
召回条数 | 前 10–15 条 | 确保在多轮对话中,能覆盖用户可能追溯的多个批次、时间点或检测项目,避免信息遗漏。 |
相似度阈值 | 0.75–0.85 | 稳定性研究术语专业性强,提高阈值可减少非相关段落的召回,提升回答的准确性。 |
重排返回条数 | 前 5 条 | 在召回结果中进一步精选最相关的片段,优化最终答案的质量和简洁性。 |
maxContext | 4096 tokens | 保证模型有足够的上下文空间来处理用户在多轮对话中提出的复杂查询,并关联多个稳定性数据点。 |
系统提示词版本 | V4.9.13 | 确保使用最新的模型能力和提示词解析逻辑,以获得更好的理解和生成效果。 |
容易做错的三处
- 现象:用户询问某个批次在特定时间点的含量,AI 回答“未找到相关信息”或给出错误数据。原因:知识库分段策略不当,导致关键数据(如
含量字段)被分割到不同的段落,或相似度阈值过高过滤掉了相关度略低的有效段落。 - 现象:多轮对话中,用户追问上一轮 AI 回复中提及的某个
有关物质的具体变化,AI 无法关联上下文。原因:maxContext参数设置过小,导致历史对话信息在后续轮次中被截断,模型无法获取完整的对话历史。 - 现象:AI 在回答中混淆了
考察时间或批号,导致数据对应关系错误。原因:提示词中未明确要求模型在回答时严格区分并引用文档中的具体字段,或召回条数不足导致模型无法获取足够区分不同批次或时间点的信息。
怎么确认配好了
- 针对典型稳定性研究问题(例如“批号 XYZ 在 36 个月 40℃/75%RH 条件下的
含量变化趋势如何?”),进行多轮测试,检查 AI 是否能准确追溯数据、关联上下文,并给出合理的解释。 - 检查 AI 回复中是否准确引用了文档中的
批号、考察时间、检测项目等关键字段,确保数据的来源可追溯。 - 在 FastGPT 后台查看
召回条数和相似度阈值对应的实际召回内容,判断召回的段落是否包含用户查询所需的所有关键信息,并排除无关信息。 - 模拟在不同
maxContext设置下,进行长对话测试,观察 AI 在对话后期对早期信息的记忆和关联能力。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。