这个品类的数据长什么样
稳定性研究的数据主要来源于药物研发过程中的批次生产记录、质量控制报告、以及长期稳定性考察报告。这些数据通常以结构化表格(如 CSV、Excel)、非结构化文本(如实验记录、分析报告 PDF)和数据库记录的形式存在。数据更新频率在药物生命周期内是持续的,新批次生产、新的稳定性考察点、以及分析方法变更都会带来更新。文档结构多样,但核心数据通常包含批号、生产日期、有效期、储存条件、检测项目、检测方法、检测结果(数值与单位)、以及判定标准。关键字段包括 批次号、样品ID、时间点、温度、湿度、含量、杂质A、溶解度、pH值,单位涉及百分比、ppm、mg/mL、摄氏度等。
这些特征在「多轮对话与提示词」这一环带来什么约束
稳定性研究数据的高度结构化与数值特性,要求多轮对话系统在理解用户意图时,能够精准识别数值范围、单位和时间序列。例如,用户可能会询问“批次 ABC-202301 在 30°C/65%RH 条件下,12个月 时的杂质A含量是否超标?”。此时,提示词需要引导模型关注这些关键参数。非结构化报告中的实验过程描述,则要求模型具备从长文本中抽取关键信息的能力,以支持更复杂的查询,如“分析 批次XYZ 稳定性报告中,溶液颜色 变化的趋势”。数据的持续更新特性,意味着系统需要定期同步知识库,并让模型感知到数据的新鲜度,避免基于过时信息进行判断。对单位的敏感性是另一约束,提示词设计必须强调对单位的识别和转换,避免因单位混淆导致误判。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8 | 稳定性研究查询通常涉及多个参数和历史数据点,8 轮对话足以覆盖大部分复杂场景。 |
分段长度 | 800–1200 字符 | 稳定性报告中的实验描述和结果表格信息密集,较长的分段长度有助于保持上下文完整性。 |
召回条数 | 前 5 条 | 确保在多轮对话中能够召回足够多的相关批次数据和检测标准,为判断提供依据。 |
相似度阈值 | 0.75 | 稳定性数据查询通常需要高精度匹配,避免召回不相关的批次或检测项。 |
重排返回条数 | 前 3 条 | 经过重排后,前 3 条通常包含最核心、最相关的批次稳定性数据或判定标准。 |
System Prompt | 按实测标定 | 需包含对 批次号、时间点、储存条件、检测项目 和 判定标准 的识别与强调。 |
容易做错的三处
- 模型在回答中遗漏关键数值或单位,原因在于提示词未明确要求模型必须输出所有相关数值和单位。
- 用户多次追问后,模型无法记住前几轮对话中提及的特定
批次号,原因在于maxContext设置过低,导致早期对话记录被丢弃。 - 系统返回“未找到相关信息”,即使知识库中存在数据,原因可能是
相似度阈值设置过高,导致召回过于严格,无法匹配用户查询中的细微表述差异。
怎么确认配好了
- 针对不同批次、不同检测项目和不同储存条件,进行多轮提问,检查模型是否能准确识别并引用
批次号、时间点、温度、湿度等关键字段。 - 测试包含数值范围和单位的查询,例如“
杂质B含量超过0.1%的批次有哪些?”,核对模型回复中数值和单位的准确性。 - 模拟用户在对话中逐步细化查询条件,例如先问“
批次X的稳定性数据”,再问“6个月时的含量数据”,确认模型能够基于前序对话的上下文进行正确响应。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。