这个品类的数据长什么样
稳定性研究的数据主要来源于各类实验报告、批生产记录、检验报告以及稳定性考察方案。这些文档的更新频率通常遵循产品生命周期管理,例如年度回顾、批次放行后的持续监控、或新配方/工艺变更后的重新评估,更新周期从数月到数年不等。文档结构上,稳定性研究报告常包含详细的实验条件、检测方法、原始数据、趋势分析图表和结论。字段方面,常见的有批号、生产日期、考察时间点、温度/湿度条件、含量、降解产物、pH值、水分等,单位则严格遵循药典或内部标准,如 mg/mL、%、℃、%RH、月 等。部分数据以 xlsx 表格形式存在,包含多维度的时序数据。
这些特征在「知识库检索与召回」这一环带来什么约束
稳定性研究数据的时序性和多维度特性,对知识库检索的准确性提出较高要求。例如,查询特定批号在不同时间点的含量变化,需要系统能关联多个文档片段。文档中包含大量图表和表格,直接的文本分段可能遗漏关键数据关系。字段和单位的标准化,意味着分词和实体识别需要具备医药领域的专业词库支持。低频的更新周期,决定了知识库构建初期需要一次性摄入大量历史数据,并能处理版本迭代。此外,对 xlsx 等结构化数据的解析能力至关重要,简单的文本提取不足以满足精确查询某个批次在某个时间点的特定指标值。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 稳定性报告段落通常较长,包含多项指标描述,长分段有助保留上下文。 |
分段重叠 | 50–100 字符 | 确保跨分段的关键信息(如批号、考察时间点)能够被有效连接。 |
召回条数 | 8–12 条 | 稳定性研究查询往往需要综合多份报告或多个时间点数据,增加召回量可提高覆盖率。 |
相似度阈值 | 0.75–0.85 | 保证召回结果与查询意图高度相关,避免引入无关的实验数据。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 xlsx 文件或包含大量图表的 PDF 文档时,需要更长的解析时间。 |
maxContext | 3000 Tokens | 稳定性研究的上下文信息密度大,需要更长的上下文窗口来承载召回内容。 |
容易做错的三处
- 现象:大语言模型无法回答知识库中
xlsx文件内特定行的数据,例如“某批号在第 6 个月含量是多少”,模型回复无法读取文件内容。 原因:知识库文件解析器默认可能只提取文本,未能识别并结构化xlsx文件中的表格数据,导致关键数据未被向量化。 - 现象:查询关于特定批次稳定性趋势时,召回结果包含不相关的批次数据,或遗漏了重要时间点的数据。 原因:分段策略未能有效识别批次号和考察时间点作为关键上下文,导致不同批次或时间点的数据混淆。
- 现象:上传的文件在知识库中显示解析失败或长时间处于解析中状态。 原因:单个稳定性报告文件(尤其是包含大量高分辨率图表或复杂表格的 PDF/
xlsx)大小超出UPLOAD_FILE_MAX_SIZE限制,或解析超时PARSE_FILE_TIMEOUT_SECONDS。
怎么确认配好了
- 上传典型稳定性研究报告(包含
xlsx和 PDF 格式),检查其解析状态是否为“成功”,并验证知识库内容预览是否能正确显示表格数据和主要文本信息。 - 针对特定批号和考察时间点,提问关键指标数值(例如“批号
20230101在第12个月的含量是多少”),检查模型是否能从知识库中准确召回并引用相关数据。 - 进行多轮对话,模拟追问同一批次不同时间点的变化趋势或不同批次间的比较,观察模型能否保持上下文一致性并有效利用已召回信息。
- 使用 FastGPT 的调试工具,查看特定查询的召回片段,评估召回结果的质量和相关性,并根据实际业务需求调整
相似度阈值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。