这个品类的数据长什么样
稳定性研究的数据主要来源于药品研发与生产过程中的长期留样观察、加速试验和中间期试验报告。这些数据更新频率相对较低,通常按季度或年度进行汇总发布,但涉及批次更新时可能出现阶段性密集更新。文档结构以 PDF 格式的报告为主,包含大量表格、图谱和文字描述。关键字段包括批号、生产日期、有效期、储存条件、检测项目、检测结果(如含量、溶出度、杂质)、检测方法和判定标准。单位涉及浓度(mg/mL)、百分比(%)、时间(月、年)等,数值精度要求高,且常伴随上下限范围描述。
这些特征在「部署与升级」这一环带来什么约束
稳定性研究数据更新频率低,但单次更新的数据量可能较大,且文档多为非结构化 PDF 报告,这对部署初期的数据导入和后续的增量更新策略提出了要求。大量的表格和图谱意味着需要强大的文件解析能力,以确保关键数据能被准确抽取。数据中涉及的批号、有效期等字段具有严格的关联性和时效性,这要求知识库在构建时能有效识别并维护这些关系,避免在问答中出现混淆。高精度数值和上下限范围的识别,则对模型理解和生成答案的精确性构成挑战,需要更精细的文本分段和向量化策略。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 稳定性研究报告通常包含多页图表,文件体积较大。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型 PDF 报告解析耗时,避免解析中断。 |
分段长度 | 800–1200 字符 | 确保稳定性报告中完整的表格或段落不被过度拆分。 |
相似度阈值 | 0.8 | 稳定性数据对精确性要求高,提高阈值减少不相关召回。 |
召回条数 | 前 10 条 | 确保能覆盖不同批次或不同检测项目的相关信息。 |
maxContext | 4000 | 稳定性报告上下文关联性强,需容纳较长上下文。 |
容易做错的三处
- 部署后文件上传失败并提示
413 Request Entity Too Large。原因是没有正确配置nginx或FastGPT容器的环境变量UPLOAD_FILE_MAX_SIZE,导致上传文件大小超出限制。 - 提问关于特定批次稳定性数据时,答案出现多个批次的信息混淆。原因是没有在数据处理阶段对文档进行有效的分段策略,导致不同批次的数据被向量化到同一段落中。
- 问及某个检测项目的具体数值范围时,模型回答不准确或缺失。原因在于 PDF 解析时表格数据抽取不完整,或者向量化模型未能有效捕捉数值与单位、上下限之间的关联。
怎么确认配好了
- 上传一份包含多页表格和图谱的稳定性研究报告 PDF,检查文件是否成功解析,并在知识库中能查看到完整文本内容。
- 针对某个特定药品的特定批号,提问其在加速试验下的含量变化趋势,检查回答是否能准确引用报告中的批号、检测项目和数值。
- 询问某个检测项目的合格标准或判定依据,确认模型能从文档中抽取出对应的文字描述,并通过对比阈值验证准确性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。