这个品类的数据长什么样
稳定性研究的数据主要来源于药企内部的质量控制实验室,以及委托第三方 CRO 机构进行的加速稳定性、长期稳定性试验报告。这些报告通常以 PDF 文档、Word 文文档或结构化数据文件(如 CSV、Excel)的形式存在。数据更新频率不固定,主要依据药物研发阶段、批次生产安排和监管要求进行,可能按季度、半年或年度更新。文档结构复杂多样,常包含图表、批次号、检测日期、储存条件(温度、湿度、光照)、检测项目(含量、溶出度、杂质、pH值、水分)、检测结果、分析方法和结论等。字段名可能存在多种表述,如“含量测定”或“Assay”,单位也因检测项目而异,如“%”、“μg/mL”、“min”。数据的核心在于跟踪药物在不同条件下的质量属性变化趋势,以评估其保质期和储存条件。
这些特征在「部署与升级」这一环带来什么约束
稳定性研究数据来源的文档化特点,决定了 FastGPT 在部署时需要重点关注文档解析能力。复杂的文档结构要求 file_parser 模块具备强大的文本、表格及图像内文字识别功能,以准确提取关键字段。数据更新频率的不固定性,意味着 cron 任务调度需要灵活配置,不能依赖固定周期,可能需要手动触发或根据事件驱动。字段名和单位的多样性,对知识库的 schema 设计提出了挑战,需要预留足够的灵活性以适应不同报告的表述,或在数据预处理阶段进行标准化。此外,数据通常涉及敏感的药物质量信息,对部署环境的安全性、访问控制和数据加密有较高要求,确保 PG_URL 等数据库连接参数的私密性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 稳定性报告常包含大量图表和详细数据,文件较大 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 复杂 PDF 文档解析耗时较长,避免解析超时 |
分段长度 | 800–1200 字符 | 确保上下文完整性,兼顾检索效率和内容密度 |
相似度阈值 | 0.75 | 提高检索准确性,过滤掉不相关的稳定性数据 |
重排返回条数 | 前 5 条 | 核心问题通常集中在少数关键报告和结果中 |
maxContext | 16384 token | 容纳较长报告片段,支持复杂的趋势分析和比较 |
容易做错的三处
- 知识库查询结果为空,原因可能是文档解析失败,导致关键信息未能正确入库或字段提取不准确。
- 系统在处理大量稳定性报告时响应变慢,日志显示
OutOfMemoryError,通常是FILE_PARSER_MEMORY_LIMIT设置过低,无法处理大型文件或高并发解析任务。 - 断电后 FastGPT 无法启动,
pg或mongodb数据库连接失败,这是由于 Docker 容器未配置持久化存储,导致数据库数据丢失或损坏。
怎么确认配好了
- 上传一份典型稳定性研究报告(PDF 格式),检查知识库中是否正确解析出批次号、检测项目和结果等关键字段。
- 执行一次包含图表内容的报告解析,观察
fastgpt-server容器日志,确认无OCR_FAILED或PARSE_ERROR错误码。 - 针对不同储存条件下的药物含量变化,使用自然语言进行查询,核对返回结果是否准确关联到相关报告片段,并评估其相关度阈值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。