这个品类的数据长什么样
化妆品智能尽调的数据主要来自品牌方的药监备案文件、第三方成分检测报告、供应商COA分析证书、电商平台公开合规信息。数据更新随配方调整、备案变更或批次生产完成触发,核心备案信息每年更新至少一次。单份完整尽调文档包含备案编号、INCI名成分表、生产批次、重金属/微生物检测项目、合规声明等字段,成分含量以百分比或mg/kg为单位,部分检测报告附带扫描件格式的原始数据。
这些特征在「部署与升级」这一环带来什么约束
化妆品数据的多格式、多字段特性,对部署环节的文档解析与索引配置提出针对性约束。备案文件的多样格式要求调整解析超时与并行参数;成分表的专业术语与精确含量要求配置实体抽取模型的专属prompt;高频更新的备案与批次数据要求配置增量同步任务,避免索引数据滞后。升级环节需适配新的合规格式变化,同时保留旧版数据的关联索引规则,防止尽调报告出现数据断层。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 化妆品备案PDF通常包含多页成分表与检测报告,解析耗时较长 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 单批次检测报告的扫描件或原始数据文件体积较大,需放宽上传限制 |
maxContext | 800–1200 字符 | 化妆品成分表单条记录长度适中,过长会导致模型上下文冗余 |
相似度阈值 | 0.75–0.85 | 需精准匹配同批次产品的备案数据与检测报告,避免跨批次数据混淆 |
增量同步间隔 | 每日 2 次 | 化妆品备案与批次信息更新频率较高,需及时同步最新合规数据 |
RECALL_TOP_N | 前 8 条 | 尽调报告需覆盖成分、合规、检测等多维度数据,召回适量条目保证完整性 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:部署v4.8.20-fix2版本后,配置OneAPI模型接口时页面配置不生效,日志提示API地址无效。原因:未在docker-compose.yml中正确配置
AI_MODEL_API_URL环境变量并追加/v1路径,旧版config配置文件已被页面配置覆盖。 - 现象:PG数据库部署的FastGPT实例中,知识库索引建立失败,文件解析进度长期停滞。原因:未调低
PARSE_PARALLEL_NUM参数,默认并行数超出8c16G无GPU虚拟机的资源承载能力,导致解析进程阻塞。 - 现象:尽调报告中深度思考触发时机混乱,简单成分查询也触发深度思考流程。原因:未配置模型触发深度思考的阈值条件,或未在页面设置中绑定触发规则,导致模型无差别触发深度思考。
怎么确认配好了
- 进入FastGPT的模型管理页面,验证
AI_MODEL_API_URL是否包含/v1后缀,对比docker-compose.yml中的环境变量配置与页面显示的API地址是否一致。 - 上传一份标准化妆品备案PDF文件,等待解析任务完成后,查看解析后的文本是否包含完整的INCI名、成分含量等核心字段,无缺失或乱码。
- 手动触发一次增量同步任务,查看同步日志是否有新的备案数据被成功导入,无连接超时或格式错误提示。
- 提交一条包含长文本成分查询的测试请求,观察模型是否按照配置的相似度阈值与召回条数返回相关知识库条目,验证深度思考触发规则是否生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。