这个品类的数据长什么样
化妆品智能尽调的数据来源包含品牌方备案资料、第三方成分检测报告、供应链台账、电商平台销售数据及监管部门公示文件。更新节奏随新品上线、合规检查周期波动,无固定周期。文档格式涵盖结构化Excel(含产品清单、成分表)、非结构化Word/PDF报告(含合规判定、功效宣称说明)。字段包含产品名称、备案编号、成分CAS号、含量百分比、合规状态等,单位涉及mg/100g、%、批次号等。
这些特征在「文档解析与分块」这一环带来什么约束
化妆品尽调数据包含万行级结构化Excel与超10万字非结构化文档,解析与分块需适配多格式混合的数据源。成分表、合规项等字段存在精准数值与关联判定,分块需保留字段边界与上下文关联,避免拆分后信息断裂。文档存在固定模块(如备案章节、成分清单),需识别模块边界以维持逻辑完整性。数据体量波动范围大,需支持动态调整参数适配不同量级的尽调文件。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 化妆品尽调文档包含成分表、合规判定等需保留上下文的内容,该区间可平衡信息完整性与向量存储效率 |
chunk_overlap | 150–200 字符 | 成分名称、含量数值等关键信息易被分块截断,重叠区间可保留跨块关联内容 |
PARSE_EXCEL_HEADER_MODE | 固定表头匹配 | 化妆品尽调Excel的表头(如产品名称、备案编号)格式固定,可避免表头识别错误 |
UPLOAD_FILE_MAX_SIZE | 200 MB | 单份备案文件或供应链台账可能达到百兆级别,该阈值可覆盖常规尽调文档体量 |
rag_split_mode | 按语义分段 | 化妆品成分报告、监管公示文档的语义模块清晰,按语义分段可保留文档逻辑完整性 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 超10万行Excel或10万字Word文档的解析耗时较长,该时长可避免解析中断 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:Excel数据分块后出现字段错位、表头被拆分到不同块中。原因:未配置
PARSE_EXCEL_HEADER_MODE为固定表头匹配模式,默认解析逻辑误将多行表头识别为内容块。 - 现象:分块后数据块超出向量模型支持上限,导致向量生成失败。原因:未调整
chunk_size至适配化妆品文档的区间,默认参数块过大超出向量模型支持范围。 - 现象:解析过程出现超时报错(状态码504)。原因:未调整
PARSE_FILE_TIMEOUT_SECONDS至适配超10万行Excel或10万字Word文档的时长,默认超时阈值不足以完成全量解析。
怎么确认配好了
- 上传单份10万行级Excel尽调数据,检查解析后的数据块是否保留完整表头与行关联,无字段错位情况。
- 上传单份10万字Word成分检测报告,检查分块结果是否保留成分名称、含量数值等关键信息的上下文关联,未出现跨块断裂。
- 查看向量生成日志,确认每个数据块的字符数处于预设的
chunk_size区间内,未出现超出向量模型支持上限的块。 - 模拟用户查询,输入与成分合规性相关的问题,检查召回的分块内容是否包含完整的关联信息,无缺失或错位。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。