这个品类的数据长什么样
饰品的营销文档主要来源于品牌方产品规格手册、电商平台导出的商品清单、营销活动方案、供应链物料包。更新节奏随新品上线、大促活动调整,新品上线时批量生成,大促前集中优化营销文案,日常有少量SKU更新。文档结构包含单页参数表、图文混合方案、SKU清单表格、长文本种草文案合集。字段包含材质、尺寸、克重、配色、活动主题、适用场景、卖点话术,尺寸单位多为毫米、厘米,克重单位为克。
这些特征在「文档解析与分块」这一环带来什么约束
饰品营销文档的图文混合结构,要求解析环节保留原图,不局限于仅提取OCR文本,避免丢失产品实拍的视觉物料信息;多sheet的Excel SKU清单,要求解析时同步提取每个sheet的名称与对应内容,避免遗漏不同sheet对应的SKU维度信息;长文本种草文案合集的段落主题分散,要求分块逻辑结合主题,不局限于仅以固定字符长度为依据,确保单条卖点完整;小尺寸参数表的紧凑排版,易出现表格解析错位,要求保留原始表格结构,不局限于仅进行扁平化转换。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
extract_original_image | true(图文混合文档),false(纯文本文档) | 饰品营销文档多含产品实拍图,开启后可保留原始图片,避免OCR误转图片内容 |
parse_excel_sheet_names | true | 饰品SKU清单多为多sheet Excel,开启后可提取每个sheet的名称,明确对应SKU维度 |
chunk_mode | topic_based | 长文本种草文案主题分散,按主题分块可保留卖点完整性,适配饰品营销的分段需求 |
max_chunk_size | 800–1200 字符 | 饰品营销文案的单卖点长度多在500-1000字符,该区间可避免拆分完整卖点 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 多文档批量解析时,该时长可覆盖大型Excel与图文PDF的完整解析流程 |
enable_pdf_enhance | true(扫描件PDF),false(可编辑PDF) | 可编辑PDF无需增强,扫描件PDF开启后可优化文本识别精度 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:开启OCR功能后,解析结果仅包含OCR文本,无原始图片文件。原因:未将
extract_original_image配置为对应场景的取值,导致解析环节丢弃原图仅提取文本。 - 现象:解析多sheet Excel SKU清单后,结果未包含sheet名称,仅合并了所有sheet的内容。原因:未开启
parse_excel_sheet_names配置,默认仅提取第一个sheet的内容。 - 现象:导入PPT或Word文档时,开启
enable_pdf_enhance后,解析结果无变化。原因:PDF增强功能仅对PDF格式文档生效,非PDF文档无法触发该配置。
怎么确认配好了
- 上传单张含产品实拍图的图文PDF,检查解析结果的附件模块,确认存在原始图片文件。
- 上传包含2个及以上sheet的Excel SKU清单,检查解析后的文档结构,确认每个sheet的名称均被标注。
- 上传Word或PPT文档,关闭
enable_pdf_enhance后执行解析,确认解析流程正常完成且无报错。 - 上传长文本种草文案,调整
chunk_mode参数后,检查分块结果是否按主题聚合内容。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。