这个品类的数据长什么样
免税营销内容的数据源包括品牌方免税活动手册、海关备案的离岛商品公示文件、线下门店促销海报电子档、会员营销规则文档。数据更新节奏随促销活动、商品进货批次调整,无固定周期。文档形态涵盖带目录的多页PDF、结构化Excel商品清单、图文混合Word营销方案。字段包含活动适用范围、商品品类、生效失效日期、额度阈值,单位多为日期格式、金额单位、分类文本。
这些特征在「文档解析与分块」这一环带来什么约束
不同来源的文档形态差异较大,既有结构化的Excel商品清单,也有图文混合的营销方案,要求解析模块同时支持格式识别与OCR提取。Excel中的合并单元格会导致字段关联断裂,分块前需先完成结构化数据的对齐修复。营销文档中的时间区间类字段,需保留上下文关联,避免拆分跨活动周期的内容。海关备案文件的固定格式要求保留字段原始顺序,不能打乱字段间的业务关联。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_OCR_ENABLE | 开启 | 免税营销文档包含线下促销海报、离岛政策图文页,需通过OCR提取图片内的文本信息 |
分段长度 | 800–1000 字符 | 免税营销内容多包含活动规则、商品清单,该长度可保留单条活动的完整逻辑 |
CHUNK_OVERLAP | 100–150 字符 | 活动规则存在跨块的上下文关联,重叠字符可确保召回时的上下文完整性 |
召回条数 | 前6–8条 | 免税营销内容的关键词集中度较高,该取值可覆盖相关活动的全部有效信息 |
相似度阈值 | 0.75–0.85 | 过滤低相关召回结果,同时保留与用户查询匹配度较高的营销内容 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 部分海关备案的大型文档解析耗时较长,该阈值可避免解析中途中断 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:查询内容与知识库内的文档chunk完全匹配,但未召回对应结果,新建知识库后操作可正常召回。原因:未正确配置
相似度阈值,阈值设置过高导致匹配结果被过滤,或召回条数取值过少未覆盖匹配内容。 - 现象:上传多份免税营销文档后,解析结果未按单份文档区分,所有内容合并为统一分块。原因:未启用按文档拆分的解析配置,导致多份文档的内容被混合分块,无法对应到原始文件。
- 现象:上传完整的免税营销PDF文档后,问答召回的内容分散且关联性弱。原因:
分段长度设置不符合文档内容密度,导致chunk无法保留完整的业务逻辑上下文。
怎么确认配好了
- 上传一份典型的免税营销Excel文档,查看解析后的字段是否完整,确认结构化数据自动解析配置已生效。
- 上传一份带图片的促销海报PDF,查看解析结果是否包含图片中的OCR文本,确认OCR配置已开启。
- 执行一次测试查询,核对召回结果的数量与匹配度,调整对应配置项的取值至符合业务需求。
- 上传多份不同类型的免税营销文档,确认每份文档的分块结果独立,未出现跨文档合并的情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。