这个品类的数据长什么样
专业服务营销内容的数据主要来自内部营销物料库、客户沟通记录、合作方提供的产品文档。更新节奏涵盖不定期(新理财产品、保险产品上线时更新)、按季度(投研分析报告)、按月(活动宣传物料)三类。文档类型包含多页PDF投研报告、结构化Excel客户/产品清单、Word格式营销话术模板,字段包含产品代码、预期收益率、风险等级、生效日期等,单位涉及百分比、元、年化天数等。单份文档长度跨度较大。
这些特征在「文档解析与分块」这一环带来什么约束
首先,结构化Excel清单的每行对应独立的客户或产品信息,需避免跨行合并拆分,否则会导致后续召回匹配错误。其次,长PDF投研报告存在明确的章节层级,按固定字符数拆分会破坏产品说明、风险提示的逻辑完整性。再者,不定期更新的营销物料需要快速解析,需支持批量上传与自动分块,无需手动调整单份文档配置。最后,含唯一标识字段的文档,分块时需保留字段关联,避免拆分跨字段的关键信息,影响后续精准匹配。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 匹配专业服务营销文档的单块信息密度,避免拆分跨产品的完整说明 |
chunk_overlap | 100–150 字符 | 保留跨块的上下文信息,例如产品风险提示跨两个分块时仍可关联 |
PARSE_EXCEL_SPLIT_BY_ROW | 开启 | 按Excel行拆分结构化数据,解决多行合并为单chunk的问题 |
SIMILARITY_THRESHOLD | 0.75–0.85 | 过滤低相关的召回结果,匹配专业服务内容的精准匹配需求 |
PARSE_PDF_USE_HEADING | 开启 | 按PDF标题层级拆分长文档,保留营销物料的章节逻辑 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 适配单份数十页投研报告或批量营销物料的上传大小限制 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 上传Excel格式的营销清单后,分块结果为多行为单条内容,原因是未开启
PARSE_EXCEL_SPLIT_BY_ROW配置,系统默认按文档整体结构拆分,未按行拆分。 - 特定分块内容与查询词完全匹配却无法召回,原因是
SIMILARITY_THRESHOLD设置过高,或分块时丢失了产品代码等唯一标识字段。 - 批量上传多份PDF营销文档后,仅生成一个总分块,原因是未开启
PARSE_PDF_SPLIT_BY_DOC配置,或工作流未配置多文档遍历节点。
怎么确认配好了
- 上传单份结构化Excel测试文件,检查知识库分块结果是否每行对应一个独立chunk。
- 上传带标题层级的PDF投研报告,检查分块结果是否按标题拆分,未按固定字符数拆分。
- 调整
SIMILARITY_THRESHOLD至0.75后,测试已知匹配内容的召回成功率。 - 批量上传多份PDF营销文档,检查工作流是否逐一处理每份文档并生成对应分块。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。