这个品类的数据长什么样
内部制度合规相关文档的来源为企业内部合规管理部门、业务部门发布的正式文件,更新节奏随行业监管政策调整、企业内部流程变更触发,无固定周期。文档格式包含PDF、Word、内部发布的HTML页面、扫描件等,结构多包含层级化章节、条款编号、生效日期、发布部门等元数据,部分文档附带合规流程图、审批表单等附件,字段以文本编号、日期、部门名称为主,单位多为章节号、页码、条款序号。
这些特征在「文档解析与分块」这一环带来什么约束
多格式来源要求解析引擎同时适配PDF、Word、HTML及扫描件的文本提取逻辑;层级化的章节结构要求分块时保留原文档的标题层级,避免跨章节拼接导致合规条款语义断裂;更新无固定周期的特性要求解析流程支持增量同步与全量刷新两种模式;部分文档包含内嵌图片与附件,要求解析环节同步提取图片内文本与附属文件内容。另外,HTML格式的内部制度文档常包含导航栏、页脚等非正文元素,需针对性过滤后再提取核心内容。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_HTML_IGNORE_SELECTOR | ".nav,.footer,.sidebar" | 移除HTML格式内部制度文档中的导航、页脚、侧边栏等非正文元素,确保仅提取核心合规条款内容 |
CHUNK_SPLIT_BY_HEADING | 启用 | 按文档的标题层级拆分分块,保留内部制度的章节结构,便于精准召回对应合规条款 |
MAX_CHUNK_SIZE | 800–1200 字符 | 适配内部制度单条条款的常规长度,避免分块过碎导致上下文断裂,或过长导致召回精度下降 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 覆盖长文档、含多附件的内部制度文档的解析耗时需求,避免因超时导致解析失败 |
ENABLE_IMAGE_OCR | 启用 | 提取内部制度文档中内嵌的合规流程图、审批表单等图片内的文本内容,满足合规问答的全量召回需求 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 允许上传包含批量附件的内部制度文档,适配企业级合规文档的上传需求 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传HTML格式的内部制度文档后,解析结果为空或仅包含少量无关文本。原因:未配置
PARSE_HTML_IGNORE_SELECTOR移除非正文元素,导致解析引擎抓取了页面导航、广告等无关内容,无法识别核心正文区域。 - 现象:PDF格式的内部制度文档解析后,分块内容跨章节拼接,出现多条合规条款合并的情况。原因:未启用
CHUNK_SPLIT_BY_HEADING配置,仅按固定字符长度拆分,破坏了文档原有的层级结构。 - 现象:上传包含内嵌公章、流程图的内部制度文档后,相关图片内的文本未被纳入召回范围。原因:未开启
ENABLE_IMAGE_OCR配置项,未启用图片文本提取功能。
怎么确认配好了
- 上传单份HTML格式的内部制度测试文档,查看解析后的文本内容,确认导航、页脚等非正文元素已被移除。
- 上传长文档测试,查看分块结果是否按标题层级拆分,无跨章节拼接的情况。
- 上传包含内嵌流程图、公章的PDF文档,查看解析结果是否包含图片内的文本内容。
- 上传超过预设
MAX_CHUNK_SIZE上限的单章节文档,查看解析后的分块是否符合配置的长度要求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。