这个品类的数据长什么样
受益所有人KYC相关数据主要来源于工商登记档案、股权架构披露文件、尽职调查提交的声明文件。数据更新随主体股权变更、实际控制人调整而触发,无固定周期。文档多为结构化表格辅以扫描件附件,部分为纯文本声明,字段包含姓名、身份凭证编号、持股比例、控制关系类型,单位包括自然人标识、机构标识、比例单位。
这些特征在「文档解析与分块」这一环带来什么约束
结构化表格的存在要求解析工具能准确识别表格结构并提取单元格内容,避免跨行跨列的信息丢失。附带的扫描件附件要求开启OCR功能,否则无法提取非文本内容。无固定更新周期意味着解析流程需适配多种格式的上传文件,无需预设固定模板。控制关系类型字段的存在要求分块时保留单主体的完整字段关联,不能拆分单个受益所有人的完整信息组。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_OCR_ENABLE | 开启 | 受益所有人文档常附带工商扫描件、股权结构图图片,需OCR提取图片内文本 |
PARSE_FILE_TABLE_MODE | 结构化提取 | 该品类文档多包含受益所有人持股比例、控制关系的表格,结构化提取可保留单元格关联关系 |
PARSE_FILE_CHUNK_SIZE | 800–1200 字符 | 受益所有人信息需保留单主体的完整字段组,过长分块会割裂关联,过短会增加检索成本 |
PARSE_FILE_TIMEOUT_SECONDS | 300–600 秒 | 多页扫描件或复杂股权结构图的解析耗时较长,需适配长任务处理 |
UPLOAD_FILE_MAX_SIZE | 50–100 MB | 该品类文档可能附带多份高清扫描附件,需允许较大文件上传 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:解析日志显示
ocr error,文件解析状态返回500错误码。原因:未开启PARSE_FILE_OCR_ENABLE配置,或OCR服务连接异常。 - 现象:正常聊天功能正常,但加入文件解析后模型返回报错。原因:未将解析后的分块文本正确拼接为模型可接收的上下文格式,或上下文长度超出模型限制。
- 现象:本地部署v4.8.22版本后,文件解析功能无响应,后台无日志输出。原因:未安装官方推荐的解析依赖包,或
PARSE_FILE_WORKER_ENABLE配置未开启。
怎么确认配好了
- 上传一份标准的受益所有人声明文档,查看解析后的文本是否完整提取了表格内的所有字段。
- 检查后台日志,确认无
ocr error类报错。 - 测试不同格式的文件(PDF扫描件、Word表格、图片),确认解析结果格式统一。
- 查看分块后的文本,确认单个受益所有人的完整信息未被拆分到不同分块中。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。