这个品类的数据长什么样
数据来源包括股份制银行内部授信审批档案、监管机构报送的合规文件、合作企业提交的审计报告、人行征信系统查询数据。更新节奏随尽调项目推进调整,单次项目文档更新覆盖全周期,常规存量尽调数据每季度同步。文档结构多为结构化报表搭配非结构化风险说明,字段包含客户统一社会信用代码、授信余额(单位:万元)、风险等级、审批日期等,部分文档附带纸质档案扫描件的转写内容。
这些特征在「知识库检索与召回」这一环带来什么约束
结构化报表与非结构化说明混合的文档结构,要求检索系统同时支持关键词匹配与语义召回,避免仅依赖关键词遗漏风险描述的关联内容。随项目周期更新的数据特征,要求配置增量同步逻辑,仅更新新增或修改的尽调文档,减少全量检索的资源消耗。文档包含带固定单位的字段,检索时需关联字段与单位的上下文,避免跨单位的无效召回。嵌入扫描件转写内容的文档,要求支持OCR解析与结构化提取,确保图片内的表格、数字信息可被检索。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_OCR_ENABLE | 开启 | 尽调文档包含纸质档案扫描件转写内容,需提取图片内的结构化信息 |
MAX_PARSE_SEGMENT_LENGTH | 800–1200 字符 | 尽调报告包含长合规条款,该长度可保留条款完整性,避免拆分破坏语义 |
RECALL_TOP_K | 前 8–12 条 | 股份制银行尽调需覆盖多维度风险点,适量召回可保证信息全面性 |
SIMILARITY_THRESHOLD | 0.72–0.85 | 平衡精准度与召回覆盖率,避免遗漏低相关但关键的风险描述 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 尽调报告可能包含多份附件合集,需支持较大文件上传 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 大型尽调文档包含多页扫描件,需足够时间完成OCR与解析 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传包含内嵌图片的PDF文档后,解析结果未提取图片内的表格与文字内容。原因:未开启
PARSE_OCR_ENABLE配置项,或OCR解析模块未完成初始化部署。 - 现象:在工作流中添加自定义知识库选择变量后,检索环节无法调用指定知识库。原因:未将变量的数据类型设置为
知识库ID字符串或数组,导致参数传递格式不符合系统要求。 - 现象:在知识库上传界面未找到CSV格式的导入选项。原因:当前FastGPT版本未启用CSV解析插件,或系统缓存导致界面选项未正确加载。
怎么确认配好了
- 上传一份包含内嵌图片的尽调PDF文档,查看解析结果是否提取图片内的表格与文字,确认OCR配置生效。
- 触发一次增量同步任务,查看同步日志是否仅显示新增或修改的尽调文档,确认增量同步逻辑正常。
- 发起一次检索测试,输入包含授信余额单位的查询词,查看召回结果是否关联对应字段的上下文,确认字段匹配逻辑生效。
- 调整
MAX_PARSE_SEGMENT_LENGTH参数后,解析同一份长文档,对比分段结果的完整性,确认参数配置符合文档结构需求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。