这个品类的数据长什么样
农商行智能尽调报告的数据来源于内部信贷审批档案、本地涉农经营主体的财务报表、人民银行征信查询结果、监管部门报送的合规材料,以及现场核查的纸质记录与照片。更新随单笔信贷业务的推进实时触发,或按季度批量更新存量客户的尽调数据。文档包含结构化字段与非结构化附件,结构化字段包括客户统一社会信用代码、授信额度、逾期天数、贷款用途等,非结构化附件包括贷前调查报告、资产负债表扫描件、现场核查照片等。字段单位统一遵循金融监管规范,授信额度以万元为单位,逾期天数以自然日为单位。
这些特征在「向量模型与索引」这一环带来什么约束
农商行尽调报告同时包含结构化字段与多模态非结构化附件,要求向量模型同时支持文本与图片OCR后的向量生成,索引需兼容混合数据类型。更新随单笔业务实时触发,要求索引支持增量更新,避免全量重建带来的系统资源消耗。文档长度差异较大,从数页的短报告到数十页的完整财务报表,要求分段策略具备自适应能力,避免语义断裂或向量冗余。字段包含枚举型与数值型内容,需在向量生成前完成标准化映射,确保向量空间的一致性,提升匹配精度。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 适配农商行尽调报告的混合文档长度,平衡语义完整性与向量生成效率 |
image_index_enabled | 开启 | 尽调报告包含现场核查照片、财务报表扫描件等非结构化附件,需启用多模态索引 |
recall_top_k | 前 8–12 条 | 覆盖尽调报告的多维度关键信息,避免召回过多低相关内容 |
similarity_threshold | 0.72–0.85 | 适配结构化与非结构化混合数据的相似度匹配,过滤无关的尽调材料 |
incremental_index_enabled | 开启 | 尽调报告随单笔业务实时更新,增量索引可降低系统资源占用 |
embedding_batch_size | 32–64 | 平衡向量生成的速度与内存占用,适配农商行文档的平均大小 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:本地部署v4.9.0版本新建知识库时无图片索引相关配置选项。原因:该功能需商业版编译包支持,社区版默认未启用多模态索引模块。
- 现象:上传的尽调报告扫描件未生成向量索引,后台日志显示
parse_image_failed错误。原因:未配置image_ocr_api_key参数,或OCR模型调用超时。 - 现象:向量模型调用OneAPI时返回400状态码,无法生成索引。原因:OneAPI未正确配置向量模型的接口参数,或FastGPT中
embedding_timeout设置过短。
怎么确认配好了
- 进入知识库管理界面,查看是否存在多模态索引相关的配置开关,确认与预设的
image_index_enabled配置一致。 - 上传一份带扫描件的尽调报告样本,等待索引完成后,查看文档解析详情页是否包含图片OCR后的文本片段。
- 发起一次向量召回测试,核对返回结果的条数与
recall_top_k的设置是否匹配。 - 查看系统监控面板,确认向量模型调用的成功率无异常波动,无持续的
embedding_connection_failed报错。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。