名单筛查KYC 的向量模型与索引

名单筛查的数据主要来自监管机构发布的制裁名单、涉恐名单、失信被执行人名单,以及行业合规共享的风险主体名单。数据更新节奏随监管要求调整,常规为每日同步全量更新

这个品类的数据长什么样

名单筛查的数据主要来自监管机构发布的制裁名单、涉恐名单、失信被执行人名单,以及行业合规共享的风险主体名单。数据更新节奏随监管要求调整,常规为每日同步全量更新,紧急名单会触发临时增量推送。单条数据包含主体姓名、证件类型与号码、机构名称、风险等级、纳入事由、发布机构、生效时间等字段,字段类型涵盖字符串、枚举值与时间戳,无嵌套复杂结构,但单批次同步数据量波动范围较大。

这些特征在「向量模型与索引」这一环带来什么约束

监管名单的实时更新要求索引支持增量同步与快速刷新,避免合规风险。单批次数据量波动范围大,要求索引的分片扩容机制适配动态数据规模。字段包含证件号等敏感信息,要求向量模型在编码时保留实体唯一性特征,同时需符合数据脱敏要求。枚举类风险等级字段需单独构建分类索引,与文本向量索引配合提升召回精度。名单数据的召回结果需严格匹配实体字段,要求索引的召回逻辑优先关联多字段,不仅依赖文本相似度。

配置怎么定

配置项建议取法这样取的依据
embedding_modelbge-large-zh-v1.5 或 text-embedding-3-small名单数据多为实体短文本,该类模型对实体特征编码效果稳定
index_refresh_interval3600 秒监管名单常规每日更新,1小时刷新可平衡同步成本与合规时效
recall_top_k20–30名单筛查需覆盖全量高匹配结果,避免漏判风险主体
similarity_threshold0.75–0.85实体匹配需兼顾严格性,避免误召回非目标主体
enable_incremental_index开启实时更新的名单数据无需全量重建索引,降低计算开销
sensitive_field_mask证件号、机构名称字段脱敏名单数据包含敏感信息,需符合数据合规要求

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:本地部署v4.9.0版本,新建知识库时未显示实体索引专属配置项。原因:该版本开源包未开放KYC名单场景的索引增强功能,仅商业版包含对应配置入口。
  • 现象:配置OneAPI作为嵌入模型后端时,日志返回500 Bad Gateway错误,知识库索引构建失败。原因:OneAPI未正确转发嵌入模型请求,或未配置对应嵌入模型的访问权限。
  • 现象:召回结果仅匹配部分字段,未关联证件号等关键实体信息。原因:索引构建时未开启多字段联合召回配置,仅基于文本内容进行相似度计算。

怎么确认配好了

  • 进入知识库设置页面,确认embedding_model配置项与选定的嵌入模型一致。
  • 查看索引刷新日志,确认增量同步任务按设定周期执行。
  • 上传测试名单数据,验证召回结果包含预设的关键实体字段。
  • 检查敏感数据脱敏配置,确认证件号等敏感字段已按要求处理。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。