这个品类的数据长什么样
名单筛查的数据主要来源于各国执法机构、国际组织发布的制裁名单、政治公众人物(PEP)清单、涉案主体公示信息等。数据更新节奏无固定周期,官方发布新名单后需及时同步。单条数据文档包含主体名称、曾用名/别名、证件类型、证件号码、关联机构、制裁事由、发布机构、发布日期等字段,字段类型涵盖字符串、日期型与文本型,无统一的单位属性。
这些特征在「知识库检索与召回」这一环带来什么约束
多源异构的数据来源要求检索系统支持对接不同格式的数据源并完成格式统一。无固定更新节奏则要求检索链路支持增量同步,不采用全量重建,避免重复计算资源浪费。字段包含敏感信息与实体别名,要求检索环节开启权限控制,同时需支持实体对齐以匹配主体的曾用名与正式名称。单条数据的字段密度较高,要求检索时优先匹配核心实体字段,不采用全文本匹配,减少无关结果干扰。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前20条 | 名单筛查数据条目较多,需保留足够候选以覆盖潜在关联主体 |
相似度阈值 | 0.85–0.92 | 需精准匹配实体名称,避免低相似度的无关条目被召回 |
PARSE_CHUNK_SIZE | 800–1200 字符 | 名单数据的字段密度较高,分段长度适配单条记录的核心信息长度 |
SYNC_INCREMENT_INTERVAL | 每6小时 | 适配无固定更新周期的数据源,平衡同步及时性与计算资源占用 |
ENABLE_DOC_PERMISSION | 开启 | 名单数据包含敏感信息,需限制非授权角色的查看权限 |
RERANK_TOP_N | 前10条 | 过滤冗余候选结果,聚焦高相关度的实体条目 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 后台删除知识库中的制裁名单条目后,检索时仍返回该条目。原因是未执行向量库的增量同步操作,或系统缓存未自动清理。
- 上传名单CSV文件时,偶发失败且状态显示卡在1组或2组索引。原因是本地部署的
m3e-large模型在高并发解析时显存不足,导致解析任务中断。 - 检索时优先匹配名称的拼音组合,不匹配实体汉字名称。原因是未关闭
拼音匹配配置项,或检索权重设置偏向拼音特征。
怎么确认配好了
- 执行一次手动增量同步,查看向量库同步日志中是否显示新增/删除条目数量与后台操作匹配。
- 提交包含敏感主体名称的测试检索,验证仅授权角色可查看完整的证件号码、制裁事由等字段信息。
- 上传测试用名单文件,确认解析进度无卡壳且索引生成完成,无异常报错日志。
- 测试包含拼音和汉字的检索词,确认优先返回汉字匹配的实体条目结果。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。