这个品类的数据长什么样
数据来源包括公安联网核验接口返回的结构化字段、用户上传的身份证件扫描件或实拍照片经OCR转换的文本,以及线下补录的补充信息。更新节奏随业务场景调整,新用户核验时实时拉取最新数据,存量客户数据按固定周期同步。文档结构包含两类:一类是结构化的标准化字段,包括姓名、18位居民身份证号码、户籍住址、签发机关、有效期限等;另一类是非结构化的OCR识别文本,包含证件印刷文字的完整识别内容。字段均有固定格式要求,比如身份证号为18位数字加末尾可能的大写字母X,住址字段包含省市区街道等层级信息。
这些特征在「向量模型与索引」这一环带来什么约束
混合结构化与非结构化数据的特征,要求向量模型同时适配标准化字段编码与自然语言文本编码,需避免结构化字段的重复特征干扰向量空间分布。OCR识别结果的完整性与准确性存在波动,会导致同一份证件的向量化结果出现偏差,需要增加预处理校验环节。居民身份证号码为全局唯一标识,需在索引构建前完成精确去重,避免重复条目占用索引资源。身份证件包含敏感个人信息,向量生成与存储环节需严格遵循数据脱敏要求,禁止留存明文敏感字段。业务对核验实时性有要求,索引的召回延迟需匹配业务响应阈值。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MAX_CONTEXT_LENGTH | 800–1500 字符 | 身份证件OCR文本通常在该区间内,限定长度可避免过长文本导致的向量生成超时与特征冗余 |
EMBEDDING_MODEL | 多模态语义模型 | 适配结构化字段与OCR文本的混合输入,兼顾标准化字段编码与自然语言语义理解能力 |
DUPLICATE_REMOVE_FIELD | 身份证号 | 居民身份证号码为全局唯一标识,以此作为去重字段可高效消除重复索引条目 |
EMBEDDING_DIMENSION | 768 维 | 平衡向量表征精度与索引检索效率,适配通用语义与结构化字段的编码需求 |
PARSE_TIMEOUT | 120 秒 | 身份证件OCR与向量化流程需兼顾识别准确性与响应速度,该时长可覆盖多数正常识别场景 |
SENSITIVE_MASK_RULE | 身份证号保留前6位与后4位 | 满足数据脱敏合规要求,同时保留少量特征用于后续关联校验 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:向量入库后总条数少于源数据条数,比如源数据十万条,入库后仅九万余条。原因:未配置
DUPLICATE_REMOVE_FIELD参数,或配置字段未正确关联唯一标识,导致重复条目被自动过滤但未触发提示。 - 现象:集合创建成功,但页面始终显示「索引构建中」状态,无进度更新。原因:未设置
PARSE_TIMEOUT参数的合理阈值,OCR识别或向量化流程超时后未触发重试,导致索引构建流程中断。 - 现象:本地运行时向量召回结果符合预期,打包为Docker镜像运行后,所有文本的向量得分完全一致。原因:Docker环境中未正确挂载模型缓存目录,或未正确配置模型加载路径,触发了默认的占位向量生成逻辑。
怎么确认配好了
- 查看向量模型加载日志,确认指定的多模态语义模型已成功加载,无模型缺失或加载失败报错。
- 上传单份身份证件样本,检查向量化后生成的向量维度与配置的维度参数值一致。
- 导入多份包含重复身份证号的测试数据,确认入库后总条数与去重后的实际条目数匹配。
- 触发批量向量化任务,检查任务执行时长未超过配置的超时阈值,无超时中断记录。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。