这个品类的数据长什么样
这个品类的数据主要来自官方身份核验数据源、线下提交的证件扫描件与结构化提取字段。官方数据源的更新节奏随接口同步周期固定,线下提交的数据按提交批次更新。文档结构分为两类:一类是结构化的身份信息文本,包含姓名、身份证号、住址、签发机关、有效期等字段;另一类是证件扫描件的OCR转写文本,附带原始图片的元数据。字段均有固定格式,例如身份证号为18位数字与末尾一位校验码的固定格式,有效期为YYYY-MM-DD至YYYY-MM-DD的日期格式。
这些特征在「知识库检索与召回」这一环带来什么约束
身份证件的唯一标识字段(身份证号)要求检索时优先精确匹配,避免召回无关的非身份证件类数据。固定格式的字段要求检索时需校验字段格式一致性,避免因格式差异导致匹配失败。OCR转写的文本可能存在少量误差,需要调整模糊匹配的容错范围。官方数据源的固定更新节奏要求知识库需定期同步,避免召回过期的证件信息。线下提交的批次数据需按提交时间分类存储,便于后续按更新时间排序召回。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前8–12条 | 身份证件相关知识库条目量级较小,过多召回会增加上下文处理负载 |
相似度阈值 | 0.85–0.90 | 兼顾身份证号等唯一标识的精确匹配要求,与OCR转写误差的容错空间 |
分段长度 | 600–1000 字符 | 身份证件相关文档多为结构化短文本组合,避免分段截断关键身份字段 |
PARSE_FILE_TIMEOUT_SECONDS | 240 秒 | 单份高清证件扫描件的解析耗时通常不超过3分钟,避免超时失败 |
UPLOAD_FILE_MAX_SIZE | 8 MB | 单份证件扫描件的常规文件大小不超过5MB,预留合理冗余空间 |
重排返回条数 | 前3–5条 | 优先返回最匹配的结果,减少用户侧的信息筛选成本 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:检索结果中旧版本的身份证件核验文档排在新版本之前。原因:未配置按更新时间倒序的重排规则,或权重参数配置错误。
- 现象:上传证件扫描件时提示
413 Request Entity Too Large报错。原因:未调整UPLOAD_FILE_MAX_SIZE配置,上传文件大小超出系统限制。 - 现象:每日固定时段出现服务器内存占用过高,检索请求超时。原因:未限制
召回条数与重排返回条数,单次检索加载过多知识库内容,占用过多系统资源。
怎么确认配好了
- 上传单份高清证件扫描件,等待解析完成后检查结构化字段是否完整,确认未触发
PARSE_FILE_TIMEOUT_SECONDS配置的超时限制。 - 检索包含已知有效身份证号的知识库条目,检查返回结果的排序是否按更新时间倒序,确认重排规则配置生效。
- 上传超过6MB的证件扫描件,检查是否触发文件大小限制提示,确认
UPLOAD_FILE_MAX_SIZE配置生效。 - 模拟批量检索请求,观察系统资源占用情况,确认
召回条数与重排返回条数配置未导致资源过载。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。