这个品类的数据长什么样
汽车服务智能尽调报告的数据主要来自线下门店维保系统、二手车交易平台档案、厂商官方质检文档。数据更新节奏依来源不同,维保记录随单次服务实时生成,年度汇总报告按季度归档。文档多为固定模板结构,包含车辆识别代号(VIN)、维保项目明细、更换配件型号、行驶里程数、客户身份信息等字段,其中里程数单位统一为公里,配件信息多附带原厂编号,部分报告混合文本与扫描图片格式。
这些特征在「文档解析与分块」这一环带来什么约束
汽车服务尽调报告的多来源混合格式、固定模板结构与差异化长度,对文档解析与分块环节带来多重约束。混合文本与扫描图片的格式,要求解析模块同时支持原生文本提取与OCR识别,避免遗漏图片类维保记录。固定字段模板要求分块时保留字段关联性,不能随意拆分跨VIN码、行驶里程数的连续段落,否则会破坏数据对应关系。单次服务报告与季度汇总报告的长度差异显著,需适配不同长度的文档分块策略,避免长报告分块过碎或短报告分块冗余。不同导出格式的文档,需统一解析规则以确保配件型号、客户信息等字段的提取一致性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_OCR_ENABLE | 开启 | 汽车服务报告常包含扫描类维保记录图片,需通过OCR提取图片内的文本内容 |
CHUNK_MAX_SIZE | 800–1200 字符 | 汽车服务报告包含长段落的维保明细,该区间可保留字段关联性同时避免分块过碎 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 季度汇总类报告内容较多,需预留足够解析时长避免中途中断 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 年度归档的全门店维保汇总报告体积较大,需适配大容量文件上传 |
SIMILARITY_THRESHOLD | 0.75–0.85 | 需区分同车型不同维保记录的相似内容,避免召回无关段落 |
RECALL_TOP_N | 前 8 条 | 汽车服务报告的字段关联性强,少量精准召回即可覆盖尽调所需的核心信息 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:扫描版汽车维保报告解析后字段为空,或提取内容乱码。原因:未开启
PARSE_OCR_ENABLE配置,仅提取原生文本无法识别图片内的维保记录。 - 现象:多份同名的门店维保报告上传后,搜索结果无法区分对应车辆的VIN码信息。原因:未开启文档元数据提取配置,未为每份文件绑定唯一标识,导致分块内容未携带来源标记。
- 现象:输入具体配件型号关键词后,知识库搜索无法召回对应分块内容。原因:
CHUNK_MAX_SIZE设置过小,将包含配件型号的长段落拆分为多个无关联小分块,导致关键词无法匹配完整上下文。
怎么确认配好了
- 上传一份扫描版维保报告,查看解析结果是否包含图片内的行驶里程数与配件型号,确认
PARSE_OCR_ENABLE配置已开启。 - 上传多份不同车辆的尽调报告,检查分块内容是否携带各自的VIN码或文件名标识,确认文档元数据提取配置已启用。
- 输入某类维保项目关键词,测试搜索召回的分块是否覆盖完整的关联字段,调整分块长度与相似度阈值至符合业务需求的范围。
- 上传一份季度汇总报告,等待解析完成后查看任务状态,确认未触发解析超时相关的报错。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。