这个品类的数据长什么样
供应商审计的质量文档通常包括审计报告、供应商资质证明、生产流程文件(SOP)、检验记录、偏差处理报告、变更控制记录等。这些文档的来源是外部供应商,更新频率取决于审计周期和供应商资质变更,通常为每年或每两年一次,但重大变更或发现问题时会触发额外更新。文档结构多样,既有标准化模板(如审计报告),也有非结构化文本(如往来邮件)。字段与单位方面,涉及批次号、生产日期、有效期、检测指标(如含量百分比、杂质ppm)、设备型号、序列号等,单位包括但不限于毫克、升、摄氏度、帕斯卡。
这些特征在「向量模型与索引」这一环带来什么约束
供应商审计文档的低更新频率意味着初期构建索引后,增量更新压力较小,但首次索引的吞吐量要求高。文档结构多样性要求向量模型对不同格式的文本有良好的编码能力,特别是对表格、图片内文本(通过OCR处理后)的语义理解。字段与单位的特定性,例如批次号、检测指标,决定了在向量化时需要保留这些关键信息的语义关联性,避免单纯的词袋模型导致信息丢失。此外,审计文档中可能包含大量法规引用和专业术语,对模型的领域知识提出了要求,需要确保召回结果的准确性和相关性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾长文档的上下文完整性与短文本的语义聚焦。 |
重叠长度 | 100–200 字符 | 确保跨段落的关键信息关联性,避免重要内容被截断。 |
召回条数 | 前 10–20 条 | 考虑到审计文档内容关联性强,适当增加召回数量以提高相关性覆盖。 |
相似度阈值 | 按实测标定 0.75–0.85 | 需结合具体查询需求和文档内容进行测试,确保高召回率。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型审计报告或扫描件OCR处理可能耗时较长的情况。 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 适应单个审计包可能包含多个大型文件的需求。 |
容易做错的三处
- 上传大型知识库文件时,部分分块向量化失败,界面显示“向量化异常”。这通常是由于
PARSE_FILE_TIMEOUT_SECONDS参数设置过小,导致文件解析或向量化处理超时。 - 更新 FastGPT 版本后,原有的知识库无法进行有效检索,搜索结果为空。这可能是因为新版本使用的向量模型或分词策略发生变化,导致旧索引与新模型不兼容,需要重新构建索引。
- 上传大量文件后服务器崩溃,重启后知识库状态停滞在“未就绪”。这通常是由于服务器资源(如内存或磁盘空间)不足,无法处理并发的索引任务,导致处理队列阻塞。
怎么确认配好了
- 上传一份包含文本、表格和图片(通过OCR处理)的供应商审计报告,确认其能被完整解析并成功向量化,且无报错信息。
- 针对报告中的关键信息(如批次号、检测指标、法规条款),进行多次查询,验证召回结果的准确性与相关性,并检查
召回条数是否符合预期。 - 模拟同时上传多个大型审计文档,观察系统资源使用情况(CPU、内存、磁盘IO),确保在负载较高时也能稳定运行,没有出现“未就绪”或超时报错。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。