这个决定什么时候必须做
当知识库规模需要定期维护、外部数据源持续变化,或向量模型和解析方案调整时,应明确更新策略。过度重建会消耗CPU、内存和存储资源,延迟更新则可能使检索内容过时。升级接口时需同步检查调用参数:v4.9.0将旧接口/api/core/dataset/collection/create/file迁至/api/core/dataset/collection/create/localFile;trainingType按所用接口schema配置,例如chunk或qa。使用v4.8.1起提供的向量模型重选与重建能力时,应安排对应索引更新,并按业务需求和数据规模验证结果。
判据矩阵
追加与重建描述数据处理范围,定时同步描述触发方式,两者可组合使用。需分别验证新增、修改和删除的处理结果。
| 候选方案 | 数据更新触发方式 | 历史数据有效性要求 | 系统资源占用水平 | 支持的数据源类型 | 索引重建需求 | API兼容性适配要求 | 单次操作耗时 |
|---|---|---|---|---|---|---|---|
| 全量重建知识库 | 重建目标范围的数据及索引 | 验证与目标数据源的一致性 | 随数据规模、解析及嵌入处理变化 | 本地文件、API导入等,按所用接口schema配置trainingType与索引参数 | 重建所选范围的索引 | 旧/api/core/dataset/collection/create/file迁至/api/core/dataset/collection/create/localFile | 按数据量和模型吞吐实测 |
| 增量追加更新 | 处理新增数据;既有内容修改需更新或替换对应集合或分块 | 验证新增内容并清理过时数据 | 随变更量和处理模式变化 | 本地文件、API导入,按版本和接口字段配置 | 新增内容生成索引;修改内容按更新实现处理 | 按所用接口schema适配字段 | 按变更量与模型吞吐实测 |
| 定时同步更新 | 按预设周期触发数据源同步 | 验证新增、修改和删除覆盖率 | 随变更量、同步范围和处理模式变化 | 受支持的外部文件库、API文件库及站点源,按版本验证参数 | 由同步策略及变更范围决定 | 按数据源接口配置同步和训练参数 | 按同步范围及处理链路实测 |
每个判据为什么重要
更新方案需同时确定处理范围和触发频率。全量重建适合需要重新生成目标范围索引的场景;增量追加适合新增数据,既有内容修改和删除需由相应更新流程处理;定时任务可触发所选同步策略。合规或核心业务知识库应按数据一致性和检索结果验收,确保新增、修改和删除均被覆盖。资源消耗取决于数据量、变更比例、解析和嵌入处理,定时执行仍需容量评估。本地上传、API导入及外部数据源按各自支持方式接入。更换向量模型时按系统重建流程更新目标索引;接口升级时核对完整路径、trainingType等字段和参数支持情况,并预估任务耗时。
换的代价
切换更新策略需评估处理范围、去重、索引和接口参数。从全量重建转为追加时,验证新增数据索引及既有数据保留;既有内容变化时验证对应集合或分块的替换与清理。转为全量重建时,先备份,再按系统流程重建目标范围,验证检索结果及恢复方案,并按实际重建和切换方式安排窗口。定时任务需协调暂停或调整,避免重建期间重复处理。若同时升级至v4.16.2,还需按该版本要求移除PARSE_FILE_WORKERS等旧配置。最后验收新增、修改、删除、重复同步和异常恢复。
什么情况下这个决定可以先不做
数据量小、更新频率低且处于内部测试时,可先采用手动上传或简单API调用,并记录已处理的数据范围。向量模型和数据源仍在评估时,可用小规模重建验证检索结果,同时测量资源与耗时。正式业务上线前应确认更新时效、修改和删除处理及失败恢复。接口仍受当前版本支持时可保留现有逻辑,并在计划升级前完成新路径与字段的适配验证。
继续阅读
参考资料
- FastGPT v4.9.0 local file API migration
- Dataset training mode enum
- Dataset collection API schema
- Changed collection replacement behavior
- FastGPT v4.16.2 parsing Worker configuration changes
- FastGPT 环境变量
- FastGPT Docker Compose 部署
需要进一步确认时
上述判据可依据公开文档与部署实测逐项核对。若需要结合具体业务规模、数据边界与运维条件确定选型,可通过商务咨询获取评估支持;云服务形态可直接开始使用,先验证业务可行性再决定部署形态。